AI 硬件都在做加法,阅星曈靠一块「减法屏」拿下近 5000 万融资

 

头图来源:阅星曈

 

极客公园获悉,超便携电子纸品牌阅星曈近期完成一笔接近 5000 万元的 A 轮追加融资,由顺为资本、经纬创投、博裕创投和小红书四家老股东继续投资。

此前在今年 4 月,阅星曈曾对外披露,自天使轮至 A 轮累计完成五轮、总额超过亿元的融资。公司方面称,此次近 5000 万元是滚动融资中近期完成的一笔 A 轮交割。资金将主要用于提前锁定电子纸屏幕和产能、研发新硬件、改善软件交互、探索 AI 能力,以及拓展内容版权和海外市场。

过去两年,AI 硬件普遍在做加法:加入麦克风、摄像头、更多传感器和更大的模型,希望设备能够听见、看见并主动理解用户。

阅星曈目前获得市场反馈的产品,却是一块功能克制的电子纸。它没有开放的应用商店,没有短视频和信息流,也没有一套需要被反复强调的 AI 功能。它只是磁吸在手机背面,让用户在地铁上、排队时或睡觉前读几页内容。

但阅星曈也开始尝试把 AI 接入这套原本克制的产品体系。按照创始人兼 CEO 胡宇沸的介绍,公司正在测试一套由云端、手机 App 和电子纸设备组成的三端架构,已经调通部分 Agent-to-Agent 测试。

按照胡宇沸的设想,AI 更像信息抵达屏幕之前的一层处理:理解用户需要什么、整理内容、减少导入和推送的步骤,最后仍由电子纸呈现结果。

一家公司因为做减法获得用户,又因为增长必须开始做加法。这是阅星曈融资之后真正值得观察的问题。

01 从「把规模做大」,到「把产品做小」

阅星曈是一家成立于 2023 年、从超便携电子纸切入的消费电子创业公司。现阶段的核心产品是 X3、X4 等小尺寸电子纸设备,其中,X3 配备 3.7 英寸屏幕,机身约 58 克;X4 的屏幕为 4.3 英寸。产品可以通过磁吸配件附着在手机背后,用户用实体按键翻页,通过手机 App 或「星曈云」导入书籍、图片等内容。

它与传统电子纸阅读器最明显的差别,在于借用手机的随身性:传统阅读器需要单独携带,阅星曈则试图让阅读设备始终与手机同时出现,目前月销量已达数十万。

阅星曈创始人胡宇沸过去更擅长的是运营。此前,他先后在 Uber 中国、小蓝单车、饿了么、OYO 酒店和新石器无人车等公司负责运营或管理工作。OYO 官方信息曾称,胡宇沸创立的 EMO 事业群在半年内开拓 275 座城市、签约 1600 家酒店。组织人、建立线下网络和快速扩大规模,是他过去最鲜明的职业标签。

但当商业模式还没有成立,速度和资本只会同步放大问题。「我是一路做运营出身,一直做 COO。」胡宇沸说,「但真正到底层,还是产品得好。」他把过去的教训归结为三条:做好产品、不依靠烧钱增长、维持小团队的战斗力。

作为电子纸重度用户,胡宇沸发现,传统阅读设备不便随身,碎片时间仍主要被手机占据。他最初想解决的问题是:能不能让一本书像手机一样,总在手边?答案是一块足够薄、足够轻、可以磁吸在手机背面的电子纸。

「我们做了一件事情,就是让几千年来都不好带的书变得好带。」他说。为了描述这种关系,他用了一个不太精致却很准确的比喻:像一块「狗皮膏药」贴在手机背后。

从行业维度看,全球电子阅读器市场正增长平稳却早已陷入存量博弈。2025 年全球电子墨水阅读器市场规模约 24.5 亿美元,预计 2032 年将接近 39 亿美元,年复合增速维持在 6.8% 左右;其中 7 英寸以下的小尺寸设备占据了超半数市场份额,便携化已是行业共识的方向。

但主流品牌大多困在 6-10 英寸的「独立阅读设备」框架里,在屏幕素质、续航与版权内容上反复内卷,阅星曈的核心差异化,则跳出了「把阅读器做小」的惯性思维,转而借势手机这一用户最高频的随身设备,重构了电子纸的存在方式。

用户手持磁吸了阅星曈小尺寸电子纸的手机,体现随身携带与零负担的日常碎片化阅读场景

图片来源:阅星曈

它不需要用户额外分配背包空间,不需要单独培养使用习惯,仅通过磁吸设计就把阅读能力「植入」了用户已有的日常动线里。这种「零额外负担」的产品形态,契合了年轻群体对数字排毒、低干扰生活的诉求,也让它有机会打开一个新的增量市场。

2025 年春节后,胡宇沸在小红书公开自己的产品设想:一定要轻、能磁吸,可以牺牲部分电池容量,但续航不能太短。早期用户随后参与讨论屏幕「额头」、翻页键位置和握持方式。

胡宇沸把这套方法概括成「六十对四十」:创始人先想清楚产品的 60%,剩下的 40% 交给用户补充。轻薄、磁吸、低干扰,是团队事先确定的部分;按键位置和具体结构,则可以根据用户反馈调整。

这更像一种公开的产品验证:用户可以改变按钮和结构,却不能替创始人定义产品。「绝对不能什么都听。」胡宇沸说。如果把所有意见都做进产品,最后很可能得到一台功能不少、但没有人真正喜欢的设备。

02 一块贴在手机背后的「减法屏」

用户先在手机 App 或「星曈云」中导入书籍、图片等内容,再通过网络同步到设备。设备采用封闭系统,不依赖开放的安卓应用生态,也不会把社交消息、广告和信息流一起带进来。

磁吸设计让阅读器借用了手机的随身性:手机正面是算法持续供给的信息,翻到背面,则是用户提前选择的一本书。

在极客公园的实际体验中,X3 足够轻,单手阅读压力很小,电子纸在自然光下也保持了舒适的可读性。但用户在阅读前往往需要自行寻找文件、导入并推送。阅读过程很安静,把内容送进设备的过程却还不够顺滑。

初代产品没有触屏和前光。胡宇沸最初将产品定义为通勤和户外阅读设备;同时,团队当时的工艺能力也不足以在加入触控和前光的情况下保住轻薄,于是先舍弃了这两项功能。

后来,睡前阅读成为一个反复出现的用户场景:用户希望在更低干扰的屏幕上看几页小说。胡宇沸自己试过后,认为这个场景足够成立,团队开始筹备带触控和前光的新版本。

图片来源:阅星曈

目前,X4 Pro 已上市,新产品在接近初代 X4 厚度的情况下加入触控和前光,1100mAh 电池容量可以支持一周左右的碎片化阅读。

这段迭代反映了阅星曈的产品方法:减法不等于永远拒绝功能,判断标准是一个功能能否对应明确、重复出现的场景。抽象的「参数更强」不足以改变产品,具体的使用行为可以。

阅星曈试图填补的,是传统电纸书没有覆盖好的碎片阅读时间。但一个成立的小场景,并不等于一门已经跑通的生意。

电子纸上游供应商数量有限,屏幕采购和备货周期较长。公司通常需要提前约半年锁定货源;销量增长时,缺货和库存资金占用会同时出现。这也是本轮融资首先被用于备货和供应链的原因。

低价硬件也很难单独支撑一家持续扩张的消费电子公司。胡宇沸将硬件称为「一张门票」,公司不会追求很高的硬件毛利,他希望先让更多设备进入用户手中,长期价值则来自软件、内容和服务。

目前,阅星曈已经提供内容导入、图片和图书制作、推送及社区等能力,国内外书籍、漫画等版权合作仍处于拓展阶段。产品已经证明人们愿意购买一块更便携的阅读屏,但设备能否被持续使用、用户是否愿意继续购买内容,仍待验证。

增长还放大了早期团队不成熟的一面。此前,阅星曈一款产品的详情页曾出现参数误标,引发部分用户对「虚标」的质疑。胡宇沸称,这是团队填写错误,并非有意误导;公司向涉及相应购买时段、提出要求的用户提供退货退款。他也承认,创业早期的合规工作做得不够好。

对于一个从公开共创中获得第一批用户的品牌而言,这类争议的代价不只是一项参数如何解释,也包括用户是否继续相信团队对产品的判断。

3 当用户不喜欢 AI,AI 应该放在哪里?

AI 被视为阅星曈从电子纸阅读器走向「手机副屏」和个人信息入口的关键一步。但在现有用户中,这种延展并未天然获得认同。

胡宇沸称,在公司面向现有用户的调研中,海外受访用户对引入 AI 更为谨慎;国内反馈略好一些,但整体仍偏保守。许多人购买阅星曈,恰恰因为它足够克制,不会再增加一套通知、推荐和交互。

对于追求「Digital Detox」的用户,一块没有信息流的电子纸已经完成了自己的任务;如果 AI 意味着更多推荐和打扰,算法只是从手机正面追到了背面。

这构成了阅星曈下一阶段最重要的产品课题:公司因为克制获得用户,却又需要通过软件和 AI 扩大产品边界。

目前,阅星曈正在搭建一套由云端、App 和电子纸设备组成的三端架构。复杂计算发生在手机和云端,电子纸负责低功耗显示。按照胡宇沸的描述,团队已经调通部分 Agent-to-Agent 测试:用户未来可以通过设备或 App 发出指令,让云端完成订阅推送或连接外部服务等任务;一些能力将随新品逐步上线。

阅星曈并不准备在一块几十克的设备上运行本地模型。AI 的作用更接近信息进入屏幕之前的处理器:它负责理解需求、筛选内容和缩短操作路径,电子纸仍是最后的输出界面。

「AI 不一定要讲得那么 fancy。」胡宇沸说,「它应该坐在业务或工作流的后端。」如果 AI 能够自动整理待读内容、同步阅读进度、生成适合小屏的信息卡片,用户感知到的应该是步骤减少,而不是功能增加。

首先是输入。现有 X3、X4 本质上都是输出设备,缺少高频、自然的主动交互。胡宇沸称,公司正在研发带语音输入的新产品,并一度考虑让主动输入使用不同品牌;长期看,输入和输出可能重新结合。产品边界目前仍在变化。

其次是内容。海外电子书市场的壁垒不仅是硬件,也包括出版社、作者版权、购买习惯和账户体系。阅星曈希望先凭借小尺寸和价格获得硬件用户,再以用户规模与出版社、漫画和 IP 版权方谈判。但硬件销量能否转化为内容购买,用户是否愿意在一个新平台建立书库,仍需要验证。

最后是扩张本身。胡宇沸给公司的长期方向取了一个名字:Portable Everything——把更多东西做小,让阅读、声音、影像、音乐甚至运动变得随身可得。电子纸是第一个品类,团队也在对其他小型硬件进行预研。

在公司的规划中,阅读只是小尺寸电子纸首先完成验证的场景。墨水屏低功耗、常显的特性,还可延展到壁纸、工牌、桌面信息卡等用途;App、内容和 AI 创作工具则被视为提高设备使用频率的后续能力。这些方向目前大多仍处于研发或拓展阶段。

支撑这一品类想象的,是阅星曈的互联网原生组织能力:前端以社区(国内小红书、海外 Reddit/Discord)触达年轻用户、完成产品共创,中层以软件与 AI 创作平台快速迭代内容生态,底层以自研嵌入式 OS 与小尺寸供应链锚定硬件体验,形成「需求 – 定义 – 落地 – 反馈」的完整闭环。

而 AI 的深度接入,则是激活这块常显终端价值的核心钥匙。

未来,依托云端 Agent 的信息处理能力,用户可以用自然语言完全自定义屏幕内容:让 AI 整理当日核心资讯、生成个性化阅读书单、同步行程与待办事项,甚至根据情绪生成专属壁纸。电子纸的常显低功耗特性,让这些信息始终以无打扰的方式呈现在手机背面—— 用户无需解锁手机、无需打开任何 App,翻转即可获取。

这为公司提供了一个比阅读器更大的图景,也可能把它重新带回一直警惕的陷阱:当「少即是多」扩展成「超便携的一切」,一家强调单点场景的公司,是否会再次开始追求大而全?

近 5000 万元的新融资,让阅星曈有能力同时推进供应链、软件、内容和新品,也更容易把产品边界拉大。下一阶段的关键不是证明这块屏幕还能承载多少功能,而是软件、内容和 AI 能否提高设备的使用频率,同时不破坏用户最初购买它的理由。这将决定,Portable Everything 是一套可复制的产品方法,还是一个被增长迅速放大的愿景。

Continue ReadingAI 硬件都在做加法,阅星曈靠一块「减法屏」拿下近 5000 万融资

对话格式塔彭雷:AI 的下一站,是解读人的大脑

 

过去半年,脑机接口行业同时踩下了几脚油门。

2026 年 1 月,Neuralink 宣布全球临床试验参与者增至 21 人。从 2024 年完成首例人体植入,到将试验扩展至多个国家,侵入式脑机接口正在越过单个患者的演示阶段。

同一个月,OpenAI 成为 Merge Labs 约 2.5 亿美元种子轮融资中的最大出资方。这家由 Sam Altman 联合创办的公司没有继续沿用电极,转而把筹码押在超声上,希望在不开颅的情况下读取和调控大脑。

另一条经血管植入路线上的 Synchron,也完成了 2 亿美元 D 轮融资,资金将用于关键性试验和商业化准备。

国内市场也迅速升温。公开统计显示,2026 年一季度国内脑机接口领域发生 17 起融资,金额约 38 亿元,单季规模已经超过 2025 年全年。7 月,成立仅半年多的格式塔又完成 4.2 亿元天使+轮融资,两轮累计融资接近 1 亿美元。

钱为什么迅速涌向一个临床周期漫长、商业模式仍未完全跑通的行业?

一个直接答案是,脑机接口终于开始从实验室进入真实患者。更深一层的变化在于,这个行业的想象力正在越过「用意念控制光标」:当 AI 从语言模型走向世界模型和生物模型,大脑可能成为下一种稀缺的数据源,脑机接口则是获取这些数据的入口。

这也让行业出现了两场同时发生的竞争。一场围绕电学、血管内介入、超声等技术路线展开,争夺更安全、更大范围、更高带宽的连接方式;另一场发生在模型层面——谁能把血流、电信号、影像和行为放进同一套表征系统,谁就可能率先建立关于人类智能的基础模型。

格式塔创始人彭雷希望外界从后一场竞争理解这家公司。

2026 年 1 月,他与陈天桥共同创办格式塔,选择此前仍少有人进入的超声脑机接口。半年多时间里,公司在成都建设全球总部和制造基地,又在上海设立承担 AI 大脑基础模型研发与国际科研合作的第二总部。

若沿用医疗器械公司的业务逻辑,这种投入速度显得反常。格式塔的第一款产品仍处于研发和临床准备阶段,后续还要穿过漫长的注册审批流程。但彭雷判断,AI 走向 AGI 与脑机接口解码大脑,最终会在同一个方向汇合。

「我们在解码大脑,同时也在建设一个对人类大脑的 Foundation Model。」他说。

01 AI 的下一站,为什么要重新研究人?

过去几年,AI 最重要的变化,是能力边界开始越过语言。

大语言模型学习互联网上的人类文本,由此获得对知识和语言关系的统计表达;世界模型和具身智能继续向前,让机器理解空间、动作、因果和物理反馈;生物 AI 则把建模对象推进到蛋白质、细胞、器官乃至完整的人体。

彭雷将这条演进路线概括为:从语言模型到物理模型,再到生物模型。

语言是已经被人类结构化的数据。网页、书籍、代码和对话天然以 token 的形式存在,模型可以在海量语料上快速训练。进入物理世界之后,数据获取开始变得昂贵:机器人需要在真实或仿真环境中行动,接收传感器反馈,在一次次失败中学习。到了生物世界,训练材料更加稀缺。血流、电信号、影像、行为和疾病表型散落在不同设备与临床场景里,数据尺度、模态和个体差异都远高于文本。

大脑位于这条路径的深处。它既是人的意图源头,也是目前已知最复杂的生物智能系统。

「人对生理信号、对人本身的研究,会极大地帮助 AI 和具身智能的学习。」彭雷说,「我们越了解人,越有可能走向 AGI。」

格式塔创始人彭雷|图片来源:格式塔

这一趋势已经在具身智能训练场里露出端倪。早期的机器人训练主要记录画面、关节轨迹和操作结果,随后加入外骨骼、力反馈与肌电信号。肌电能够解释肌肉如何执行动作,脑电和脑血流则有机会把数据链条继续向前追溯——人在抬手之前产生了什么意图,如何规划运动,又如何根据环境反馈修正动作。

格式塔正在与傅利叶等具身智能企业展开合作,在具身智能训练过程中同步采集操作员的脑电和脑血流等信号。双方试图验证一个假设:加入脑部多模态数据后,具身模型能否比只使用动作数据的模型获得更好的泛化能力。

现阶段,这仍是刚刚启动的实验,意义却很直接。今天的机器人主要学习「人做了什么」,下一阶段可能需要理解「人为什么这样做」。摄像头记录结果,肌电记录执行,脑信号靠近意图。数据源越接近决策形成的位置,机器越有机会学到动作背后的结构。

过去,神经科学和人工智能主要互相提供灵感。卷积、注意力和强化学习等重要思想,都能在神经科学中找到不同程度的参照。彭雷判断,接下来的关系会进一步深入:从相互启发走向相互支撑,最终达到相互解释。

这也是格式塔把自己的一部分能力定义为 AI for Science 的原因。它需要用 AI 处理大脑信号,同时希望从大脑数据中提取可以反哺 AI 的规律。

02 为什么是超声?它要解决的不只是「不开颅」

脑机接口过去最受关注的故事,大多围绕侵入式电极展开。

Neuralink 已经让受试者通过意念控制光标、操作软件;Synchron 则把电极通过血管送至大脑附近,希望降低植入过程的侵入程度。电学路线的优势十分明确:它可以用较高的时间分辨率记录局部神经活动,对于渐冻症、高位截瘫等患者,意念控制已经展现出真实的临床价值。

彭雷曾联合创办侵入式脑机接口公司脑虎科技。他并没有否定电学路线,转向超声源于另一个问题:如果目标从读取局部神经元,扩大到理解记忆、语言、情绪和运动规划等高级功能,只观察少数脑区是否足够?

大脑高级功能通常由分布在不同区域的神经环路协同完成。电极擅长观察「点」,功能磁共振能够看见更大的范围,却存在设备体积大和时间滞后等限制。聚焦超声提供了第三种可能:通过功能性超声成像 (fUS) 技术,读取血流变化捕捉脑内神经活动的信号,以及利用经颅聚焦超声 (tFUS) 技术,通过相控阵方式调控深部脑区的神经活动,并在理论上覆盖更大的脑区。

这也是「格式塔 Gestala」这个名字的由来,源于德国哲学与心理学概念「Gestalt」,其核心理念是「整体大于部分之和」。彭雷相信,大脑正是一个无法被局部信号完全解释的整体系统。

在他看来,超声路线有三个值得押注的特征:具备走向更大范围乃至全脑读写的潜力;适应症可能覆盖慢性疼痛、卒中康复和部分精神类、神经退行性疾病;更关键的是,它与 AI 的结合更深。

这种「更深」首先来自超声自身的局限。

声学无法直接读取神经元的电活动。格式塔读取的是神经活动引起的血流变化,而血流信号与电信号之间存在生理时间差。颅骨还会造成声波衰减和散射,每个人的颅骨厚度、大脑结构也不完全相同。想从这些信号中恢复人的意图,必须同时处理跨模态、跨个体和跨任务的泛化问题。

AI 因此不是设备完成之后再添加的一层软件。它决定了超声设备能从噪声中提取多少信息,也决定了电信号、血流、核磁影像和外部行为能否被放进同一个表征空间。

格式塔希望训练的大脑基础模型,会同时使用电信号、超声、血流、核磁影像及行为数据。文本模型以词语为 token,这套模型处理的则是生物指标。它需要学习神经活动与外部行为之间的对应关系:一个人在看什么、想说什么、准备伸手拿什么,以及一次调控如何改变疼痛或情绪。

这个模型当前最先撞上的瓶颈是数据。

互联网为大语言模型准备了数十年的文本,脑数据却要依靠设备、动物实验和临床合作一点点生产。疼痛、卒中、抑郁和阿尔茨海默病提供的是不同数据;正常人与患者的数据也不能简单互换。每扩展一种场景,都需要重新建立采集、标注、验证和伦理审查流程。

这决定了格式塔无法只做模型。产品负责采集数据,临床验证安全性和有效性,科研团队寻找信号机制,模型再反过来改善读取和调控。硬件、临床、科研与 AI 构成同一个循环,缺少任何一环,大脑基础模型都很难持续进化。

03 医疗是第一道窄门,也是模型的数据飞轮

宏大的技术愿景需要一个足够具体的起点,格式塔选择了慢性疼痛。

低强度聚焦超声调控疼痛相关脑区,已经有同行评议研究和早期临床探索作为科学基础。根据在美国的临床数据,通过超声调节前扣带皮层(ACC)后,受试者的疼痛程度降低约一半,效果持续一至两周。不过,此项临床试验仍未在中国展开,产品目前仍处于研发和注册准备阶段,距离获批上市还有完整的临床与监管流程。

这条事实边界很重要。脑机接口行业从不缺少具有冲击力的演示,真正决定技术能否进入社会的,是安全性、可重复性、长期有效性和可负担性。

慢性疼痛适合作为第一站,一方面因为患者数量庞大、现有药物方案存在局限;另一方面,疼痛同时连接了感知、情绪与神经环路,是验证超声调控能力的重要入口。格式塔随后计划探索卒中康复、抑郁、创伤后应激障碍、强迫症以及阿尔茨海默病等方向。

这张路线图更像一家制药公司的适应症管线。每一种疾病都对应不同脑区、不同信号和不同临床终点,也会为模型增加一种新的「生物语料」。医疗场景在这里承担了双重角色:它让患者获得可测量的收益,也以最高的数据安全和数据标准训练系统。

彭雷将格式塔计划在 2026 年底发布的第一代模型比作「GPT-1.0」:可能只在少数适应症和特定任务上有效,距离通用仍很远。与模型同时亮相的,还将包括第一代超声脑机接口产品、慢性疼痛的初步临床数据和阶段性科研成果。

这也解释了格式塔为何在成立初期同时建设总部、工厂、临床合作与 AI 团队。相比一件孤立的硬件,它更想建立一套持续生产高质量脑数据、再用数据推动模型进化的系统。

这套系统能否形成飞轮,取决于三个条件:设备能否稳定采到有效数据,临床结果能否被重复验证,不同患者和任务的数据能否在模型中实现泛化。目前三个问题都没有完整答案。

彭雷认为,面向患者的超声脑机接口有机会在未来两到五年逐渐进入临床,面向健康人的增强应用则需要更长时间。两者之间不仅隔着技术成熟度,也隔着一道尚未被社会回答的问题:健康人究竟希望从脑机接口中得到什么?

控制鼠标、提高人机通信带宽、增强记忆,和直接调节情绪,指向完全不同的产品与伦理后果。一个抑郁症患者接受调控,是为了恢复健康;一个健康人通过设备持续获得愉悦,则会改变「自主选择」的含义。

医疗因此既是格式塔早期商业化的路径,也是必要的约束。它迫使技术在谈论增强人类之前,先证明自己能够安全、克制地帮助人。

04 新的「罗塞塔石碑」,以及谁来守住人的一边

彭雷提到一个比喻:新的「罗塞塔石碑」。

古代罗塞塔石碑用三种文字记录同一段内容,由此帮助后人破解失传的语言。在他设想的未来,AI 模型、人类行为与神经科学模型也能形成类似关系。硅基模型预测一个人将如何行动,脑模型记录行动产生前的神经活动,外部世界提供结果与反馈。三者映射到一起,机器可能获得解释人类智能的新坐标系。

这不意味着碳基智能和硅基智能终将收敛为同一种架构。

大脑是有生命周期的计算系统,软硬件难以分离,记忆与计算高度耦合;硅基系统可以在不同硬件上迁移,模型与算力基础设施相对分离。两者的数据、token、能耗方式和学习机制都不相同。彭雷所说的「融合」,更接近互相校验和翻译:各自沿着自己的路径进化,同时逐步建立可解释的接口。

短期看,这种接口可以帮助具身模型理解人的运动意图,也可以帮助脑机系统借用 AI 的表征能力改善解码。再向前,它可能进入生物 AI 的核心地带。

DeepMind 等机构正在把「虚拟细胞」视为下一阶段的重要目标:模拟细胞在不同环境和扰动下的变化,再从细胞走向器官乃至虚拟人体。大脑基础模型可以看作这条路线中最困难的一块拼图。它处理的不只是结构和代谢,还包括感知、决策、记忆、情绪与意识等涌现现象。

由此再看格式塔与 Merge Labs 几乎同时押注超声,意义已经超出脑机接口的一次技术分流。太平洋两岸的创业者正在争夺一种新的数据入口:谁能以更低风险、更大范围读取大脑,谁就更有机会训练出关于人类智能的基础模型。

中国公司在这场竞争中的优势,来自临床资源、患者规模、供应链和工程迭代速度。彭雷判断,中国与海外超声脑机接口公司的差距约为一年到一年半,并希望用两年左右追平。这仍是一家创业公司的判断,却揭示了格式塔的全球化逻辑:立足中国获得工程与临床效率,同时引入全球科学家,开展国际临床和科研合作。

但当模型开始接近意图、记忆和情绪,竞争就不再只是技术与数据的竞争。

格式塔品牌理念与脑机接口伦理宣言插图,强调保障人类主体性与大脑数据隐私的科技愿景。

图片来源:格式塔

格式塔在官网宣言中写道:大脑无法被视作一台可以简单「优化」的机器,也不能成为可被任意利用的资源;它是人格、尊严、创造力与自由的生物学基础。公司的研究「不以牺牲人类主体性为代价」。

主体性之所以成为底线,是因为脑机接口面对的对象比一般个人数据更接近「人本身」。当设备能够识别意图、改变情绪甚至影响决策,知情同意、数据所有权和责任归属都会获得新的含义。技术能否实现,只是问题的一半;谁有权使用、在什么条件下使用、结果由谁负责,同样决定它能否进入社会。

彭雷对具体边界保持谨慎。他认为,人类对大脑的理解还不足以提前画出一条完整的线。更现实的方式,是让认知边界与伦理边界同步向前:每获得一种新能力,就建立相应的验证、监管和治理机制。

AI 也在接近类似的问题。纯语言模型缺少与真实世界持续互动的身体,很难据此讨论意识;当具身模型开始从环境中获得感知、奖惩和自我与他者的区分,主体性将从哲学命题逐渐变成工程和制度问题。

AI 研究者正在尝试创造一种此前不存在的智能,脑科学研究者则面对一个已经存在、却始终没有被充分理解的智能。二者在技术上靠近时,关于意识、责任和人的边界也会合流。

45 岁时,彭雷开始了自己的第六次创业。此前 20 年,他主要在互联网行业创业;过去 6 年,他进入脑机接口,做过侵入式电学路线,又转向超声。他说自己现在可以用十五年甚至二十五年的尺度看待这件事。

支撑这个长期选择的,是一个近乎古典的问题。

康德写过,两种事物越是反复思考,越让人心生敬畏:头顶的星空与心中的道德。彭雷将前者理解为人类为何出现在宇宙中,将后者理解为人何以成为人。两条看似不同的追问,最终都指向意识与智能的来源。

今天的 AI 已经能够生成语言、图像和代码,开始进入汽车、机器人和实验室。它越来越像一个理解世界的系统,也越来越暴露出我们对「理解」本身的无知。

人类长期尝试用机器模拟大脑,却从未真正读懂大脑。如果我们不了解智能如何在生物体中产生,又该如何判断机器是否拥有真正的智能?

脑机接口的下一章,因此不会只发生在手术室和康复科。它也会进入 AI 实验室、机器人训练场,以及关于人类未来的制度讨论。

从这个角度看,格式塔制造的既是一台超声设备,也是一种观察智能的方法。医疗是它必须穿过的第一道窄门。门后更长的路,是让碳基与硅基第一次拥有彼此可以理解的语言,同时确保翻译完成之后,定义目的和边界的仍然是人。

Continue Reading对话格式塔彭雷:AI 的下一站,是解读人的大脑

对话影溯章国锋:互联网数据才是空间智能最需要的「太阳能」

作者|张鹏

整理| 徐珊

 

世界模型的牌桌上,坐着的已经全是重量级玩家。Yann LeCun 离开 Meta 亲自下场,李飞飞的 World Labs 发布 Marble,NVIDIA 用 Cosmos 拉起联盟,国内的大厂与创业公司也在密集进场。让 AI 理解物理世界,已经是今年的主流方向。

但模型智能的上限,最终取决于喂给它的数据。 语言模型和视频模型的成长,都建立在互联网三十年的积累上;而这一次,世界模型的牌桌上,没有任何一家的数据够得到训练基础模型所需的量级。

行业不是没有努力。从遥操到第一视角采集,具身公司都在重金投入数据。但在影溯科技创始人兼董事长、浙江大学求是特聘教授 章国锋看来,这些方式像伐木和挖石油,有价值但却要时间积累,耗时耗力。真正能支撑训练数据能源应该像阳光,无处不在、取之不竭。

唯一够得到互联网量级的,其实就藏在人人每天刷过的视频里,这也是他眼中真正的「阳光」。视频的每一帧里,其实都藏着这个世界的运动、物理的规律。3D数据一直都在,只是从没有人能把它取出来。

从阳光中获得能量,给 3D 世界造一块「太阳能板」,正是影溯在做的事。它要把海量视频数据转化成能直接训练世界模型的 3D 数据,让无处不在的「阳光」,第一次变成构建空间智能的能量。这家成立一年的上海公司,将在今年实现单目视频转 360 度动态场景,并开始批量转制。相较于传统实地采集再加重建的模式,这种方式的整体成本至少下降一至两个数量级,为整个空间智能赛道解决最棘手的 3D 数据底层供给难题。今年 6 月,公司完成新一轮融资,将主要投入模型训练与数据引擎的建设。

近期,极客公园创始人张鹏与章国锋进行了一次交流。这场交流里,他谈到3D数据为什么是空间智能的第一性问题,几十张卡训练世界模型的账该怎么算,以及物理世界的 ChatGPT 时刻会以什么迹象到来。

以下是本次对话精编。

 

01

空间智能的「阳光」

来自互联网数据

 

张鹏:你做SLAM 技术很长时间了,从 SLAM 这种空间计算到现在大家讨论的空间智能,你是怎么理解这个跃迁的?

章国锋: SLAM 主要做在线的三维地图重建,确定自身在空间中的方位。真正要理解这个世界,光有空间定位和 3D 重建是不够的。比如我们要能判断桌上这个杯子,碰到它,它会掉下去,里面的水会倒出来。因为这个动作接下来会发生什么,需要建立在你对真正物理世界的理解上,不只是空间定位。

所以从 SLAM(或者叫原来的空间计算)到空间智能,很大不同在于你需要真正能对空间进行理解,并与之交互,甚至推演。比如说,我在这个空间做一个行动,接下来可能发生什么,我能预判。对一个智能体来说,还能做相应的动作,真正让智能体能在物理空间上交互。

可以简单理解为空间计算是个三维问题,而空间智能在此之上还要理解场景语义,通晓物理规则并能进行推演预测,这对智能提出了显然更高的要求。

 

张鹏:当年做 SLAM 的时候,我们找不到往智能走的路径。为什么今天大家在智能这个维度上开始有预期?背后的技术和认知变化是什么?

章国锋: 其实我做了二十多年三维,想解决的终极问题一直没有变,就是怎么教机器真正理解空间。过去一直没有一条很通用、范化性足够强的学习路径。

大模型的突破真正重要的地方,不只是语言模型本身做得有多好,而是验证了一种新的学习范式:当模型、数据和算力达到一定规模之后,很多过去很难靠人工定义的能力,是可以从数据里学习出来的,甚至会出现远超我们原来预期的能力。

这对三维领域的意义非常大。过去我们更多是在显式地计算几何、设计规则,或者使用传统的机器学习方法;现在第一次有机会让模型从大量真实世界的数据里,自己学习空间结构、运动规律,甚至进一步学习物理和预测。

语言模型证明了智能可以从大规模学习中涌现,而我们现在要回答的是,同样的事情能不能在三维物理世界里发生。

 

张鹏:所以Scaling 所需要的数据就成了问题。具身数据这几年的风向变了好几轮,ALOHA 带火遥操作,EgoScale 带火第一人称。但感觉这些数据似乎还是不太够用吧?

章国锋 遥操和第一人称数据都很重要,但它们更像阶段性的解法。这些数据需要持续投入人和设备去采,成本高、速度慢,多样性也有限,很难真正做到Scaling。

所以我们判断,下一阶段的关键不是换一种方式继续采,而是把互联网上已经存在的海量2D影像,转化成结构化的3D/4D数据。机器人最终要在三维的物理世界里行动,3D不只是一种数据格式,更是机器理解世界、预测变化和采取行动的基础,也会成为World Action Model的核心。

我们内部的具身实验也初步验证了这一点,把3D几何表征和动作联合建模之后,模型在复杂遮挡等任务上的成功率有了明显提升。这至少说明3D这条方向是有效的。但要把这种提升从特定任务扩展到更多场景,关键还是能不能低成本、规模化地获得足够丰富的3D/4D数据。 谁能率先完成这种规模化的数据升维,谁就更有可能掌握空间智能的数据入口。

 

张鹏:在你看来,世界模型的路线图背后,有哪些技术支撑点要串起来?

章国锋: 空间智能其实包括空间的感知、重建、生成以及理解、交互和推演。最重要的是解决「空间骨架」的问题。当 3D 的骨架建立好之后,物理一致性很自然地可以在这上面再去学习。

2D 的很多东西定义在像素上,但物理的规律,比如说物理公式不是定义在像素上的,而是定义在 3D 空间上的,硬要对应到 2D 像素上,会带来很多额外的负担。二维图像只是局部的观测,本身存在大量冗余,也不是对世界状态唯一的表达,同一个二维观测背后可能对应多种不同的真实三维状态。模型还需要额外去维护时空一致性,过程中也容易产生误差累积。

所以把空间的骨架建立起来之后,后面很多东西就变得好学了。这也是为什么我们 做空间智能,首先要先做 3D 空间的生成,先把空间生成建立起来,后面的理解、推演就直接建立在 3D 表征上,不会有 2D 上额外的负担。 这非常重要。这跟李飞飞做的其实不谋而合,大家对这个问题的认知也越来越一致: 如果要真正理解物理世界,首先还是要建立起对三维空间本身的表征,这是一个很本质的问题。

有了生成之后,还要能理解,有预测,还有能统一。观测是理解这个世界的状态,进一步需要推演预测,再行动。举个例子,我看到一个杯子,要判断这个杯子里可能有什么,有水,抓它的时候要注意什么。 未来的空间智能模型,它一定是一个整体的模型,不会拆分成一个生成模型再加一个什么东西,而是生成、理解、预测、推演一体化。

 

张鹏:文本世界里人类积累了大量数据,只要敢 S caling,这件事就能实现。但在具身、空间智能的世界里,数据是个卡点。你的视角里,它到底卡在什么维度上?

章国锋: 现在这套深度学习范式,大家其实有一个共同信仰,就是 Scaling。你希望最后出现通用智能,就一定要让模型看到足够大量、足够多样的世界。

空间智能现在最大的问题,是数据的生产方式还 Scale 不起来。

大家现在最直接的办法就是采。遥操也好、第一视角也好,前面一批数据靠堆人、堆设备是可以做出来的,但越往后,新增的数据会越来越贵,而且越来越容易重复。 真正难的不是拿到一批数据,而是数据扩大一百倍、一万倍以后,还能不能持续获得新的、多样的经验。

多样性这件事我觉得很多人还低估了。很简单的例子,模型如果每天看到的都是差不多的房间、差不多的动作,即使小时数很多,也不一定能涌现出通用能力。就像你今天训练语言模型,如果不是用整个互联网,而是雇很多人每天坐在那里打字,当然也能生产很多文字,但你不会认为靠这种方式可以做出 ChatGPT,更何况是更复杂的智能。

所以采集不是没有价值,生成也不是没有价值,但这些更像我们现在「有什么先用什么」。 如果目标真的是通用空间智能,最终一定要找到一种新的数据机制,让数据的量和多样性可以持续增长,而且边际成本越来越低。

互联网已有的海量图像和视频里,其实已经包含了大量三维信息。怎么把这些信息高效地提取出来,变成模型真正能学习的 3D、4D 数据,会是其中一条非常重要的路径。但判断一个数据策略是否可行的标准其实很简单, 它必须能够 Scale,且必须能足够多样;只有数据真正 Scale 起来,空间智能才有机会涌现。

 

张鹏:所以空间智能 的 问题要靠3D的数据来解,而要批量拥有高质量3D数据,核心是批量有效的从2D数据升维到3D数据。那你怎么定义这个可以提供模型训练的数据质量 ?在空间智能的世界里,数据的「好」有哪些必然要实现的条件?

章国锋 它一定是 3D 坐标系下的多模态数据。过去 2D 图像视频冗余很大,都只是现象,作为数据组织不够高效,说到底是不够本质,无法体现这个世界的真实状态,没有物理属性。只有更高维、更本质的数据,才能直接去训练更高维的模型。

至于什么是高质量的数据,行业里包括具身在内还没有标准,大家都在摸索。以前大家都去采遥操数据、第一视角数据,但采回来的还是 2D 数据,给具身训练并不高效。采集之后,还需要做 3D 结构化、打标注,恢复运动物体的位姿和时序上的对应,过程也比较繁琐。

所以 好数据的标准是全量,不是单一局部的画面,而是完整的 3D 信息,甚至把时序对应、因果关系都 嵌 在里面。拿这样的数据训练,具身才能真正理解整个空间,具备很强的泛化能力。 而这正是影溯的3D世界模型的优势,能够从2D数据自动高效地生成出全量的3D场景数据。

 

张鹏:所以遥操采集数据也不是没有价值。如果给这些数据排个序,我们应该追求什么才是最高效的?

章国锋: 数据肯定不是单一来源,它应该是一个金字塔的层次,就像人类用能源,会有烧木柴的,有挖石油的,也有阳光,不同的层对应不同的获取方式和成本。

实际采集的数据,遥操、Egocentric、以及模拟仿真的数据,都有价值,但更像烧木柴、挖石油。你要一点点去采、去挖,很难够到互联网的量级。就像图像视频是几十亿人花几十年积累出来的,靠现在短时间去采,基本没有可能。

金字塔的最底层,要有最大量、达到互联网级别,得像阳光一样无处不在,关键是你能不能把它照进来、利用起来。

真正训练需要的是不同数据的配比,有些数据一定要保证足够多的量、足够多的多样性数据,模型才具备很强的泛化能力;比如我要生成非常高清晰度的内容,就需要一些很高分辨率的数据,帮助提升最后生成的精细度。所以不同的数据有不同的价值。

 

张鹏:看起来把互联网数据这种已经存在「阳光」,转化为「太阳能」运用到空间智能的发展上,是你最核心的思考?

章国锋 : 今天最大的卡点在最底层,文字、图像、视频都有互联网级别的量,唯独 3D 没有原生的、互联网级别的数据 。我们从现有视频入手,互联网上的海量视频本身含 3D 信息,关键是能不能把它抽取出来,甚至变成全量的、高质量的 3D 数据。这也相当于把无处不在的阳光,变成能量。

现在也有一些拿到 3D 数据的办法,比如用深度相机去拍,得到的画面带有距离信息(也就是 RGBD 数据)。但这种数据是局部的、不完整的,它够「重建」用,不够「生成」用。

重建是把拍到的东西还原出来,拍到多少、还原多少,所以拿这种不完整数据、再加一些合成数据去训练就可以,效果也不错,比如 VGGT (Visual Geometry Grounded Transformer)就是用 Transformer 前馈式地做 3D 重建。重建这件事同样符合 Scaling Law,数据越多,能力越强。

但生成不一样,模型要能补全没拍到的部分,训练时就必须给它看完整的样本。一张图像,对应一个完整的 3D 场景。这样的数据目前非常缺,要达到互联网级别更是难上加难。所以最高效的解法,还是把互联网视频转成全量的 3D 数据,甚至是动态的。

 

张鹏:未来在这个路线上,数据的成本会是什么样的?

章国锋: 3D 数据比较缺,所以成本确实很关键。如果真的完全靠实采,成本就太高太慢了,特别是动态的场景,真的用相机阵列去拍摄,再重建成 4D 的成本非常高。我们认为问题应该回到怎么把互联网这座金矿用好,用非常低成本的方式去转。这可能需要一些清晰度非常高、分辨率非常高的数据;也需要实采,对提升模型最后的精细度是有帮助的。

回到我们前面说的金字塔,成本也可以这样来看,最大的量用最低的成本获取到,顶层的一些数据可以用成本相对高的方式采到或获得,综合起来成本才可接受。这和语言模型其实很像。预训练需要的是海量、多样的数据,这部分必须足够便宜,才能真正 Scaling;到了 Post-training,一些专家数据可以很贵、质量可以很高,因为它需要的量没有那么大。3D 数据未来也会是类似这样的结构。

所以真正合理的成本结构,是最大的量用最低的成本获取,少量高价值的数据可以用更高成本获得,最后组合起来,整个训练体系才是可持续的。

从互联网数据转制,一个很大的优势就是没有额外的采集成本。我们现在做的事情,是不断把转制效率做高。比如从普通视频出发,生成时空一致的不同视角,再进一步恢复成完整的 4D 场景。只要这个过程的效率足够高,单位数据的成本就可以持续往下降。

我们的目标不是把某一个 4D 场景做得多便宜,而是最终让大规模生产 3D、4D 数据这件事,在经济上真正成立。

 

张鹏:物理世界的 ChatGPT时刻要到来之前,会出现什么迹象,给我们一些导航点?

章国锋 我们可以先想一下,ChatGPT 的那个时刻到底是什么。

它并不是说那一天 AI 突然就变成 AGI 了,而是普通人第一次非常直接地感受到, 原来机器真的可以听懂我说话,而且我可以很自然地跟它交流。 空间智能应该也会有类似的时刻。不是等到机器人什么都会做,而是有一天,大家第一次很直观地发现, 原来机器真的开始理解空间了。

这个信号可能先出现在数字世界。今天做一个 3D 世界,还是需要建模、材质、动画很多专业环节;未来可能你说一句话、给它几张图,它就能给你一个完整的、可以走进去、可以交互的三维世界。

再往物理世界走,可能就是我们开始看到真正「聪明起来」的机器。比如更聪明的扫地机器人,不只按规则运行判断,而是真开始理解这个房间,自然的规避掉Corner Case;或者自动驾驶开始能够处理很多以前没有见过的复杂情况。

它不会一上来就是一个万能机器人。ChatGPT 出来的时候也没有解决所有智能问题,但大家已经知道,范式变了。空间智能也一样,只要出现一个足够直观、足够好用的产品,让大家第一次感受到机器真的能够理解一个三维世界,我觉得那个时刻就已经开始了。

而且这一轮大模型已经给我们积累了很多 Scaling 的经验,算力、模型、训练方法都在快速往前走。空间智能现在最缺的,还是能够真正 Scale 起来的 3D、4D 数据。所以我相信,一旦数据问题被解决,这些事情到来的速度可能会比我们预想得更快。

 

02

创业的吸引力在于

「解决那个空间智能的第一性问题」

 

张鹏:从研究者到创业者,你为什么是这个时间点下场?背后有什么因素?

章国锋: 首先,技术的发展正好到了窗口期。我20年来一直在探索能获取通用空间智能的机会。过去传统的空间计算门槛太高,设备、采集、重建都很复杂,人才非常稀缺,很难大规模使用。 但今天不一样。AI 下一步要进入物理世界,具身智能、机器人都要真正理解空间, 3D 从来没有像现在这么重要过,而且是绕不开的。

同时,生成式 AI 又在快速降低 3D 的门槛。过去没拍到就是没拍到,现在可以补全、生成;过去很多事情需要非常专业的采集,现在也开始有机会变得更简单。

所以对我来说,身处这个时代其实特别兴奋,终于到了 3D 最有机会发挥巨大价值的时候。2024 年李飞飞做 World Labs,其实也是一个很强的信号:因为做了这么多年 3D,你会感觉到,终于有越来越多最顶尖的人开始看到同一个方向,空间智能真正到了一个新的时间点。

 

张鹏:可能具身的需求也到位了,这个门的打开可能也是因为有明确的需求在等这个突破,而不是突破完了不知道谁会用。

章国锋: 是的,这也是为什么这两年世界模型突然变得这么重要。机器人如果只在工厂里做一个固定动作,其实可以把环境、流程都标准化,很多问题都能靠工程解决。但如果机器人真的要进入家庭、办公室,环境每天都在变,你不可能把每一个杯子放在哪里、每一把椅子怎么摆都提前教给它。

所以真正通用的机器人,不能只是记住「看到这个画面就做这个动作」,它需要理解自己在哪里、周围有什么、做一个动作之后会发生什么。 世界模型真正要解决的,就是让机器人脑子里有一个对这个世界的理解,能够先判断、先推演,再去行动。

我觉得这才是具身智能真正走向泛化的关键。 从一个为特定环境训练出来的机器人,到一个换个房间、换个工厂也能自己理解和行动的机器人,中间缺的就是这种对空间和物理世界的通用理解能力。

 

张鹏:公司成立一年了。真正下场之后,你们的技术发展是高于预期还是符合预期?有什么变化?

章国锋: 模型的能力在非常快速地推进,虽然遇到不少困难和挑战,但总体是超出我们原来预期的,发展不完全是线性的。

我在 2025 年初的时候写过一篇文章,讲空间智能跟空间生成的关系,提到数据要从 2D 去转,可以从互联网视频转成 3D 的场景。 当时我们觉得静态场景能做好已经挺难的了,但后来我们发现将单目视频转成全量 3D 动态场景在技术上是完全可行的 ,这个进展有点超出我最初的预期。

原来我们预期在静态场景下,用一张或几张图像生成一个很好的 3D 场景。这已经不容易了,但我们内部最近的研究进展比预想得快很多,现在已经看到,单目视频生成360 度动态全量3D 或者说 4D 场景是完全可行的。虽然现在还有一些细节要继续解决,但从技术路径上看,我们已经非常有信心。

一旦 4D 数据能够从海量互联网视频里低成本、规模化地产生,意义就不只是多了一种数据格式,而是我们第一次有机会把真实世界里大量的空间变化和物理经验,真正变成可以 Scaling 的训练数据。前面说互联网视频像无处不在的「阳光」,到这一步,我们才真正有机会把这些阳光转成能量。

 

张鹏:拿 OpenAI 在 GPT 上走过的 1.0、2.0、3.0 到 3.5 打比方,影溯现在处于什么阶段?单目视频变成 360 度动态 3D 场景的还原,属于哪个阶段?

章国锋: 按这个类比,我们现在更接近 2.0:关键技术路径已经得到了一些验证,但真正的数据 Scaling 还没有发生。

下一阶段最关键,就是把数据规模真正做起来,提升模型能力。我们内部已经看到一些比较明确的信号,把明确的 3D 结构加入模型之后,学习效率能够有一个数量级以上的提升。在数据量和算力都还比较有限的情况下,一些任务已经能取得比较好的结果。3D 表征确实能改变模型学习世界的效率。

在我们的规划里,最终可能需要几千万到 1 亿量级的场景数据,才有机会看到空间智能真正的 ChatGPT 时刻。 因为真实世界的复杂度不只来自数据量,更来自环境、物体、运动和交互组合出的巨大多样性。要出现真正的泛化和涌现,模型需要见过足够大、足够多样的世界。

所以我理解的 3.0,是数据和模型真正开始 Scaling;再往后,当 Scaling 带来明显的泛化甚至新的能力涌现,才更接近 3.5。

 

张鹏:物理规则需要被设定到模型吗?还是相信在足够的数据里,模型通过观测可以自己掌握?

章国锋 : 我觉得两种都需要。

物理规律其实有两类。 一类是我们已经知道的,一类是我们自己都很难建模清楚的。

已经很确定的东西,比如一些基本的几何和物理约束,没有必要让模型花很大的代价再学一遍,可以直接告诉它。

但真实世界最复杂的部分,往往恰恰是人很难写成规则的。一个东西怎么运动、怎么形变,不同物体碰在一起会发生什么,这些最终还是要让模型从大量真实世界的数据里自己学出来。

所以我们的思路很简单: 知道的,就告诉它;不知道的,就让世界告诉它。

这也是为什么 4D 数据很重要。它记录的不只是世界长什么样,而是世界怎么变化。很多物理规律,其实就藏在这些变化里面。

 

张鹏:除了选择路线不同,你们在模型的架构上有什么思考?

章国锋 架构创新最根本的一点,是你的表征选在哪一层,这直接决定了训练的账怎么算。你看视频数据,相邻两帧之间大量信息是重复的,因为同一个场景,视角或者物体动了一点,每一帧都要把整个画面重新表达一遍,冗余度非常大。

但换到 3D 表征上就不一样了,3D 表征分为显式和隐式,显式表征适合场景编辑和快速渲染,隐式表征则在处理复杂不规则几何和推演规划上更具优势,我们也是显式和隐式表征结合用,核心关键是要坚守 3D 本质。因为依托 3D 表征,场景本身只需要表达一次,变化的只是状态,Token 的数量就能少一到两个数量级。Token 少了,需要的数据量、参数量是同步下降的。所以我们现在是几十张卡在训练,不需要万卡集群训练。这其实不是我们省着用,是这条路线的账本身就是这么算的。

具体的架构,我们是两条线在探索,一条是把 Transformer 往三维去适配。它在序列数据上已经被验证得很充分,我们看它怎么更好地适应三维结构;另一条更激进一些,是跳出 Next Token Prediction 这个范式本身去想问题。

两条路线我们都还在探索,但有一件事已经比较明确:方法可以变,三维结构不能丢。我们的内部实验里,只是把 3D 结构引入模型,学习效率就能提升一个数量级以上,在不同的下游任务中也能看到明显的效果。对我们来说,这已经是一个很强的信号。三维世界的问题,本来就应该尽量在三维空间里解决。

 

03

造「大脑」、开源和商业循环

 

张鹏:你是怎么定位影溯?是 Frontier Lab、产业里的技术能力供给公司,还是未来的产品公司?想用什么样的定位参与产业?

章国锋: 影溯的目标是实现通用空间智能基础模型。

我们最关注的不是先把它用在哪个行业,而是这个模型本身有没有足够强的基础能力。比如它能不能真正理解一个三维空间,能不能知道这个世界接下来会怎么变化,进一步能不能理解行动会带来什么结果。

就像一个人空间能力足够强,他到了家里可以收拾东西,到了工厂可以操作设备,开车时候又可以判断路况。 场景变了,但底层用的是同一种对空间和物理世界的理解。

这些能力一旦做成基础模型,就不只属于某一个行业。对具身来说,它可以成为机器人的「大脑」,解决换一个环境、换一个物体之后还能不能工作的泛化问题;对自动驾驶,可以帮助理解和生成各种复杂、长尾的真实世界场景;对游戏、影视和互动内容,它又可以变成空间生成、编辑和交互的基础能力。

所以具身、自动驾驶、游戏、影视,看起来是完全不同的行业,但对我们来说,底层很多问题其实是一样的:都是在理解、生成和推演一个世界。

我们真正要做的,是先把这个最基础的 「 空间能力 」 做强。基础模型足够强,上面的应用自然会长出来。

影溯是一家站在 空间智能 模型的视角,而不是原来语言模型的视角的公司。 人的智能包括语言智能和空间智能。语言智能至少发展到一定的成熟度了;而 AI 要走出对话框、进入到真实的物理世界,就需要空间智能。这目前还在刚开始的阶段。 下一个 AI 的 10 年,空间智能是最核心要解决的东西 。我们想做的,是下一个 AI 十年的事情。

 

张鹏:怎么理解影溯最近持续放出的新成果?

章国锋 过去一年我们发布的东西,主要分成两块:一个基础模型,InSpatio-World;一个引擎平台 ,Topos。Topos 又分 Pro 和 Lite 两个版本。InSpatio-World 解决「如何让空间走进动态视频」,Topos Pro 服务具身的训练仿真,Topos Lite 则是我们在前馈式 3D 生成模型上的探索,希望把 3D 生成做得更快、更轻、更好玩。

先说 InSpatio-World。输入一段视频,你就可以走进这个动态的场景里,自由视角地看。3 月份发布的时候,我们还做不到真正的 360 度,偏离拍摄视角过大可能会出现幻觉。但我们很快会有一个改进的新模型,活动自由度更大、效果更好,之后也会直接开放给用户,让大家上传自己的视频玩起来。

 

 

Topos Pro对标的是Marble,也就是用一张或几张图像生成一个3D场景。但我们不只是生成连成一片的3D高斯场景,还会把里面的物体自动识别、分割出来,再逐个实例化和补全,并且赋予相应的物理属性 。

逐个实例化之后,机器人面对的就不再是一整块只能看的3D画面,而是桌子、杯子、椅子等可以单独编辑和操作的对象。这些场景还可以进一步接入物理引擎,用来设计抓取、搬运、避障等任务,并采集机器人的动作、轨迹和任务成败等仿真数据。

更重要的是,我们可以把互联网上大量、多样的图像批量转成这样的3D场景。传统仿真场景主要依靠人工建模,数量和多样性都比较有限;用这种方式,可以快速生成不同空间、物体组合和环境条件的场景,用于机器人的训练和评测。如果机器人在某类场景中经常失败,系统还可以针对性地生成更多类似场景,让它继续训练,形成不断迭代的数据闭环。

 

 

不过前提是仿真环境和真实世界的差距要足够小,二是物理引擎本身的精度。 我们看到现在的引擎基于物理公式计算,算刚体还行,碰到柔性物体、流体这类复杂情况精度就不够,这块我们认为要靠数据驱动的可微物理引擎去突破。

 

张鹏:Pro 是给具身用的,为什么还要做一个 Lite 给普通人玩?

章国锋 Topos Pro 更追求质量和完整的世界模拟能力,而 Topos Lite 是我们对轻量化 3D 应用的一次探索,也是我们降低 3D 数据生产成本这条路线上的一个成果。

我们一直觉得,3D 过去很难真正普及,一个很重要的原因就是它太重了。但如果有一天,你随便就能拍下可以自由浏览的 3D 世界,可能很多原来不存在的应用可能就会出来。

所以我们把 Topos Lite 做得很轻,也把模型和技术报告开源了。我们希望不只是自己做几个应用,而是让更多开发者拿这个能力去尝试,看看轻量 3D 到底还能产生什么新的东西。我们自己也做了一个 App,让普通用户可以直接体验。

用户只要随意拍几张照片,秒级生成一个 3D 场景。以前也有类似的应用,但要小心翼翼拍一段视频、在云端等上 10 分钟,普通用户没这个耐心。现在拍完马上所见即所得,用户就愿意玩、愿意分享,原来发朋友圈的是照片,现在可以直接分享一个 3D 场景了。如果这件事足够高效、成本足够低,甚至能在手机端侧高效运行,3D 内容的生产方式会被彻底改变,就跟今天拍照、拍视频一样简单。它可以是记录,可以是分享,可以是创作,也可以进一步进入游戏、数字娱乐、电商、虚实交互等场景 ,甚至成为很多 AI 应用理解真实空间的入口。这个想象空间其实非常大。

 

张鹏:Cosmos、World Labs 都在往这个方向收敛。你觉得影溯的窗口期还有多久?

章国锋 技术上领先肯定都是阶段性的,我觉得真正重要的不是一个模型能领先多久,而是 能不能把这段领先变成积累。

我们现在最想建立的是数据的飞轮。转制能力更强,就能更早、更低成本地获得大量 3D、4D 数据;数据更多、更丰富之后,我们就有更大的空间去探索更强的模型,模型能力提高以后,又会反过来提升数据生产的质量和效率。

这个循环一旦转起来,积累的就不只是某一代模型,而是数据、模型和数据生产能力一起往前走。

所以我不太把它理解成一个很短窗口期。真正的竞争,是谁能更早把这个循环跑起来,然后让时间站在自己这一边。

 

张鹏:在国内的产业和资本环境下,在尽早养活自己和聚焦技术突破上,权重怎么选?

章国锋 我们定位自己是一个基模公司,最重要的还是不断去突破模型能力、去摸高。我们的判断是一旦空间智能实现 ChatGPT 时刻,应用就会开始爆发、规模化。所以我们目前还不想太早地深耕到某一个垂类去做商业化、太重视收入。我们担心的是,从长期来看这反而限制了天花板。

你看 LLM 的发展,可能一年前,大家没有想到 Vibe Coding、AI Coding 会是这么重要的一个应用。当时大家觉得全世界程序员也没有多少,蛋糕没那么大。但模型发展让不会编程的人也可以用 Vibe Coding,这个量就很大了。我们毕竟是研发驱动的基模公司,模型能力的突破从长远来讲更重要,它的突破会解锁原来你想不到的商业模式和应用。

 

张鹏:在 ChatGPT 时刻到来之前,价值循环率先会在哪些市场形成?已经印证了哪些?

章国锋 在此之前,我们目前也在做商业价值的印证,主要是三块。

一是我们的可控视频能力,跟一些视频模型结合,提供 Agent,让创作者效率更高、做出品质更高的视频,这完全是可以的。

二是给具身做数据服务。具身很缺数据,要采很多,我们的能力可以给它做数据打标、3D 结构化;很多第三视角的数据,可以变成第一视角的,甚至变成完全全量的3D数据;还可以增加多样性,换背景、各种光照都可以生成。这些是马上就能看到的商业价值。

三是跟一些头部具身智能公司,联合研发面向具身的世界模型。现在的 World Action Model,大家在用的时候,里面的 World Model其实是一个 2D 模型加后训练来做的。但这样的模型推理比较慢,空间理解能力有限,面对复杂遮挡就会遇到挑战。

我们认为这里面的模型应该就是一个 3D 世界模型。我们最新的一个工作,把 3D 几何的表征和动作的表征做联合建模,在一些非常有挑战性的复杂任务上,成功率显著提升,具体来说,在复杂遮挡环境的数据集 LIBERO-Occ 上成功率从原来的百分之四十几提升到 80% 以上。

另外 Topos Lite 我们刚发布,完全免费,模型也开源了,就是想让大家玩起来。如果 3D 内容真的起来了、蛋糕做大了,我们哪怕只占一小部分,也是很大的。

 

张鹏: 你们现在团队是什么样的 ?你怎么理解大家都在讨论的AI Native组织?

章国锋: 我们这个团队其实比较特殊。3D 今天看起来还是一个相对非共识的方向,很大程度上是因为数据太稀缺、技术链条也特别长,很难像语言模型一样,很快看到 Scaling 的结果。

但空间本身又是一个非常底层的问题。图形学、三维视觉、SLAM 这些方向,本来就是计算机科学里最复杂的几个领域之一。今天再往空间智能走,又要把大模型、数据、训练架构接进来,所以它天然需要一支非常复合的团队。

我们这里既有做了很多年 3D 的研究者,也有非常年轻的 00 后。老一代带来的是长期积累和判断,年轻人带来新的模型、新的工具和更大胆的想法。很多好的结果,恰恰是这两种东西碰在一起出来的。

Topos-Lite (开源名称为 QuerySplat ) 就是一个很典型的例子,它是由 00 后研究员主导,有经验的研究员在后面支持,有足够好的3D infra,一起碰撞出来的。我觉得这种组合特别有意思,年轻人可以大胆往前冲,但又不是从零开始,后面有很多年积累下来的东西托着他。

所以我理解的 AI Native,也不只是大家都会用 AI Coding。这个当然会提高效率,但不是最本质的。 更重要的是组织要足够扁平,让最好的想法可以最快被验证。

我们会把职级尽量弱化。谁对问题理解得最深、谁有最好的想法,谁就可以主导。路线也可以不确定,实验可以失败,甚至我们鼓励失败,但前提是每一次失败都要带回来新的信息。

我觉得真正 AI Native 的研究组织,一边要能把一个问题想很多年,一边又要能用几天把一个新想法试出来。 这两种能力同时存在,才是我们最想要的状态。

*头图来源: 影溯科技

本文为极客公园原创文章,转载请联系极客君微信 geekparkGO

Continue Reading对话影溯章国锋:互联网数据才是空间智能最需要的「太阳能」

Seedance 2.5 上线后,LibTV 先帮创作者「学会」了新模型

作者|甘德

编辑| 郑玄

 

Seedance 2.5 发布的时候,身边几乎所有 AI 视频或者 AI 影视相关的朋友都很兴奋。

「模型能力已经溢出了」。

一位在做 AI 短剧导演的朋友这样评价。他的体验是,现在有一个好故事,有专业的电影制作经验,或者一支足够专业的抽卡师团队,以及比较充足的资金,Seedance 2.5 已经能够稳定制作出业界工业水准之上的视频内容了。

但这样专业而无后顾之忧的创作者仍然是少数。

过去一年,视频模型的生成能力大幅提升。但这些变化还没有能够完全兑现到视频整体质量的提升上。

答案或许在那位 AI 短剧导演的后半句里。Seedance 2.5 是一块金子,但对于大多数人来说,需要一套更完整的专业创作工具,让模型能力得以最大化的兑现出来。LibTV 最近的更新,就是在更好地 leverage 前沿模型的迭代。

01

把模型的新 feature 做成工作流

Seedance 2.5 最大的变化之一,是它对参考素材的容量比 Seedance 2.0 大了很多。在 Seedance 2.0 最多可以同时处理 9 张图片、3 段视频和 3 段音频的素材容量上限上,Seedance 2.5 把全模态素材容量扩展到了 50 个。

模型吃得下更多上下文,但这些参考素材本身需要被生产、整理和匹配。这正是 LibTV 的切入点。

LibTV 的智能拉片(Shot Breakdown),旨在帮助创作者解决参考素材的生产和调用问题。

在传统影视生产里,拉片是一项前置于创作的基本功。导演、摄影甚至美术、剪辑都会从成熟作品中把影像拆解成一些独立的镜头片段来作为创作时的参考。「智能拉片」把这件事从手工拆解变成一个几乎一键完成的工作流。

整个智能拉片的操作很简单,你只需要把参考的完整影片放进去,然后就能得到「分镜」、「动态」和「音乐」三个模块的拉片结果。比如用一段岩井俊二的电影片段作为拉片素材,很精准的得到了拆分这段片段中具体场景的三个分镜组。

「智能拉片」提供的的拆解方式有「分镜」、「动态」和「音乐」三种。刚才提到的是「分镜」,除此之外,「动态」部分可以提供对于参考影片运镜的分析参考。而参考影片的 BGM 也能够在「音乐」中被准确的整理出来。

这个拉片的过程对算力积分的消耗是 0。

解决参考素材的自动化生产后,下一个更头疼的问题是,这么多不同维度的素材要如何在创作过程中做整理和匹配?

角色正面或是侧面、远景或是特写、行动轨迹、道具、服装、情绪和声音……一个 AI 视频创作在实际进入生成阶段前,往往已经有剧本、人物、风格和大量参考图,但这些东西并不会自然变成模型可用的输入。对于创作者来说,如果这些工作都靠人工完成,AI 省下来的时间很快会被另一种劳动吃掉。过去耗在拍摄和剪辑上的成本,可能只是转移到了素材整理、提示词修改和反复试错上。

好的参考素材变得更多,也更难管理了。LibTV 的智能引用(AutoLink)解决的就是「素材匹配」的问题。

当项目里包含大量角色、场景、道具和风格参考时,LibTV 会理解剧本内容,从画布素材中匹配相应参考,并把它们插入提示词中正确的位置。

对于参考素材的归纳和整理能力,难点并不在视频生成模型的能力本身,更像是视频创作里的「工程问题」。但当对 AI 视频作品的细节质量和时长要求更严苛,智能拉片(Shot Breakdown)和智能引用(AutoLink)或许会是 AI 视频创作者的生产力提升里,最容易被低估的一步。

对于 ai 视频创作最重要的视频生成环节,LibTV 也在 Seedance 2.5 的基础上做了一些很有吸引力的能力提升。

02

生成更长了,重拍更短了

Seedance 2.5 把单次生成长度从 15 秒扩展到 30 秒。对 AI 视频生成来说,更长的单段生成意味着视频画面在一致性的保证下,可以承载更完整的人物关系、剧情结构,甚至尝试更多更有深度的镜头语言的风格。

但对于更高质量的影视创作场景, 30 秒仍然不够长。

如果你要复刻一段小津安二郎在《东京物语》里那样对一个人物固定几分钟的长镜头对话,把数个 30 秒的视频拼接起来,保证完全一样的人物和环境,多次天衣无缝的首尾帧衔接,这仍然非常困难。

LibTV 的超长视频(Long Video Direct)功能,把单次视频生成 30 秒的时长上限,扩展到了 5 分钟。

你需要做的就是像在 Seedance 2.5 中操作的那样,把故事脚本、视觉风格和所有素材锚点放在画布上,然后把参考的图片、视频和音乐素材也放上去。比如下面演示的,生成一个《芭比》和《MadMax》混搭风格,高饱和度且有些暗黑、带点韩风的 MV 视频。

 

另外一点是,视频越长,要修改的部分可能就越多。一个 5 分钟视频里,问题可能出现在第 12 秒的表情或者第 2 分钟的角色动作,或者任何一个前后帧之间的画面不连贯。如果每次修改都要重新抽卡,生成视频长度变长对于创作者来说没有任何正向收益。

所以 LibTV 生成的这支 5 分钟的视频,不只是一次性生成出来的成片,你可以把它看作一个全流程可再编辑的项目。

整个视频中所有的镜头节点都会被保留下来。创作者可以看到它是由哪些片段组成的,再像传统剪辑一样逐段检查、局部返工和完善。长视频因此不只是变长了,而是变得可拆、可改、可迭代。对真正要交付作品的人来说,这比单纯把生成时长拉长更重要。

除此之外,哪怕回归到目前视频生成最基本要的抽卡环节,LibTV 仍然认为这里有可以提升的空间。

Seedance 2.5 的抽卡成功率比 2.0 提升很多,很多镜头基本可以一次抽成功,也能对具体时间段和画面内容进行调整。但在实际制作中,修改仍然可能牵一发动全身。

从 Seedance2.0 到 Seedance2.5,虽然模型可对具体时间段和画面内容进行调整,但不变的是修改后需要重新生成整条视频。如果创作者对内容的修改只能以再次抽卡的方式来实现,那从 15 秒到 30 秒到 5 分钟,视频生成的长度越长,创作者创作的成本也就越高。并且仍然存在每次重新抽卡,上一版视频原本满意的部分被改动了的状况。

如果以真实拍摄做个类比,当一段拍摄素材里整体符合要求,只是几个镜头有瑕疵,最优的选择不是全部重拍一遍,而是对那个瑕疵做些「补拍」。

LibTV 新的「片段重拍」功能关注的就是如何把生成视频的改动量范围的更小,比如——30 秒视频里如果只错 2 秒,就只改 2 秒。

这里有一段人物眼神特写的视频,如果现在我希望画面里的蓝眼睛短暂变成红色,然后又变回蓝色。我只需要在这段生成视频的基础上,继续给出明确时间戳信息的 prompt 即可。

而 LibTV 在不同长度视频的生产中所透露出的,对于局部修改能力的关注,也体现出头部 AI 视频工具对于创作者需求的感知变化:AI 视频工具开始从「生成逻辑」转向「制作逻辑」。生成逻辑关心模型一次能做什么。制作逻辑更关心一部作品到底如何被创作出来——各种素材如何被反复修改、协作、复用和交付。前者让人兴奋,后者真正让 AI 视频生成在现实的生产场景里成立。

03

理解模型,不应该成为创作者的工作

专业 AI 创作者今天仍有一个隐形的门槛:理解模型。

AI 为视频创作平权的叙事里,现阶段一个常被忽略的事实是:绝大多数创作者并非离 AI 那么近的人。他们面对的是一个个孤立的黑盒模型,而不是一套成熟的创作工具。

这不是创作者本来应该承担的工作。

导演应该理解镜头,不必理解模型脾气。设计师应该理解视觉表达,不必理解不同模型的输入偏好。AI 视频要成为真正的创作基础设施,这部分模型理解能力应该沉到工具里。

在 AI 内容创作这件事上,模型提供能力, AI 视频平台整合创作工具,但没有任何一方比创作者更重要。

LiblibAI 最早被很多人理解为 AI 绘画时代的模型社区。它把模型、提示词、作品和创作者连接起来,让原本分散的开源模型生态变得更容易使用。到今天,LibTV 当前强调 20 多个独家专业功能、50 多个顶尖模型聚合、100 多个 AI 导演 Skill,以及一个巨大的创作者社区。

这些数字本身不是重点,对视频创作工作流的理解深度,是 LibTV 能够在一众 AI 视频平台的竞争中,能够让创作者用脚投票的原因。

模型能力决定视频的上限,但工作流决定创意兑现的效率、确定性和成本。Seedance 2.5 把上限再次抬高了。LibTV 要解决的是另一件事:让这个上限不只属于少数既懂影视、又懂模型,还有足够资金的人。

 

 

前段时间爆火的《被裁掉的女孩》是一个侧面例子。

导演菲菲飞和团队制作的这部 AI 短剧,上线不到 30 天播放量就破了 1 亿。在 20 岁到 27 岁,菲菲飞的身份是一名模特,这部短剧的故事有很多从菲菲飞自己经历中生长出来的灵感。而随着 LibTV 团队版、资产管理、工作流等新能力上线,才有了《被裁掉的女孩》这样一部爆款作品,菲菲飞也第一次真正把 AI 短剧做成了一条能够持续生产、持续更新的创作流程。

换句话说, 模型能力越强,创作者越不应该把精力放在理解模型本身上。

如何创造一种新的语言,让模型能真正与创作者站在一侧,而创作者能够比以往更专注的思考作品中的故事、人物、镜头和节奏——LibTV 现在试图回答的,就是这个问题。

*头图来源:LibTV

本文为极客公园原创文章,转载请联系极客君微信 geekparkGO

Continue ReadingSeedance 2.5 上线后,LibTV 先帮创作者「学会」了新模型

全球存储芯片供应趋紧:内存长协议逐步向二三线厂商扩散

快科技8月12日消息,全球存储芯片供应紧张态势持续升级,长期供应协议(LTA)的覆盖范围已从三星、SK海力士与美光三大原厂,快速延展至闪迪及中国长鑫存储。

据Digital Daily此前报道,苹果公司曾试图与长鑫存储就DRAM采购价展开谈判,希望争取更低报价,但遭到后者断然拒绝。

长鑫存储坚持其报价不得低于三星电子和SK海力士的同期水平,甚至要求更高。

原因在于,华为、小米等中国本土终端企业已通过长期合约提前锁定长鑫存储的大部分产能,使其无需在价格条款上向苹果做出妥协。

市场预期,旧款iPhone 17将于本周启动涨价,日本市场旧机型价格已录得8%至11%的涨幅,而MacBook Air的增值幅度更达20%。

高盛发布的三星、SK海力士、美光及闪迪四家厂商长约条款对比表显示,目前各家合约期限普遍设为五年,部分客户选择三年期——即便最短的三年期,也已达到过去行业惯例(通常为一年)的三倍。

三星在近期财报电话会上明确表示,其LTA以五年为基础期限,并设有逐年滚动续约机制,实质上使合约处于“永不到期”的持续有效状态。

对一家云服务商而言,若要确保2028年前获得充足的HBM与DRAM供应,须先行将数十亿美元级别的资金存入厂商账户。

这笔预付款既锁定了货源,也牢牢绑定了买方,违约成本被抬至极高水平。高盛将此预付款机制定义为“本轮LTA周期与历次周期最显著的本质区别”。

全球存储芯片供应趋紧:内存长协议逐步向二三线厂商扩散

Continue Reading全球存储芯片供应趋紧:内存长协议逐步向二三线厂商扩散

销量暴涨150%!REDMI K100 Pro Max首销4199元闭眼冲

快科技8月12日消息,REDMI K100 Pro Max首销战报正式出炉,首销日销量直接做到了上代K90 Pro Max同期的150%。

在内存、芯片全线涨价的大环境里,还能拿出这样的销量成绩,属实是不容易。

今年数码圈的行情大家都清楚,旗舰机普遍涨价,很多机型要么加价要么减配,能守住性价比的没几个。REDMI K100 Pro Max这次不仅稳住了价格,产品定义还特别准,完全踩中了用户的核心需求。

核心性能方面,新机搭载8E5旗舰芯片,综合跑分达到455.5万,性能相当能打,日常使用、玩大型手游都不卡顿,再战两年完全没问题。

屏幕是这次的大升级,采用M11发光材料,还支持185Hz高刷,相比前代素质提升巨大,观感和操控体验都上了一个台阶。

续航也没短板,配上9070mAh小米史上最大电池,日常使用完全不用频繁充电。还有行业独一份的2.1立体声Bose调音,保证影音体验,首销4199元的价格,性价比十足。

网上还有不少人讨论,说K100 Pro Max值不值4499元的定价。其实根本不用吵,用户早就用销量投票了,销量暴涨150%就是最直接的证明。

上代K90 Pro Max口碑一直不错,如今已经停产了,想买的只能看剩余库存。

现在K100 Pro系列首销还有专属优惠,今年的行情就是早买早享受,晚买不仅没优惠,大概率还要涨价,想入手的抓紧冲就完事了。

销量暴涨150%!REDMI K100 Pro Max首销4199元闭眼冲

Continue Reading销量暴涨150%!REDMI K100 Pro Max首销4199元闭眼冲