OpenAI 高管不满中国的开源 AI 战略
科学家根据体细胞突变量化人类寿命的极限
西班牙夺冠,中国赞助商赢麻了
(本文作者为 融中财经,钛媒体经授权发布)
文 | 融中财经
北京时间7月20日,纽约新泽西体育场的终场哨响,斗牛士军团时隔16年再度捧起大力神杯。上一次,还是2010年的南非,他们击败荷兰首次登顶。十六年后,传控足球的信徒们等来了第二座。
这座冠军没有半点侥幸。半决赛2比0干掉世界排名第一的法国,西班牙将一项恐怖纪录延续至今——自2024年3月以来37场常规时间不败,追平意大利在2018至2021年间创下的历史纪录。
这个世界没有什么比一战成名更让人热血沸腾。如果有,也只能是在成名前加上“年少”二字。手握欧洲杯与世界杯双冠,19岁的亚马尔站在球场中央,一个时代的接力完成得干脆利落。
而赛场内外,中国生意一场没落下。本届世界杯16家全球赞助商中,中国企业占据3席,合计投入超5亿美元,约占FIFA全球赞助总收入的16%,规模位列全球第二。
揭幕战当晚,围挡广告牌上一行中文格外扎眼——”海信蒙牛值得信,蒙牛海信就是牛”,两个中国品牌的名字并排出现在世界杯赛场,这在近百年的赛事历史上还是头一遭。
围挡上的中文,裁判室里的中国屏
本次国际足联设置的不同档次合作级别:最高级“国际足联合作伙伴”享有FIFA旗下所有的赛事权利,四年的投入从一亿五千万美元开始;中等水平的世界杯赞助商费用大约为六千五百万至九千五百万美元之间;更低一级的是本届扩大的区域支持商,要求约为两千万美元左右。

联想的入场姿态最引人注目。首次参加就进入了第一梯队,并且作为国际足联历史上第一个中国的技术合作伙伴参与到比赛中来,提供了人工智能裁判系统、三维数字化人物等等核心的技术支持。海信与蒙牛都坐到了第二级官方赞助商的位置上,前者是继2018年的俄罗斯、2022年的卡塔尔之后的第三次赞助,后者也是完成了三次连续的赞助。
联想给16个球场布置了超过一万七千台设备,并派遣了二百多个工程师,赛事的服务器、人工智能结构以及越位判罚三维建模技术都是由他们完成的;而海信则向VAR视频裁判中心提供了RGB-Mini LED显示屏,并且被直接植入到判决过程中去。
也就是说,在裁判画线、比分跳动的时候,背后都有中国的屏幕和中国的计算能力起作用。有一个很具象征意义的地方:第一位执法两届世界杯的中国裁判员马宁此次身份为联想AI技术体验官,中国裁判没有进入决赛,但是中国的科技却进入了裁判室。
蒙牛打的是情感牌。从去年12月开始进行世界杯主题球星拍摄活动,到今年4月份推出“和蒙牛一起踢球”的全球倡议,并且一口气签下了梅西、姆巴佩、亚马尔三名代言人之外,还有中央电视台世界杯转播钻石级合作伙伴的身份,同时还将旗下的各个子品牌进行了细分授权:特仑苏、圣牧有机、每日鲜语、妙可蓝分别对应官方牛奶、有机牛奶、高端鲜奶与奶酪合作伙伴。2030年的世界杯官方赞助商席位也已经被蒙牛提前官宣锁定。
决赛这晚,中国品牌的押注几乎全部命中。TCL同时赞助了西班牙、阿根廷、德国三支国家队,伊利签下的五支国家队里也有阿根廷,库迪咖啡是阿根廷国家队全球赞助商,瑞幸则拿下西班牙国家队中国区赞助权,2018年靠“法国队夺冠退全款”一战成名的华帝,这届成了西班牙队的中国大陆区官方厨电合作伙伴。决赛双方身后各站着一排中国品牌,梅西和亚马尔隔网相对,蒙牛的两位代言人总有一个要举杯。
官方赞助之外的战场同样热闹。泡泡玛特的LABUBU成为了世界杯历史上第一个被邀请到开幕式上、第一个出现在官方单曲MV里的中国原创潮玩IP,在THE MONSTERS×FIFA系列联名产品里有三款商品卖出了超过一万份,其中Catch the Win搪胶毛绒公仔卖出两万多只。
而距离比赛地一万公里之外的义乌,则已经分出了输赢。“义乌制造”的市场份额在上届世界杯时就占据了全球周边产品市场将近七成的比例,在本届赛事中又增加了二十到三十个百分点的新订单。
根据义乌海关的数据,在2025年的时候当地的体育用品和器材出口金额达到了116.5亿人民币,并且比上一年增长了20.3%。有的商家已经给球衣在国外申请了四十多个外观设计专利,同一种产品却卖出了二十个百分点的价格优势;一个用各国国旗颜色制作而成的“解压足球”,上线之后几天内就收到了三十万多个订单。
一批四年前没什么人认识的出海品牌,也在这个夏天集体开张。深圳投影仪品牌TouYinGer在巴西市场的世界杯期间销售增长超9倍,耳机品牌KZ在巴西增长12倍,Magcubic的西班牙爆品增长了90倍。
把镜头再拉远一点,中国元素几乎铺满了赛事的地基。在墨西哥赛区有800多辆新能源接驳车上,其中超过95%都是来自中国的车辆,而宇通就占了其中的85%;中国中车提供给赛事使用的115列轻轨列车,在世界杯期间每天可以承载超过12.5万的人次客流;洲明科技和艾比森为赛事提供了将近一千平米的led显示屏方案。
不止赞助方,拿下世界杯转播权的小红书也赌赢了。
今早 6 点西班牙时隔 16 年重夺大力神杯将热度拉满。小红书官方披露世界杯转播成绩远超预期:APP 使用时长环比增速翻两倍,日发布笔记数环比增速提升 3 倍,长时观播用户同比涨近 5 倍。
据数据,世界杯期间足球内容日均搜索量是上届的 3 倍,日均发布量是上届的 27 倍,万赞优质笔记是赛前的 200 倍,体育垂类曝光量同比增长 200%。
从英利的广告牌开始,中国企业的世界杯赞助史
中国企业和世界杯的缘分,始于一次救场。由于2010年的金融危机使南非世界杯的一个赞助商突然退出,所以光伏企业英利用上新的清洁能源理念说服了国际足联(FIFA),从而获得了最后一张入场券。
在每一场比赛中,“中国英利”四字会在场上出现8分钟的时间,有很多中国的球迷到现在还记着那个“中国英利、光伏入户”的广告牌。回报很快到来,在比赛期间英利股票价格上升了3.8美元,市值增加了5.6亿美金,赛后媒体报道量增长了八百个百分点,网站访问量提高了五倍以上,当年的组件销量也翻了一番,之后两年一直保持世界第一的位置。
在2014年的巴西世界杯上,英利仍然是唯一一个中国企业的赞助商。根据当时的国内媒体报道来计算的话,在这两届世界杯期间,英利所花费的钱大约是十亿左右。
真正意义上的集体入场是在2018年发生的。这一届的情况很特殊,在距离俄罗斯世界杯开幕只剩一周的时候,由于老牌赞助商没有续约的原因,还有15个空缺的席位。
中国企业的机会就此来了。万达、海信、蒙牛、vivo、雅迪、指点艺境、帝牌这七家企业都进入了赞助名单中,并且涵盖了所有的三个等级;而万达早在2016年就花费了1.5亿美元获得了第一级赞助商的位置,其权益包括了之后四届世界杯。
根据市场研究公司Zenith的数据,在那一届世界杯期间,中国的广告开支达到了8.35亿美元,比美国企业的4亿美元多了将近一倍。
那一届世界杯也留下了一则被载入中国营销史中的案例。2018年3月,厨电品牌华帝与法国队签约,在5月30日的报纸上刊登了整版广告:“法国队夺冠,华帝退款。”随着法国队一路前进,这句话的热度也在不断上升。
等到了法国队真的拿奖杯的时候,人们都为华帝计算着要赔多少钱,但是华帝自己账本上的情况却大不相同。根据其公告,在线下的销售渠道中,整个活动期间预计会有超过七亿元人民币的销售额,并且比去年增长了大约二十个百分点;在线上渠道里,则有三亿多元以上的销售量出现并且增幅达到三十个百分点以上;但是所要承担的退换货费用总共只有不到七千九百万元。
夺冠第二天早上开盘时,华帝股票就涨停了。在同一年的世界足球赛中,长虹美菱与比利时队合作推出了“夺冠免单”,万和则和阿根廷队一起发起了“金靴五折”的促销活动。
到2022年的卡塔尔,该曲线已经到达了最高点。根据英国咨询机构GlobalData的数据,在这四个企业中,万达、蒙牛、海信和vivo一共花费了13.95亿美元来参加世界杯,超过了美国企业所花的11亿美元,中国企业的第一次成为了世界杯最大的赞助商。
在比赛开始前两天的时候,雅迪与BOSS直聘也进行了一场压轴官宣,并且赶上了区域赞助商的最后一班车。而伊利则另起炉灶,一并签下了阿根廷、西班牙、葡萄牙、德国四个国家的球队,成为本届赛事中最为抢眼的一个品牌。有球迷看了揭幕战之后说,中国的广告把整个世界杯赛场都给围起来了。
到2026年的时候,故事就变成了另外一种说法。根据华创证券的数据,在本次中国企业参加世界杯官方合作赞助的情况下总共花费了超过五亿美金,比上一届减少了将近三分之二,并且只有三个品牌的参与度降低。
由于赛事在北美洲举行,很多比赛都安排在了北京时间晚上十一点之后、凌晨之前进行,所以一些公司根据自己的运营规律作出了选择。但是数量减少的同时分量却变重了:联想参与到赛事规则的制定和执行当中来,海信产品被深深地植入到裁判系统里去,蒙牛则通过线下消费场景来进行情感上的连接,剩下的三家公司所获得的赞助级别以及价值都比以前提高了。
16年里,赞助逻辑也发生了一些变化。海信这样的公司赞助世界杯是由于它正在做全球化的事业,在国外消费者的脑海中要形成品牌的印象。
而对于主要面向国内市场的企业而言,“借势”的核心价值更大一些。行业内有一个被广泛接受的计算公式是:只付赞助费不进行激活的话就相当于买了一个没有人宣传的广告牌位置,一般要加上两到三倍的激活营销费用才能把世界杯流量变成品牌的知名度和销售量。
按照这样的计算方法来算的话,一个顶级赞助商全部的营销投入可能会达到三到四十亿人民币。每一年都会有人重新去做这道题,但是每年的答案都不同。
世界杯之外的体育赛道
把目光从北美收回国内,会发现中国的赛事生意正在自己长出新故事,最典型的样本是苏超。
2025年的第一届“苏超”现场观赛人数已经达到了243万人次以上,场均上座率达到2.8万人左右,创造了省内的记录,在线观看人数超过22亿次,社交媒体上的相关内容浏览量也超过了1000亿次;最初的赞助商只有六家,在整个过程中逐渐增加到了省级层面的四十一家,官方赞助席位的价格也涨到了三百万元,并且出现了“一席难求”的情况。
互联网大厂入场的方式很有趣,阿里系旗下的淘宝闪购、支付宝、花呗、余额宝等分别给不同的球队命名,被称为“阿里内战”;而美团、京东和饿了么也把即时零售之战烧到了赛场上,在球场之外上演了一场行业的对决。
于是热度就自然地成了价格了。到2026年的时候,苏超将会被江苏银行和苏豪控股共同冠名,并且苏豪控股还会带着旗下的五家公司一起参与进来;而国缘V3、海澜之家、海之蓝、伊利等等二十四个品牌也会组建成一个赞助矩阵,根据媒体报道中的信息显示,本次比赛的总冠名费用相比上一年度增长了很多。
一级市场账本也在不断增厚。根据懒熊体育的数据,在2025年的国内体育相关的公司中,有35个公司的融资事件发生,总共大约是16.75亿人民币,比上一年增加了约18.42%,而总的金额也增长了约40%;并且种子轮、天使轮和A轮融资加起来占到了七成以上,早期项目依然是资金关注的重点。
钱最多的地方就是室外。根据国家体育总局公布的数据来看,我国户外运动的人数已经超过了四亿人,在2025年的全年来,该赛道共完成了十次以上的融资活动,并且总金额达到了8.2亿人民币左右,占据了整个市场将近一半的比例。
2025年4月,伯希和向港交所提交了招股说明书,在此之前的一个月里刚刚获得了来自腾讯的三亿元战略投资;到了10月份的时候,坦博尔也递交了上市申请书,成为了今年内第二个要进入资本市场进行融资的品牌;而到年底时,“为李宁、安踏、安德玛生产运动鞋”的龙行天下拿到了广东省证监局的辅导备案,并且开始了在上海证券交易所主板上的首次公开募股,乐欣户外也在经历了两次失败之后第三次试图发起新的申请。
有趣的是,世界杯的赞助商也在这份名单上。到2025年底的时候,蒙牛集团旗下的专业运动营养品牌已经完成了接近一亿人民币的A轮融资,其中仙乐健康是领投方之一,而高瓴创投和蒙牛创投则是跟投方。一边在世界杯赛场上抢夺最昂贵的广告位置,另一边又在一级市场上投资于更加早期的运动产业中去。而在另一端的大洋彼岸,投资人则更为直接地表示出自己的观点:切宁集团的贝蒂内利说:“所有有关于2026年美国世界杯的相关项目都可以被‘买入’。”
世界杯每四年就有一个周期,在此期间内赞助商名单也是一次又一次地更换。但是从英利的广告牌、联想的裁判室、义乌的小商品、开幕式上出现的LABUBU,一直到苏超300万一份的赞助席位以及一级市场的16亿投注额——中国的体育生意这本书已经不需要等到一张决赛门票就可以打开了。
更多精彩内容,关注钛媒体微信号(ID:taimeiti),或者下载钛媒体App
具身智能的“ChatGPT时刻”,可能不会同一天到来
(本文作者为 吴怼怼,钛媒体经授权发布)
文 | 吴怼怼
在WAIC 2026智启具身论坛,行业在探讨的,是一套能够在物理世界持续学习、自我改进的系统。
7月19日,2026世界人工智能大会·智启具身论坛在上海世博中心举行。论坛由智元、觅蜂科技联合主办,清华大学、Physical Intelligence、Genesis AI、Dyna Robotics、Sunday Robotics、腾讯 Robotics X等团队参与。
听完后,一个很明显的感受是:虽然“人形机器人”依然是最容易吸引镜头的概念,但台上被反复讨论的关键词,已经从自由度、关节数量和动作展示,转向了数据、模型、仿真、部署、失败反馈和持续学习。
这意味着,具身智能正在进入一个新阶段。
过去两年,行业首先要证明机器人“能做”;现在,问题变成了它能不能连续做几百次、几千次,换一个环境还能不能做,失败以后能不能自己恢复,以及部署出去以后,能力能否继续增长。
换句话说,具身智能的竞争,正在从机器人产品竞争,变成一场训练系统和数据基础设施的竞争。
01、物理AI的Scaling Law,卡在交互经验
大语言模型的Scaling Law相对直接:更多数据、更大模型、更多算力,通常可以换来更好的能力。
但物理世界并不是一个可以直接爬取的互联网。
智元合伙人、觅蜂科技董事长兼CEO姚卯青在演讲中将物理AI面临的问题概括为“三道墙”:数据墙、表征墙和闭环墙。

数据墙,是高质量真实交互数据昂贵且稀缺;表征墙,是不同任务、场景和机器人本体之间,尚未形成足够统一的物理表征;闭环墙,则是真实世界中的试错速度慢、成本高,一次失败可能带来零部件损坏,甚至影响整台机器。
这个判断很重要。
语言模型犯错,通常只是生成了一个错误答案;机器人犯错,可能打碎杯子、碰伤人或者造成产线停机。因此,物理AI真正需要规模化的,并不只是“数据量”,更是可执行、可评价、可回流的交互闭环。
这也解释了为什么把一个大模型接到机器人上,并不等于完成了具身智能。大模型擅长回答“这是什么”“应该做什么”,机器人还必须解决“怎样做”“力度多大”“失败后怎么办”,以及“做完以后,世界发生了什么变化”。
从数字AI到物理AI,是要把经验规模化。
02、数据开始从“数量竞赛”变成“配方竞争”
本次论坛最值得关注的变化,是几乎所有团队都不再相信单一数据来源能够解决问题。
目前逐渐形成的数据结构,大致像一个金字塔。
底层是规模最大的互联网视频和人类行为视频,它们成本低、覆盖广,可以帮助模型理解物体、场景和人类行为;中间层是第一视角、UMI等“无本体数据”,即通过手持或穿戴式设备记录人的动作轨迹,绕开昂贵机器人的采集瓶颈;顶层则是真机遥操作数据、实际部署数据以及机器人失败后的回流数据,数量最少,却最接近真实执行。
姚卯青在圆桌中估计,若将机器人的“ChatGPT时刻”定义为能够开箱即用、理解开放式自然语言指令,并在常见任务中达到70%至80%的基础成功率,具身数据可能需要达到亿小时级别。这个数字,说明了真机采集不可能是唯一答案。
清华大学计算机系副研究员苏航把具身预训练的演进归纳为三条线:数据从单一本体走向多源混合,模型从行为模仿走向世界建模,学习从离线训练走向真实部署中的持续进化。
这意味着,未来的模型不会只学习“看到这个画面就做这个动作”。它还要理解任务进展、预测动作后果,并把不同机械臂、人形机器人和场景中的经验压缩成可迁移的能力。
数据基础设施由此成为具身智能产业链里越来越重要的一层。觅蜂科技展示了MEgo系列采集终端、MEgo Engine治理平台和AGIBOT WORLD真机数据集,试图把采集、清洗、标注、评测和部署回流接成一条链。商业价值可能也会从“出售一批数据”,转向帮助客户设计数据配方,并证明这批数据确实提升了模型表现。
对具身智能来说,低质量数据的规模化甚至可能放大问题。一个动作标签偏差、一段时间没有对齐的传感器数据,进入训练后都会变成机器人执行时的误差。数据量很重要,数据能否跨本体复用、能否回到真机闭环验证,重要性更高。
03、VLA和世界模型,正在从路线之争走向融合
过去一段时间,具身智能存在一场路线争论:机器人应该直接使用视觉—语言—动作模型,也就是VLA,从图像和指令端到端输出动作;还是应该先建立世界模型,预测每个动作可能给环境带来的变化,再决定如何行动?
从这次论坛释放的信息看,两条路线正在走向融合。
智元展示的GO-2强调动作思维链,让机器人先做粗粒度规划,再完成高频、精细的执行;Act2Goal则通过预测中间视觉状态,实现“先想后做”。智元将VLA与世界动作模型融合后的方向称为WRAM,即世界推理动作模型。
Physical Intelligence研究科学家任至意展示的π0.7模型,则提供了另一个有代表性的结果:模型在ARX机械臂上学习衣物折叠后,可以迁移到UR5双臂机器人上执行相似任务,不需要针对新本体重新微调。
跨本体迁移,是具身智能能否形成平台型公司的关键。
假如每换一种机械臂、夹爪或者机器人,都要重新采集数据、重新训练模型,那么机器人行业最终仍然会停留在传统自动化项目制。一旦模型能够把不同本体的经验映射到相对统一的动作空间,软件和数据才可能获得真正的规模效应。
清华大学苏航提出的方向同样指向统一表征:数据从单一本体走向多源混合,模型从行为模仿走向世界建模,训练则从一次性离线学习,走向部署过程中的持续进化。
最终的物理AI系统,可能是一个多时间尺度系统:上层理解语言和任务,中层预测未来状态并制定计划,底层负责高频控制和即时反应。
这更像人类的大脑、小脑和神经反射系统协同工作,而不是让一个模型以同样频率思考所有问题。
04、真正的分水岭,是从“视频能看”到“机器能用”
具身智能行业曾经有大量令人惊艳的演示,但演示和产品之间存在一条很深的鸿沟。
一个机器人成功叠好一次衣服,可以制作一段传播广泛的视频;一家工厂真正关心的,却是它能否连续工作,成功率是否稳定,出现异常是否能够恢复,维护成本能否被节省的人力覆盖。
这次论坛上,一些数据开始具有产业参考意义。
据智元现场披露,其机器人在江西南昌的一条3C产线上进行了连续六天、每天超过10小时的作业,累计完成接近6.5万次操作,成功率达到99.99%。
Dyna Robotics披露,其商用基座模型DYNA-1在餐巾折叠任务中成功率达到99.4%,并在24小时无人干预情况下完成超过850个餐巾的折叠;针对新任务,所需后训练数据不到一小时。
这些数字仍需要放到更长周期、更多场景和实际成本中观察,但衡量标准的变化已经十分明确:行业开始用连续运行时间、任务成功率、适配数据量和人工干预频率,而不是单次演示效果评价机器人。
更深一层看,商业部署与通用智能并非完全对立。
过去,人们担心做具体项目会拖累通用模型研发。但Dyna Robotics等团队提出的“研究—部署飞轮”说明,真实部署可以暴露实验室无法预见的问题,也能产生最有价值的长尾数据。部署不只是模型训练完成后的终点,也可能是下一轮训练的起点。
谁先把机器人部署出去,谁就更早获得真实数据;谁能更快消化数据,谁的后续部署成本就更低。这可能成为具身智能时代最重要的飞轮。
05、“ChatGPT时刻”不会在同一天到来
圆桌最后,嘉宾们给出的时间判断从两年到五年不等:姚卯青判断两年,Sunday Robotics赵子豪认为三年以内,马也骋判断四年,任至意认为四五年,张正友给出了三到五年的区间。
机器人未必会复制ChatGPT在某一天突然席卷所有人的路径。大家口中的“ChatGPT时刻”其实未必指向同一个终点。
ChatGPT是一项纯软件产品,只要服务器准备好,几乎可以瞬间触达全球用户。机器人受到制造产能、硬件成本、供应链、安全标准和现场维护的共同限制,不可能通过一个网页完成全球分发。
物理AI更可能是分层涌现。
试想一下,首先出现的,会是在工厂、仓储、后厨等环境相对结构化、任务价值明确的场景;随后进入商超、酒店、养老等半开放环境;最晚成熟的,很可能才是变量最多、容错要求最高的家庭。
因此,具身智能真正值得关注的,是谁能同时建立模型能力、数据基础设施、仿真评测、机器人本体和真实部署网络。
在这场竞争中,中国公司的优势在于制造业场景密集、供应链完整、工程落地速度快;下一步要回答的,则是这些场景能否沉淀出跨本体、跨行业复用的模型能力。
当越来越多机器人在真实世界里持续工作,并把每天遇到的成功、失败和意外重新变成训练材料时,物理AI的智能涌现已经在发生,只是速度不一,地点不同。
更多精彩内容,关注钛媒体微信号(ID:taimeiti),或者下载钛媒体App
具身智能还在“前GPT时代”

WAIC 2026的展台上,机器人叠衣服、冲咖啡、切菜、分拣,从工业产线到厨房灶台都在演示“干活”。
走出展台,跟那些真正在一线的人聊下来,不管是造机器人的、训模型的,还是铺产线的,听到的判断要保守得多。这个行业的实际进度,远没有展台画面看上去那么近。
面壁智能的姚远打了个比方,现在的具身智能像2018年的大模型,BERT、GPT、T5三条路线并存,谁也不知道哪条最终成立。“当前最火的不一定能笑到最后。”腾讯张正友说,最聪明的人工智能“还是一个缸中之脑,它可以编程、通过考试,但从来没有真正地活过”。大模型善于推理和知识问答,也能读懂图像和视频,但一旦进入真实世界,“很难在一个持续变化的环境里面,一边行动一边接受反馈,再及时做出调整”。具身智能还没有像Transformer那样收敛的统一框架。
不管是路线、能力还是可靠性,几位核心从业者的判断指向同一个结论,具身智能还在“前GPT时代”。
Scaling Law在物理世界遇到了什么
大模型在数字世界靠堆数据实现涌现,物理世界没有这么顺畅。
智元机器人联合创始人姚卯青在WAIC期间把障碍归纳为三道墙,数据墙、表征墙、闭环墙。数据墙指真实交互数据稀缺且昂贵;表征墙指跨任务、跨场景、跨本体的统一表征尚未形成;闭环墙指真实试错代价高、反馈慢。
面壁智能的角度不同,姚远把具身智能分成三个模块,各自成熟度不同,语言模型最成熟,多模态感知大约在70%到80%,行动(action)可能只有40%。
两种说法落到同一个结论,Scaling Law在物理世界不能简单复制。
互联网文本可以持续累积,机器人面对的物理交互数据却不会天然存在,跨场景的统一表征远比文本tokenization复杂,真实世界里试错要付出代价,而且不可回滚,反馈慢,无法像数字世界那样低成本地反复重跑。
三道墙之间是相互锁死的。数据不够,表征就训不好,表征上不去,闭环效率随之下降,闭环慢了,反过来又拖累数据积累。姚卯青点出了VLA(视觉-语言-动作)模型的一个短板:“VLA没有L(语言),无法做长程任务规划和判断。”当前最主流的端到端范式,在需要理解指令、拆解步骤、做中间判断的长程任务上,缺的就是这一块。
路线还没收敛
问题明确,但往哪走还没有答案。
目前至少有三条路线在并行,VLA(视觉-语言-动作端到端)、世界模型(预测物理状态变化来指导决策)、智元提出的WRAM(世界推理动作模型,把世界模型和语言推理能力整合进一个框架)。姚卯青认为VLA缺语言能力,无法完成长程规划。面壁智能和Physical Intelligence倾向另一条路,把VLA与世界模型融合。
张正友的判断又不一样,他主张认知系统、感知行动系统、底层反应系统分层协同。不同模块要在不同频率上运行,底层反应要100赫兹甚至更高,感知行动在10到15赫兹,大脑可以慢一些。他用人的肢体反应打比方,“绊了一脚,肢体反应假如用VLM是达不到,那个是10赫兹,100毫秒,这个时间来决策是来不及”。VLA的问题在于前面的VLM和后面的动作模块在同一个频率上运行,跟物理世界直接交互时反馈跟不上。单一模型很难解决一切。
现在像2018年大模型的BERT/GPT/T5阶段,收敛还需要两到三年。“2018年最被看好的并非GPT,最后胜出的却是GPT。”姚远说。
具身智能可能也会如此,今天展台上最吸引眼球的路线,未必是终局。
姚卯青还有一个更底层的判断。现在用的底层组件,Tokenizer、Encoder,都是从VQA(视觉问答)和对话模型借来的,并非为具身任务原生设计。他把这称为“具身原生”问题,认为要到百万小时级数据才能做真正的原生架构。行业目前还在用“改装发动机”,没有造出“原生引擎”。
这个判断如果成立,当前的路线之争可能还在浅层,真正的分歧要等数据规模上来、原生架构成为可能之后才会展开。
能演示和能干活之间,隔着工程量
展台上叠一件衣服3分钟,观众拍手叫好。但工厂要的是6秒节拍、99.8%的准确率。
博世智能科技的刘敏在WAIC论坛上给出了制造业的标准:“工厂要99.8%准确率,节拍6秒是门槛。从能用到可用,是两个指标。”这两个指标之间,要求具身智能跨过展台走向产线。
智元在南昌一家3C工厂的产线上做到了99.99%成功率,是目前公开案例里最高的数字之一。姚卯青详述了背后的工程量,首批项目需要数月做硬件软件集成、对接MES系统(制造执行系统),然后是通宵压测,每晚测试,连续一个月才上主产线。从零到一要三四个月,到产品化之后才能一两周复制一个点。
越疆科技的刘培超谈的是硬件,机器人至少20个关节起步,比汽车更复杂,行业通用要求是5万小时MTBF(平均无故障时间)。他接着说:“今天大部分机器人可能10小时的MTBF都没有。”
灵巧手的情况更严峻,姚卯青提到,灵巧手“采集数据一两周就出问题,每工作半小时要散热”。零部件“还没有到汽车16949标准”,这是汽车行业零部件供应链的质量管理标准,机器人核心零部件的可靠性工程,离工业级还远。
艾欧智能联合创始人丁哲章看到的是另一面,今年聊“落地”的需求明显变多了,“但落地案例有没有变多,要打个问号”。他说的核心问题是,“场景方对具身的预期,和本体、模型现在真正能做到的程度之间,有一个断层”。
他的思路是“渐进式落地”,机器人做一部分,人监管一部分,先接受这种“中间状态”。他把具身的发展阶段梳理成一条时间线,2022年是“PPT阶段”,2023年是“把本体做出来但放那儿不能动”,2024年“将将能动起来”,去年“进入部分场景、具备部分自主能力”。
至于今年能到什么程度,他持保留态度。
腾讯云的黄阳则认为,这类技术都有长尾效应,“会非常快速地推进到60%、70%、80%,但最后那20%要花非常非常多的时间去填。”
今年跑通,但路还长
几位具身行业的资深人士给出的时间线开始接近,但都不算近。
姚卯青判断,“2027年底到2028年初看到比较强的涌现时刻”。面壁智能的刘知远说端侧模型“还需要1到2年、2到3年”。丁哲章更谨慎,他以自动驾驶作类比,十年前从业者宣称2025年做到L5全自动驾驶,十年过去,自动驾驶达到的是“差不多可用”,好用、可用,但并非当初想象的全自主。他认为具身也会经历同样的预期修正,“先有高预期,然后预期调整,再逐渐贴近现实,这个过程可能非常漫长”。
张正友的参照系是ChatGPT。他在微软做过20多年人机交互,语音对话在特定场景里效果不错,“但是问的问题稍微变一变很不稳定,所以一直没有发展起来”,直到ChatGPT出现才“真的感觉是有进步”。具身智能也需要这样的节点,“他真的帮你做事情你可以依赖于它。假如说失败概率太大,不稳定要人照顾机器人,还不如让这个人完成这个任务效率更高”。
光轮智能联合创始人杨海波给出了更具体的时间判断,今年是“跑通”年,明年才能“算账”。他预测明年本体价格会降到今年的十分之一,稳定性提高一百倍,如果成立,硬件可靠性这道坎有可能在明年迈过去一大步。软件、数据、评测这些基础设施的缺口,不会随硬件改善自动消失。
把这些判断放在一起,大致能勾勒出一张时间表。短期内(今明两年)是特定场景的工程跑通,中期(2027到2028)可能出现能力涌现的节点,通用具身智能要从工厂走进家庭,从结构化的工业场景走到非结构化的生活场景,这条路可能比大多数人预期的要慢得多。
展台上的画面和这些判断之间显然还存在一些落差。展位都在展示机器人“干活”,真正做过产线的人清楚,从演示到能上产线,再到大规模普及,中间隔着的不止一两个技术突破,还有一整套未建成的基础设施,数据标准、评测体系都缺,零部件可靠性不够,持续学习能力也尚未成形。
姚远说”当前最火的不一定能笑到最后”。这句话置于2026年的WAIC,不只是路线之争,也是整个行业此刻所要面对的真实处境。(本文首发钛媒体APP,作者 | AGI-Signal,编辑 | 秦聪慧)

更多精彩内容,关注钛媒体微信号(ID:taimeiti),或者下载钛媒体App
- Go to the previous page
- 1
- …
- 114
- 115
- 116
- 117
- 118
- 119
- 120
- …
- 160
- Go to the next page
