夜雨聆风学习资料网

ARTICLE · 1046910

世界模型会是机器人的安卓时刻吗

世界模型会是机器人的安卓时刻吗

李飞飞9月初放出了她说的「全球首个多模态世界模型」Atlas,同一周,淡出管理层多年的张一鸣被曝亲自下场督战字节的世界模型,国内松延、智元、宇树在8天里连发5个模型。三方连热闹都是同一场热闹。

我第一个想说的是这句,大语言模型把「理解语言」这条赛道快卷到头了,现在所有人扭头去抢同一个新码头,叫作「让机器理解物理世界跑起来的样子」。这是个连李飞飞自己都承认被用滥了的词,可她照样把它捧在手心,这个反差本身就很有意思。

这篇不准备替你吹谁踩谁,就顺着「世界模型到底在赌什么」这条线,把为什么这么多钱同时涌进来、为什么又有一半人喊它是泡沫,摊开给你看。

三家在同一个月里扑向同一个词

先看李飞飞那张牌。World Labs的Atlas,官方口径是全球首个多模态世界模型,原生处理文本、图像、视频、相机位姿和三维深度图。它跟那些做视频生成的AI最大的区别,是预测的东西不一样。语言模型预测下一个词,视频模型预测下一帧画面,Atlas预测的是「换一个角度看过去,世界应该长什么样」,官方管这个叫新视角预测,New View。你给它一两张参考图,画一条运镜轨迹,它能沿轨迹生成最长60秒、1440p的画面,还能从手机随手拍的几段视频里重建出一个可探索的3D空间,那种《黑客帝国》的子弹时间,拿手机就能做出来。

英伟达的Jim Fan给了个很克制的评价,说这是机器人在真实到仿真这条路上的一大步。World Labs这几年攒下的身家也不薄,累计融资超12亿美元,2026年2月那一轮直接到10亿美元,估值约50亿美元。

接着是张一鸣那张牌。9月7号彭博社拉响警报,字节跳动正在基于自研的视频生成模型Seedance,开发一款实时空间视频生成的世界模型,视频在云端每秒生成约20帧、延迟约0.05秒,直接喂给Pico头显。你张口、转身,眼前的世界跟着你变。这个参数的杀伤力在于,50毫秒是人类感知交互延迟的临界线附近,它基本做到了感知无缝。这种跨部门的资源调度,一般高管推不动,所以张一鸣亲自上阵协调算力与团队,而这距他卸任字节CEO已经有5年。有报道称字节2026把世界模型列为核心要务首位,数据投入是其他国内实验室的三四倍,内部自评眼下还落后全球头部约10%的样子。

国内机器人本体厂商也没闲着。松延动力9月8号推出具身智能品牌Scalabot和第一个世界模型HERON,9月15号紧接着发第二个模型HERON-CRA,主打让机器人记住过去、从错误里学习、把经验迁移到别的身体上;智元9月9号一天发AGILE 2.0和GE-Act 2.0两个感控一体模型;宇树9月10号开源新一代人形机器人基础模型UnifoLM-WLA-1.0。红星新闻算了笔账,8天时间,3家企业连发5个模型,过去以做本体出名的机器人公司,这回不约而同补上了「大脑」这块拼图。

你可能会说,这不就是大公司在追概念吗。可这几张牌捏在一起,方向感已经很清楚了。

大模型为什么突然讲不下去语言了

要搞懂为什么是「现在」,得先看大模型最尴尬的地方。

大语言模型确实能把文字接得天衣无缝,但它对物理世界几乎一无所知。你问它一杯水洒了水往哪流,它能给你讲得头头是道,可它一辈子没碰过一滴水,它是从文本的统计规律里「猜」出这个答案的。李飞飞反复讲一句话,世界不是由文字构成的。语言模型学的是文本怎么排列,世界模型学的是时空怎么运作。光线怎么落在物体表面,遮挡后面的物体长什么样,东西被推一下会怎么倒。这些不靠看像素,靠的是理解空间。

「物理智能」这个词这两年频繁出现在财报和投资人嘴里,国外的World Labs、英伟达的Cosmos,都往这个方向砸。图灵奖得主LeCun这些年一直在喊同一个判断,光靠把语言模型越做越大,机器永远理解不了物理世界,他自己那套JEPA架构就是另一个押法。当硅谷最聪明的一批人对「靠堆规模做大语言模型」开始动摇的时候,资本就涌向下一个还具备想象力的出口,世界模型。

这是机制层面的第一个原因。第二个原因在数据。语言模型的燃料是互联网上已经堆了几十年的文本,机器人没有这样的现成数据。一次真机示教,要硬件、场地、人工、传感器同时到位,不同机器人的动作空间还各不相同。这个鸿沟得靠世界模型这种「先在脑子里推演世界怎么变、再指导动作」的路子来绕,而不是靠继续堆语言token。

中国的4D,也许才是当地人的暗牌

国内很有意思的一点是,几乎没人真去照着Atlas复刻一个。他们走了另一条路,4D。

影身智能这家公司,2024年成立,从一开始就没走「先拍二维视频再让机器人学动作」的老路,而是从多视角采集和动态重建做起,把真实世界还原成随时间连续变化的4D状态,再从中训练世界模型。创始人闵伟有个说法叫「数据冶炼」,说数据采集本质是劳动密集型的包工头生意,真正拉开差距的是把原始数据提纯成富含空间位置、遮挡、接触、受力和形变信息的「数字实验样本」的本事。这家公司现在把世界模型送进了福建晋江的制鞋厂,处理不同鞋款、尺码、材料的柔性曲面,也凭同一套4D能力在服贸会上用6台摄像头做了实时4D直播。

有趣的是影身与Atlas在这条线上的不谋而合。具身研习社那篇分析说得直白,Atlas把1到6张图变成可探索的3D世界,影身从真实世界出发把被二维投影压缩掉的维度重新升回来,两家在太平洋两岸独立推导出相近的答案,这种平行收敛在科技史上往往意味着一条路是对的。

摩尔线程的张建中给过一个更实在的观察,现在大量VLA模型还停在70亿参数左右,训练可能几十张GPU就够,真要到世界模型的「ChatGPT时刻」,算力需求得到千卡甚至万卡级。这多少解释了为什么字节敢砸几百亿进来,在这条赛道上,谁先跑通规模,谁的护城河就比「多炼一个模型」深得多。

一半人却在喊,这又是一场泡沫

热闹归热闹,冷水也没断过。

最刺眼的反方论据是数据鸿沟。墨奇智能的黄青虬算过一笔账,硬件、软件、算法三个模块,假设每个模块失败率1%,单个动作成功率就是0.99的三次方,0.97;可一个长程任务常常是10个动作的集合,成功率就是0.99的30次方,约0.74。也就是说,在工厂这种连续作业环境里,机器人每跑三四次任务就可能栽一次,这个稳定性离「生产力工具」还差太远。

落地数据同样扎心。多个行业口径显示,2026上半年国内人形机器人实际交付约2.3万台,其中超过六成流向科研和展会演示,真正进到家庭或工厂常态化使用的不足5%。斯坦福AI Index 2026的数据更直白,人形机器人在仿真环境里任务完成率能到89.4%,一进真实家庭直接掉到12%。晚点那期播客主题就叫《具身智能的金钱游戏》,开篇就是一句,具身智能现在连GPT-1时刻都还没到。世界机器人大会上,贴着VLA招牌的展台比去年少了一圈,连从业者自己都在说路线之争退潮了、数据之问抬头了。

还有一重估值层面的怀疑。Counterpoint的数据说全球人形机器人2026上半年出货超2.2万台、同比涨近300%,但其中娱乐、表演、数据生产、科研占掉六成以上,智能制造只有13%、仓储物流5%。可另一家数据机构的说法完全相反,认为工业与商用占比已经超过70%。同一批数据,两家机构给出两个截然相反的结论,这不是统计误差,它恰恰说明,连这个行业的出货到底在服务谁,都还没有共识。

苏航在清华大学那场圆桌里给了一个相对克制的判断,VLA和世界模型不是非此即彼,未来更可能是一种融合架构,不同时间尺度上,一个负责动作生成,一个负责状态预测和纠错。

你看,连技术路线本身都还没有定论。

我的看法,这不是故事,是所有人的数据焦虑

那世界模型到底是安卓时刻还是又一个泡沫。我的答案可能不够痛快,是它俩在抢同一副身体。

安卓之所以能成,是因为所有手机厂商接受同一个操作系统、共享同一种产能。机器人行业离这个还很远,各家本体的坐标、传感器、动作空间都不一样,「统一大脑」到现在还只是个方向,而不是现实。优必选在矿山里往里跑,松延在把成本从塑料外壳里抠出来,宇树还在开源和商业化两头拉扯,谁都想当那个标准,但谁都还没当上。

可换个角度看,这一波跟单纯的炒概念又不一样。它从2023年谷歌RT-2确立VLA范式到现在,短短三年,OpenVLA、英伟达GR00T、智元的基座模型、松延的HERON,一层层把「给机器人装统一大脑」从论文落成了可训练、可开源、可进产线的工程。数据瓶颈是真实的,但真实到所有玩家都在拼了命给机器人攒数据集,这正是泡沫和基座之间最微妙的差别,泡沫是钱砸进去什么响动都没有,基座是钱砸进去、一点一点把工程磨平。

你要我怎么预判,我说不上来具体哪年会落地。我只知道一件事,过去两年所有人期待「多堆真机数据、多训几轮VLA,通用机器人拐点自然到来」,这个期待并没有如期兑现。世界模型是这场期待落空之后的第二次下注,这次下注的人更多、钱更大,也把「数据怎么来、怎么炼」从后台推到了辩论的最前面。

能不能成,不取决于谁的口号喊得响,取决于谁的机器人真的在一家工厂里,连续几个月,不出岔子地干活。这行就这么土。

本文事实部分由 AI 辅助整理自公开报道(彭博社、《中国经营报》、红星新闻等),观点与判断经作者审定并负责。封面及配图为 AI 生成。

觉得这篇对你有用,点个「在看」让我知道,也欢迎转发给那个一直在跟你聊机器人的朋友。下一篇见。

相关学习资料