夜雨聆风学习资料网

ARTICLE · 1128463

世界模型:AI如何学会在脑中预演世界

世界模型:AI如何学会在脑中预演世界

先关注再阅读

从LeCun的10亿美元豪赌,到Sora的物理幻觉——一文看懂AI的下一个前沿

一句话先说清楚:大语言模型预测下一个词,世界模型预测下一个状态。前者学会了"说",后者要学会"想"——在行动之前,先在脑中预演一遍世界会怎么变。

01 一个杯子,暴露了AI最大的盲区

桌边有个杯子,被碰了一下,正在掉落。

你做了什么?你伸手接住了它。

你没有计算抛物线方程,没有估算重力加速度,没有做有限元分析。你脑中有一个"世界模型"——它自动预演了杯子的下落轨迹,你的手就到位了。

现在把这个问题丢给ChatGPT:

"杯子从桌边掉下来会怎样?"

它会告诉你:杯子会受到重力作用向下加速运动,碰到地面可能碎裂,碎片会四散——描述准确,逻辑清晰。

但它从未见过杯子掉下来。

它只是读过几百万遍别人描述这件事的文字。它知道"杯子掉下来"这个句子后面跟着"碎裂",就像它知道"从前"后面跟着"有座山"一样。这不是理解,这是背诵。

这个gap——知道(knowing in words)和体验(knowing in experience)之间的鸿沟——就是世界模型要填的坑。

2026年第一季度,超过20亿美元的资本涌入这个方向。图灵奖得主Yann LeCun离开待了12年的Meta,创立AMI Labs,拿到10.3亿美元种子轮;李飞飞的World Labs拿到10亿美元,估值50亿。两家还没产品的公司,押注的是同一个词:World Model。

这到底是一场怎样的技术革命?让我们系统拆解。

02 什么是世界模型?

定义:世界模型是AI系统内部的一个"环境模拟器"——它学会预测"如果做了某个行动,世界接下来会变成什么样"。有了这个模拟器,AI可以在真正行动之前,先在内部推演各种可能的后果,再挑最好的那条路。

它从视频和传感器数据中学习世界怎么运作,支撑的是规划、物理推理与因果理解——这些正是纯语言模型最弱的地方。

和LLM的核心区别,可以用一个表格说清楚:

维度
大语言模型(LLM)
世界模型(World Model)
预测什么
下一个词(token)
下一个状态(state)
训练数据
文本
视频、图像、传感器数据
学到什么
语言的统计结构
空间与时间的统计结构
能交互吗
不能(只输出文本)
能(行动会改变预测结果)
擅长什么
语言任务、知识问答
物理直觉、规划、因果推理

这里有一个关键的判断标准,来自LeCun和多个研究者的共识:

问自己两个问题:① 我的行为能介入这个系统吗?② 我的行动会改变它预测的后果吗?答不出"能"的,大概率是视频生成工具,不是世界模型。

Sora能生成一段杯子掉落的视频,但你不能在中途"伸手"进去接住它。Genie 3可以——你可以在生成的环境中实时移动、交互,环境跟着你的输入演变。可交互性,是世界模型的灵魂。

03 八十年简史:从一个心理学猜想到百亿美元赛道

世界模型不是2026年发明的词。它的 intellectual lineage 可以追溯到80多年前。

1943年,苏格兰心理学家Kenneth Craik在《解释的本质》中提出:大脑会构建一个"小尺度模型"来模拟外部现实,预测事件、推理后果、测试假设行动。人类不把重力当作一条背诵的规则,而是有一种直觉性的、身体化的感知。

1990年,Jürgen Schmidhuber在机器学习中首次引入"世界模型"概念,提出用循环神经网络从观测中预测未来状态,并用预测来训练agent。

2018年,David Ha和Schmidhuber发表了那篇标志性论文《World Models》。他们做了一件当时听上去很科幻的事:让agent先把赛车游戏环境压缩成内部生成模型,然后整个训练搬进模型生成的"梦境"里进行——agent在自己想像出来的赛道上练车,练完把策略搬回真实游戏,居然能用。论文原话叫"在幻觉出的梦里训练agent"。

2022年,LeCun发表立场文件《一条通往自主机器智能的道路》,提出JEPA(联合嵌入预测架构)。他的核心论证:要规划物理行动,就必须能在内部预测行动的后果。这个"必须",就是世界模型。

2024-2025年,Google DeepMind发布Genie和Genie 2,OpenAI发布Sora并称其为"世界模拟器",NVIDIA在CES 2025推出开源Cosmos平台。

2026年,概念爆发。四大里程碑在同一年叠在一起:

时间
事件
意义
2025年8月
DeepMind Genie 3
首个实时交互通用世界模型,720p/24fps
2025年11月
World Labs推出Marble
文字/照片转可编辑3D场景,freemium定价
2026年3月
LeCun创立AMI Labs
募10.3亿美元,欧洲史上最大种子轮
2026年5月
NVIDIA Cosmos 3
开源世界基模,下载量破300万次

一个学术巨头、一个AI教母、Google、NVIDIA——一整条产业链在同一个时间窗口成形。

04 三大技术路线:像素派、抽象派、和"梦中训练"派

世界模型的技术实现,目前分三大阵营。理解这三条路线,就理解了这个领域的全部张力。

路线一:生成式(像素级预测)

核心思路:直接生成下一帧像素。模型通过逐帧预测视频画面来"隐式"学习物理规律。代表作:Genie 3、Sora、Marble优势:画面质量高,可交互问题:学的是视觉序列的统计规律,不是物理因果结构

Sora是这条路线的代表,也是争议的中心。LeCun反复批评:Sora生成的玻璃杯碰地不碎、人的手臂穿过椅背——这类"物理幻觉"反复出现。模型学会了"看起来像",但并不"理解为什么"。

路线二:潜在预测式(JEPA)

核心思路:放弃预测像素,在抽象特征空间中预测未来的特征嵌入。不生成画面,只学语义结构。代表作:V-JEPA 2、LeWorldModel优势:计算效率高,专注学习高层语义和物理规律问题:空间细节丢失,难以做毫米级精细操作

LeCun的论证是:世界包含本质上不可预测的细节——树叶怎么飘、传感器噪声——强迫模型在像素层面预测这些细节,会浪费模型容量在根本无法预测的事物上。与其预测每一片叶子怎么动,不如预测"风会吹动叶子"这个概念。

V-JEPA 2的成绩令人瞩目:用百万小时视频做自监督预训练,只用62小时机器人数据微调,就让机械臂实现了零样本抓取陌生物体。数据效率极高。

路线三:潜在动力学模型(Dreamer系列)

核心思路:结合确定性路径(RNN)和随机性路径(VAE),在潜在空间中同时建模环境的确定性规律和不可预测的随机性。代表作:Dreamer V1/V2/V3、PlaNet、TD-MPC优势:能处理局部可观测性,在连续控制任务中达到SOTA问题:通常针对特定环境训练,泛化能力有限

三条路线并非互斥。NVIDIA的Cosmos 3就是混合体:一个自回归Transformer负责推理和文本预测,一个扩散Transformer负责多模态生成——视觉语言模型和世界模型合二为一。

对比维度
生成式(像素)
JEPA(抽象)
潜在动力学
预测目标
像素
特征嵌入
潜在状态
计算成本
高
低(2.5-10x效率)
中
画面质量
高
不生成画面
中
物理理解
弱(统计规律)
强(语义结构)
中
代表阵营
OpenAI、DeepMind
AMI Labs
强化学习社区

05 资本狂潮:20亿美元赌的是什么?

2026年第一季,仅AMI Labs和World Labs两笔融资就超过20亿美元。加上Runway、Luma、General Intuition等,资本涌入的速度远超当年LLM赛道。

公司
融资额
估值
核心路线
AMI Labs
$10.3亿
$35亿
JEPA架构
World Labs
$10亿
~$50亿
空间智能/3D
Runway
$3.15亿
$53亿
视频到世界模拟
Luma
$9亿
$40亿
多模态推理
General Intuition
$3.2亿
$23亿
时空推理

高盛在2026年4月的报告中称:世界模型可能成为AI基础设施需求的"第二引擎"。PitchBook预测,世界模型在游戏领域的市场将从2022-2025年的12亿美元飙升到2030年的2760亿美元。空间计算市场更宽口径的预测是2035年达到1.2万亿美元。

但AMI Labs自己的CEO Alexandre LeBrun说了一句清醒话:

"我预测world model会是下一个buzzword。六个月内,每家公司都会自称world model来募资。"

连押注这条路线的人都提醒你:接下来看到的"世界模型"标签,很多会是包装。

06 六大应用场景:从机器人到城市治理

① 具身智能与机器人

世界模型被视为突破具身智能泛化瓶颈的核心技术。想象几年后,你家有个机器人助手。你说"把厨房收拾一下",它不会傻乎乎地乱抓,而是在"脑子里"先模拟一遍:红酒杯易碎得轻拿,剩菜要放冰箱,刀得避开——预判每个动作的后果后才动手。

德勤预计,世界模型的仿真闭环有望将具身智能的试错成本降低两个数量级,2027年工业仿真可实现商业化闭环。

② 自动驾驶

Waymo在2026年2月采用Genie 3构建了专用驾驶世界模型,能生成同步的摄像头和激光雷达输出,创造真实道路上罕见的边缘场景。特斯拉FSD和英国Wayve的GAIA-1也在构建世界模型,让汽车能像老司机一样"预判"其他车辆的变道轨迹。

有了世界模型,汽车不再只对当下情况做反应,而是能对未发生之事做预演——这是安全的关键。

③ 游戏与视频生成

字节跳动Seedance 2.0属于视觉世界模型,能根据当前帧预测未来帧。阿里云的HappyOyster支持1分钟连续实时位移和3分钟以上高清画面生成。Roblox正在开发"实时造梦"功能,让创作者用语言提示生成和迭代虚拟环境。

④ 3D场景生成

World Labs的Marble可以把文字、照片、视频甚至360度全景图转成可编辑、可下载的3D环境,支持Vision Pro和Quest 3查看。Autodesk以2亿美元领投,正是看中了3D设计工作流与世界模型的结合。

⑤ 数字孪生与城市治理

为一座工厂、一座城市建立可推演的数字分身,从而预测交通拥堵、能源消耗、突发事件的连锁反应。当AI真正拥有推演能力,它就从回答问题的工具,变成了一个能帮我们推演世界、规划行动的伙伴。

⑥ 医疗手术机器人

PrimalVerse元昊动力与精锋医疗合作,围绕医疗场景专用世界模型、手术机器人及智能仿真训练平台开展联合研发,推动手术机器人从精准执行工具升级为具备场景理解、风险预判与协同操作能力的智能外科基础设施。

07 中国玩家:工程化能力显著,多路线并进

2026年WAIC(世界人工智能大会)上,中国厂商集体亮相,展现出不同于硅谷的工程化能力:

腾讯Robotics X:联合混元发布3款具身智能模型,首次系统性打通"感知—身体—行动"闭环。Hy-Embodied-VLM-1.0像"右脑"理解图像空间;Hy-Embodied-RxBrain-1.0是具身"大脑",把"会推理"与"会想象"统一;Hy-Embodied-VLA-0.5连接"小脑"和身体,仿真综合排名第一。蚂蚁灵波:发布业界首个具身原生世界动作模型LingBot-VA 2.0,从零预训练,采用严格因果自回归架构——先有因、后有果,已适配17家厂商的20余种机器人构型。阿里:发布HappyOyster实时世界模型,支持导演模式和漫游模式,可生成3分钟in-world视频。字节跳动:Seedance 2.0视觉世界模型,根据当前帧预测未来帧。京东:开源全球首个全栈实时视频视觉语言交互模型,支持30FPS流式视频实时编辑。PrimalVerse元昊动力:清华团队打造4D世界模型基模,完成数亿元种子轮,覆盖具身智能、医疗手术、游戏影视、自动驾驶四大场景。极佳视界:GigaWorld通用世界模型,构建"世界生成→任务理解→策略输出→真机部署"闭环。 

蚂蚁灵波首席科学家沈宇军用"开门见猫"的例子揭示了中国玩家的差异化思考:一扇磨砂玻璃门后有只猫,数字世界的视觉理解中猫清晰可见,但对机器人而言,从物理空间感知角度,那只猫不应该存在。数字世界和物理世界的需求天然不一样——数字世界要画质高、有想象力;物理世界更重要的是快,是合理。

08 路线之争:LLM是死路吗?

世界模型最热闹的部分,是路线之争。

LeCun这边,他在2026年3月布朗大学的演讲说得很直接:

"LLM路线本质上是死路。几千亿美元投在一个赌LLM会达到人类水平智慧的产业上,这完全是鬼扯。"

论证核心:只处理语言的架构,再怎么放大也学不到物理世界的结构;能看、能预测后果的系统才可能规划和安全行动。

继续scale这边,OpenAI、Anthropic与Google的主力产品线仍在扩大LLM与推理模型,而且拿得出成绩——推理模型在数学、代码上的分数持续垫高,Agent产品的商业收入也是LLM路线在赚。

一个常被忽略的事实:做出Genie 3的DeepMind,同时也在做Gemini——同一家公司,两条路线并押注。

这不是非此即彼的选择。世界模型和LLM目前是互补路线:LLM负责语言、知识、推理;世界模型负责物理直觉、空间理解、行动规划。未来的系统很可能是两者的融合——Cosmos 3已经在这条路上。

09 七大挑战:GPT-3时刻还没到

资本很热,但世界模型远未成熟。七个硬骨头摆在面前:

① 物理幻觉。Sora生成的玻璃杯碰地不碎、人的手臂穿过椅背。模型学会了"看起来像",但不理解"为什么"。南洋理工大学团队的Apple-π基准测试显示,即使是SOTA模型,物理推理得分也只有0.473(满分1.0)。

② 长时序一致性差。Genie 3的环境维持几分钟就会漂移,场景里的文字渲染常是乱码。小预测误差在长链路推演中持续累积,模型开始"做梦"——而且自己无法检测自己的梦什么时候开始跑偏。

③ 仿真到现实的鸿沟。机器人在软件仿真中任务成功率可达89.4%,但在真实家庭环境中只有约12%。这个gap是世界模型走向实用的最大障碍。

④ 数据三角困局。真实交互数据稀缺且昂贵;仿真数据有sim-to-real域差距;合成数据会导致模型崩溃。三条路都有死结。

⑤ 算力与能耗高壁垒。训练高质量世界模型需要数千张顶级GPU,单次训练成本与能耗极高。NVIDIA Cosmos用了2000万小时真实世界数据、9000万亿tokens做预训练——这个门槛不是一般公司能跨过的。

⑥ 可解释性缺失。模型在潜在空间模拟了成千上万种结果做出决策时,人类很难追踪背后的逻辑。在自动驾驶、医疗等高安全场景,这意味着严重的责任归属问题。

⑦ 缺乏统一标准。LLM有一整套benchmark文化,世界模型的"物理正确性"怎么量、跨场景怎么比,业界才刚开始建。NVIDIA引用的Physics-IQ等榜单都很新。

一句话总结:世界模型还没等到自己的"GPT-3时刻"——那个让所有人闭嘴的能力展示。20亿美元已经进场,赌的就是这个时刻会在谁手上发生。

10 企业该怎么做?

如果你是企业管理者或技术决策者,2026年的现实建议是克制的:

能用的,现在就用。仿真场景是真实的价值:用世界模型为机器人生成训练数据、为自动驾驶生成边缘场景、为工业流程做数字孪生——这些今天就能做,能衡量,能算ROI。NVIDIA宣称Cosmos能把物理AI的训练评估周期"从几个月缩到几天"。

通用智能的承诺,还不是可预算的。没有任何已部署的世界模型展示了稳健的分布外物理推理能力。把"我们的世界模型理解物理"当成任何非同寻常的声明来对待——要失败案例,不要highlight reel。

关注抽象派与生成派的融合。抽象派(JEPA)有更强的理论论证,生成派有更强的近期产品。最终的持久系统很可能落在两者综合——用潜在空间做规划,在需要高保真的地方选择性地生成。Cosmos 3的混合架构已经指明了这个方向。

不要被AGI叙事扭曲路线图。通向通用智能的辩论很重要,但它的时间尺度和你的下两个季度无关。一个能缩短机器人训练时间、生成稀缺边缘数据的世界模型,不管它最终是否"理解"任何东西,都能 earn its keep。

11 写在最后

1943年,Craik说大脑会构建"小尺度模型"来预测现实。

83年后的今天,人类正在试图把这个能力移植到机器里。

从Schmidhuber的循环网络,到Ha的"梦境训练",到LeCun的JEPA,到Genie 3的实时交互世界——每一步都在回答同一个问题:机器能不能学会在行动之前先想一想?

李飞飞说得好:"如果AI要真正有用,它必须理解世界,而不只是文字。"

世界模型距离成熟还有很长的路。物理幻觉还没解决,长时序一致性还在分钟级挣扎,sim-to-real的鸿沟还深不见底。但方向是清晰的:

AI正在从"读过世界"走向"见过世界",最终要走向"在世界中行动过"。这条路可能要走十年。但20亿美元的赌注已经下注——赌的是:当机器终于学会在脑中预演世界的那一刻,一切都会不一样。

相关学习资料