ARTICLE · 1123028
AI 追踪 | AI 模型正在为物理世界做准备

AI 模型正在为物理世界做准备
来源: 经济学人
发表日期: 2026-02-25
中文标题: AI 模型正在为物理世界做准备
英文标题: AI models are being prepared for the physical world
文章链接:无
总结概述
这篇文章讨论的是 AI 研究正在从“会说话、会写字的大模型”,转向“能理解并模拟真实环境的世界模型”。文章以谷歌 2026 年 1 月发布的 Project Genie 为切入口:用户只要输入一张图片或一小段文字,它就能生成一个可探索的互动世界,看起来像游戏,但谷歌把它视为未来机器人、自动驾驶汽车等系统理解复杂物理空间的基础工具。作者借此说明,AI 如果要真正进入商店、道路、工厂等现实场景,仅靠语言能力并不够,它还必须能对环境做一致、可推演的内部建模。
文章随后梳理了三条主要技术路线。第一条是以视频生成模型为基础,把连贯视频当成世界模拟器;第二条是由李飞飞推动的“空间智能”,直接构建完整、可交互、内部一致的 3D 世界;第三条则来自 Yann LeCun 的 JEPA 设想,强调 AI 不一定要逐帧还原现实,而要学会抽象预测未来状态。与此同时,Ilya Sutskever 等人认为,大语言模型本身也许已经隐含某种内部世界模型,像 2023 年 Othello 实验和 Anthropic 的可解释性研究都给出了一些证据。文章最终没有宣布哪条路线必胜,但认为 AI 走向现实世界已经是迫近中的趋势。
文章基本事实
•谷歌在 2026 年 1 月发布了实验性模型 Project Genie,可根据图片或简短文字生成互动式世界。
•谷歌把 Project Genie 称为“世界模型”,认为它对未来人形机器人与自动驾驶等应用至关重要。
•“世界模型”概念可追溯到苏格兰心理学家 Kenneth Craik 于 1943 年提出的“小尺度世界模型”设想。
•当前构建世界模型的三条主要路线包括:视频生成路线、3D 空间智能路线,以及 Yann LeCun 提倡的 JEPA 路线。
•基于视频的 Project Genie 最长可稳定运行约 60 秒,随后模拟会开始出现破绽。
•李飞飞的创业公司 World Labs 构建了名为 Marble 的世界模型,可生成内部一致、完整的 3D 数字空间。
•World Labs 目前把产品卖点之一放在建筑设计场景,允许建筑师先虚拟探索空间,再送去 3D 打印。
•Yann LeCun 自 2022 年起研究 JEPA,并于 2025 年 11 月离开 Meta 全职投入这一方向。
•LeCun 的新公司 Advanced Machine Intelligence 已与医疗科技公司 Nabla 建立合作。
•Ilya Sutskever 在 2023 年提出,训练大语言模型本质上就是在学习世界模型。
•2023 年有研究发现,一个只学习过黑白棋走法序列的语言模型,在神经网络内部形成了棋盘状态表示。
•Anthropic 的可解释性研究已找到与愧疚感、金门大桥等概念相关的神经元簇。
核心观点/意见/看法
✓如果 AI 要真正进入现实环境执行任务,理解世界运行机制将比单纯生成语言更重要。
✓世界模型之争的关键,不是“会不会生成逼真画面”,而是能否形成一致、可交互、可规划的环境表示。
✓视频生成、3D 空间建模和抽象预测三条路线,各自代表了对“理解世界”这一问题的不同答案。
✓大语言模型内部或许已经有某种世界表示,但这是否等于真正“接地气”的世界理解,研究界仍在争论。
✓无论最终技术路径如何,AI 从屏幕内走向物理世界和复杂任务环境,已成为明确的发展方向。
文章具体内容整理
1) 为什么需要“世界模型”:现实任务不能只靠语言能力
•谷歌用购物买菜做饭的人形机器人、能在乡间道路行驶的自动驾驶汽车来说明,许多未来应用都要求 AI 处理复杂且不可预测的物理空间。
•文章援引 Kenneth Craik 的思想指出,生物要先在脑中形成世界的缩略模型,才能先试想、再行动;否则只能被动反应。
•这意味着,AI 若想规划行动而非仅作即时回应,也需要一套能够模拟环境与后果的内部机制。
2) 第一条路线:用视频生成去逼近现实
•视频生成模型要想产出连贯画面,就必须隐含某种世界一致性,否则现实规律一旦在帧与帧之间断裂,输出就会变得荒谬。
•Project Genie 正是这一路线的代表,它可以从迷宫图片中补全通路,也能从一张双手拿罐子的照片中推演开盖动作。
•这类模型的优势是可以为机器人提供远多于现实世界的训练数据,但缺点也很明显,例如看不见镜头外的信息,难以处理气味、遮挡物和多人共享的复杂空间。
3) 第二条路线:直接搭建完整一致的 3D 世界
•李飞飞认为,真正的世界模型必须同时满足可交互、多模态和内部一致三项要求,而视频系统通常卡在第三项。
•World Labs 的 Marble 会一次性生成完整空间,而不是随着用户转头重新“幻觉式补图”,因此可以支持多人同时进入同一世界。
•这种方法目前被推向建筑等行业场景,体现出世界模型不只是科研玩具,也在寻找具体商业用途。
4) 第三条路线与争论:抽象预测,还是 LLM 已经内生世界观
•Yann LeCun 认为,AI 不必把现实逐秒逐帧渲染出来,更重要的是学会快速预测不同动作会导向什么结果,这正是 JEPA 想解决的问题。
•他强调,AI 要处理的不只是商店和道路,也包括人力资源系统、法律文件等“虚拟迷宫”,因此世界模型应同时适用于物理和数字环境。
•另一派以 Ilya Sutskever 为代表,主张大语言模型在压缩互联网信息时,可能已经学会了底层规律;Othello 实验和 Anthropic 的可解释性研究被视作支撑证据。
•李飞飞则明确反对把语言理解等同于世界理解,她把 LLM 比作“在黑暗中的文字匠”,认为只会谈论世界,不等于真正立足于世界。
— END —