夜雨聆风学习资料网

ARTICLE · 1123028

AI 追踪 | AI 模型正在为物理世界做准备

AI 追踪 | AI 模型正在为物理世界做准备

AI 模型正在为物理世界做准备

来源: 经济学人 

发表日期: 2026-02-25 

中文标题: AI 模型正在为物理世界做准备 

英文标题: AI models are being prepared for the physical world 

文章链接:无

总结概述

这篇文章讨论的是 AI 研究正在从“会说话、会写字的大模型”,转向“能理解并模拟真实环境的世界模型”。文章以谷歌 2026 年 1 月发布的 Project Genie 为切入口:用户只要输入一张图片或一小段文字,它就能生成一个可探索的互动世界,看起来像游戏,但谷歌把它视为未来机器人、自动驾驶汽车等系统理解复杂物理空间的基础工具。作者借此说明,AI 如果要真正进入商店、道路、工厂等现实场景,仅靠语言能力并不够,它还必须能对环境做一致、可推演的内部建模。

文章随后梳理了三条主要技术路线。第一条是以视频生成模型为基础,把连贯视频当成世界模拟器;第二条是由李飞飞推动的“空间智能”,直接构建完整、可交互、内部一致的 3D 世界;第三条则来自 Yann LeCun 的 JEPA 设想,强调 AI 不一定要逐帧还原现实,而要学会抽象预测未来状态。与此同时,Ilya Sutskever 等人认为,大语言模型本身也许已经隐含某种内部世界模型,像 2023 年 Othello 实验和 Anthropic 的可解释性研究都给出了一些证据。文章最终没有宣布哪条路线必胜,但认为 AI 走向现实世界已经是迫近中的趋势。

文章基本事实

•谷歌在 2026 年 1 月发布了实验性模型 Project Genie,可根据图片或简短文字生成互动式世界。

•谷歌把 Project Genie 称为“世界模型”,认为它对未来人形机器人与自动驾驶等应用至关重要。

•“世界模型”概念可追溯到苏格兰心理学家 Kenneth Craik 于 1943 年提出的“小尺度世界模型”设想。

•当前构建世界模型的三条主要路线包括:视频生成路线、3D 空间智能路线,以及 Yann LeCun 提倡的 JEPA 路线。

•基于视频的 Project Genie 最长可稳定运行约 60 秒,随后模拟会开始出现破绽。

•李飞飞的创业公司 World Labs 构建了名为 Marble 的世界模型,可生成内部一致、完整的 3D 数字空间。

•World Labs 目前把产品卖点之一放在建筑设计场景,允许建筑师先虚拟探索空间,再送去 3D 打印。

•Yann LeCun 自 2022 年起研究 JEPA,并于 2025 年 11 月离开 Meta 全职投入这一方向。

•LeCun 的新公司 Advanced Machine Intelligence 已与医疗科技公司 Nabla 建立合作。

•Ilya Sutskever 在 2023 年提出,训练大语言模型本质上就是在学习世界模型。

•2023 年有研究发现,一个只学习过黑白棋走法序列的语言模型,在神经网络内部形成了棋盘状态表示。

•Anthropic 的可解释性研究已找到与愧疚感、金门大桥等概念相关的神经元簇。

核心观点/意见/看法

✓如果 AI 要真正进入现实环境执行任务,理解世界运行机制将比单纯生成语言更重要。

✓世界模型之争的关键,不是“会不会生成逼真画面”,而是能否形成一致、可交互、可规划的环境表示。

✓视频生成、3D 空间建模和抽象预测三条路线,各自代表了对“理解世界”这一问题的不同答案。

✓大语言模型内部或许已经有某种世界表示,但这是否等于真正“接地气”的世界理解,研究界仍在争论。

✓无论最终技术路径如何,AI 从屏幕内走向物理世界和复杂任务环境,已成为明确的发展方向。

文章具体内容整理

1) 为什么需要“世界模型”:现实任务不能只靠语言能力

•谷歌用购物买菜做饭的人形机器人、能在乡间道路行驶的自动驾驶汽车来说明,许多未来应用都要求 AI 处理复杂且不可预测的物理空间。

•文章援引 Kenneth Craik 的思想指出,生物要先在脑中形成世界的缩略模型,才能先试想、再行动;否则只能被动反应。

•这意味着,AI 若想规划行动而非仅作即时回应,也需要一套能够模拟环境与后果的内部机制。

2) 第一条路线:用视频生成去逼近现实

•视频生成模型要想产出连贯画面,就必须隐含某种世界一致性,否则现实规律一旦在帧与帧之间断裂,输出就会变得荒谬。

•Project Genie 正是这一路线的代表,它可以从迷宫图片中补全通路,也能从一张双手拿罐子的照片中推演开盖动作。

•这类模型的优势是可以为机器人提供远多于现实世界的训练数据,但缺点也很明显,例如看不见镜头外的信息,难以处理气味、遮挡物和多人共享的复杂空间。

3) 第二条路线:直接搭建完整一致的 3D 世界

•李飞飞认为,真正的世界模型必须同时满足可交互、多模态和内部一致三项要求,而视频系统通常卡在第三项。

•World Labs 的 Marble 会一次性生成完整空间,而不是随着用户转头重新“幻觉式补图”,因此可以支持多人同时进入同一世界。

•这种方法目前被推向建筑等行业场景,体现出世界模型不只是科研玩具,也在寻找具体商业用途。

4) 第三条路线与争论:抽象预测,还是 LLM 已经内生世界观

•Yann LeCun 认为,AI 不必把现实逐秒逐帧渲染出来,更重要的是学会快速预测不同动作会导向什么结果,这正是 JEPA 想解决的问题。

•他强调,AI 要处理的不只是商店和道路,也包括人力资源系统、法律文件等“虚拟迷宫”,因此世界模型应同时适用于物理和数字环境。

•另一派以 Ilya Sutskever 为代表,主张大语言模型在压缩互联网信息时,可能已经学会了底层规律;Othello 实验和 Anthropic 的可解释性研究被视作支撑证据。

•李飞飞则明确反对把语言理解等同于世界理解,她把 LLM 比作“在黑暗中的文字匠”,认为只会谈论世界,不等于真正立足于世界。

— END —

相关学习资料