乐于分享
好东西不私藏

世界模型的前世今生:从认知科学到物理AI的核心引擎

世界模型的前世今生:从认知科学到物理AI的核心引擎
摘要
2026 年,世界模型正成为 AI 领域最热的技术方向之一。从 Yann LeCun 的系统定义,到 Sora、Genie、HiDream-O1-World 等产品的密集涌现,这条技术路线正在重塑我们对“智能”的理解。
一、思想源头:人脑里那个“小尺度模型”
世界模型的思想,最早可以追溯到 1943 年英国心理学家 Kenneth Craik 提出的“心智模型”——他认为人类大脑会在内部构建一个外部现实的小尺度模型,用来预演未来、做出决策。
在 AI 语境下,“world model”一词首次明确出现于 1990 年,由 Jürgen Schmidhuber 在其技术报告中使用:一个神经网络学习环境动态,另一个据此向前规划。2018 年,他与 David Ha 合作发表论文《World Models》,用 VAE + RNN + 控制器的架构,让智能体在“梦境”中训练策略,这一概念开始在深度学习社区广泛传播。
二、现代定义:LeCun 的系统性框架
2022 年 6 月,图灵奖得主、Meta 首席 AI 科学家 Yann LeCun 发表长篇论文《A Path Towards Autonomous Machine Intelligence》,首次系统定义了现代 AI 意义上的“世界模型”,并提出
JEPA(联合嵌入预测架构)
作为核心实现路径。
LeCun 认为,当前主流大模型存在根本缺陷:生成式方法被迫预测所有细节(包括噪声、纹理、光照等无关信息),浪费算力且难以用于规划和推理。他提出的世界模型,核心能力是在抽象表征空间中预测未来状态,而非生成像素级画面。
这一框架包含六大模块:配置器、感知模块、世界模型、代价模块、短期记忆和行动模块,形成完整的“感知→预测→规划→行动”闭环。
三、技术分化:两条路线、三种实现
世界模型发展到今天,已经形成清晰的技术分化格局:
  • 非生成式路线(JEPA 系):以 Meta 为代表,只在抽象表征空间做预测,不还原画面。优点是避免像素冗余、训练效率高、适合长期规划;缺点是可视化难度大、产业落地样本较少。
  • 生成式路线:以 OpenAI、Google DeepMind、英伟达等为代表,直接生成未来画面或视频。内部又分为两种实现路径——
自回归
:按时间顺序逐个预测视觉 token,天然适合实时交互和连续生成,代表产品有 DeepMind Genie、英伟达 Cosmos 自回归家族;
扩散模型
:对整段画面加噪后迭代去噪,整体一致性和画质更强,代表产品有 OpenAI Sora、小鹏 X-World。
两条路线并非替代关系,而是按场景取舍。英伟达 Cosmos 同时提供两种模型家族,已说明产业侧走向混合策略。
四、关键节点:四年进化史
世界模型从概念提出到产品密集涌现,只用了四年:
2022 年 6 月:LeCun 发表奠基论文,系统定义世界模型与 JEPA 架构。
2023 年:Meta 推出 I-JEPA(图像版),首个落地实现;学术界出现 UniPi 等工作,将策略学习框定为“视频生成 + 逆动力学”。
2024 年 2 月:V-JEPA 发布(恰好紧随 Sora 公布之后),展示 JEPA 在动态世界理解上的潜力。同年,DeepMind 推出 Genie(可交互世界模型),Wayve 发布 GAIA-1(自动驾驶世界模型),世界模型进入产品化元年。
2025 年:V-JEPA 2 发布,参数规模达 12 亿,首次展示零样本机器人控制能力;英伟达推出 Cosmos 世界基础模型平台;李飞飞 World Labs 明确区分“渲染器”与“模拟器”两类世界模型。
2026 年:智象未来发布 HiDream-O1-World,号称全球首款原生全模态交互式世界模型,支持漫游、编辑、交互三大能力;LeCun 离开 Meta 创立 AMI Labs,融资超 10 亿美元专攻 JEPA 路线商业化。
五、核心技术脉络
梳理世界模型背后的关键技术,可以归纳为四条主线:
  • JEPA(联合嵌入预测架构)
    :在抽象表征空间做预测,避免像素级冗余,是 LeCun 认定的通往自主智能的核心路径。
  • 扩散模型
    :通过迭代去噪生成高质量视频,天然处理多种可能的未来,是当前生成式世界模型的主流实现之一。
  • 自回归 Transformer
    :将画面切分为视觉 token 逐个预测,适合实时交互和无限延续场景。
  • 多模态融合与世界状态建模
    :从单一视觉预测走向视觉、语言、动作、物理状态的统一建模,支撑更复杂的决策和规划
六、为什么世界模型重要?
世界模型的本质,是让 AI 从“被动响应”走向“主动预演”。它不再只是识别眼前发生了什么,而是能够想象“如果我做某个动作,世界会变成什么样”。
这正是物理 AI、具身智能、工业机器人等方向的核心瓶颈——智能体必须理解物理规律、预测未来状态、做出长期规划,而这些能力,都建立在世界模型之上。
从这一视角看,世界模型不只是一个技术方向,而是下一代 AI 基础设施的关键组成部分。
参考来源:
LeCun, Y. (2022).A Path Towards Autonomous Machine Intelligence. OpenReview.
Ha, D. & Schmidhuber, J. (2018).World Models. arXiv:1803.10122.
Meta AI. I-JEPA / V-JEPA / V-JEPA 2 系列论文及官方公告.
东吴证券研究所.《AI 系列深度 13 期:世界模型如何实现?》(2026-08-05).
智象未来 HiDream-O1-World 官方发布信息.

● END ●

北京元梦翼科技有限公司创立于2023年,以自主研发为核心,依托中科院体系研发团队,专注AI算法与物理仿真前沿技术。打通数字世界与物理世界的技术壁垒,助力实体经济实现数智化升级。业务深度布局工业安全数智实训、公共安全数智宣教、职业教育仿真实训、文旅文博数字沉浸四大板块,提供全链路、自主可控的虚实融合解决方案,赋能产业数智化转型。