夜雨聆风学习资料网

ARTICLE · 1155301

物理 AI 研究进展

 物理 AI 研究进展

——从世界模型到具身基础模型的范式演进

文章结构

摘要

关键词

一、引言

二、概念界定与研究框架

(一)物理 AI 的边界

(二)三层技术栈

三、世界模型:从视频生成到可交互的物理推演

(一)视频预测路线的得与失

(二)潜在空间与显式物理约束

(三)物理一致性的评测困境

四、具身基础模型:从 VLA 到世界—动作模型

(一)双系统架构

(二)动作生成的范式迁移

(三)世界—动作模型的崛起

五、数据引擎:从倒置金字塔到第一视角学习

(一)倒置金字塔

(二)从遥操作到人类第一视角

(三)合成数据与缩放律

六、仿真到现实:迁移技术的进展

(一)并行物理引擎

(二)域随机化与系统辨识

七、评测体系:从单点成功率到泛化度量

八、关键挑战

(一)数据墙与跨本体异构

(二)物理幻觉与因果缺失

(三)长程任务与误差累积

(四)算力约束与产业生态

(五)安全验证与评测标准化

九、趋势展望

参考文献

摘要

物理 AI(Physical AI)指能够感知、理解、预测真实物理世界,并能在其中自主交互以完成各种任务的人工智能模型与系统。它被视为人工智能从数字空间走向实体世界的关键范式跃迁,2026 年被业界普遍称作"物理 AI 元年"。系统梳理该领域近三年的研究进展:首先界定物理 AI 的概念边界与全模态、多维异步性、局域性三大属性,提出"世界模型—具身基础模型—实时执行"的三层技术栈;继而分析世界模型的视频预测路线与潜在空间路线,指出"物理幻觉"是当前模型逼近真实物理规律的主要障碍;随后追踪具身基础模型从视觉—语言—动作模型(Vision-Language-Action Model,VLA)向世界—动作模型(World Action Model,WAM)的演进,剖析双系统架构、流匹配动作生成与统一多模态建模三条技术脉络;进而讨论以"倒置金字塔"为核心的数据引擎、从遥操作转向人类第一视角数据的范式转移,以及并行物理引擎与域随机化驱动的仿真到现实迁移;最后结合 LIBERO、LIBERO-Plus、RoboTwin 2.0、RoboArena 等评测体系的实测数据,指出当前模型在分布扰动下性能大幅衰减、物理一致性远低于人类水平的基本事实,并归纳数据墙、跨本体异构、长程误差累积、算力约束与安全验证五大挑战。认为,物理 AI 的"ChatGPT 时刻"不会由单一技术突破带来,而将通过"世界动作模型统一化、第一视角数据规模化、分层场景落地"三条路径渐进实现。

关键词:物理 AI;世界模型;具身智能;视觉—语言—动作模型;世界—动作模型;仿真到现实;缩放律

一、引言

过去十年,人工智能最深刻的进展几乎都发生在数字空间:语言模型学会了写作与推理,扩散模型学会了绘制图像与视频。然而这些系统有一个共同特征——它们只"说"和"画",却从不"动"。它们对世界的全部认识来自被人类挑选过的文本与像素,从未体验过把一个杯子推下桌子会发生什么。

物理 AI 正是要补上这一课。它的目标不是让模型更善于描述世界,而是让模型能够预测世界如何演变,并在演变之中选择自己的动作。2026 年前后,这一方向从学术议题迅速升格为产业主线:仅 2026 年第一季度,全球物理 AI 领域融资即超过 64 亿美元,此前 18 个月累计流入资金超过百亿美元;ICRA 2026 的世界挑战赛吸引了来自多个国家和地区的 336 支团队逐鹿世界模型赛道;同年 6 月,国内首个"物理智能创新联合体"成立。业内普遍将 2026 年称为"物理 AI 元年"。

热度之下,产业界的判断反而更加冷静。复旦大学张立华教授在世界人工智能大会上指出,AI 模型能感知空间、识别物体,并不代表能在物理空间中顺利完成任务,中间隔着状态建模、物理推演、策略规划、实时控制与安全验证等多个环节。"从看懂到做对",这道天堑正是本领域的核心命题。

要跨越它,仅靠把语言模型做得更大是不够的。语言模型处理的是人类已经压缩好的符号,而物理世界提供的是连续、高维、带噪声、部分可观测的观测流。一个只能做模式识别的系统,无论参数多庞大,都无法替代对重力、摩擦、接触与因果的显式或隐式建模。这正是世界模型被重新置于舞台中央的原因。

从 2022 年生成式模型的爆发,到 2025 年首个开源人形机器人基础模型发布,再到 2026 年世界—动作模型的集体涌现,这一领域的技术脉络已初步成形。图 1 梳理了近五年间的标志性事件。

图 1 物理 AI 领域的标志性事件时间轴

本文的组织如下:第二节界定物理 AI 的概念与三层技术栈;第三节讨论世界模型的两条技术路线及其物理一致性困境;第四节分析具身基础模型从 VLA 到 WAM 的演进;第五节梳理数据引擎的范式转移;第六节介绍仿真到现实的迁移技术;第七节审视评测体系的演进与暴露出的问题;第八节归纳关键挑战;第九节给出趋势判断。

二、概念界定与研究框架

(一)物理 AI 的边界

物理 AI 并非凭空出现的新技术,而是物理仿真、机器人学、具身智能与基础模型等多条脉络的集大成者。一个被广泛引用的表述是:物理 AI 是能够感知和理解真实物理世界、能够模拟和预测真实物理世界运转过程、能够在真实物理世界中交互并完成各种任务的人工智能模型与系统。

它与人们熟悉的数字 AI 存在系统性差异。最根本的一点在于:数字 AI 的输出是符号或像素,错误的代价只是重生成一次;物理 AI 的输出是力和位移,错误的代价可能是摔坏的物体,甚至是受伤的人。这一差异决定了物理 AI 在数据、评测与安全三个维度上都面临更严苛的约束。

与之一同被反复讨论的是物理 AI 的三个属性。其一是全模态:系统需要同时处理视觉、听觉、触觉、本体感觉(proprioception)乃至力反馈,任何单一模态都不足以支撑操作决策。其二是多维异步性:不同模态的采样频率天然不同——视觉相机可能工作在 30 Hz,力矩传感器在 1 kHz,而语言指令可能几十秒才出现一次,模型必须在这种非同步的流上建立统一的时间基准。其三是局域性:智能体只能观测到世界的一个局部,外部影响只能通过干预的方式介入,这使其在数学上天然对应一个部分可观测马尔可夫决策过程(Partially Observable Markov Decision Process,POMDP)。

表 1 给出了物理 AI 与数字 AI 的对比。

表 1 物理 AI 与数字 AI 的关键差异

对比维度

数字 AI

物理 AI

输入空间

文本、图像等人类已符号化的数据

连续、高维、带噪声的传感器流

输出空间

符号序列、像素

力、位移、关节角度等控制量

试错代价

极低,可无限重采样

高,涉及硬件损耗与人身安全

数据获取

互联网现成语料,近乎零边际成本

需真机采集,人力与时间成本高昂

泛化要求

分布内插值即可交付

必须在未见的物体、场景与任务上成立

时间约束

秒级延迟可接受

关键控制回路需毫秒级闭环

评测方式

静态基准、自动打分

需真机 rollout 或高保真仿真

(二)三层技术栈

综合近三年的技术演进,物理 AI 可以归纳为一个三层结构,如图 2 所示。

图 2 物理 AI 的三层技术栈与数据闭环

最底层是实时执行层,包括机器人本体、关节模组、灵巧手、力控与阻抗控制器。它的时间尺度是毫秒,评价指标是稳定性、精度与安全性。中间层是具身基础模型层,负责把感知与语言映射为动作序列,时间尺度是几十到几百毫秒,评价指标是任务成功率与泛化能力。最上层是世界模型层,负责对"如果这样做,世界会变成什么样"进行推演,时间尺度可以放宽到秒级,评价指标是预测的物理一致性与长程连贯性。

三层之间并非单向传递,而构成一个闭环:世界模型为具身模型提供想象的"内部试验场",使策略可以在不接触真实硬件的前提下被预筛;具身模型在真实环境中的失败回流,又成为修正世界模型的数据来源。这一闭环的存在,是物理 AI 区别于传统"感知—规划—控制"流水线的本质特征。

形式上,令 st 表示 t 时刻的世界状态,ot 为观测,at 为动作,l 为语言指令。世界模型的职责是学习状态转移的预测分布:

st+1 ~ pθ(st+1 | s1:t, a1:t)(1)

具身基础模型(策略)的职责则是在观测历史与指令条件下输出动作:

at ~ πθ(at | o1:t, l)(2)

式(1)与式(2)共同刻画了物理 AI 的双重学习目标:前者学习"世界如何运转",后者学习"我该如何行动"。二者共享表征、交替训练,正是当前主流架构的设计出发点。

三、世界模型:从视频生成到可交互的物理推演

(一)视频预测路线的得与失

当前主流的世界模型以视频生成为主要技术路线:给定一帧或若干帧画面,预测后续画面的演变。这一路线的吸引力在于数据来源极其充沛——互联网上每分钟都在产生新的视频,而每一段普通视频里都藏着物体恒存、刚性与柔性、遮挡与因果这些物理先验。

国内外的代表性工作密集涌现。英伟达在 ICRA 2026 期间推出面向物理 AI 的开放世界基础模型 Cosmos 3,采用统一的混合专家 Transformer 架构,试图把语言、图像、视频、音频、动作五种模态收进同一模型,使一个框架同时承担视觉语言模型、视频生成器、世界模拟器与世界—动作模型四种角色。智元机器人发布的 GE-Act 2.0 则被称作首个"原生"世界—动作模型:它从随机初始化开始,在具身数据上从头训练,不针对任何评测任务做微调;其自研的 CoAE 编码器能把一帧 256×384 的画面压缩成 24 个 token,仅为 DINOv3 的十六分之一,在 RTX 5090 上生成一个动作块只需 104 毫秒。

视频预测路线已经初步展现出对基础物理规律的把握。根据手持水杯翻转的画面推演出水杯倾斜、水流流出的过程,说明模型捕获了重力与流体的大致行为。但其短板同样明显:物理幻觉(physical hallucination)——画面中物体凭空消失、水流穿透桌面、刚体穿模——至今仍是顽疾。这类错误不是分辨率问题,而是模型缺乏对守恒律与接触约束的显式表征。

(二)潜在空间与显式物理约束

针对像素空间预测的固有缺陷,研究者提出两条改进路径。

第一条是转向潜在空间。与其预测未来的像素,不如预测未来的抽象状态。LeCun 提出的联合嵌入预测架构(Joint Embedding Predictive Architecture,JEPA)是这一思路的原型。2026 年被 ECCV 接收的 VLA-JEPA 是该路线与 VLA 结合的代表:它以 Qwen3-VL 作为视觉语言骨干,视频帧经 V-JEPA2 编码为世界状态表征,一个可学习的潜在动作 token 表示状态之间的转移,预测器在只能看到当前状态与动作 token 的条件下预测未来潜在状态,并与目标编码器的输出对齐。关键在于,未来帧不再是模型输入而只是监督信号,这一设计封堵了信息泄漏通道,迫使潜在动作真正编码"状态为什么会变",而不是"下一帧长什么样"。该模型在 LIBERO 上取得 97.2% 的平均成功率,在引入七类分布扰动的 LIBERO-Plus 上以 78.1% 位列第一,显著高于 OpenVLA-OFT 的 69.6% 与 π0-Fast 的 61.6%。更值得注意的是其在规划效率上的代际优势:潜空间规划只需对小型预测器做若干次前向,V-JEPA 2-AC 单步规划约 16 秒即可在 RTX 4090 上完成零样本抓放,而 Cosmos 系列的扩散式规划需要数分钟,且成功率区间低得多。

第二条是引入显式物理约束。飞捷科思发布的新一代物理世界模型 Fysiverse 采用"显式物理模拟器 + 生成式渲染器"的双驱动架构:以可微分物理仿真引擎作为核心约束与因果引擎,让生成模型只负责视觉表达,而物理推演回归物理学本身。这种分工的哲学很清晰——渲染可以交给学习,因果不该交给学习。

(三)物理一致性的评测困境

世界模型是否真的"懂物理",需要可量化的度量。目前国际上有三个被引用较多的基准,情况并不乐观,见表 2。

表 2 主流物理一致性评测基准上的模型表现

基准

评测目标

最佳模型成绩

人类/上界

口径

VideoPhy-2

生成视频的物理合理性

21.9%(困难子集)

—(人评)

联合达标率

Physics-IQ

图像到视频的物理预测

23%(原始榜单)

100(物理方差基线)

部分自报

Physics-IQ

同上(统一流水线复测)

39.5%

100

第三方复测

IntPhys 2

直觉物理理解

57.51%

96.44%

评测方自测

无论生成式还是预测式,当前模型对物理规律的理解在困难场景下都接近随机水平,与人类接近满分的表现存在数量级差距。这一结论为整个领域划定了清醒的坐标:世界模型可以生成以假乱真的视频,但"看起来对"与"物理上对"之间,仍隔着相当距离。

四、具身基础模型:从 VLA 到世界—动作模型

(一)双系统架构

2025 年 3 月,英伟达发布 Isaac GR00T N1,被称为全球首个开源且可完全定制的人形机器人基础模型。其架构受人类认知原理启发,采用"慢思考 + 快思考"的双系统设计,如图 3 所示。

图 3 具身基础模型的双系统架构(以 GR00T N1 为例)

系统 2(慢思考)由视觉语言模型承担,基于 NVIDIA Eagle 与 SmolLM-1.7B 构建,负责解释环境与语言指令、进行常识推理并生成高层动作规划。系统 1(快思考)是一个扩散 Transformer,负责把系统 2 的规划转化为精确、连续的运动指令,闭环控制频率最高可达 120 Hz。公开的 GR00T-N1-2B 检查点总参数量约 22 亿(其中视觉语言部分 13.4 亿),在 L40 GPU 上采样 16 个动作仅需 63.9 毫秒,足以支撑实时控制。值得注意的是,两个系统并非简单拼接,而是在后训练阶段被联合优化。

同一时期,Figure AI 的 Helix 采用了同构思路但参数分配迥异:系统 1 是约 8000 万参数的视觉运动策略,运行频率高达 200 Hz,可同时控制 35 个自由度(含手指、手腕、躯干与头部);系统 2 则是 70 亿参数的视觉语言模型,训练数据约为 500 小时遥操作演示。Helix 的两个纪录值得一提:它是首个能同时在两台机器人上运行的 VLA,使机器人可以在共享的长程操作任务中协作;其后续版本 Helix 02 把控制扩展到全身,在一次演示中自主完成了整套厨房洗碗机的装载与卸载,全程 4 分钟无中断、无重置、无人工干预。谷歌 DeepMind 则于 2025 年 3 月把 Gemini 2.0 多模态模型扩展出物理动作输出能力,形成 Gemini Robotics。

(二)动作生成的范式迁移

在动作表示的层面,领域经历了一次明显的范式迁移。

早期做法是把连续动作离散化为 token,交给自回归 Transformer 逐词预测,代表工作如 RT-2 与 OpenVLA。这条路线的优点是复用了语言模型的训练基础设施,缺点是推理需逐 token 串行生成,频率低,且在精度要求高的连续控制上容易出现量化误差。

新一范式的代表是流匹配(flow matching)与扩散策略。以 π0 及 π0.5 为例,模型不直接回归动作,而是学习一个把噪声输运到动作分布的速度场,用少步积分即可生成整段动作块:

L(θ) = E[ || vθ(aτ, τ, c) - (a1 - a0) ||2 ](3)

其中 a0 为噪声样本,a1 为目标动作块,τ 为插值时间,c 为观测与语言构成的上下文。这一形式使模型可以在单次前向中并行输出整个动作块,兼顾精度与频率。实测数据显示,π0 在 LIBERO 上取得 94.2% 的平均成功率,π0.5 提升至 96.9%,显著高于自回归的 OpenVLA(76.5%)。

(三)世界—动作模型的崛起

2026 年最显著的变化,是"世界—动作模型"(World Action Model,WAM)成为该领域的新命名。传统 VLA 是"看到什么就做什么",本质是条件反射式的模式匹配;WAM 多走一步——先预测"这样做下去世界会变成什么样",再决定动作,这一步之差把机器人从条件反射推向谋定后动。

在 RoboTwin 2.0 的 50 个双臂仿真任务榜单上,这一差距被量化得相当清晰:榜首几乎被 WAM 类方法垄断,Next Forcing、LingBot-VA、Fast-WAM 等模型的清洁/随机化平均成功率在 91.9% 至 94.1% 之间,而 π0.5、X-VLA、π0 等纯 VLA 方法分布在 65.9% 至 82.7% 之间。更有信息量的两个结构性规律是:其一,WAM 与 VLA 的差距随任务时域延长而扩大,在单步任务上领先约 3.2 个百分点,在三步任务上则扩大到 8 至 9 个百分点,说明时序记忆存在复利效应;其二,差距在随机化条件下进一步拉大,π0.5 从清洁到随机掉 5.9 个百分点,而顶级 WAM 的跌幅不超过 1.5 个百分点,说明视频先验吸收了视觉扰动。

技术路线也在快速收敛。智元与上海创智学院联合发布的 τ0-WM 在约 27300 小时的异构语料上预训练(含 17800 小时真机遥操作、6500 小时 UMI 采集与 3000 小时第一人称人类视频),模型仅 50 亿参数,却把动作生成、视频预测与任务评估统一进一个共享预测表示;推理时模型采样多个候选动作,用动作条件视频模拟器"预演"未来,再挑出最有前景的一条,构成"提议—评估—修正"的闭环,如图 4 所示。海外方面,Riemann-1.0 用超过 20 万小时的交互数据,把可执行策略与多本体视觉世界模拟器融进同一个自回归模型,在 RoboTwin 2.0 上取得 94.3%、在 LIBERO 上取得 99.0% 的成功率。表 3 汇总了若干代表性模型。

图 4 世界—动作模型的"提议—评估—修正"闭环

表 3 代表性具身基础模型对比

模型

机构

规模

核心架构

关键数据

代表性结果

OpenVLA

斯坦福等

70 亿

自回归 VLA

Open X-Embodiment

LIBERO 76.5%

π0

Physical Intelligence

30 亿

流匹配 VLA

跨本体遥操作

LIBERO 94.2%

π0.5

Physical Intelligence

30 亿

流匹配 VLA

异构混合数据

LIBERO 96.9%

GR00T N1

英伟达

22 亿

双系统 + 扩散 Transformer

真机 + 合成 + 互联网视频

实时闭环 120 Hz

Helix

Figure AI

0.8 亿 + 70 亿

双系统

约 500 小时遥操作

全身 35 自由度 200 Hz

VLA-JEPA

中科大等

—

潜在世界模型 VLA

22 万人类视频 + 7.6 万轨迹

LIBERO 97.2%

τ0-WM

智元 / 上海创智学院

50 亿

世界—动作模型

2.73 万小时异构语料

统一预测表示

Riemann-1.0

—

—

策略与模拟器统一自回归

20 万小时以上交互

LIBERO 99.0%

DobotWAM

越疆科技

—

世界—动作模型

三维空间理解 + 数据闭环

LIBERO 99.25%

五、数据引擎:从倒置金字塔到第一视角学习

(一)倒置金字塔

物理 AI 面临的第一道墙是数据。数字 AI 可以近乎零成本地吞下整个互联网,而机器人数据的采集需要真机、人力与时间。传统上,一名熟练操作员录制一段高质量示范动作大约需要一分钟,这使大规模推广极其困难。

业界的应对之道被形象地概括为"倒置金字塔"工作流,如图 5 所示。其逻辑是:专有机器人数据在多样性上注定无法与互联网竞争,不如先"借用"互联网中现成的物理常识,再逐层过滤、合成与提纯,最终蒸馏成任务对齐、紧凑的真实世界数据。

图 5 物理 AI 数据的倒置金字塔

金字塔顶端是数十亿量级的互联网行为视频,用于解锁隐含的物理先验;向下依次是中继层的合成数据与穿戴式设备(如通用操作接口 UMI)采集的第一视角动作,以及核心层的真机部署与失败回流产生的长尾数据。这一结构的关键不在于总量,而在于跨本体迁移能力——谁能把不同机械臂、不同夹爪的经验压缩进一个通用动作空间,谁就掌握了规模效应的密钥。

(二)从遥操作到人类第一视角

2026 年被一线团队普遍视为"人类学习"(AnthroLearning)的元年。行业开始从"遥操作 + 仿真数据"的路径,转向以人类第一视角视频为核心的数据体系。其底层逻辑是"第一性"的:机器人未来也是通过自身的感知系统与世界交互,而第一视角数据天然记录了这一过程,不仅包含动作结果,还隐含了空间关系、时序逻辑与物体的物理属性。

实证效果相当直接。英伟达在 GR00T N1.7 上引入了 EgoScale 数据集,包含超过两万小时、覆盖二十余个任务类别的带传感人类第一视角视频;实测表明,把该类数据从 1000 小时增加到 20000 小时,平均任务完成度提升超过一倍,英伟达称之为"机器人灵巧度的第一条缩放律"。更具冲击力的一项对照实验是:在 DreamZero 的评测中,仅用 12 分钟的人类第一视角视频做联合训练(视频中不含任何动作标签),即把未见任务上的表现从 38.3% 提升到 54.3%。原因在于纯视频数据可以直接嵌入联合目标的视频一侧,无需动作标注即可贡献梯度。

(三)合成数据与缩放律

在真实数据昂贵的前提下,合成数据成为放大器。英伟达的 Isaac GR00T Blueprint 基于 Omniverse 与 Cosmos 构建,只需少量人类示范即可生成海量合成数据集:开发者在 11 小时内可生成超过 78 万条合成轨迹,相当于 6500 小时、约九个月连续人类演示的数据量。把合成数据与真实数据混合训练后,GR00T N1 的性能相比仅用真实数据提升约 40%。GR00T-Dreams Blueprint 更进一步,使 GR00T N1.5 的开发仅用 36 小时即可完成,而纯人工数据收集路线需要近三个月。

缩放律的信号也开始在具身领域出现。智元的实验显示,把训练数据从 300 小时拉升到 3 万小时(100 倍),机器人在陌生场景零样本测试中可完成的精细任务从 39 项增至 76 项——折叠毛巾、嵌套纸杯、插花这些此前完全无法理解的动作,在数据规模足够时"突然开窍",如图 6 所示。Generalist 发布的 GEN-0 被业内视为标志性事件:随着预训练数据与算力持续增加,模型在多任务场景中的性能提升呈现稳定且可预测的趋势,并开始出现跨任务迁移能力。若这一规律成立,竞争逻辑将随之改变——决定系统上限的不再是机器人能完成多少动作,而是模型能否形成对物理世界的统一表征。经验上,这一关系常被写作幂律形式:

L(N) = L∞ + (Nc / N)α(4)

其中 N 为数据或算力规模,L∞ 为不可约误差下界,Nc 与 α 为拟合常数。该式提醒我们:缩放律保证的是"投入有回报",而非"投入即通用",不可约误差下界恰恰对应那些必须由架构或归纳偏置补足的能力。

图 6 数据规模与可完成任务数的缩放关系

六、仿真到现实:迁移技术的进展

(一)并行物理引擎

仿真到现实(sim-to-real)迁移是物理 AI 的老问题,2026 年出现了基础设施级的突破。英伟达联合谷歌 DeepMind 与迪士尼研究院开发的 Newton 开源物理引擎,基于 Warp 框架构建,专为机器人学习优化,并兼容 MuJoCo 与 Isaac Lab 等仿真框架。双方合作的 MuJoCo-Warp 预计可将机器人机器学习负载加速 70 倍以上,并通过 DeepMind 的 MJX 开源库与 Newton 同步开放。

这一进展的意义不止于速度。真正的价值在于:当仿真吞吐提升两个数量级,策略搜索与域随机化才能从"采样几百条轨迹"扩展到"采样数百万条轨迹",从而使强化学习在复杂接触任务上变得可行。此外,英伟达、谷歌 DeepMind 与迪士尼研究院还计划让 Newton 支持迪士尼自研物理引擎,用于下一代娱乐机器人。

(二)域随机化与系统辨识

随机化是弥合仿真与现实差距的主要手段。其基本思想是不去精确辨识真实世界的单组参数,而是让策略在整个参数分布上都被训练到稳健。形式化地,若仿真参数记为 ξ(如质量、摩擦系数、延迟、光照),则策略优化目标为:

θ* = argminθEξ ~ P(ξ) [ L(πθ, ξ) ](5)

其中 P(ξ) 为参数先验分布。这一目标迫使策略学会"不依赖任何特定参数"的运动方式,从而在参数漂移时仍能工作。图 7 给出了仿真到现实的主要误差来源与对应缓解手段。

图 7 仿真到现实的误差来源与缓解手段

需要指出的是,域随机化并非银弹。过度随机化会使策略变得过度保守,在真实环境中失去效率;随机化范围过窄则无法覆盖真实分布偏移。当前更受青睐的做法是"仿真预训练 + 真机后训练"的两段式配方:先用大规模随机化仿真获得泛化的运动先验,再用少量真机数据做对齐微调。GR00T N1 的成功部署正是这一配方的直接体现——1X Technologies 在其 NEO Gamma 机器人上,仅用少量后训练数据即完成了策略落地。

七、评测体系:从单点成功率到泛化度量

评测是领域成熟度的镜子。物理 AI 的评测体系在近两年经历了从"单点成功率"到"泛化能力"的重心转移,而这一转移本身揭示了模型能力的真实边界。

LIBERO 长期是 VLA 方向最通行的基准,涵盖超过 130 个任务,覆盖空间关系理解、物体泛化、目标指令理解与长时序执行四个套件。该基准上,OpenVLA 为 76.5%、π0 为 94.2%、π0.5 为 96.9%、OpenVLA-OFT 为 97.1%、Cosmos Policy 与 LingBot-VA 达到 98.5%,而越疆科技的世界—动作模型空弈 DobotWAM 报告了 99.25% 的平均成功率,在 LIBERO-Object 套件上达到满分。另有工作以仅 1 条轨迹预热、结合在线强化学习后训练,在四个套件上取得 99.9% 的平均成功率。

问题恰恰在于,这一基准已经饱和。当几乎所有强模型都挤在 95% 以上,排行榜的区分度便趋于消失——这本身就是最强的信号:真正有判别力的评测已经转向泛化能力,而倍数级的差距恰恰存在于那里。

LIBERO-Plus 正是为此设计的扩展基准,它在标准任务上叠加七类分布扰动:相机、机器人本体、语言、光照、背景、噪声与布局。第三方复测的结果极具警示意义,见表 4 与图 8。

表 4 LIBERO 与 LIBERO-Plus 上的性能衰减(第三方复测)

方法

类型

标准分

扰动后

跌幅

OpenVLA

自回归 VLA

76.5%

15.6%

-79.5%

WorldVLA

统一 VLA + 世界模型

81.8%

25.0%

-69.5%

π0

流匹配 VLA

94.2%

53.6%

-43.1%

π0.5

流匹配 VLA

96.9%

80.7%

-16.7%

图 8 标准基准与分布扰动下的成功率对比

两个规律值得强调。第一,扰动下的排名与标准基准不一致:自回归系方法跌幅接近八成,而 π0 系仅跌 16.7%,说明标准基准的高分可能高度依赖于对特定视觉分布的过拟合。第二,引入世界模型统一训练带来的增益在扰动下保留得相对较好,但绝对水平仍不足以支撑真实部署——即便表现最好的 π0.5,在扰动条件下也只有八成的成功率。

为逼近真实场景,评测正沿着两条路径演化。一条是提高仿真任务的多样性与双臂复杂度,如 RoboTwin 2.0 提供了 50 个双臂任务;另一条是直接回到真机,RoboArena 采用众包双盲 A/B 评测,在七家机构间对 DROID 机器人上的策略进行对照,被称为机器人领域的"竞技场"。截至 2026 年 6 月,该榜单上 Spirit AI 的 Spirit v1.6 与英伟达的 Cosmos3-Nano-Policy 分列前两位。此外,Ai2 的 MolmoSpaces-Bench 等新一代泛化基准也在快速建立。

八、关键挑战

(一)数据墙与跨本体异构

物理 AI 与硬件本体深度绑定:不同机器人搭载的传感器、关节模组各不相同,导致严重的数据异构。为一款设备采集的动作数据,往往无法直接用于另一款设备。如何构建通用数据集、训练跨平台通用模型,是行业普遍难题。当前的缓解路径包括统一动作空间表征、潜在动作学习以及跨本体联合训练,但距离"一次训练、处处可用"仍有距离。

(二)物理幻觉与因果缺失

如第三节所述,世界模型在困难物理场景下的表现接近随机。根本原因在于,当前主流方法以像素重建或表征对齐为训练目标,而守恒律、接触约束、因果方向这些结构并不在目标函数中显式出现。显式物理约束与可微分仿真器的引入是一条有希望的方向,但其与生成式模型的融合仍处早期。

(三)长程任务与误差累积

操作任务的时域越长,误差累积越显著。RoboTwin 2.0 上 WAM 相对 VLA 的优势随任务步数扩大(从 3.2 个百分点增至 8 至 9 个百分点),从反面说明长程一致性是当前架构的软肋。要支撑数分钟乃至数十分钟的连续作业,模型需要具备可回溯的记忆机制与失败自恢复能力。

(四)算力约束与产业生态

算力是部分地区发展物理 AI 的主要短板。高端算力芯片仍受到外部制约,而物理 AI 对算力的需求集中在两个环节:一是大规模预训练,二是高吞吐仿真采样。国产软硬件生态的完善、以及对国产 GPU 的深度适配,正在成为产业自主可控的关键变量。与此同时,算法专利审查困境、仿真数据与训练模型的资产权属模糊、侵权责任认定复杂三类知识产权难题也随商用推进而凸显。

(五)安全验证与评测标准化

与数字 AI 不同,物理 AI 的错误直接作用于物理世界。这要求建立覆盖硬件失效、感知退化、人机共处的安全验证体系。目前该领域既缺乏统一的测试协议,也缺乏公认的失效模式库。当机器人在产线上以 99% 以上的成功率连续作业数千小时时,剩余 1% 的失败如何被预见与兜底,仍是开放问题。

九、趋势展望

综合上述进展,可以对未来两到三年作出几点判断。

第一,架构将走向统一。世界模型、视觉语言模型、视频生成器与世界—动作模型正在被压缩进同一个多模态骨干。"世界动作模型"这一命名本身,已经预告了世界模型与策略模型的合流。英伟达预告的 GR00T N2 采用全新的世界动作模型架构,据称在陌生环境中执行新任务的成功率可达当时主流 VLA 的两倍以上,计划于 2026 年底发布。

第二,数据范式将围绕第一视角重组。人类第一视角视频提供了唯一具备互联网级规模、且携带物理先验的数据源。若其与缩放律结合,具身智能有望复现大模型曾经历的"能力涌现"曲线。与之配套的,是低成本采集硬件(手持夹爪、穿戴式设备、UMI)与自动标注管线的成熟。

第三,落地将沿分层路径推进。业界的共识是从工业切入、经商业服务过渡、最终进入家庭。工业场景任务价值高、需求明确、数据质量好,是具身智能走向真实世界的第一块试金石。已有案例显示,机器人可在动力电池产线上承担高压测试插头插接等复杂工序,作业成功率稳定在 99% 以上。

第四,评测将决定技术走向。当标准基准饱和,泛化能力、扰动鲁棒性、长程一致性与安全边界的度量,将成为区分模型优劣的核心标尺。图 9 给出了物理 AI 的能力现状与关键挑战之间的关系。

图 9 物理 AI 的能力现状、瓶颈与演进方向

最后需要强调,物理 AI 与生成式 AI、智能体并非替代关系,各类 AI 形态将在不同场景中长期共生。物理 AI 是人工智能发展的高阶形态,但它的成熟不会由某一次单点突破宣告,而将由一连串可复现的工程进展累积而成。从"能看懂"到"能干活",这一公里或许不需要奇迹,需要的只是把每一层都做扎实。

参考文献

[1] 徐凯. 世界模型:物理 AI 的核心引擎[R]. 中国科学院工业人工智能研究所物理智能团队, 2026.

[2] 张立华. 物理 AI 技术瓶颈是完整闭环的基础设施[R]. 2026 世界人工智能大会物理智能创新生态论坛, 2026.

[3] NVIDIA. NVIDIA Announces Isaac GR00T N1 — the World's First Open Humanoid Robot Foundation Model — and Simulation Frameworks to Speed Robot Development[EB/OL]. NVIDIA Newsroom, 2025-03-18.

[4] NVIDIA. Project GR00T: 人形机器人通用基础模型[EB/OL]. GTC 2024, 2024-03-18.

[5] NVIDIA. Isaac GR00T N1.6 与 Cosmos Reason 发布[EB/OL]. CoRL 2025, 2025-09.

[6] NVIDIA. Isaac GR00T N1.7 与 GR00T N2 预告[EB/OL]. GTC 2026, 2026-03.

[7] NVIDIA. NVIDIA Cosmos 3 开放世界基础模型[EB/OL]. ICRA 2026, 2026-06.

[8] NVIDIA, Google DeepMind, Disney Research. Newton: An Open-Source Physics Engine for Robotics[EB/OL]. 2025.

[9] Figure AI. Helix: A Generalist Vision-Language-Action Model for Humanoid Robots[EB/OL]. 2025-02.

[10] Google DeepMind. Gemini Robotics: Bringing AI into the Physical World[EB/OL]. 2025-03.

[11] Physical Intelligence. π0: A Vision-Language-Action Flow Model for General Robot Control[J]. arXiv preprint, 2024.

[12] Physical Intelligence. π0.5: A Vision-Language-Action Model with Open-World Generalization[J]. arXiv preprint, 2025.

[13] KIM M J, et al. OpenVLA: An Open-Source Vision-Language-Action Model[C]. CoRL, 2024.

[14] 智元机器人, 上海创智学院. τ0-WM:统一动作生成、视频预测与任务评估的世界模型[R]. 2026.

[15] 智元机器人. GE-Act 2.0:原生世界—动作模型[R]. 2026.

[16] LEHMANN T, et al. ECCV 2026: VLA-JEPA — Latent World Model Pretraining for Vision-Language-Action Models[C]. ECCV, 2026.

[17] BARDES A, GARIDO Q, et al. V-JEPA 2: Self-Supervised Video Models Enable Understanding, Prediction and Planning[J]. arXiv preprint, 2025.

[18] Generalist AI. GEN-0: Scaling Laws for Embodied Foundation Models[R]. 2026.

[19] 越疆科技. 空弈 DobotWAM 具身大模型评测报告[R]. 2026-05.

[20] 星源智机器人. ω-EVA 具身交互世界模型技术报告[R]. 2026-08.

[21] 飞捷科思. Fysiverse 物理世界模型技术白皮书[R]. 2026-07.

[22] 文远知行. WeRide WITT 物理 AI 认知基础大模型[R]. 2026-07.

[23] LIU Y, et al. LIBERO: Benchmarking Knowledge Transfer for Lifelong Robot Learning[C]. NeurIPS, 2023.

[24] ROBOTWIN 团队. RoboTwin 2.0: A Scalable Data Generator and Benchmark for Bimanual Robotic Manipulation[J]. arXiv preprint, 2025.

[25] 世界机器人大会组委会. 2026 具身智能世界模型评测汇总[R]. 2026-08.

[26] 中国日报. 从"会表演"到"会干活":WAIC 2026 上具身智能更务实[N]. 2026-07-20.

相关学习资料