先说结论OpenClaw 已经进入数字 Agent Runtime 的问题空间;初代贾维斯的核心领先,并不只是模型更聪明,而是它已经形成了传感、判断、实体控制与反馈闭合的具身实时系统。
拿 OpenClaw 和贾维斯比较,很容易落入两种误区:要么把电影当科幻,什么都无法比较;要么把一句台词硬换算成算力、参数量和领先年限。两种做法都不可靠。
这次我换了一种尽量可验证的办法:贾维斯一侧只取影片、字幕和公开剧本中可观察的下界;OpenClaw 一侧只跑当前实例的只读测试。没有共同输入、共同输出和共同验收条件的项目,不给分、不算倍数。
先给最小测试集。它不是产品宣传中的“支持多 Agent”,而是同一台当前运行实例上,真实发起的只读任务。
无工具响应:3 次测试全部成功,用时 5.923、7.901、8.519 秒,中位数 7.901 秒。两工具状态任务:连续 3 次全部成功,完成“读取健康状态+读取调度状态+组织结构化结果”,用时 12.720、15.540、15.802 秒,中位数 15.540 秒。三工具状态汇总:一次成功,18.189 秒,正确汇总运行健康、定时任务和节点状态。连续性与恢复:同一会话跨轮准确取回前一轮信息;一次确定失败的命令后,继续完成健康检查。边界校准:没有把离线设备的能力误报成在线能力。
这些数据只能证明一件事:OpenClaw 不再只是单轮聊天。它已经能把语言意图转成工具调用,读取系统状态,保留短上下文,并在受控失败后继续推进。
但样本只有 1 到 3 次,所以我们只报告成功次数、中位数和范围;不拿它冒充 p95,更不写成 SLA。
从《钢铁侠》到《复仇者联盟2》中幻视诞生前,贾维斯至少出现过以下可观察能力。
感知输入:自然语言、3D 激光扫描、红外扫描至少 3 类。红外扫描还给出了“钢筋加固、空气流动”两个结构特征。实体执行:住宅环境、制造、飞行与装甲、钢铁军团,至少 4 个外部执行域。飞控闭环:托尼说出“接管”后,字幕约 3.4 秒后出现“航向已锁定”的确认。运行广度:影片明确说它从自然语言 UI 起步,后来运行钢铁军团和大量业务。韧性与情报:遭攻击后丢弃记忆但保留协议,随后被重新拼回;另有对 SHIELD 安全文件运行解密任务的情节。
有一个重要边界剧本里的“十一数量级能量产率”和“TB 级计算”只能证明电影设定中存在复杂工程分析,不能被换算成贾维斯的 FLOPS、参数量或 GPU 数量。把它们直接拿来和现实模型比,是伪精确。
两者有交集。它们都能接收自然语言意图,都可以调度外部能力,也都涉及状态和任务推进。换句话说,OpenClaw 已经触及了贾维斯的数字任务执行骨架。
但两者的闭环不同。
OpenClaw 当前形成的闭环:文本意图 → 模型推理 → 数字工具 → 文本或系统结果。贾维斯所代表的闭环:传感 → 状态估计与分析 → 实体控制 → 反馈。
因此,最准确的结论不是“OpenClaw 是贾维斯的百分之几”,也不是“贾维斯快多少倍”。前者是数字 Agent Runtime,后者已经是具身、实时、可执行于物理世界的智能系统。
继续堆更大的模型,或者继续增加技能数量,都不会自动得到一个贾维斯。要从数字任务运行时走向早期具身 Agent,至少还要补四层工程能力:
多模态感知与时间同步可查询的世界状态模型与 LLM 解耦的安全控制器可审计、可回滚的执行器适配层
这四层缺一不可。模型负责理解与规划;真正让系统进入现实世界的,是可靠的状态、确定性的控制和受约束的执行。
最后的判断OpenClaw 离初代贾维斯,不是还差一个更大的模型,而是还差一整套把感知、世界模型、实时控制和实体执行连接起来的工程系统。数字 Agent Runtime 已经出现;具身智能体的主战场,才刚刚开始。