乐于分享
好东西不私藏

英伟达AI拿下ARC‑AGI‑3满分

英伟达AI拿下ARC‑AGI‑3满分

深度核查 · AI智能体

英伟达AI拿下ARC‑AGI‑3满分:是真的,但先别急着给AGI摆庆功宴

文|技术观察 发布日期|2026年8月22日

公开集跑到满分,值得鼓掌;帘子后面的隐藏评测,才是下一场硬仗。|AI生成插图

英伟达最近宣布,它的通用智能体系统 AVO 在 ARC‑AGI‑3 互动推理基准上拿到 100.00分:25个环境、183个关卡,全部通关。

消息没造假,数字也对得上。但这句话像一张精心裁过的照片:主角很清楚,画框外还有不少东西。

一、它到底做成了什么?

ARC‑AGI‑3不是选择题,也不是“请证明你很聪明”。它把智能体扔进一批陌生的回合制像素游戏里,不给玩法说明,不讲胜利条件,连按钮是干什么的都要自己试。

智能体必须一边碰壁,一边推断:谁是我?什么会动?哪里算赢?刚才那一步为什么把自己送走了?设计者想测的,是探索、建模、目标发现、规划,以及能否把前面学到的经验带到后面的关卡。

英伟达披露,AVO搭载 Claude Opus 5,以64×64文本栅格读取环境,不看游戏截图,也没有收到具体规则和目标。最终它用6,624次环境动作完成全部183关,获得100.00 RHAE。

成绩单,翻译成人话:

✓ 25个公开游戏环境

✓ 183个关卡全部完成

✓ 6,624次计分环境动作

✓ 100.00 RHAE,触及指标上限

✗ 尚不是半私有或完全私有集成绩

二、30分变100分,模型偷偷补课了?

ARC Prize对 Claude Opus 5 High 的标准化评测是30.16%。到了AVO手里,同一家族的模型却跑出100分。模型没在后台连夜长出新参数,真正变化的是它身边那套“班底”。

同一个“大脑”,有无记忆、工具、反馈和监督,可能像单兵闯迷宫与带队施工的区别。|AI生成插图

AVO给模型配上了持久记忆、工具调用、代码执行、反馈循环、错误恢复和监督器。主智能体负责探索;卡住太久,监督器会提醒它别再和同一堵墙培养感情。

这说明一个越来越重要的事实:评估模型,不等于评估智能体。模型决定思维上限,脚手架决定这些能力能否在几小时、几天甚至更长任务中稳定兑现。

不过,30.16%与100%并非严格控制变量实验。推理设置、观察接口、上下文管理和执行方式均不相同。把69.84个百分点全部记在AVO账上,就像换了车、换了胎、换了赛道,再认真计算哪颗螺丝贡献了圈速。

三、100分,也有100分的“小字部分”

RHAE衡量两件事:完成多少关,以及用了多少环境动作。人类第一次玩这些游戏的动作效率被当作参照。

但模型在落子之前可以思考多久、调用多少次工具、运行多少代码、烧掉多少token,这些都不算“环境动作”。因此,100分说明AVO很会珍惜正式落子次数,不等于它和人类一样省时间、省钱、省电。

换句话说,它可能在每一步前开了一场董事会;计分器只看到董事会最后按下了哪个按钮。

而且RHAE会封顶。一个系统即使比人类少用很多动作,显示出来也还是100。这个指标适合判断是否达到人类级动作效率,却不适合继续区分已经撞到天花板的高手。

四、最大限定:这是一张“公开卷”

公开环境是练习场;真正检验迁移能力的,是门外从未见过的新世界。|AI生成插图

ARC‑AGI‑3分为公开集、半私有集和完全私有集。公开集可供研究人员下载、观察和反复调试;完全私有集才用于正式竞赛,防止记忆、手工适配和过拟合。

这25个公开游戏早已收到近百万份计分记录。它们更像开发集,而不是考场里的密封试卷。团队完全可以合法地围绕它们优化观察方式、提示结构、记忆策略和工具接口。

这不等于AVO作弊,也不能抹掉它的工程能力;它只是意味着:公开集100分证明“这套系统能把这些公开环境做透”,尚未证明“面对一批真正陌生的隐藏环境仍能满分”。

正式竞赛的70万美元大奖,等的正是后一个答案。

五、它不是唯一满分,但依然值得重视

另一套智能体系统 Tycho 已报告使用 Claude Opus 5 完成183关、获得100分,用了6,641次动作;其 GPT‑5.6 Sol 版本也拿到100分。AVO的6,624次只比Tycho少17步,约0.26%。

没有多次重复实验和误差范围,这17步不宜被包装成架构上的碾压。更合理的结论是:ARC‑AGI‑3公开集正在被成熟的智能体脚手架“做满”,竞争焦点已从“模型能不能玩”转向“系统怎样让模型长期、稳定、高效地玩”。

AVO真正漂亮的地方,是它原本用于软件工程和GPU内核优化。它曾连续运行七天,探索500多个优化方向,产出40个内核版本;现在同一类长程循环又迁移到了抽象游戏。

这说明可迁移的未必是领域知识,而可能是更朴素的能力:提出假设、动手验证、保存经验、承认搞错、换个方向继续干。听起来没那么玄学,倒很像一位不下班的工程师。

六、这离AGI还有多远?

一套系统能在抽象、确定、机器可验证的游戏里表现优异,不代表它能处理现实世界的模糊目标、冲突利益、错误信息、权限边界和不可逆后果。

游戏走错一步可以重来;现实里发错一笔款,财务总监通常不会欣赏你的“探索精神”。

因此,这一成绩证明的是智能体工程取得了突破,而不是AGI已经毕业。真正有说服力的下一步,是把代码和提示冻结,再放进从未见过的半私有或完全私有环境,看它还能剩下多少分。

七、英伟达真正想讲的,是另一门生意

未来的竞争,不只是造一个更大的脑袋,而是给它配上记忆、工具、反馈、护栏和发动机。|AI生成插图

AVO用的是 Anthropic 的模型,却由英伟达完成系统级编排。这恰好符合英伟达的战略:即使基础模型来自别人,它也可以掌握智能体框架、执行环境、GPU优化和推理基础设施。

而长程智能体往往需要反复调用模型、运行代码、保存上下文。它可能少走几步,却在每一步之前想得更多。对卖算力的人来说,这当然不是坏消息。

接下来,盯住这五件事

  1. 同一套冻结系统在私有集上的成绩;
  2. 完整代码、系统提示与可检查回放;
  3. 总token、模型调用数、耗时和成本;
  4. 多次运行后的稳定性,而非一次最佳成绩;
  5. 记忆、监督器、文本观察等组件的消融实验。

主要资料

1. NVIDIA:AVO在ARC‑AGI‑3公开集的技术说明

2. ARC Prize:RHAE评分方法

3. ARC Prize:Claude Opus 5标准化成绩

4. Tycho:ARC‑AGI‑3可执行世界模型研究

5. AVO:自主进化搜索论文

6. ARC‑AGI‑3技术报告