七月的AI圈,又一声惊雷。
就在所有人以为ARC-AGI-3这块“AI智商天花板”还要再冰封几年的时候,Anthropic的Claude Opus 5一脚踹开了门,30.2%,把此前GPT-5.6 Sol保持的7.8%纪录直接碾了近四倍
就在几个月前,最强模型在这张卷子上的成绩还不到1%
这次进步呈现出断层式的跳跃。


▲ ARC Prize官方宣布新纪录:30.2%,前纪录7.8%,散点图上Opus 5的黄点孤悬于所有模型之上
什么是ARC-AGI-3?为什么它被称为“没法刷题的考试”?
先解释一下这张卷子为什么这么特殊
大多数AI基准测试,本质上都是做选择题,题库有限,模型见过类似题型,靠海量训练数据“背答案”就能拿高分
ARC-AGI-3换了一套考法。
它的全称是Abstraction and Reasoning Corpus(抽象与推理语料库),由深度学习框架Keras的创造者François Chollet提出,专门测量一种叫“流体智力”的东西,面对从未见过的全新问题,你能不能当场搞懂规则?

▲ ARC-AGI-3官方页面:像素风掌机界面,背后是大量从未见过的小游戏环境
而第三代ARC-AGI-3更是把难度拉满,它是一个交互式基准
想象一下:把你扔进一款规则未知、按钮功能不明的陌生游戏里,你只能靠自己点来点去,从稀疏的反馈中猜出规则、制定策略、通关
你得在缺少自然语言提示和任务描述的情况下,反复探索、试错、推理、再试
这就是为什么,当GPT-5.5在上面只拿到0.43%、Opus 4.7只拿到0.18%的时候,没有人觉得意外
这本来就是AI最不擅长的事。
从“趴在地板上”到“一脚起飞”:一条令人窒息的分数曲线
把时间线拉开看,这条曲线简直像心电图突然来了一下暴击:
- 2026年春
:GPT-5.5 → 0.43%,Opus 4.7 → 0.18% - 随后数周
:Opus 4.8小幅刷新至约1.5% - GPT-5.6 Sol登场
:一把拉到7.8%,已是“历史性突破” - 7月24日,Opus 5空降
:30.2%
从不到1%到30%,中间只隔了不到三个月

▲ 排行榜散点图:底部挤满了个位数分数的模型,Opus 5的红点孤零零挂在30%高度
ARC Prize联合创始人Mike Knoop看完了每一条回放,写下了一段极具信息量的分析,而他的结论,比分数本身更有意思
两极分化:一半天才,一半废物
Knoop说,Opus 5在半私有测试集上的表现呈现出一种诡异的两极分布:
约**20%的游戏,满分通关。
约20%**的游戏,零分,完全迷路。
他把观察概括为:简单游戏似乎很容易,复杂游戏似乎很难



▲ Mike Knoop的深度拆解:20%满分/20%零分的两极分布,以及他对成功与失败机制的定性
公开演示集的25个环境逐一验证了这种分裂:
- 5个环境拿到100%满分
:AR25、FT09、LP85、R11L、S5I5,全部是此前没有任何模型攻破的关卡 - 3个环境精确零分
:BP35、G50T、SC25,彻底摸不着门 中间地带从98.8%一路滑坡到0.6%,形成一条触目惊心的长尾

▲ 公开Demo环境逐项得分:表格顶部列出5个100%通关的环境
30%这个数字是一个平均值,它掩盖了更分裂的表现:Opus 5彻底攻破了一批关卡,同时在另一批关卡上仍然像个无头苍蝇
由此也带来一个问题:它到底“懂”了什么?
又在哪里依然是“假懂”?
代数方程:一个让所有人停下来的瞬间
ARC Prize在官方线程中放出了一段被疯狂转发的观察
在一个叫AR25的环境里,Opus 5做了一件从未有模型做过的事:它用代数方程重写了游戏中的空间关系
第23步,它写下:
4_center = 2×axis − 5_center
到了第248步,它把反射推广到了二维:
ghost = reflection about axis strips: br' = 2·br_axis − br, bc' = 2·bc_axis − bc


▲ ARC Prize展示Opus 5的“反射方程”:这是分析过的所有模型中首次出现显式代数推理
这是第一次,一个AI模型在完全陌生的交互环境中,自发地把视觉布局翻译成了符号逻辑
Chollet本人转发了这一发现,强调这是在“无任何先验接触”条件下取得的突破,而这个条件,恰恰是历史上缩放收益最少的区域

▲ Chollet引用成绩说明:这里是缩放收益最少的区域,30%的跃升“令人印象深刻”
争议风暴:真突破,还是“高级应试”?
然而,兴奋还没来得及蔓延,质疑声就以同样的速度炸开了
一位名为VraserX的用户直接开炮:
"Anthropic就是在针对基准做训练,把视觉推理变成显式代数演练。这只能算benchmark optimization,谈不上通用智能。说实话,基准分数已经没什么意义了。"

▲ 直击灵魂的质疑:所谓的“反射方程”,到底是通用推理能力,还是模式匹配的高级形态?
另一位用户virgil nicula的质疑更加技术化,他怀疑Anthropic可能搭建了专用的强化学习环境来训练模型应对ARC-AGI-3的谜题模式,并提出了一个极具建设性的反驳方案:随机改键位、改环境更新规则,保持游戏逻辑不变,看模型是否还能过关

▲ 一个可证伪的实验设计:如果真是通用能力,换一层皮应该照样能玩
还有人指出,那5个满分通关的游戏可能共享某种特定的先验结构,比如反射、对称,如果模型恰好被训练过这类模式,那高分就不代表“理解”,只代表“命中”

▲ 对满分环境共性的追问:通关的那几局,是否碰巧踩中了模型已有的知识?
更有人直接吐槽ARC Prize自身的命名混乱,public set和semi-private set的口径区分不够清晰,导致外行很容易把不同集合的数字张冠李戴
历史镜鉴:当“不可攻破”的基准突然被攻破
机器学习的历史上,这种剧情反复上演:一个长期被视为“铜墙铁壁”的基准,突然在某一天分数跳变
原因可能是方法突破、数据泄漏或评测协议被绕过
ARC Prize的应对方案包括:私有/半私有集分割、交互新颖性设计、公开验证政策、以及可下载的回放文件
Knoop还特别声明:这次是纯模型测试,没有任何外挂脚手架,意在把信号归因到模型本身

▲ GitHub上的官方benchmarking仓库:ARC Prize把“可复现”做成了制度
但"分布内专项强化"的幽灵不会自动散去
任何宣称通用性的分数,最终都要回答一个问题:换一层皮之后,你还行不行?
30%意味着什么?70%的沉默更值得听
最后,必须提醒一个容易被忽略的事实:ARC-AGI-3的100%标尺对应的是人类水平的学习效率
每一个环境,至少有两名普通人在没有任何特殊训练的情况下成功通关
30%,是一次惊人的跃升。
但它同时意味着,在70%的能力光谱上,最强AI仍然不如一个随便拉来的普通人
Knoop给出了一个精妙的判据来区分“简单”和“复杂”:如果你看Opus 5玩前两关的回放,你自己就能看出规则,那这关对模型来说是简单的;
如果连人类观察者看了回放都一头雾水、必须亲自上手才能理解,那模型多半也过不了
这不仅仅是一个基准测试的故事。
它是关于“理解”这个词本身的故事。
当AI开始在一部分陌生世界里写出反射方程,而在另一部分陌生世界里撞墙到底,它触碰到的,恰恰是智能最古老的边界:已知与未知的分界线
而那条线,刚刚被重新画了一笔。
夜雨聆风