ARTICLE · 1123605
何恺明团队:给 AI 摘眼罩,Claude 满分——大模型被 "蒙眼" 考了半年 AGI
何恺明团队:给 AI 摘眼罩,Claude 满分——大模型被 "蒙眼" 考了半年 AGI导语 先接受一个荒诞的事实: 过去半年,全球顶尖大模型参加 AGI 考试,全程蒙着眼。 这不是比喻 —— 考场递给它们的,不是画面,是一张密密麻麻的数字表。人眼里的游戏世界,到它们那儿只剩一串数字。 何恺明团队看不下去,动手改了俩地方:让 AI 睁眼、给它存档。 结果,同一个模型,从 40 分直接干到满分。 出题人是 Keras 之父 Chollet 和 ARC Prize 基金会,今年 3 月放出的这套卷子,规则极其刁钻: 全是交互式像素小游戏,开局零说明,玩家只能自己试错。评分更狠 —— 官方拉来近 500 名人类小白做基准,AI 要拿满分,不光得通关,步数还得比人少。
可到了模型手里,试卷变成了什么?一张 64×64 的表格,4096 个格子。 想象一下:有人蒙上你的眼睛,在旁边报坐标,让你玩超级马里奥。就是这种感觉。 何恺明团队干的第一件事,朴素到不像论文:把表格换回图片。 只换这个,其余一概不动。结果 GPT-5.6 Sol 的得分从 13.33 分蹿到 47.32 分。 
顺带还省了钱 —— 表格里一个格子要吃掉约 4000 个 Token,一张 512×512 的图片只要 308 个。一局下来,文本版烧掉 7190 万 Token,图片版只要 3070 万,分还更高。 一双眼睛,34 分。 眼睛有了,新问题来了:游戏一局几百步,模型看过的画面,上下文一满就被删了,想回头核对细节,啥都不剩。 何恺明团队的办法简单粗暴 —— 全程录像。 每一帧,连动画帧都按编号存好。模型随时能把某几帧调出来并排对比、放大抠细节,还能读精确颜色。最关键的是:翻记录不算步数,只有真操作才计步。 这套机制他们叫 "显式注意力",外加两个笔记本:一本记规则,一本打草稿。 
论文里有个特别 "像人" 的瞬间:一个游戏里,模型点了橙色方块,方块变成 X。它停下来,调出前几帧反复对比,几回合后恍然大悟,在笔记本上写:"这就是我要的工具,用它搭天花板,挡住会要命的上升。" 那一关,人类第一次玩要走 44 步,它 34 步走完。 玩吃豆人时,它更是两次翻回第一帧,就为了把迷宫地图记牢。 按常理,给模型更多上下文、更高清的图,应该更强? 实测打脸:上下文从 200K 拉到 780K,每局 Token 从 3070 万涨到 1.057 亿,成绩反而从 99 分跌到 93.9;图片放大到 16 倍,分数只剩 88.3,而 4 倍时是 99.7。 
道理很简单:喂进去的垃圾 Token,把真正有用的上下文挤没了。 所以这套系统刻意走极简路线 ——没有训练一个新模型,提示词就四句话,没有一个字教它怎么玩游戏。 这个夏天,各路大神打这套考试的主流打法,是给每个游戏写一段能跑的程序、硬造模拟器反复试错。 光一个跳棋游戏,有人就写了 4000 行 Python。 VISTA 呢?模型用自然语言在笔记本上写三句话,同样的规则就讲明白了。 
论文说,这是第一个不靠写程序、就在这套考试里拿满分或接近满分的系统。 现实世界可没人给你提前写好 4000 行模拟器 —— 这才是这个点最值钱的地方。 硬数据摆出来: Claude Opus 5:25 个游戏、183 关全通,门门 100 分,总步数 7302,只有人类的 0.43 倍; GPT-5.6 Sol:全部通关,99 分; 最夸张的一个游戏,人类要走 1107 步,它 219 步走完。
关键是这套 "外挂" 哪儿都能用:塞进 3D 画面,84.12 分;扔进 34 个网页游戏(马里奥、2048、我的世界都有),成功率 63.3%,压过人类小白的 55.3%;连静态连线题都受益 —— 不看 "存档" 时模型把驼鹿和兔子连反了,一看就答对。 最狠的测试:一个用官方方法只拿 1.89 分的开源模型,套上这套系统,直接 66.93 分,暴涨 35 倍。 这个团队的执念,跟主流完全拧着来。 主流都在卷文本推理,他们一年发了三篇论文,立场始终如一:ARC 是视觉问题,不是文字问题。 第一篇,1800 万参数的小模型从零训练,纯看图就追平人类平均分;第二篇,先让模型看猫看狗补课,抽象推理变强;第三篇,就是这次 —— 连小模型都不练了,直接给大模型配外挂。 
论文核心是何恺明的博士生胡珂雅,上海交大 ACM 班出身,三篇里两篇一作;另外两位共同一作来自 MIT。 行业默认路线是:把模型做大、把推理拉长,智能全押在模型本身。 何恺明这波操作,等于拍桌子反对:同一个模型,从 40 分到满分,靠的是模型外面的一双眼睛、一本相册。 ARC Prize 联合创始人 Mike Knoop 也说,越来越多的 "学习" 会发生在模型权重之外。 
通往 AGI 的下一程,比的是谁能让模型看清世界、记住世界。 而何恺明团队的下一站,是充满真实画面的具身环境 —— 那里,不会有人提前把世界翻译成数字表。评论区聊聊。
一、这场考试,本来就不讲武德

二、改动一:睁眼

三、改动二:存档

四、反转来了:喂得越多,分越低

五、同行在写代码,它在写笔记

六、成绩单和外挂的通用性

七、何恺明团队:一年三篇,死磕一件事

八、最后一句
