一句话结论: OpenAI 在 ARC-AGI-3 上把 GPT-5.6 Sol 的公开集成绩从 13.3% 拉到 38.3%,靠的不是换了模型、不是多训了数据,而是打开了两项运行时能力:保留推理与上下文压缩。这件事真正刺痛行业的地方在于:很多所谓模型评测,测到的其实是“模型 + 推理链路 + 上下文管理 + Agent Harness”的组合,而不只是模型本身。
7.8%、0.4%、13.3%、38.3%——同一类模型,放进不同运行时,能出现近三倍的成绩差。
这不是一个 benchmark 调参故事,而是 Agent 工程正在取代“只看模型参数”的又一个证据。
一、同一个模型,为什么会像换了一个脑子?
ARC-AGI-3 是一套 2D 小游戏测试:Agent 不拿规则说明,只能不断观察画面、试动作、推断机制,再通关。
OpenAI 最初看到 GPT-5.6 Sol 在这项测试上表现很差:整体只有 7.8%;GPT-5.5 更只有 0.4%。但这和模型此前解决数学问题、完成复杂游戏任务的表现并不相称。
复盘后,问题不在“不会推理”,而在每走一步,系统都在让它失忆:
每次动作之后,私有推理过程被丢弃; 历史记录增长后,旧内容按滚动窗口被直接截断; 模型看得到它做过什么,却看不到当初为什么这么做、已经形成了哪些假设。
这就像让一个人玩解谜游戏:允许他看自己的操作录像,却不允许他保留草稿纸;录像一长,还从最早的关键线索开始删除。
在这样的环境里,模型不是在“持续学习”,而是在反复从头猜。
二、两项设置,具体改变了什么?
OpenAI 做的改动只有两项。
在官方 ARC harness 中,GPT-5.6 Sol 在公开集的 RHAE 得分为 13.3%;换成 OpenAI 更接近 ChatGPT/Codex 生产环境的 Responses API harness 后,提升到 38.3%。
更反直觉的是:分数接近三倍的同时,输出 token 还减少了 6 倍。
原因并不神秘。一个每轮都要重新理解游戏的 Agent,会不断重复“我现在看到什么、规则可能是什么”;一个保留了推理记忆的 Agent,则可以直接沿着已有假设验证、修正和推进。
记忆不是锦上添花,它直接决定了推理是否能累积。
三、滚动截断为什么是长任务的隐形杀手?
很多 Agent 系统应对上下文变长的默认做法,是滚动截断:超出限制,就删最早的对话。
它简单、便宜,也很危险。
第一,早期信息往往恰好是任务的“建模阶段”。例如游戏规则、用户约束、架构选择、失败原因,一旦被删掉,后面的 Agent 会带着局部信息继续工作,越来越像在错误地图上赶路。
第二,满上下文运行本身也会拖慢模型。OpenAI 的观察是:使用 compaction 后,模型既保留了关键学习,又避免长期把上下文窗口塞得过满。
这对所有长链路任务都适用:
编程 Agent 跑数小时任务; 客服/销售 Agent 承接多轮客户历史; 研究 Agent 在几十篇资料中形成判断; 运营 Agent 跨多天执行、复盘、继续迭代。
如果系统只会“把旧消息删掉”,那它本质上并没有长期工作能力;它只是一个上下文足够长的短期助手。
四、这次结果改写的,是评测的解释方式
ARC-AGI 的初衷是用统一、通用的 harness 比较模型,避免厂商为某个模型做专门优化。这在科学比较上是合理的。
但 OpenAI 的结果也提出了另一面:如果评测运行时系统性地抹掉一个模型在真实产品中本来就拥有的能力,测到的就不再是“真实可用能力”。
所以今后的榜单至少要拆成两层:
- 裸模型能力
:在极简、统一、受限的环境中,模型本身能做到什么; - 生产 Agent 能力
:模型连同推理保留、工具、记忆、压缩、工作流后,真实用户能得到什么。
前者适合研究比较,后者决定商业价值。
把两者混成一个数字,最容易发生两种误判:
低估某个模型在产品中的实际表现; 高估只在特定脚手架里跑得漂亮的系统。
五、给开发者的不是“调参建议”,而是一份架构清单
OpenAI 的建议很直接:使用 Responses API、保留 reasoning、启用 compaction。
过去大家把 Agent 的竞争理解成“谁的模型更强”。接下来,竞争更像是:谁能让模型在长任务里不丢脑子。
结语:模型能力正在从参数表,迁移到运行时
ARC-AGI-3 的这次近三倍提升,给行业上了一堂很现实的课。
模型并不是一个脱离环境的 CPU。它的能力要通过上下文、工具调用、推理留存、记忆压缩和任务编排才能真正释放出来。
因此,下一阶段 AI 产品的分水岭,未必是谁又多了几千亿参数;而是谁先把“会思考的模型”变成了“能持续记住、持续推进、持续交付的系统”。
模型决定智力上限,运行时决定能不能把上限兑现。
如果你也关心 AI 如何进入组织、重塑岗位和生产力,可以点个赞,也欢迎继续关注。
资料来源:OpenAI,《How enabling two settings tripled our scores on the ARC-AGI-3 benchmark》,2026 年 7 月 29 日。文中 ARC-AGI-3 公开集的 13.3%→38.3% 及 6 倍 token 降幅均引自原文。

夜雨聆风