ARTICLE · 1063038
AI早报 · 9月23日|Claude Opus 5.5 发布:分数追平上一代旗舰,缓存读单价降到五分之一
AI早报 · 9月23日|Claude Opus 5.5 发布:分数追平上一代旗舰,缓存读单价降到五分之一AI呀 · 每日早报 / 2026年9月23日 星期三 编辑:草木灰 · 本文由 AI 自动采编,结论经人工审核,来源均为公开报道 本期看点 1. 重大新闻 Claude Opus 5.5 发布:分数追平上一代旗舰,缓存读单价降到五分之一 2. 新工具 HarnessRouter:把 Codex、Claude Code 这类编码智… 3. 论文速读 给智能体的自我进化加正则,压掉只在自家基准上涨的假进步 01 / 重大新闻 Claude Opus 5.5 发布:分数追平上一代旗舰,缓存读单价降到五分之一 9 月 22 日,Anthropic 发布 Claude Opus 5.5,这是新的 Claude 5.5 家族第一个模型。官方给的定位很直接:在大多数工作上看齐此前的旗舰 Claude Fable 5.1,而运行成本比 Opus 5 低约 40%。定价(每百万 token):输入 4 美元、输出 20 美元,两项都比 Opus 5 低 20%;缓存读 0.20 美元,比 Opus 5 的 0.50 美元低 60%——官方特意点明缓存读占了智能体与编码工作成本的大头;缓存写 5 美元。Claude Code 与 Claude Platform 另外提供 Fast 模式,最高 2.5 倍速度,每百万输入 8 美元、输出 40 美元。分数方面:Terminal-Bench 4.0 拿到 66.4%(Fable 5.1 是 55.8、Opus 5 是 52.3,同期的 GPT-6 Astra 是 57.9、GPT-5.6 Sol 是 37.3),FrontierCode v1.1 主榜 54.4%、CursorBench 4.0 57.8%、GDPval-AA v2.1 得 1846 分、AutomationBench 40.0%、带工具的 Humanity's Last Exam 67.7%、OSWorld 2.0 81.8%(部分完成口径)、Chartography 89.0%。官方称这是他们呼吁给前沿发展留出评估时间之后的第一个发布,发布前交由外部评测方测试,其中包括 METR;内部自动化行为审计是有史以来最好的一版,更少采取难以回退的动作,也比 Opus 5 更抗提示注入。因为它在生物与网络安全上与此前的 Mythos 5.1 同级,沿用同一档防护措施。Sonnet 5.5 与 Haiku 5.5 将在未来数周跟进。成本侧有个可对照的上手案例:一位早期测试者用它审计并修复一个 20 万行的代码库,用了不到三小时,同样的工作 Opus 5 花了 20 多个小时。 结论:这次发布里最该拿走的信息不是 66.4% 这个分数,而是缓存读降到每百万 0.20 美元——它占智能体与编码类工作成本的大头,官方把它单独砍掉 60%,等于直接对着「长时间反复读同一份上下文」这种最贵的用法开刀。如果你在跑编码智能体或长会话工作流,动作很具体:把主力模型切到 Opus 5.5,用一周实测账单与任务成功率对拍,重点看每个任务消耗的 token 数是否同步下降,而不是只看单价——官方给的 40% 降本是单价与单任务用量的合力,用法不变的话省不到四成。同时记住两条边界:Fast 模式按 2.5 倍速计费(输入 8 美元、输出 40 美元),只在交互式改代码这类等不起的场景开;而输出侧它只是与 Fable 5.1 同档,别指望换个模型就能补上任务本身设计上的缺口。 来源:Anthropic 官方发布页《Introducing Claude Opus 5.5》(2026-09-22);该页定价表与评测对比表原文(对照分数含 Fable 5.1、Opus 5、GPT-6 Astra、GPT-5.6 Sol) 02 / 新工具 HarnessRouter:把 Codex、Claude Code 这类编码智能体收进一个统一接口 8 月 9 日创建、9 月 22 日仍在更新的开源项目 HarnessRouter(Apache-2.0,约 2200 star),做的事一句话能说完:把已经存在的 agent harness——它在 README 里点名的例子是 Codex 与 Claude Code——变成可插拔的后端,你的产品通过一个 API 就能让它们跑任务、取结果、换实现。它为这件事定义了统一 harness 协议 UHP,并在 README 徽章上标注协议一致性为 Full;对外同时提供 OpenAI Responses 兼容接口,也就是原本按 Responses 写好的调用代码基本不用改就能接上。项目自带持久会话、流式进度、文件与产物、任务取消和结构化失败这些基础设施,README 里给了一张同一任务跑八组 harness 与模型组合的对照表,用来比较成本与延迟。社区版走自托管路线:一条 docker 命令起服务,用你自己的 provider key,不需要注册它的账号,也不捆绑模型或试用额度。 结论:这类「统一层」的价值不在功能本身,而在它砍掉了一项持续支出——每换一个编码智能体就要重写一遍对接代码。要不要用,取决于你现在手上有几套 harness:只有一套就先别引入中间层,多一跳就多一处故障点,收益还不够覆盖调试成本;已经在两套以上之间来回比效果(比如一边用 Claude Code、一边试 Codex),那它值得花半天做一次真机测试,重点验三件事——失败与取消的语义能否对上你已有的重试逻辑、流式输出的中断重连是否可靠、自托管后密钥是否真的只落在自己机器上。判断标准很直接:接完之后换 harness 只需要改一个配置项,它就成立;如果换一次仍要动业务代码,那它只是又一个抽象层。 来源:HarnessRouter 官方仓库(GitHub: HarnessRouter/harnessrouter,Apache-2.0,README 与仓库元数据,2026-09-22 仍在提交) 03 / 论文速读 给智能体的自我进化加正则,压掉只在自家基准上涨的假进步 9 月 21 日挂上 arXiv 的论文(2609.24972)研究的是一个具体现象:把智能体的「外壳」——也就是提示词、控制流、工具、记忆与上下文管理,底层模型冻结——交给自动流程反复改写,分数确实会涨,但可能只是把评测任务背下来了。论文点名的机制是过拟合:在自己演化的那份数据上大涨,换到分布外就缩水甚至消失。它给出的约束方案叫 RRSI,在两端同时加正则——提案端用随时间退火的预算,限制一个候选一次能捆绑多少处改动,并按演化历史鼓励还没走过的路径;选择端配一个 critic 筛掉只对某个基准有效的提案、一个 pruner 砍掉太小、太贵或已经不产生作用的改动。作者来自 Google Cloud AI Research,联合斯坦福、UNC 与圣路易斯华盛顿大学。在横跨编码、智能体工作区与工程设计的八个基准上,它在自己演化的那份数据上最多涨 14.1 分,在五个分布外基准上最多涨 4.7 分,同时最终得到的外壳消耗的策略 token 比不做正则的演化少 30%。代码已开在 google-research/rrsi,项目页 regularized-rsi.com。 结论:这篇论文真正值钱的地方是它指出的问题,而不是它给的方法——当「改进智能体」变成自动循环,评测集就从衡量标准变成了训练目标,涨分必然发生,但未必是能力。自己的演化集上涨 14.1、分布外只涨 4.7 这个落差,正是所有做自动优化的人迟早会撞上的那堵墙。可执行的判断只有一条:给自演化流程留一份从未参与演化的留出集,而且要在流程开始前就冻结,之后任何一次调参都不许碰它;只在演化集上看收益,你得到的是过拟合的工程,不是更强的智能体。另外那 30% 的 token 降幅值得单独关注——它说明「少改、改得更可复用」在这里既是提分手段也是省钱手段,两件事并不冲突。 来源:arXiv:2609.24972《RRSI: Regularized Recursive Self-Improvement of Agent Harnesses》(2026-09-21 挂出);配套代码 github.com/google-research/rrsi 今日总判断 今天三条线索分别落在成本、接口和评测上,指向同一件事——真正拉开差距的不是模型分数,而是你用它的方式能不能复现、能不能迁移、能不能验证。缓存读被砍到五分之一,说明头部厂商开始对「长时间反复读同一份上下文」这种最贵的用法动手,你的账单结构比模型选型更需要体检;把编码智能体做成可插拔后端的项目出现,说明换 harness 正在从重写代码变成改配置,值得提前把自己的对接层解耦;而那篇给自演化加正则的论文提醒得更直接——任何只要涨分就算成功的自动流程,都会先涨出一个漂亮数字,再把它还回去。顺序建议就按这个来:先把评测留出集冻结、再把成本按单任务核算,最后才讨论换哪个模型。 上面这类信息,AI呀 都做成了可查、可比、可复用的页面——不只报发生了什么,还给结论。四个入口: 🔍 AI工具测评🧩 AI工具集🔌 免费API💬 提示词库 直达:aiya.pw (复制到浏览器打开)