Claude 又更新了。
Anthropic 自豪地宣布: Opus 4.8 和 Sonnet 5 性能更强、更智能!
结果开发者一用,发现工具调用崩了。
新模型,旧问题
一位知名开发者 Armin Ronacher 扒出了一个诡异现象:
Claude 最新的 Opus 4.8 和 Sonnet 5 在工具调用上,竟然比老版本还差。
不是开玩笑。
他测试了同一套代码编辑工具,老版本 Claude 正常工作,新版本频繁报错。
问题出在哪? Tool Schema 处理能力退化了。
更讽刺的是,这些都是 Anthropic 的 SOTA (最先进)模型,理论上应该碾压前辈。
实际上?被前辈吊打。
工具调用的真相
很多人以为 AI 调用工具是什么高科技。
其实没那么神秘。
工具调用本质上就是文本游戏——模型吐出特定格式的文本,客户端解析后执行操作。
Claude 用的是 ANTML 标记格式,大概长这样:
模型训练时见过这种格式的大量示例,所以知道该怎么生成。
听起来很简单?
问题就出在"简单"上。
为什么新模型反而更差?
这里有个反直觉的现象:
模型能力越强,越容易在简单任务上翻车。
原因很简单:训练数据变了。
新模型为了提升通用能力,加入了更多复杂场景的训练数据。
结果就是,模型学会了高难度操作,但忘了基础功。
就像你学会了写交响乐,但弹《小星星》却弹错了。
Armin 的测试数据很明确:Opus 4.8 和 Sonnet 5 在工具 schema 解析上的错误率,明显高于老版本。
这不是个例,是系统性退化。
开发者的噩梦
对于依赖 Claude 做代码编辑、文件操作的开发者来说,这简直是灾难。
想象一下:
你写了一个 AI 助手,用 Claude API 做代码重构。
昨天还好好的,今天 Anthropic 推送了"更强大的新模型"。
结果你的工具彻底罢工。
不是代码有 bug ,是 AI 退步了。
更糟的是, Anthropic 不会告诉你"新模型某些能力退化了"。
他们只会说"性能提升 X%,准确率提升 Y%"。
至于工具调用变差?
抱歉,这不在 benchmark 里。
API 稳定性是个笑话
这个事件暴露了一个更深层的问题:
AI API 根本没有稳定性保证。
传统软件开发里, API 变更要走严格的版本控制。
Breaking changes 必须明确标注,给开发者迁移时间。
但 AI 模型呢?
今天推送新版本,明天你的代码就炸了。
没有 changelog ,没有 migration guide ,甚至没有版本号。
你只能祈祷 Anthropic 的内部测试覆盖到了你的使用场景。
显然,他们没有。
追求 benchmark 的代价
为什么会这样?
因为整个 AI 行业都在疯狂内卷 benchmark 。
谁的 MMLU 高 0.5%,谁就是"更好的模型"。
至于实际使用中的工具调用、格式化输出、指令遵循?
这些不性感的能力,没人在意。
结果就是:模型在考试题上越来越强,在真实工作上越来越废。
就像学生为了高考刷题,但毕业后发现啥也不会。
开发者该怎么办?
面对这种情况,开发者只能自救:
1. 别急着升级
看到新模型发布,先等等。
让别人当小白鼠,确认没问题再说。
2. 做好降级准备
你的代码要支持回退到老版本模型。
万一新版本翻车,至少有 plan B 。
3. 别把关键流程托付给 AI
工具调用这种基础能力都能退化,还有什么是靠谱的?
核心逻辑自己写, AI 只做辅助。
结语
AI 行业现在有点像当年的 Web3 :
每天都有"革命性突破",但实际可用性一言难尽。
Claude 从 Opus 3 到 Opus 4.8 ,模型是"进步"了。
但对于依赖工具调用的开发者来说,这是一次降级。
更好的模型,更差的工具。
这就是 2026 年 AI 开发的现状。
你还敢无脑追新吗?
夜雨聆风