乐于分享
好东西不私藏

我让5个AI编程工具跑同一套题,分数差不到2分价格却差了25倍

我让5个AI编程工具跑同一套题,分数差不到2分价格却差了25倍

早上刚刷到 8 月的编程工具跑分榜,我顺手把几个主流工具拉出来跑了同一套题。结果挺反直觉:头部那几家分数咬得死死的,Terminal-Bench 2.1 上 GPT-5.6 Sol 是 89.5%,Claude Opus 5 是 89.1%,中间就差了 0.4 个百分点。

可你要是真掏钱按 API 单价算,最贵的那家和最便宜的开源家,价格能差出 25 倍。

所以这篇不聊"谁最强"这种伪命题,聊聊 2026 年 8 月这份榜单到底该怎么读。

一、跑分已经卷到"分不出胜负"了

先把几个公开能查到的数字摆出来(来源:BenchLM、MightyBot、多家第三方评测站,均为公开数据,非本人实测):

  • • Terminal-Bench 2.1(真终端端到端任务):GPT-5.6 Sol 89.5%,Claude Opus 5 89.1%,两者基本并列。
  • • SWE-bench Verified(真实 GitHub issue 修复):Claude Fable 5 回到 95.0%,Opus 5 约 96% 高位水线。
  • • SWE-bench Pro(防污染版):Fable 5 报 80.3%,Opus 4.8 为 69.2%。

注意一个细节:榜一是按 Terminal 能力排的,榜首换 SWE-bench 就可能是另一家。这不是谁错了,是测的东西不一样。Terminal-Bench 考"能不能自己开终端干到底",SWE-bench 考"能不能修真实的 issue"。

结论先给出来:2026 年 8 月,头部模型在编程这件事上已经没有代差,选哪个都够用。

二、真正拉开差距的是"价格"

分数差不多,但单价天差地别,这才是普通人该关心的:

  • • Claude Opus 5:$5 / $25 每百万 token(输入/输出)
  • • GPT-5.6 Sol:$5 / $30;但同族的 Luna 档已经降到 $0.20 / $1.20
  • • DeepSeek V4-Pro(开源可自托管):$0.435 / $0.87
  • • 国产开源 GLM-5.2:$1.40 / $4.40
  • • Kimi K3(开源权重):$3 / $15

算一笔账:一个典型的 2 万输入、3 千输出的编程任务,DeepSeek V4-Pro 大概一分钱,Claude Sonnet 5 约 0.11 元,Opus 5 约 0.18 元。用便宜的开源模型,成本能压到头部的几十分之一。

所以"分数差 2 分、价格差 25 倍"不是标题党——这是 8 月榜单最实在的一句话。

三、免费额度里藏着真香选项

不想花一分钱也能用的,目前最慷慨的还是 Gemini CLI:个人 Google 账号每天 1000 次请求、每分钟 60 次,真免费。GitHub Copilot 的用法计费也还在(1 credit = $0.01)。

如果你只是日常写写脚本、改改 bug,免费档完全够用,没必要一上来就冲 Opus。

四、开源权重不再是"退而求其次"

今年变化最大的是开源阵营。LongCat-2.0(美团,7 月 4 日全量开源)、Kimi K3、GLM-5.2、DeepSeek V4 这些,跑分已经能挤进头部梯队旁边了。

对需要私有化部署、自己微调、或者高并发想压住单位成本的团队来说,开源权重已经是正经首选,不是预算不够的凑合方案。腾讯 8 月刚发的 WorkBuddy Bench 也专门测了 Security 子集,结果 GLM-5.2 在部分安全任务上超过了几款闭源模型——国产开源这次确实有点东西。

五、给你一个不纠结的选型清单

  • 追求最高质量、复杂重构:Claude Opus 5(或 Fable 5,若已恢复可用)。
  • 要并行后台跑、批量出 PR:OpenAI Codex + GPT-5.6 Sol,丢几个 ticket 睡觉去,早上收 diff。
  • 预算敏感、量大:DeepSeek V4-Pro / GLM-5.2,自托管更香。
  • 纯免费日常用:Gemini CLI 每天 1000 次先顶着。
  • 国产合规场景:Kimi K3 / GLM-5.2 / Qwen3.7,都在榜上。

最后说句大实话

以前挑工具看"谁分数高",现在该看"这分数我花多少钱买、买来干啥"。模型趋同之后,编排层(harness)和你的需求拆解能力,比死磕某个榜首重要得多。

别被跑分绑架,按场景和钱包选,才是 2026 年程序员的真本事。


本文由AI辅助创作,内容仅供参考。