模型厂商发新模型,全网都在比基准测试分数。Peter Steinberger 不看分数。他用了一整年,每天同时开几十个会话,他对模型的判断全是具体的、带着使用场景的,而且不留情面。
这一篇讲他在一线怎么评判模型。
慢的那个,反而更好
他最早用 Claude Code,后来换到 Codex。换的理由很具体。
他说,Claude 会读三个文件,然后自信地开始写代码。Codex 不一样,它会沉默很久,就一直在读文件,读十分钟、十五分钟,然后才动手。Codex 单次任务慢得多,有时候要跑十分钟到一个小时,但一次成功率接近九成。Claude 快,但你经常要回头修它修的东西。
他的结论:开发者本能地追求快,但他选了慢十倍的工具,产出反而更好。因为慢的那个时间花在了读你的代码库上。
他还给过一个非常毒舌的对比。他说 Claude Code 用起来更舒服,性格好,但 Claude 会告诉你「百分之百生产就绪」,然后你一跑全是 bug。Codex 他形容是「枯燥的欧洲人」,但它会读更多代码,通常能找到更好的解。他的原话是,如果你真懂你在做什么,两个工具都能用,只是工作量不一样。
模型「变差」,多数时候是你适应了
有一个现象几乎每个用 AI 的人都遇到过:新模型发布,惊为天人,过了一个月开始抱怨「退化了」「是不是偷偷量化降质了」。
他的判断很干脆:模型没变,是你的预期追上去了。每个新模型出来,你觉得它好得不得了,一个月后你习惯了,把它当成新的基准线,于是同样的模型你觉得变差了。不是厂商偷工减料,是需求端的心理适应。
这个观察的推论很冷:开源模型落后当前最强模型一年,但用户对一年前的最强模型的态度,已经从「惊为天人」变成「垃圾」。模型在进步,但用户预期的基准线跑得比模型还快。
prompt engineering 已死
他对 prompt engineering 这个领域,态度更狠:它过时了。
他的理由是,prompt engineering 那些技巧(角色扮演、全大写强调、few-shot 示例)是前 reasoning 模型时代的产物。所谓 reasoning 模型,就是会先自己推演一遍再回答的模型(像 GPT-5 的思考模式、OpenAI 的 o 系列)。它出现之前的模型不会自己思考,你要用角色扮演、全大写这些技巧把它引导到位。但 reasoning 模型会自己想,这些技巧反而成了干扰。
他给了一个具体例子。Claude 喜欢你用全大写强调重点。但 GPT-5 开了思考模式之后,你用全大写,它会在自己的内心独白里乱套,循环反而变慢。同一个技巧,在两个模型上是相反的效果。也就是说,prompt engineering 不可能标准化成一套通用技巧,根本不存在「在所有模型上都成立」的技巧。
他的做法是不写统一的 prompt 文件,针对每个模型分别调。他甚至说,给 agent 加「你是一个资深工程师」这种角色设定,在现在的模型上基本没用。整个 prompt engineering 领域,「一年前还有用,现在充其量是浪费时间」。
他对各家模型的直白评价
他在演讲里给过一些非常不留情面的评价。
- Gemini「不是一个好模型」,工具调用和 agent 场景都不行
- MiniMax M2 是开源模型里最 agentic 的,虽然和美国头部实验室还有差距,但追上是时间问题
- Opus(Claude)有某种「特别的东西」,用起来很舒服,它驱动着他的 OpenClaw
这些评价都不是外交辞令。他不是在发布会上客套,是在一线用了一整年之后下的判断,时间大约到 2026 年中。当然,这是他个人的判断,不是客观排名,而且他 2 月加入了 OpenAI,评 GPT-5 时带立场,要打折;模型迭代又快,过几个月可能就变。但他给的每一条都有具体理由(为什么慢、为什么返工、为什么乱套),比基准测试分数可复现得多。
选模型的真问题

把上面这些连起来,他想说的其实是:选模型这件事,看基准测试分数是最没用的。
基准测试测的是模型在标准任务上的上限。但你真实工作里,模型的表现取决于它怎么读你的代码、怎么处理你的上下文、会不会过度自信、适不适合你的工作节奏。这些东西基准测试测不出来,只能你自己拿真实任务去试。
模型的强弱不在分数表上,在它和你代码库相处的方式里。分数告诉你它能不能,相处告诉你它好不好用。
而且,正如上一篇讲的,他宁可花力气搭一个好 harness,也不纯靠等更强的模型。旧模型配好 harness,能打赢新模型配烂 harness。模型选不对可以换,harness 搭不好,再强的模型也救不了你。
下一篇,话题会重很多。他造 OpenClaw 五个月,收到了 1142 份安全报告,比 Linux 内核日均还多一倍。从那些报告里,他看到了一个他不想看到的行业真相。
(本系列第五篇:被 1142 份报告淹没之后。)
参考(Steinberger 公开演讲,YouTube):
- 2026-01-28 Pragmatic Engineer 访谈:https://youtu.be/8lF7HmQ_RgY
- 2026-02-07「Why 80% Of Apps Will Disappear」:https://youtu.be/4uzGDAoNOZc
- 2026-01-23 GitHub Open Source Friday:https://youtu.be/1iCcUjnAIOM
- 2026-03-01 Imperial College London:https://youtu.be/rnuI_fR6t1Q
- 2025-10-19 NSSpain:https://youtu.be/NjW7lxtZwIM
交流群

和我们一起探索
扫码加入
夜雨聆风