想必最近大家都有关注到,GPT 又降智了。
这次降智,罪魁祸首很可能不是模型变菜了,而是那些让你觉得很好用的功能——是它们让 AI 变笨了。
这篇想聊的也不止 Codex。我把自己的 agent 砍到只剩 4 个工具之后,肉眼可见产出质量变高了——不是因为模型更强了,而是因为我把干扰它的东西全删了。
如果你也装了一堆 MCP、囤了一堆 SKILL,但总觉得 AI 一到复杂任务就拉胯,那这篇文章就是写给你看的。
你的 AI 是怎么变笨的
好用,是有代价的
Codex 是个所有人都能用的产品,为了让每个人都觉得易用、好用,它对模型有一堆额外要求。
比如让模型时不时调用内置 tool,你就能看到这个"第 2/3 步":

比如在你提问之后,先告诉你它准备干啥、进度怎么样,让你知道它是要好好干活还是要把你的代码搞爆炸:

但这是有代价的。
Codex 为了定期给你显示进度,每隔大概 30 秒会要求模型更新一次进度,模型思考超过 100 个词还会被打断、强制先汇报。最近推理 token 趋近 516 个的问题,长任务思考深度不够、输出质量差——也就是"降智"——很可能就是这么来的。
试想你在做一个非常复杂的任务,本来要想清楚这问题到底是什么、用什么方法解、能不能跑通。这时候强行要求你每个步骤前汇报"我打算怎么想"、每个步骤后汇报"我做了什么",每 30 秒来一次——你是不是也得分出脑子处理这些和任务无关的东西?
人会烦,模型会笨。
工具越多,越笨
Codex 设计了很多功能让你觉得好用:写代码、画图、处理文档、操作电脑,全都要靠 tool 实现。我问了一下它有哪些,好家伙,一页都没显示完:

刚启动就烧了 22k token。

再看一些专门为编程设计的 agent,只有这几个 tool:

启动只用 4k token。当然 Codex 自己的系统指令也长,但最终 5 倍的差距,够说明问题了。

上下文就是它的工位
把模型的上下文窗口想象成它的工位。每一个工具描述、每一次强制汇报、每一段"你可能用得上"的说明书,都是往它工位上堆杂物。杂物堆多了,真正干活的地方就没了。
这也是我讨厌 MCP 的原因:不管你用不用得上,它先往上下文里注入一大堆废话,token 实实在在烧了,输出还实实在在变差了。
SKILL 就纯粹得多——只给模型一句"什么时候用我",等真用上了再读 SKILL.md 看细节。这就是渐进式披露,说白了:用的时候再说,不用别废话。
主流从 MCP 往 SKILL 过渡,是有道理的。
我把 agent 砍到只剩 4 个工具
我很早就不用 Codex 写代码了,日常只拿它搜搜东西、整理文档。中间用了很长一段 OpenCode,慢慢感觉它的定位是开源版 Codex/Claude 平替,不是纯粹的 coding agent。
我的需求很简单:我就是个臭写代码的,能把我需求做好的 agent 就是好 agent,不需要花里胡哨。
后来我换成了 pi。这玩意冷门到官网时不时 404,页面都打不开。
它的介绍也朴素:一个极简 agent harness。官网就一句话——"There are many agent harnesses, but this one is yours"。它适应你的工作流,而不是你适应它,就是这个感觉。

装完就 4 个 tool:read、bash、edit、write。没了。你需要什么,自己拿插件加进来。
它还做了一件 Codex 没做的事:把 AGENTS.md 注入到系统指令里。上下文压缩不会动系统指令,所以再长的任务,硬性要求全都留得下来,模型遵循度大幅改善。
代价是你的 AGENTS.md 得写得好——太长、太泛、互相冲突的提示,都会让模型行为漂移。所以现在我项目里随地都是提示词,跟着目录走,不同目录注入不同的规矩:

这套目录级提示词怎么分层、AGENTS.md 怎么写才不漂移,后边有需要我整理发出来,点个「赞」,让我知道。
顺带一提,Codex 是把 AGENTS.md 注入到用户消息里的。官方解释是系统指令经过精心设计、最佳匹配模型,不推荐改。以前我信,后来发现它除了约束模型不输出哥布林之外好像没啥用途。
看看效果
质量先赢了
真正让我留下来的是这个:一个持续 11 轮、总时长 47 分钟、近 16 万行代码的项目里,253 次工具调用,全程 XHigh 推理深度,直到任务完成才第一次触发上下文压缩,此时窗口用量 254k。

窗口里没有杂物,就全是活儿。
钱包也守住了
别听奥特曼说 GPT 5.6 降价了,仔细看账单,多了一项 Cache writes,实际开支几乎翻倍:

pi 在成本上就友好得多,整体 token 消耗只有 Codex 的七成到一半——没有多余的工具描述,没有一大长串系统指令,天生就省。
不只是我的体感
Databricks 在他们千万行级的代码库上做过一组 coding agent 基准测试。结论是,pi 的成本降了一半。

质量(通过率)反而还高了 5 个点。

省一半的钱,还多对 5 个点,那可太划算了。
模型自由了
Claude 很有自己的主见,它喜欢在你的规划外,额外多给你一些"惊喜",当然也有可能是惊吓。GPT 就很听话,说什么做什么,不说不做。Grok 就是快,没别的了,它真的非常快。
现在,pi 给了我随意切模型的能力,我不用担心被一家绑定,也不用担心 GPT 写出来的东西没人味、过于抽象,也不用担心 Claude 干活留了一堆屎山给我。
做方案、写文档的时候,就让 Claude Fable 来,执行任务、审查工作时,就让 GPT 来,如果我非常非常急,迫切看个代码查问题的,就让 Grok 来。多模型一起用,才是 subagent 最有价值的地方,让不同的模型各司其职、各执所长。

而且可选的余地还在变大:GPT 5.6 的窗口从 272k 加到了 353k,老马家 Grok 4.5 也上线了,直接开到 500k,简单看一眼数据,coding 榜已经冲到第 6——老马还是有点东西的,以后又能多一个选择。

终于不失忆了
长任务失忆这事,我试过 SpecKit、OpenSpec,结论是都很难彻底解决。有条件的情况下,仍然是大窗口、不压缩优先,压缩永远是最后手段。一旦压缩,就相当于换了个人接手现场,原来它是怎么想的、为什么要这么做,细节就很难再对齐了。
实在绕不开压缩的场景,我自己写了一个「交接包」SKILL:在压缩前把任务状态、决策记录、未竟事项打包成交接文档,新窗口读完就能几乎无缝接手,相当于给两个 agent 办了个工作交接。
这个 SKILL 打磨过几轮了,后台回复「交接包」拿,有需要可自取。
一张图总结
让 AI 产出的核心就一个词:上下文预算。窗口是稀缺资源,像管钱一样管它
1. 工具做减法:默认越少越好,用到再装,而不是先装了再说 2. 硬约束进系统指令:会被压缩掉的地方,别放原则 3. 渐进式披露:用的时候再说,不用别废话(所以 SKILL > MCP) 4. 大窗口、不压缩:压缩是止损手段,不是日常操作 5. 人负责 review:AI 负责产出,你负责别让它拉💩

人反而更重要了
体验了这么多 agent 产品,我越来越确定一件事:agent 能接管的只是那些约定俗成、重复的工作,前提是你把流程、边界、约束全部定好,不然稍微出点状况,局面就不可控了。
现在 agent 一天能给我产出 2 万行代码,人 review 的速度已经完全追不上 AI 产出的速度。想法变成现实的门槛越来越低,于是控制 agent 做出真正有意义的功能、避免它真的拉出💩来,反而成了最值钱的活。人对产品的感觉和把握,成了 vibe coding 时代最重要的东西。
如果你觉得今天这篇文章有收获,欢迎 点赞、在看、转发 三连,我们下篇见。
夜雨聆风