夜雨聆风学习资料网

ARTICLE · 1159766

AI 不是越用越笨,是我们一直在用错力气

AI 不是越用越笨,是我们一直在用错力气

       重思 · 重现 · 重生     

       我的 agent 研究笔记 · 第一篇     

重新发现 AGENT · 001     

AI 不是越用越笨,是我们一直在用错力气     

这一篇文章,是我决定把 agent 从「偷偷用的工具」搬到台前研究的开始。         我把十二条关于 AI 的流行说法逐条对了证据,结果比我预想的更反常识。       

先说一个我猜你也遇到过的现象。     

对话刚开始的时候,它写得很认真。两千字,结构清楚,该展开的都展开了。聊到后面,你说「再深入一点,加上对比」,它回你一千字。你再问「还有哪些没考虑到」,它给你三行。     

你的第一反应是——它变懒了,它在敷衍我。     

这个感觉是对的。但原因不是你想的那个。     

一 · 这不是错觉,有数据       

我找到一组实测数据:六个主流模型,七十五个真实任务。任务进行到第三到第五小时,它每次回答的输出量掉了三到四成。     

最反常识的是:越强的模型掉得越狠。能力最强的那个,掉了 45%。     

所以不是「它不行了」。是我们这个用法,本身在消耗它。     

二 · 同一个模型,成绩能差一倍       

第二个发现更颠覆。     

同一个模型,同一批任务,一行权重都不改,只换「怎么给它信息、怎么让它记东西、它能调用什么」,成绩能从 40.68 直接跑到 100。     

差别不在模型好不好,在接法对不对。这件事我第一次看到的时候,盯着那张表看了很久。     

三 · 那为什么老办法突然不管用了       

你肯定有过这种经历:精心调了一套提示词,效果很好。过了三个月模型升级,同样的提示词,反而让它变差了。     

我找到了实测:几套专业工作流,在旧模型上好用,换到新模型上全部翻负——有的从 +8.3 掉到 −8.3,有的从 −10 掉到 −40。     

原因其实不难理解:你的流程,本质上是在补某个具体模型的短板。模型自己学会那件事之后,你的流程就从「帮助」变成了「干扰」。     

四 · 网上最流行的那条建议,也是错的       

「对话太长就重开一个」——这条几乎所有人都听过。     

实测下来:重开得越勤,成绩越差。每步都重开、中频率重开,两个设置都不如什么都不做。     

顺带说,把记忆容量从 200K 加到 780K,成绩零提升,成本贵 3.4 倍。反过来砍到 100K,成绩只掉 0.4%,成本减半。     

给更多、给更大、写更详细的说明书——这三个方向我都找到了实验验证:都没用。

所以真正的分水岭在这里       

我们是在「用 AI 干好任务」,还是在「用好 AI 干任务」?       

用 AI 干好任务         

教它怎么做。写流程、补背景、叮嘱注意事项。你补的是它的短板——而短板会过期。

用好 AI 干任务         

先定义「怎么算做完了」。给它一个它看得见、但改不了的标准。你锚定的是任务本身——它不会过期。

这一句同时解释了三件事:为什么你的提示词会失效、为什么「重开对话」没用、以及为什么「让它自己检查一遍」反而真的有效。       

五 · 明天就能改的三件事     

1 · 先想「怎么判断它做对了」       

写提示词之前,先确定一个能客观打分的标准。有了它,你不需要教它方法。       

2 · 这个标准要它自己改不了       

外部给、提前定好,它不能自己改判分规则。一个能被它轻易满足的标准,会被轻易满足。       

3 · 升级模型后,把「教它怎么做」的部分删掉再试       

模型变强之后,那部分会从帮助变成干扰。这已经不是我的猜测——是厂商自己在建议的做法。       

我们总在讨论「该用哪个 AI」。但真正决定结果的那个变量,可能一直是我们怎么用它。     

这也是我决定开始做 agent 研究的原因——上面这些结论,每一条背后都是一篇论文、一组数据、一次可复现的测量。它们不是我拍脑袋想出来的,也不该只作为「技巧」流传。     

数据来源       

· VISTA: A Visual Harness for Reasoning in an Interactive World — arXiv:2610.02200(MIT,2026-10-01)· Evaluating AGENTS.md: Are Repository-Level Context Files Helpful for Coding         Agents? — arXiv:2602.11988(ETH Zurich)· 一份 ICLR 2027 在审投稿关于单 agent 长时程退化与harness staleness 的测量       

         本文所有数字均来自公开材料,可查证。未经核实的推测已在文中明确标注。       

       重思 · 重现 · 重生     

       把 agent 从工具,搬到台前     

相关学习资料