一条提示词,一夜无人值守,一个编程代理对着自己的源代码动了刀。
当工程师第二天早上打开终端,屏幕上的数字从 77.5% 跳到了 88.8%,而每次跑分的花费从 79美元 降到了 49.8美元,更强,还更便宜。整件事总共烧掉 680美元API账单,吞吐将近 十亿token。
这场来自开源编程代理 Cline 团队的真实实验,在2026年7月底公开复盘。他们给它起了一个让整个AI圈吵翻天的名字:递归自我改进(Recursive Self-Improvement)。


▲ Cline官方公告:17小时,77.5%→88.8%,成本降37%
模型没变,“外挂”变强了
先泼一盆冷水把概念讲清楚
很多人看到标题的第一反应是:AI自己把自己训练得更强了?模型权重一个字节都没动,改动发生在模型外面那层叫 harness(运行框架/脚手架) 的东西上。
打个比方:模型是赛车手,harness 是赛车本身。手不变,但你把刹车系统换了、变速箱调了、油路优化了,同一个车手,圈速快了一大截。
具体到这次实验,被改掉的全是基础设施层面的工程Bug:API限流时直接放弃不重试、循环检测误杀正在合法轮询的进程、pkill -f 的模式匹配宽到把自己杀掉、异步索引导致模型还没被调用程序就退出了……模型常常还没来得及答卷,脚手架就先把它赶出了考场。
操刀修改这些Bug的是另一个AI。
一场精心设计的“代理改代理”接力赛
实验的架构其实是一场双模型接力:
指挥官是 OpenAI 的 GPT-5.6-Sol,负责读失败日志、形成假设、写代码补丁、决定保留还是回退。考生是月之暗面的 Kimi K3,跑在 Cline 的 harness 上去做 Terminal-Bench 2.1 的89道题。Sol改完脚手架,K3就在新脚手架上重新考试;考完Sol再看哪里挂了,再改,再考,循环往复,十七个小时。


▲ Cline工程师Ara宣布:编程代理的递归自我改进
但这里有一个微妙的表述落差Cline官方推文写的是“让 Kimi K3 递归自我改进Cline harness”,博文里则明确说控制/leader模型是 GPT-5.6-Sol。两者并不矛盾,K3是被改进的对象也是评测的载体,Sol是动手改代码的大脑,但简短摘要很容易混淆主语。谁改的、改了谁、谁变强了,这三个问题的答案分别是三个不同的实体。
680美元买了什么?一份失败图鉴
打开成本账本,680美元几乎对半劈成两刀:
- 指挥线程
(GPT-5.6-Sol思考+改代码):约2.77亿token,337美元 - 评测线程
(Kimi K3反复跑题):约3.91亿token,344美元
这揭示了自动化AI研究的一个冷酷经济学:你不仅要为“干活的模型”付钱,还要为“指挥干活的模型”付钱。元层推理和目标层评估,双重计费
但比账单更有价值的,是实验过程中挖出来的失败模式清单,这才是整件事最可复用的知识资产:
pkill -f |
每一条都记录着脚手架如何抢在AI解题前先塌掉。 这对所有在搞长程AI代理的团队来说,简直是一份可以直接拿去对照自查的体检报告。

▲ 公开PR标题:改进CLI在长程代理工作流中的韧性
“现在把刷榜叫递归自我改进了吗?”
分数一出,社区立刻炸开争论沿着三条线展开
第一条线:刷榜质疑 有人怼过来,“are we calling benchmaxxing RSI now”,现在管刷榜叫递归自我改进了?

▲ "现在把刷榜叫RSI了吗",社区的灵魂拷问
Cline的反驳是:提示词里明确禁止按任务名做特判、禁止改验证器、禁止灌水超时,所有改动都是通用的重试/循环/进程管理修复。但质疑者指出:哪怕你不偷看答案,连续十七小时拿同一套89题当适应度函数,也可能学到“只对这89题有用”的模式。
第二条线:88.8%该怎么看? Terminal-Bench 2.1的公开排行榜上,最高分在 83.x% 左右。Cline自报88.8%,但两者跑分协议可能不同,超时倍率、尝试次数、是否严格遵守 harbor run 统一命令,都会影响结果。Cline自己的提示词都写了“不要把开发协议分数直接等同于排行榜分数”。 这种自我约束反而是加分项

▲ Terminal-Bench 2.1 公开排行榜
第三条线,也是最深的一条:这算不算“递归自我改进”? 一位叫Unobserved的用户提出追问:改进后的harness若无法继续自我改进并突破88.8%,便够不上严格意义的递归。

▲ 社区追问:新harness能否继续改进自己并突破88.8%
这话戳到了要害经典意义上的RSI,是系统持续螺旋上升的能力闭环,每一轮改进为下一轮创造更高的起点。Cline完成了一次有天花板的自动化工程优化,改动集中在工具调用的重试逻辑和进程管理,模型权重与学习算法保持原样。这很了不起,但叫“递归自我改进”,帽子确实大了一号。
关键的信号:脚手架军备竞赛来了
抛开术语之争,88.8%背后已经显出竞争维度迁移。
当前沿模型的“裸能力”越来越接近时,下一美元和下一个百分点,越来越多花在harness工程上。 Claude Code、Codex、Cursor CLI、Terminus、Cline、各厂商自研Agent,谁更会重试,谁更能扛长任务,谁更少误杀后台进程,谁更会保存推理历史。这是一场脚手架军备竞赛
而Cline刚刚证明了一件事:脚手架工程本身,开始可以由AI来承担。
过去,Cline团队用四个人、几周时间、一遍遍人眼读日志,把分数从47%磨到57%。现在,一条提示词、一夜API调用、680美元。完成的是同一类劳动:读轨迹、找假设、改代码、验证。区别在于谁承担迭代带宽

▲ Cline博文:《编程代理的递归自我改进》
Cline团队已经表示,要把这套RSI流程标准化到每个新模型发布后,先跑基线,再用提示词驱动自动优化。这里呈现的是发布流程的递归
写在最后:奇点没来,但账单到了
让我们把目光从术语之争中拉回来,看看这件事最朴素的一面:
一个开源项目,花了不到700美元和一个晚上,让一个模型在一个严肃基准上多答对了10道题,同时还省了37%的钱。它没有重新训练或引入人工标注与私有数据,只修掉了脚手架里那些“本不该挂”的Bug。
奇点仍在远处,但某种新常态已经露出轮廓:AI开始承担工程流程里最枯燥、最消耗眼睛和耐心的部分,读日志,猜原因,改配置,再来一遍。
680美元,十亿token,十七小时。一个代理改完了自己的脚手架,然后在新脚手架上,跑得更好了。
至于这算不算“递归自我改进”,那张账单至少记录了一夜自动化工程迭代的成本。
夜雨聆风