一条提示词,十七个小时,近乎零人工干预。 当工程师第二天早上打开终端,发现AI不仅把自己的考试成绩从77.5%拉到了88.8%,跑一次还比原来便宜了三成。
这场实验发生在2026年7月底开源编程代理 Cline 团队让月之暗面的 Kimi K3 模型,坐在自己的运行框架里,亲手改写了自己脚下的脚手架代码,然后一遍又一遍地重新考试,直到把分数刷到接近天花板。


▲ Cline官方公告:左侧灰柱为改进前(77.5%,$79/次),右侧蓝柱为改进后(88.8%,$49.8/次),成本下降37%
整件事的账单?680美元 大约一台中端手机的价格
一、先搞清楚:它到底改了什么?
“递归自我改进”很容易让人联想到AI觉醒。先厘清边界:团队调整的是运行框架,Kimi K3的神经网络权重一个字节都没动。
被改写的是 harness,中文可以叫“运行框架”或者“脚手架”。你可以这样理解:如果大模型是一个极其聪明但没有手脚的大脑,那harness就是它的假肢系统,决定它怎么敲键盘、怎么读屏幕、卡住了怎么重试、后台进程怎么清理、API报错了是放弃还是再来。
同一颗大脑,换一副更好的假肢,干活效果天差地别。
这正是Cline团队的核心主张:模型之外的人与流程,同样会成为性能瓶颈。
二、680美元买了什么:一场“AI给AI做手术”的全纪录
实验的目标平台是 Terminal-Bench 2.1,一套由斯坦福等机构推动的AI代理基准测试,包含89道“真实感”极强的终端操作任务:编译内核、改系统配置、管理后台进程、处理长命令链。代理必须在Linux终端里完成实际操作。

▲ Terminal-Bench官网:专门衡量AI代理在终端环境中的实战能力
实验架构颇为精妙:GPT-5.6-Sol 担任“总指挥”,负责阅读失败日志、形成假设、改写Cline的代码;Kimi K3 是“被改进的对象”,每改一轮就重新跑一遍考试。提示词由工程师 Ara Khan 写好后一键启动,此后人类的角色被压缩到极致,几小时看一眼,代理停了就点继续。
整个过程像一场精密的外科手术,修复点各有侧重:
API重试 基线跑分里有5道题,Kimi K3 明明会做,但OpenRouter返回了429限流错误,Cline直接认命放弃了。修复方案简单粗暴,把重试次数从2提到5,加上指数退避。五道题,全部翻转通过
循环检测 两道长任务里,代理在合法轮询后台进程的进度,输出内容其实一直在变,但“重复工具调用”检测器只看形式不看内容,直接判了死刑。修复后的检测器能感知输出是否有实质变化。两题翻转
幽灵退出 最诡异的Bug,某道题在7.6秒内退出,零token生成、零API调用,模型连话都没来得及说就被宣告失败。根因是代码里一个异步文件索引在前台启动前就让进程"合法退出"了。一处保活修复,搞定
自杀式清理 两道题中,代理执行 pkill -f 做进程清理时,匹配模式太宽,把自己的父进程也杀了,相当于外科医生切肿瘤时把自己的手也切掉了。修复是在工具文档里加了一条“记住精确PID,别用宽匹配”的警告。

▲ GitHub PR #12465:所有改动以工程PR形式公开,标题为"改善长程代理工作流的CLI韧性"
这些修复都在帮AI减少系统性意外。类似Bug可能出现在任何长程终端代理身上,属于通用的系统工程问题,也没有针对89道题写入特定答案。
三、便宜还是贵?一道有意思的算术题

▲ 有人追问花了多少钱,Cline官方干脆利落:$680
680美元的账单几乎对半劈开:336美元花在“指挥官”GPT-5.6-Sol的思考上,344美元花在Kimi K3反复考试上。总共烧掉了大约十亿个token
有评论者算了一笔更有趣的账:

▲ Sandeep Alluru的评论:变强的同时变便宜,"这种事几乎从不发生"
改进前,跑一次完整基准要79美元,得分77.5%;改进后,49.8美元拿到88.8%换算成“每美元买到的分数”,效率提升了大约1.8倍。Cline博文还特意做了一组对照:同一套题,用 Fable 5 跑一次要花约552美元,GPT-5.6 Terra 约400美元,而经过RSI优化的 Kimi K3 + Cline 只要49.8美元,不到前者的十分之一。
更关键的对比藏在时间维度里Cline团队2026年1月做过一次“人肉爬坡”:四个工程师花了好几个星期,眼睛读日志读到出血,才把某个模型组合的分数从47%拉到57%。半年后,类似优化的工作周期被压缩到了17小时。

▲ Cline 2026年1月的博文:人工诊断周末级密集工作的方法论,正是本次RSI实验的前身
680美元买到了一种可复制的工作流。每当新模型发布,一条提示词和一夜的API调用,就有机会完成一轮自动诊断与优化。
四、这算“递归自我改进”吗?社区吵翻了
Cline把这件事包装成“AI的递归自我改进”,这个说法在AI圈的杀伤力堪比往火药桶里扔火柴。

▲ 有人直接开怼:"现在把刷榜叫RSI了吗?"
反对阵营的声音很尖锐有人概括:"所谓RSI = 在Cline里跑Kimi并让它改Cline,就这?" 还有人提出了一个苛刻的判据:如果改进后的harness无法继续自我改进、冲击更高分,其递归属性就很有限,可归为一次性的自动优化。

▲ 方法论质疑:优化器盯着这个分数看了17小时,就算没有"显式刷题",也可能隐性过拟合
“刷榜”(benchmaxxing)的指控同样直击要害。Ari Heljakka 的追问很到位:Terminal-Bench的分数在RSI循环里全程可见吗?如果优化器盯着这个分数看了17个小时,它完全可以在不做任何"针对性修复"的情况下,学会只对这89道题有用的模式。

▲ Grok的长回复:逐条列举通用修复项,并复述提示词中的反刷分禁令
官方立场由多条回复拼出:修复项是限流重试、进度感知循环检测、PID防自杀、reasoning路由,这些改动“不提Terminal-Bench”也完全说得通。提示词里明确禁止按任务名检测、禁止改验证器、禁止灌水超时。而且PR标题就叫“改善长程代理工作流的CLI韧性”,连Terminal-Bench的名字都没出现。
但核心张力仍然存在 这是一个经典的认识论问题:当你的优化器和你的考试用的是同一套卷子,即使你禁止了所有“显式作弊”,隐式过拟合的幽灵依然在场。只有等独立团队在完全不同的基准上复现类似涨幅,这个问号才能被拉直。
五、88.8%之外
回到更大的图景
2026年的AI竞赛,正在从“谁的模型更大” 悄然转向 “谁的脚手架更结实”。公开排行榜上,同一个模型换不同的agent框架(Claude Code、Codex、Terminus、Cline、厂商自研),分数可以差出十几个百分点。当大脑趋同时,假肢决定胜负

▲ Cline官方博文首页:标题直书"编程代理的递归自我改进"
而Cline这场实验最锋利的启示或许是:脚手架工程本身,开始可以由AI来做了。 那个“读日志→找Bug→写补丁→重新测试”的循环,过去可能占用资深工程师一周,现在被压缩成了一条提示词和一夜的token消耗。
这离奇点或AI觉醒还很远,严格说也很难算完整的“递归自我改进”。它展示了AI工程自动化已经能推进到什么程度。
当AI能够诊断自己为什么失败、修复自己的运行环境、然后证明修复有效,哪怕它做的只是把重试次数从2改成5、把进程清理从宽匹配改成精确PID,“评测-诊断-补丁”循环的效率边界也已经改变。
680美元十七个小时一条提示词
下一条被这套方法重塑的工程循环,会在哪里出现?
夜雨聆风