一条提示词一个云端虚拟机一位工程师按下回车后去睡觉
17小时后,AI把运行自己的那套软件,改得面目全非。
这段近似科幻电影开场的情节发生在2026年7月底。开源编码代理Cline在社交媒体上宣布:他们让Kimi K3,月之暗面旗下的推理模型,坐进自己的驾驶舱,花了整整一个通宵,一边跑基准测试,一边修改控制自己行为的代码框架。最终成绩单上写着:Terminal-Bench 2.1得分从77.5%飙升到88.8%,单次跑分成本从79美元骤降到49.8美元。
更刺激的部分是:整场实验的总账单,约680美元。


▲ Cline官方发布的前后对比:灰色柱是改造前的基线,蓝色柱是17小时后的成绩,绿色标注"+11.3 pts"和"37% cheaper per run"
一场精心设计的“AI改造AI”实验
先把故事里的角色关系理清楚,这可能是整件事最容易被误读的地方。
Cline是一个开源的编码代理产品,你可以理解为一个能接管你的终端、编辑器和浏览器的AI助手。Cline本身属于harness,也就是把大模型接到真实世界工具上的那一层运行框架。怎么发请求、遇到限流怎么办、怎么判断AI陷入了死循环、上下文太长怎么压缩……这些脏活累活,全是harness的工作。
同一个模型,换不同的harness,分数可以天差地别。
这次实验的精确分工是这样的:被优化、最终出分的目标模型是月之暗面的Kimi K3(通过OpenRouter接入);而主导整个17小时控制循环、决定改哪里、怎么改、改完跑不跑的领导模型,是OpenAI的GPT-5.6-Sol。用一个比喻来说:GPT-5.6是总工程师,Kimi K3是被调校的赛车手,Cline的harness代码是那辆赛车,Terminal-Bench是赛道。
总工程师花了17小时,一边让赛车手跑圈计时,一边改装赛车,直到圈速快了、油耗低了。
四个Bug,四次翻盘:AI到底改了什么?
最让工程师群体着迷的,是这17小时里发生的具体故事。博客按实验编号逐一记录,读起来像一部侦探小说。
实验0:被吞掉的"满血模式" AI发现Cline的代码里有个静默的bug,Kimi K3明明支持max级别的推理强度,但harness默默把它降级成了high。模型连自己有多大力气都不知道 修复之后,推理通道才顺利打通
实验1:429限流直接投降 基线跑分里有五道题全部失败,原因惊人地一致:OpenRouter返回HTTP 429(请求太多)后,Cline直接放弃了,不重试、不等待、不退避,就这么认输。AI把重试次数从2提到5,加上指数退避策略。五道题,全部翻盘
实验2:误杀"慢工出细活" 有两道题需要AI在后台运行长时间任务,比如编译内核。Cline内置的循环检测器看到AI反复调用同一个工具,就判定它陷入了死循环,直接杀掉进程。但实际上AI每次调用的输出都在变化,它只是在耐心等结果。AI把检测逻辑改成了"输出感知型":只要输出还在变,就不算死循环。两道题,翻盘
实验3:7.6秒的幽灵崩溃 一道题在启动后7.6秒就退出了,零token、无session,整个模型甚至还没被调用。根因被追溯到一个极其诡异的角落:提示词里出现了类似@a的字符串,触发了文件提及查找的异步worker;而超时逻辑在worker完成前就合法地终止了进程。一行修复,确定性翻盘
实验4:AI把自己杀了 这是最戏剧性的一幕两道题失败的原因是:AI在清理后台进程时使用了pkill -f这种宽泛的模式匹配命令,匹配到了harness自身的命令行,把自己的父进程干掉了。 修复方式是在工具说明里加警告:追踪精确PID,避免宽匹配。


▲ 社区热传的"680美元commit":Can Bölük贴出diff,新增的代码要求工具描述包含"capture PID"和"pkill -f"警告。有人戏谑"这么多钱就换来几行注释"
680美元买了什么?约10亿token的智力燃烧
官方公开的成本拆分,读起来像一张精密的战争开支表:
GPT-5.6-Sol控制线程:约2.77亿token,花费约337美元。这是总工程师的脑力费,它在17小时里持续阅读失败轨迹、提出假设、写补丁、调度评测。
Terminal-Bench评测运行:约3.91亿token,花费约344美元。这是赛车手反复跑圈的油费,每改一处,都要让Kimi K3在89道真实任务上重新证明自己。
合计:约680美元,约10亿token。
Cline把这笔账和"工程师数周时间加机会成本"做对比,认为划算。社区的反应则更加五味杂陈有人追问"到底花了多少钱?"

▲ Vlad Tansky在官方帖下的直球提问
而更尖锐的对比来自另一组数字:单次完整跑分的成本。Kimi K3加优化后Cline只要49.8美元就拿到88.8%;博客称同级别成绩,Fable 5要花552美元,GPT-5.6 Terra要400美元。换算下来,Kimi K3的性价比是前沿模型的近10倍。

▲ 博客中的暗色成本对比图:Kimi K3那根蓝色矮柱和旁边的灰色高柱形成鲜明反差
"这算递归自我改进吗?",一场定义之战
Cline官方把这次实验称为"a version of recursive self-improvement",措辞留有余地。随后参与讨论的账号不断给这个标签加压。
科技账号SciTech Era写道:"这就是实际的递归AI自我改进的样子。"


▲ SciTech Era的引用转发,"we are living through an amazing period of acceleration!"
Dr Singularity等账号更是直接把故事推向奇点判断:AI已经比人类AI开发者聪明,RSI通向ASI。
但反对声同样犀利医学与AI研究者Louis Mullie一针见血:
一轮带来提升的自我修改,尚不足以构成递归自我改进。

▲ Louis Mullie的引用评论,指出单轮改进与递归循环之间的差别
另一位评论者Unobserved追问得更狠:如果这真是递归自我改进,为什么不继续跑?新的harness能不能再把分数推过88.8%?实验停下来的原因又是什么?

▲ Unobserved的回复:RSI要求改进后的版本仍能继续自我提升
还有一条评论将整套做法概括为:"所谓递归自我改进,就是在Cline里跑Kimi,让它改Cline。"
这场定义之争的核心在于:经典意义上的递归自我改进,意味着系统改进自身后,改进后的版本能更快地进行下一轮改进,形成加速闭环。 Cline展示的内容接近一次自动化的hill climbing,爬山爬到了一个更高的点,但现有证据还无法证明它能继续爬、而且爬得越来越快。
这两者之间的距离,可能正是"有趣的工程实验"和"改变人类命运的拐点"之间的距离。
不能忽视的灰色地带:当评测本身在循环之内
芬兰研究者Ari Heljakka提出了一个更深层的方法论质疑:Terminal-Bench的分数是否在优化循环的内部?
这个问题的分量比它表面看起来大得多。即使提示词明确禁止题面特判、禁止改判分器,但优化器连续17小时以分数作为反馈信号这件事本身,就构成了一种选择压力。你没有针对某道题作弊,但你的每一个决策都是为了让这89道题的总分更高,这和"通用改进"之间,界限比想象中模糊。

▲ Ari Heljakka的方法论追问:分数在不在优化环内?
Cline的防线是多层的:提示词明文禁止reward hacking、保留的修复都是通用harness问题、最终由人类审核PR再合并。但"以榜为信号"本身带来的过拟合风险,无法被提示词消灭。 三次确认跑的分数,88.8%、85.4%、87.6%,之间的波动,或许正在暗示这个区间的真实不确定性。
分数之外的信号:工作范式
略过社交媒体上的兴奋与争议,这个故事释放出的信号可能是:评测基础设施、可写清的实验协议、长时agent能力,三件事同时成熟了。
半年前,Cline团队做同样的hill climbing需要四个工程师、数周时间、逐条阅读89道题的失败轨迹。现在,一条提示词、一名工程师、17小时、680美元。
故事的焦点在于,AI开发AI的流水线正在成型。Cline在博客末尾透露,他们已经把类似的RSI流程准备成了新模型发布后的标准动作:先跑基线,再让agent自动榨取harness红利。

▲ PR #12465:标题写着"Improve CLI resilience for long-running agent workflows",+774/-58行变更
当"让AI改进运行AI的代码"变成一个可复现的、有账单的、开源的标准流程,我们或许无需纠结它能否达到经典定义中的递归自我改进。
问题随之而来:当这条流水线的成本从680美元降到68美元,再降到6.8美元的时候,世界会变成什么样?
夜雨聆风