一条提示词,一夜API账单,一个开源编程代理对着自己的失败日志连续手术十七个小时。
科幻小说里的设定,走进了现实2026年7月底,开源编程代理 Cline 团队公布了一项让整个AI工程圈炸锅的实验,他们用一条精心编写的长程提示词启动了一场自动化"爬坡战役",让AI去改写运行AI的脚手架代码,目标只有一个:在Terminal-Bench 2.1基准测试上,把Kimi K3的分数往死里拉。
结果?77.5%飙到88.8%,成本从79美元砍到49.8美元。 更强,还更便宜


▲ Cline官方公告帖:左侧灰柱Before 77.5%,右侧蓝柱After 88.8%,成本下降37%
整场实验总花费:680美元吞掉了将近十亿个token没有一个模型权重被改动
一个工程师的一条提示词,替代了四个人几周的活
要理解这件事为什么值得兴奋,得先倒带半年。
2026年初,Cline团队曾面临一个尴尬局面:有潜在合作方来要基准分数,结果发现他们落后于Cursor、Claude Code等竞品。于是四个工程师咬牙坐下来,花了好几周时间,一条一条地读失败日志、猜假设、改代码、重跑评测,眼睛读到出血的那种。最终把某个配置组合的分数从约47%拉到了57%。
这套方法论,他们管叫"爬坡"(hill climbing):分数涨了就保留改动,跌了就回退,反复迭代。朴素,但管用

▲ Cline早期博文《A practical guide to hill climbing》,记录了人肉爬坡的血泪史
半年后,模型能力更强了Cline工程师Ara Khan做了一件大胆的事:把"人怎么爬坡"这套流程翻译成一条可执行的提示词,交给GPT-5.6-Sol去当"总指挥",让它自主完成"分析失败→形成假设→改代码→跑评测→记账→再来一轮"的完整闭环。
四个人、几周、无数杯咖啡的工作量,被压缩成了一条提示词、十七小时、680美元API账单。
分数上涨,靠的是“少死于非命”
这里有一个关键的认知转折,Kimi K3的模型权重,自始至终没有被改过一个比特。
那到底改了什么?
答案是harness,也就是模型外面那一层"运行框架"。你可以把它理解成AI的操作系统:怎么调用工具、超时怎么处理、API报错要不要重试、怎样判断代理陷入了死循环、后台进程怎么清理。模型再聪明,如果运行框架动不动把它"误杀",分数照样上不去。
GPT-5.6-Sol在十七小时里,对着Kimi K3的失败轨迹做了一系列"验尸报告",发现的问题堪称代理工程的"失败百科全书":
实验1:API限流直接放弃 基线测试中有5个任务失败,原因完全相同,OpenRouter返回429(限流),Cline二话不说就放弃了。明明只是服务器说"等一下",代理却理解成了"你完蛋了"。 修复:把重试次数从2提到5,加上指数退避。五个任务全部翻转
实验2:把合法轮询当死循环 两个任务里,代理在等一个长时间后台任务时反复查看进度。循环检测器看到"重复调用"就痛下杀手。但输出明明在变化,说明任务仍在推进,循环检测器误判了它。修复:让检测器感知输出内容两题翻转
实验3:7.6秒幽灵退出 某个任务在启动后7.6秒就退出了,零token、无会话、模型根本没被调用过。根因竟是:提示词里出现了类似@a的文本,触发了文件索引查找的异步逻辑,导致进程在AI还没开始思考之前就安静地自杀了。
实验4:代理用pkill杀掉了自己。 两个任务中,代理用宽匹配模式清理后台进程,结果匹配到了自身的命令行,把运行自己的父进程给杀了。一个AI,亲手拔掉了自己的电源插头。

▲ 实验产出的GitHub PR:标题为"改善长程代理工作流的CLI可靠性",改动涉及数十个文件
这些修复组合起来,就是从77.5%到88.8%的全部秘密。修复全部围绕运行稳定性,与题目答案、验证器或特定任务后门无关。全是"少死于非命"
680美元的账单,藏着自动化研究的成本密码

▲ 公开的成本账本与轨迹包索引页
Cline把花费拆得明明白白:控制线程(GPT-5.6-Sol负责改代码)消耗约2.77亿token,折合337美元;评测线程(Kimi K3反复考试)约3.91亿token,折合344美元。合计680美元
这揭示了一个自动化研究的典型成本结构,你得同时为"会改仓库的指挥官"和"被派去反复考试的士兵"付钱。一个太弱指挥不动,一个太贵考不起而长上下文缓存的定价,会显著改变这类实验的经济性。
有人在评论区直接问Cline:花了多少钱?官方极简回复:$680

▲ 社区追问实验成本
而在此之前,人肉爬坡的隐性成本是什么?四个工程师、好几周、会议与加班,折算成硅谷工程师时薪,680美元大概只够付一个人半天的工资。
"递归自我改进"?社区吵翻了
Cline官方把这个故事包装成一个大词:Recursive Self Improvement(递归自我改进)。
炸锅是必然的

▲ "我们现在管刷榜叫RSI了吗?"
反对派的火力集中在三个方向第一,这不就是刷榜(benchmaxxing)吗? 优化器对着同一套89道题连续跑了十七个小时,就算提示词禁止按题目名字作弊,也难保不会学到"只对这89题有效"的模式。第二,这配叫"递归"吗? 有人提出了一个刁钻的判据:如果改进后的harness不能继续启动下一轮自我改进、冲击更高分,那就只是一次性优化,递归无从谈起。第三,主体到底是谁? 推文说"Kimi K3自我改进",但干活的分明是GPT-5.6-Sol,这就好比说"学生自己提高了成绩",但其实是家教替他重写了学习计划。


▲ 中文社区评论:肯定闭环价值,但质疑RSI标题"有些唬人"
支持派的反驳也有力改动确实是通用的可靠性修复,重试逻辑、循环检测、进程管理,这些改动拿掉Terminal-Bench的名字照样说得通。而且Cline的提示词里白纸黑字写着反刷分禁令:禁止改验证器、禁止按任务名检测、禁止灌水超时。


▲ 有评论者精确指出:GPT-5.6 Sol改写harness,K3权重未变,研究的是失败模式
客观地说,这处在一个灰色地带 它比"改一改system prompt"更接近字面意义上的递归自我改进,毕竟改的是代理将要继续运行在上面的代码仓库;但它又远未达到"模型重写自身权重与目标函数"的强版本。按工程边界描述:这是一次由AI主导的、针对AI运行环境的自动化工程优化。
脚手架军备竞赛已经开始
抛开术语之争,这件事传递的底层信号才是最值得关注的。
2026年的AI编程代理排行榜,越来越像一场脚手架军备竞赛。Claude Code、Codex、Cursor CLI、Terminus、Cline、各家厂商自研Agent排排坐,谁更会重试、谁更能扛长任务、谁更少误杀后台进程、谁更会保存推理历史,这些"非智力因素"正在成为边际胜负手。
Terminal-Bench官网排行榜上,公开提交的前列成绩是Claude Code + Fable 5约83.8%,Codex + GPT-5.5约83.1%。Cline声称的88.8%跑在自己的开发/确认流程下,与公开榜协议不同,Cline自己的提示词也要求不把开发分数直接等价于排行榜成绩。

▲ Terminal-Bench 2.1公开排行榜,统一要求harbor run命令与默认资源限制
但这恰恰说明了一件事:同一个模型,换一套脚手架,可以差出一大截。 当模型能力趋近时,下一美元和下一百分点,越来越多地花在让AI少犯低级错误上。
而Cline刚刚证明:这部分工程工作,AI自己也能干了。
680美元,十七小时,十亿token。一条提示词启动的自动化工程循环,替代了一群工程师数周的体力活。模型权重原地不动,运行时却少摔了很多跤。
这到底是"递归自我改进"的黎明,还只是一次精彩的自动化重构?答案或许取决于:明天,它还能不能对着88.8%的自己,再来一轮。
夜雨聆风