乐于分享
好东西不私藏

AI 从"工具"到"员工",自我改进即复利

AI 从"工具"到"员工",自我改进即复利

一、 先说一件小事

前几天,我一个做技术的朋友跟我吐槽。他说,他现在最烦的不是写代码,是"带新人"。

新人来了,你得告诉他项目怎么跑起来,告诉他这个函数为什么不能这么改,告诉他上次线上事故是怎么来的。你说一遍,他记住了。过两个月,他走了。来了个新人,你再说一遍。

他说,我这三年,同样的话说了不下二十遍。

我问他,那你有没有想过把这些写下来?

他愣了一下,说,写下来也没用。文档写完就过期了,而且没人看。

这话我记了很久。因为它戳中了一个特别普遍的困境——经验,是这个世界上最难被复制的东西。

你花十年踩过的坑,没办法在十分钟里传给另一个人。你能传的只是结论,传不了那个让你得出结论的过程。

而最近,GitHub 上有一个项目,正在试图解决这件事。而且它的解法,有点吓人。

这个项目叫 prime-agent,来自 PrimeIntellect-ai 团队。截至 2026 年 8 月 8 日,它的总星标数是 6,300,其中 2,271 颗,是过去 24 小时里涨的。

一天涨了三分之一。这个数字在 GitHub 上不常见。

它的自我描述只有一句话:一个用于编码工作流和长时程自主任务的、能自我改进的 RLM 智能体。

注意那两个词:自我改进(self-improving),和长时程(long-running)

这两个词放在一起,说的是同一件事:它不只是干活,它还在琢磨怎么把活干得更好。而且它不需要你在旁边盯着。

我们可能低估了这件事的分量。

二、从"工具"到"员工",中间隔着一个"过夜"

我们先聊聊,为什么"长时程"这三个字这么重要。

过去两年,我们用 AI 的方式,本质上是"一问一答"。

你提一个问题,它给一个答案。你不满意,你再问一遍。这个过程很像什么?很像你在用一个搜索引擎,只不过这个搜索引擎会说话。

在这个模式下,AI 是工具

工具的特点是什么?是它必须被握在手里。锤子不会自己去钉钉子,你得举起它,对准,敲下去。你停下,它就停下。

所以过去两年,很多人用 AI 用得很累。

因为你省下了"敲代码"的时间,但你多出了"盯着它敲代码"的时间。你得不停地检查、纠正、重新提问。算下来,效率提升可能只有百分之二三十。

而"长时程自主任务"想改变的,是这件事的性质。

它想让 AI 从"工具",变成"员工"。

员工和工具的区别在哪?在于你可以下班

你把一件事交给一个员工,说清楚要什么,然后你去睡觉。第二天早上,事情做完了。中间他遇到问题,他自己查资料、自己试错、自己找人问。他不会每卡住一次就打电话给你。

这中间隔着的,就是一个"过夜"。

听起来只是时间长短的差别,但它带来的是性质的跃迁

因为一旦 AI 能够独立工作八小时,你的产出就不再受限于你的在场时间。你的一天,可以变成两天。

prime-agent 押注的,就是这个。它不追求单次回答有多惊艳,它追求的是能不能连续跑很久而不跑偏。

这是两种完全不同的技术目标。前者比的是爆发力,后者比的是耐力

而在真实的商业世界里,绝大多数价值,是耐力创造的,不是爆发力。

三、"自我改进",是在做复利

如果说"长时程"解决的是量的问题,那"自我改进"解决的,是质的问题。

我们来看一个对比。

假设你雇了两个助理。

第一个助理,能力很强,每件事都能做到 80 分。但他有个特点:他不记事。今天你纠正过他的错误,明天他还会再犯一次。一年之后,他还是 80 分。

第二个助理,能力一般,一开始只能做到 60 分。但他每做完一件事,都会复盘一下:这次哪里做得不好?下次怎么改?他把这些记下来,形成自己的方法。

半年后,他可能到了 75 分。一年后,85 分。三年后,你已经离不开他了。

你选哪个?

答案很显然。但吊诡的是,我们过去用的 AI,几乎全是第一个助理。

每一次对话都是崭新的。你上次告诉它的偏好、纠正过的错误、约定好的规范,下次全部清零。它永远聪明,但永远不成长。

这是一种巨大的浪费。

因为成长的本质,是把一次性的教训,变成永久性的能力

而"自我改进",就是给 AI 装上这个机制。让它在完成任务的过程中,不断沉淀出可复用的经验,写回自己的知识里。

这件事的可怕之处在于——它是复利。

复利这个东西,短期看毫无威力。第一天改进 1%,第二天改进 1%,你根本感觉不到。但你把时间拉长到一年,1.01 的 365 次方,是 37.8。

三十七倍。

我们对复利总是没有直觉。因为人类的大脑习惯线性思考,看到今天比昨天好一点点,就默认明天也只好一点点。

但复利不是这样运作的。它前面很平,后面很陡。所有的爆发,都发生在你已经放弃观察之后。

prime-agent 的星标能在一天内涨 2,271,说明有很多开发者,看懂了这个逻辑。

他们看的不是它今天有多强,而是它明年会有多强

四、RLM:为什么"能自己练"比"被教会"更重要

项目描述里还有一个词,叫 RLM。这个概念稍微技术一点,但它背后的道理,特别值得说。

传统的模型训练,逻辑是"喂"。

你准备大量的标准答案,喂给模型,让它模仿。这个过程很像应试教育——刷题,对答案,记住正确解法。

这种方式的天花板很明显:模型最多只能学到数据里已有的东西。

它可以逼近人类的平均水平,甚至逼近人类的最好水平,但它很难超越。因为它的老师就是人类。

而强化学习的逻辑不一样。它是"练"。

你不给标准答案,你只给一个目标和一个反馈信号。做对了,给奖励;做错了,给惩罚。然后让它自己去试,试成千上万次。

这个过程很像什么?很像一个人在真实世界里摸爬滚打。

没人告诉他标准答案,他只知道结果好不好。他试错,他调整,他慢慢摸出门道。

这两种方式,培养出来的东西是不一样的。

"喂"出来的,是知识。"练"出来的,是能力

知识可以背,能力只能长。

而且更关键的是,"练"是没有天花板的。因为它的老师不是人类,是现实。只要现实还能给出反馈,它就还能继续变强。

围棋的历史已经证明过一次这件事。靠学习人类棋谱的程序,最多下到职业水平。而完全靠自我对弈、不看任何人类棋谱的程序,把人类甩开了一整个身位。

prime-agent 把这套逻辑,搬到了编程这件事上。

编程恰好是一个非常适合"练"的领域。因为它的反馈极其清晰——代码能不能跑通,测试能不能通过,性能有没有变好。这些都是明确的、可自动判定的信号。

不需要人来打分。现实会打分。

这可能是编程领域会先于其他领域被彻底改变的原因。不是因为程序员更容易被替代,而是因为编程这件事,天然提供了最好的训练场。

五、6,300 颗星背后,一个更值得想的问题

说了这么多它的好,我想说点别的。

prime-agent 目前的总星标是 6,300,被 fork 了 503 次。用 TypeScript 写的。

坦白说,这个体量不大。GitHub 上有大量十万星级别的项目。它现在只是一个非常早期的东西。

它今天能冲上趋势榜第一,靠的不是成熟度,是方向感

有很多人相信它指的那个方向是对的,所以先点了颗星,占个位置。

这本身就说明了一件事:在一个变化剧烈的领域里,方向的价值,高于完成度的价值。

一个做对了 90% 但方向偏了 10 度的项目,跑得越久,离目标越远。而一个只做了 10% 但方向正确的项目,剩下的只是时间问题。

这个道理放在个人身上,同样成立。

我见过很多非常努力的人,每天工作十四个小时,学习各种新技能,但五年过去,还在原地。

不是不够努力,是方向。

努力是乘数,方向是符号。方向错了,你越努力,负得越多。

我还想补充一点。

很多人判断方向,用的是"这个东西现在好不好用"。这是一个非常危险的判断标准。

因为任何新东西刚出来的时候,都不好用。汽车刚出来的时候跑不过马车,还经常抛锚。第一批用汽车的人,被马车夫嘲笑了很多年。

判断方向,不能看当下的性能,要看改进的斜率

一个今天 60 分、每月提升 5 分的东西,和一个今天 90 分、三年没变过的东西,你应该押哪个?

答案是前者。因为十个月后它就超过了,而且不会停。

所以看一个新事物,别只问"它现在能干什么"。多问一句:"它去年能干什么?"

两个答案之间的差值,才是真正的信息。

那么,什么是当下正确的方向?

我不敢下结论。但从 prime-agent 这类项目的走红里,我至少看到三个正在被反复验证的趋势:

第一,从"人操作工具",转向"人管理系统"。你的核心能力,正在从"会做"变成"会安排别人做"。

第二,从"积累知识",转向"积累机制"。知识会过期,机制会增值。一个能让你持续改进的机制,比一百条现成的答案更值钱。

第三,从"追求单次最优",转向"追求长期不崩"。能持续跑八小时的 60 分,胜过只能跑十分钟的 95 分。

六、写在最后

回到开头我朋友的那个困境。

他花三年说了二十遍同样的话,本质上是因为——他的经验没有载体

它存在他脑子里,只能靠嘴巴一次一次地往外搬。搬一次,损耗一次。

而现在这批工具想做的,就是给经验找一个载体。让它可以被存储、被复用、被自动调用,甚至被自动改进。

这件事如果真的做成了,改变的不只是写代码的方式。

改变的是经验这种资产的性质

它会从"随人消失",变成"可以留存"。从"线性积累",变成"复利增长"。

最后,说一句我的核心观点:

未来最值钱的能力,不是你会做什么,而是你能不能把"你会做什么"这件事,变成一套可以自己跑起来、还能自己变好的系统。

给你三个具体的行动建议:

第一,从今天起,把你每次解决问题的过程记下来。不是记结论,是记过程——你当时怎么判断的,试了哪几条路,为什么排除了其他的。结论会过期,判断方式不会。

第二,找一件你每周都要重复做三次以上的事,想办法让它自动化。哪怕第一版做得很糙。自动化的价值不在这一次,在后面的五百次。

第三,别急着追最新的工具。先想清楚你要去哪儿。方向对了,工具会自己找上门;方向错了,最好的工具只会让你更快地撞墙。