
一、 先说一件小事
前几天,我一个做技术的朋友跟我吐槽。他说,他现在最烦的不是写代码,是"带新人"。
新人来了,你得告诉他项目怎么跑起来,告诉他这个函数为什么不能这么改,告诉他上次线上事故是怎么来的。你说一遍,他记住了。过两个月,他走了。来了个新人,你再说一遍。
他说,我这三年,同样的话说了不下二十遍。
我问他,那你有没有想过把这些写下来?
他愣了一下,说,写下来也没用。文档写完就过期了,而且没人看。
这话我记了很久。因为它戳中了一个特别普遍的困境——经验,是这个世界上最难被复制的东西。
你花十年踩过的坑,没办法在十分钟里传给另一个人。你能传的只是结论,传不了那个让你得出结论的过程。
而最近,GitHub 上有一个项目,正在试图解决这件事。而且它的解法,有点吓人。
这个项目叫 prime-agent,来自 PrimeIntellect-ai 团队。截至 2026 年 8 月 8 日,它的总星标数是 6,300,其中 2,271 颗,是过去 24 小时里涨的。
一天涨了三分之一。这个数字在 GitHub 上不常见。
它的自我描述只有一句话:一个用于编码工作流和长时程自主任务的、能自我改进的 RLM 智能体。
注意那两个词:自我改进(self-improving),和长时程(long-running)。
这两个词放在一起,说的是同一件事:它不只是干活,它还在琢磨怎么把活干得更好。而且它不需要你在旁边盯着。
我们可能低估了这件事的分量。
二、从"工具"到"员工",中间隔着一个"过夜"
我们先聊聊,为什么"长时程"这三个字这么重要。
过去两年,我们用 AI 的方式,本质上是"一问一答"。
你提一个问题,它给一个答案。你不满意,你再问一遍。这个过程很像什么?很像你在用一个搜索引擎,只不过这个搜索引擎会说话。
在这个模式下,AI 是工具。
工具的特点是什么?是它必须被握在手里。锤子不会自己去钉钉子,你得举起它,对准,敲下去。你停下,它就停下。
所以过去两年,很多人用 AI 用得很累。
因为你省下了"敲代码"的时间,但你多出了"盯着它敲代码"的时间。你得不停地检查、纠正、重新提问。算下来,效率提升可能只有百分之二三十。
而"长时程自主任务"想改变的,是这件事的性质。
它想让 AI 从"工具",变成"员工"。
员工和工具的区别在哪?在于你可以下班。
你把一件事交给一个员工,说清楚要什么,然后你去睡觉。第二天早上,事情做完了。中间他遇到问题,他自己查资料、自己试错、自己找人问。他不会每卡住一次就打电话给你。
这中间隔着的,就是一个"过夜"。

听起来只是时间长短的差别,但它带来的是性质的跃迁。
因为一旦 AI 能够独立工作八小时,你的产出就不再受限于你的在场时间。你的一天,可以变成两天。
prime-agent 押注的,就是这个。它不追求单次回答有多惊艳,它追求的是能不能连续跑很久而不跑偏。
这是两种完全不同的技术目标。前者比的是爆发力,后者比的是耐力。
而在真实的商业世界里,绝大多数价值,是耐力创造的,不是爆发力。
三、"自我改进",是在做复利
如果说"长时程"解决的是量的问题,那"自我改进"解决的,是质的问题。
我们来看一个对比。
假设你雇了两个助理。
第一个助理,能力很强,每件事都能做到 80 分。但他有个特点:他不记事。今天你纠正过他的错误,明天他还会再犯一次。一年之后,他还是 80 分。
第二个助理,能力一般,一开始只能做到 60 分。但他每做完一件事,都会复盘一下:这次哪里做得不好?下次怎么改?他把这些记下来,形成自己的方法。
半年后,他可能到了 75 分。一年后,85 分。三年后,你已经离不开他了。
你选哪个?
答案很显然。但吊诡的是,我们过去用的 AI,几乎全是第一个助理。
每一次对话都是崭新的。你上次告诉它的偏好、纠正过的错误、约定好的规范,下次全部清零。它永远聪明,但永远不成长。
这是一种巨大的浪费。
因为成长的本质,是把一次性的教训,变成永久性的能力。
而"自我改进",就是给 AI 装上这个机制。让它在完成任务的过程中,不断沉淀出可复用的经验,写回自己的知识里。
这件事的可怕之处在于——它是复利。
复利这个东西,短期看毫无威力。第一天改进 1%,第二天改进 1%,你根本感觉不到。但你把时间拉长到一年,1.01 的 365 次方,是 37.8。
三十七倍。

我们对复利总是没有直觉。因为人类的大脑习惯线性思考,看到今天比昨天好一点点,就默认明天也只好一点点。
但复利不是这样运作的。它前面很平,后面很陡。所有的爆发,都发生在你已经放弃观察之后。
prime-agent 的星标能在一天内涨 2,271,说明有很多开发者,看懂了这个逻辑。
他们看的不是它今天有多强,而是它明年会有多强。
四、RLM:为什么"能自己练"比"被教会"更重要

项目描述里还有一个词,叫 RLM。这个概念稍微技术一点,但它背后的道理,特别值得说。
传统的模型训练,逻辑是"喂"。
你准备大量的标准答案,喂给模型,让它模仿。这个过程很像应试教育——刷题,对答案,记住正确解法。
这种方式的天花板很明显:模型最多只能学到数据里已有的东西。
它可以逼近人类的平均水平,甚至逼近人类的最好水平,但它很难超越。因为它的老师就是人类。
而强化学习的逻辑不一样。它是"练"。
你不给标准答案,你只给一个目标和一个反馈信号。做对了,给奖励;做错了,给惩罚。然后让它自己去试,试成千上万次。
这个过程很像什么?很像一个人在真实世界里摸爬滚打。
没人告诉他标准答案,他只知道结果好不好。他试错,他调整,他慢慢摸出门道。
这两种方式,培养出来的东西是不一样的。
"喂"出来的,是知识。"练"出来的,是能力。
知识可以背,能力只能长。
而且更关键的是,"练"是没有天花板的。因为它的老师不是人类,是现实。只要现实还能给出反馈,它就还能继续变强。
围棋的历史已经证明过一次这件事。靠学习人类棋谱的程序,最多下到职业水平。而完全靠自我对弈、不看任何人类棋谱的程序,把人类甩开了一整个身位。
prime-agent 把这套逻辑,搬到了编程这件事上。
编程恰好是一个非常适合"练"的领域。因为它的反馈极其清晰——代码能不能跑通,测试能不能通过,性能有没有变好。这些都是明确的、可自动判定的信号。
不需要人来打分。现实会打分。
这可能是编程领域会先于其他领域被彻底改变的原因。不是因为程序员更容易被替代,而是因为编程这件事,天然提供了最好的训练场。
五、6,300 颗星背后,一个更值得想的问题

说了这么多它的好,我想说点别的。
prime-agent 目前的总星标是 6,300,被 fork 了 503 次。用 TypeScript 写的。
坦白说,这个体量不大。GitHub 上有大量十万星级别的项目。它现在只是一个非常早期的东西。
它今天能冲上趋势榜第一,靠的不是成熟度,是方向感。
有很多人相信它指的那个方向是对的,所以先点了颗星,占个位置。
这本身就说明了一件事:在一个变化剧烈的领域里,方向的价值,高于完成度的价值。
一个做对了 90% 但方向偏了 10 度的项目,跑得越久,离目标越远。而一个只做了 10% 但方向正确的项目,剩下的只是时间问题。
这个道理放在个人身上,同样成立。
我见过很多非常努力的人,每天工作十四个小时,学习各种新技能,但五年过去,还在原地。
不是不够努力,是方向。
努力是乘数,方向是符号。方向错了,你越努力,负得越多。
我还想补充一点。
很多人判断方向,用的是"这个东西现在好不好用"。这是一个非常危险的判断标准。
因为任何新东西刚出来的时候,都不好用。汽车刚出来的时候跑不过马车,还经常抛锚。第一批用汽车的人,被马车夫嘲笑了很多年。
判断方向,不能看当下的性能,要看改进的斜率。
一个今天 60 分、每月提升 5 分的东西,和一个今天 90 分、三年没变过的东西,你应该押哪个?
答案是前者。因为十个月后它就超过了,而且不会停。
所以看一个新事物,别只问"它现在能干什么"。多问一句:"它去年能干什么?"
两个答案之间的差值,才是真正的信息。
那么,什么是当下正确的方向?
我不敢下结论。但从 prime-agent 这类项目的走红里,我至少看到三个正在被反复验证的趋势:
第一,从"人操作工具",转向"人管理系统"。你的核心能力,正在从"会做"变成"会安排别人做"。
第二,从"积累知识",转向"积累机制"。知识会过期,机制会增值。一个能让你持续改进的机制,比一百条现成的答案更值钱。
第三,从"追求单次最优",转向"追求长期不崩"。能持续跑八小时的 60 分,胜过只能跑十分钟的 95 分。
六、写在最后
回到开头我朋友的那个困境。
他花三年说了二十遍同样的话,本质上是因为——他的经验没有载体。
它存在他脑子里,只能靠嘴巴一次一次地往外搬。搬一次,损耗一次。
而现在这批工具想做的,就是给经验找一个载体。让它可以被存储、被复用、被自动调用,甚至被自动改进。
这件事如果真的做成了,改变的不只是写代码的方式。
改变的是经验这种资产的性质。
它会从"随人消失",变成"可以留存"。从"线性积累",变成"复利增长"。
最后,说一句我的核心观点:
未来最值钱的能力,不是你会做什么,而是你能不能把"你会做什么"这件事,变成一套可以自己跑起来、还能自己变好的系统。
给你三个具体的行动建议:
第一,从今天起,把你每次解决问题的过程记下来。不是记结论,是记过程——你当时怎么判断的,试了哪几条路,为什么排除了其他的。结论会过期,判断方式不会。
第二,找一件你每周都要重复做三次以上的事,想办法让它自动化。哪怕第一版做得很糙。自动化的价值不在这一次,在后面的五百次。
第三,别急着追最新的工具。先想清楚你要去哪儿。方向对了,工具会自己找上门;方向错了,最好的工具只会让你更快地撞墙。
夜雨聆风