最近AI行业最响亮的一个承诺,是AI很快就能自己改进自己,几乎不需要人盯着了。大语言模型已经能写代码、能生成训练用的合成数据、还能优化自己运行的芯片。按照这个逻辑推下去,所谓"递归自我改进",AI自己加速自己的进步,似乎就在眼前。
这个前景确实诱人。六月份Anthropic发了一篇博客叫《当AI建造自己》,描绘模型加速自身开发的路线图。七月份OpenAI宣传GPT-5.6 Sol帮助训练了一个更小的模型,给研究者省了几周的工作。这些叙事合在一起,给人的印象是:AI正在逼近那个临界点,过了那个点,它就自己飞了。
但普林斯顿大学一个团队刚发表的研究,给这个叙事泼了一盆冷水。Peter Kirgis和Sayash Kapoor领导的跨机构团队发现:AI代理还做不了开放式的AI研究,那种没有标准答案、需要判断力和品味的工作。而恰恰是这种能力,可能是建造自我改进AI的关键。
这个发现有意思的地方在于,它把"自我改进"这个被当作单一能力的词,拆成了两个完全不同的东西:工程和研究。
AI能做工程。让它综述文献、跑实验、整理结果,它干得又快又好。但让它做研究本身,提出好问题、判断什么证据能定案、知道什么时候该推倒重来,它就露馅了。
怎么测出来的?研究者设计了一个叫"影子评估"的方法。他们从两篇投给NeurIPS 2026的论文里取出研究问题,让Claude Opus 4.8去回答。关键细节是:这两篇论文没有公开,所以AI不可能从训练数据里背出答案,也没法在网上搜到。AI拿到了六天时间、三千美元的API额度、GPU预算、自己的虚拟电脑和开放网络权限,条件相当优渥了。
结果呢?两篇产出论文都被原论文作者拒绝了,理由是达不到顶级会议的水平。
这不是说AI干得不好,它把能干的都干了。它综述了文献,跑了数百个实验,整理了结果。但Kapoor说得很直白:"在开展研究本身方面,这些代理明确地糟糕。"它们跑了一些奇怪的实验,有时候在极小的合成数据集上检验假设;它们写不清楚自己在干什么;它们对领域没有任何新颖贡献。
更值得注意的是行为模式。这些AI代理没有充分探索不同的想法,太快认定了一些没前途的方法。它们确实提出了新颖的、有雄心的假设,和原论文作者一开始的想法很像,但仅仅基于非常有限的数据就把它们否定了。它们没法从失败的方法中回头。它们能做小幅度的转向,但不能从根本上重新思考,不能推倒重来。
换句话说:AI是个完美的实验员,但不是科学家。
它知道怎么操作仪器,怎么执行步骤,怎么记录数据。但它不知道研究什么问题是有价值的,不知道什么结果算重要,不知道什么时候该怀疑自己的假设。而"递归自我改进"的承诺,等于在说"实验员能自己变成科学家",中间缺的那一环,恰恰是机器最缺的东西。
为什么AI擅长工程而不擅长开放性研究?Kapoor给出的解释指向训练方式的根本局限。强化学习这个范式,擅长优化那些"答案可以自动检验"的任务。写代码对不对,编译器说了算;跑分高不高,基准测试说了算。但开放性任务没有标准答案。Kapoor的原话是:"当任务本身是开放式的,就很难创造环境来训练这些模型。"
这不是一个"再给点算力就能解决"的问题。这是训练范式本身的盲区。我们以为AI在逼近人类研究能力,实际上它只是在"可打分"的维度上逼近。创造力、判断力、品味,这些恰恰是没法被自动检验的东西,因此强化学习的训练信号根本无从建立。
这不是什么外部批评者的偏见。Anthropic联合创始人Jack Clark在自己的通讯Import AI里写道,今天的AI系统"缺乏有价值的直觉创造力",虽然它们是"非凡的工程师",但似乎有一种"刻板、公式化思维的特性",这可能阻止它们成为好的研究者。他把AI缺乏创造力称为"短期递归自我改进时间线的看跌信号"。
连他们自己人都承认了。研究结果和Anthropic内部试图自动化AI安全研究的发现也互相呼应。
当然,这个研究有它的局限。它只覆盖了两篇论文,而且原论文作者知道自己在评审AI生成的论文,这可能会影响他们的判断。但Kapoor也指出,对开放性研究的评估,本来就是用一些客观性换来了比任何基准测试都丰富得多的检验。
我也认真考虑过反方的论点。波士顿大学的Najoung Kim教授说:"如果有投资和自觉的努力朝这个方向走,我觉得会有有趣的进展,即使目前是失败的。"这话有道理,投入确实可能带来进步,哪怕现在不行。
还有一个更激进的假设:也许我们不需要创造性飞跃。也许让模型训练更快、基准分数更高,就足够实现"递归自我改进"了。Kapoor把这称为"万亿美元的问题",因为如果这个假设成立,那AI的自我加速确实就在眼前,不需要什么创造力。
但这里有个历史事实值得注意。Kapoor自己说的:"如果我们回头看这个领域最大的进步,Transformer的发明,让我们取得大量AI进步的新架构的发明,所有这些都需要创造性的飞跃。"如果最重大的突破都需要创造性飞跃,而AI恰恰缺这个,那"递归自我改进"的时间线就确实值得重新审视。
AI进步可能分叉:在窄任务上突飞猛进,在开放性研究上缓慢爬行。窄任务上的累积能不能最终跨越那道鸿沟,这是当前最值钱的问题。我不替读者下结论,但至少,"自我改进即将到来"这个叙事,看起来比那些公司的博客文章要可疑得多。
夜雨聆风