夜雨聆风学习资料网

ARTICLE · 1041987

AI已经开始“自己教自己”?最新递归自进化,到底是突破还是噱头?

AI已经开始“自己教自己”?最新递归自进化,到底是突破还是噱头?

1965年,有个很有意思的事。二战帮图灵一起破解纳粹密码的英国数学家I·J·古德,说了一句影响至今的预言。

他说:人类造出的第一个超级智能AI,大概率就是人类最后一个发明。

原因很简单:一旦AI聪明到可以自己改进自己,就会进入无限滚雪球的正向循环。它每变强一点,就更擅长让自己变强,循环往复,无穷无尽。

这个过程,就是AI圈常说的RSI递归自我提升。也是几十年来所有AI研究者梦寐以求的终极目标。

而就在最近,这条沉寂多年的赛道,突然被两篇重磅论文彻底引爆。

先是字节、清华等国内多家实验室的33位研究者,联合发了一篇题为《人类打造的最后一代AI》的论文。里面直接给出了一套分五级的AI自我进化路线图,最终极的阶段非常颠覆:AI会彻底改写自己的升级逻辑,实现完全自主进化。届时人类基本退出技术迭代,只剩下基础生产工作。

紧接着周日,谷歌DeepMind和马里兰大学立刻跟进,甩出了一篇同量级的新作,主打一套全新的“梦境RSI”技术。

他们的核心思路很颠覆:让AI把自己过去所有的试错记录,变成一个虚拟训练场。不用改动模型本身,不用人类插手,AI就能在虚拟场景里疯狂推演、摸索全新的探索策略,自己优化自己的工作模式。

很多人看完直接懵了:这到底是真·AI自我进化,又是一场换皮炒作?今天我们通俗扒透底层逻辑,讲清楚这次的突破到底含金量在哪。

先搞懂一个事:今年所有AI封神的数学突破,从雅可比猜想、纳维-斯托克斯方程,再到黎曼猜想的阶段性进展,套路全都一模一样。

说白了就是循环试错:给AI一个问题、一套评分标准,让它不断写方案、跑测试、收反馈、改bug,重复成千上万次,直到跑出最优结果。

这套流程大家都看懂了,但很少有人注意到里面最关键的隐形核心——探索策略

简单说就是:AI下一步该怎么试、往哪个方向优化,出问题了该全盘推翻还是局部微调。

举个直白的例子:AI优化算法时,如果某次尝试效果稍微变好一点,它是死磕这个方向继续打磨,还是大胆换一条全新赛道?如果代码直接跑崩了,是思路彻底错了,只是写法有问题?

过去,所有这些决策,全是人类提前写死的。

AI没有任何自主选择权,只能跟着人类定好的规则试错。这也是AI一直没法真正自我进化的核心卡点。

而这次DeepMind的“梦境进化”,刚好卡在这个关键点上完成了突破。

他们的做法特别巧妙:把AI每一次运行的所有数据——写过的代码、最终得分、是否崩溃、报错细节,全部完整缓存保存。

有了这份完整的历史数据库,就不需要人工改模型、改策略了。AI可以直接对着过往所有真实试错记录,在虚拟环境里疯狂做推演。

重点是:这个过程几乎零成本

AI能一次性测试上万种全新的探索策略,自动筛选出试错最少、效率最高、效果最好的那一套,用到下一轮真实迭代中。新的运行数据再次存档,越积越多,形成持续优化的闭环。

团队把这个“复盘过往、虚拟推演、自主优化”的过程,形象地叫做AI的“梦境学习”。

实测效果非常能打:在Lasso求解器的测试任务里,传统固定策略需要550次试错才能搞定,旧行业纪录更是要五万多次。而开启梦境进化的Gemini,仅用300次尝试就跑出了超越主流Python库的效果

更有意思的是,这套系统的精髓,藏在一句简单的prompt里:强制AI开工前必须复盘全部历史记录,禁止重复踩坑、禁止无效微调,从根源杜绝瞎试错。

看到这里,很多人会觉得:这不就是传说中的终极RSI、AI自我成神了?

但实话实说:严格来讲,它不算。

回顾最开始的定义,真正的RSI核心是:AI自己变得更聪明,突破原本的能力上限。迭代后的模型,要能做到之前的自己做不到的事。

可现在的梦境AI,核心模型还是那个Gemini,智商、能力、认知边界完全没变。它没有学会新的思维逻辑,没有突破智力上限,只是更会找方法、更少走弯路、迭代效率更高

说白了:它优化的是“干活的方式”,不是“自己的智商”。

其实今年所有的AI数学突破,全是这个逻辑:固定模型底座,靠人工搭建框架、多智能体协同堆叠效果。模型本身不会自主升级,最后还是要靠人类整合数据、重新训练,才能完成能力进阶。

所以客观总结一下:

放宽标准看,这套技术确实趋近于“人类最后一项发明”——AI可以自主优化迭代流程,全程少人工干预,大幅降低研发门槛。

但按硬核学术定义来看,这依旧是一套极度高效的智能搜索+缓存优化算法,不是真正的超级智能自我进化。

它让AI变得更高效,但还没让AI变得更聪明。

这波突破确实够颠覆,彻底终结了“人工定死迭代规则”的旧时代,是AI自主进化路上的关键一步。但距离真正无限自我升级的超级AI时代,我们还有很远的路要走。

相关学习资料