ARTICLE · 1039586
谷歌让AI学会了做梦,成本直降162倍
大家好,我是大兵(尹相兵),一位正处在AI时代的破界者,见字如面。

有意思,谷歌刚被曝跑通RSI,一篇关于如何让AI实现自我进化的论文,就被官方发到了网上。

打开方式还挺别致,「做梦」。
没有让大模型重新训练自己,也没有让AI直接修改自己的权重。而是 Dream-RSI,直译过来就是「梦中学」。
正经说,研究人员发现了一件挺妙的事:AI真实探索留下的历史记录,本身就是一个模拟世界。
一次昂贵的真实探索结束之后,Agent不用真的再跑几百、几千遍实验,只要在过去已经发生的搜索树里做虚拟推演,反复试验新的搜索策略。找到更好的策略,再回到真实环境里跑一次。
新的探索又会长出一棵更大的搜索树,再拿来「做梦」。
如此循环。钱省了一大笔,效果还真的更好。

在算法工程、数学优化、GPU内核工程三类任务上,研究团队都证明:Dream-RSI 不仅能大幅降低探索的计算成本,还能达到甚至超越原有方案的发现效果。
01 历史就是世界
论文的核心思路可以这样总结:把AI走过的弯路,变成AI新的训练场。
谷歌的研究人员认为,RSI 的核心驱动力其实在于高效探索。怎么管控并优化探索策略,是这里最关键的命题。
很多AI科研系统已经实现了一个 Loop:生成方案 → 跑实验 → 看结果 → 改方案 → 再跑实验。
问题在于,随着搜索空间不断扩大,固定的探索策略没法自适应调整;而在线的策略优化,又面临迭代时间长、反馈滞后、代价高这些困境。
Dream-RSI 抓住了一个此前没被充分利用的东西:历史。

一次 Agent 探索任务跑下来,会留下非常丰富的记录,形成一棵发现树(Discovery Tree)。

谷歌的研究人员换了个视角,发现这一堆历史日志,不就是一个模拟器嘛。
举个例子,Agent 第一次执行的策略,是把 A、B、C 三个分支依次都跑一遍。跑完之后,每个节点的结果其实都存下来了:A1 得多少分、B1 会不会报错、C2 效果怎样、各自花了多少计算量。
现在换一种搜索策略,比如先跑 C,C1 不够好再走 A。
要从头再跑一遍吗?大可不必。C、C1、A、A1 这些结果都可以直接调用。只要让新策略在旧树上「重新走一遍」,就能算出:如果当时那么做,需要花费多少计算量、能达到什么效果。

也就是说,在 Agent 已经探索过的区域里,历史就是世界。
只需要一次真实的执行,大量新的策略探索都能以更低的成本,在这个「模拟世界」中被验证。
02 三步走,让AI在梦里进化
整个 Dream-RSI 系统分三步。
第一步 真实探索
当前的探索策略控制一个 Coding Agent,决定开哪些分支、继续哪些方案、跑多少个并行任务、什么时候结束。所有过程被记录为一棵发现树。
↓
第二步 开始做梦
引入另一个大语言模型来负责开发探索策略。每生成一种新的探索方案,不重新跑实验,而是在过去积累的所有发现树上「回放」结果。最终综合考虑答案质量、搜索成本和并行效率,找出更好的动态策略。
↓
第三步 把赢家重新派出去
新策略进入真实环境,指挥下一轮探索。由于策略已经变化,它可能会走到上一代 Agent 没有抵达过的位置,于是产生新的发现树,继续扩大下一轮的「梦境」。
↺ 新策略产生新历史,循环继续
Dream-RSI 的三步循环
整个循环长这样:
真实探索 → 产生更多历史 → 历史变成更多模拟世界 → 在模拟世界中优化探索策略 → 更好的策略产生新的历史
03 成本降下来了,效果反而更好
研究团队把 Dream-RSI 扔进了 8 个发现任务,横跨算法工程、数学优化和 GPU Kernel 优化三个方向。
最直接的对照组叫 Recursive Fixed Exploration。它和 Dream-RSI 使用相同模型、相同 Evaluator、相同初始策略和资源约束。唯一的差别是:一个每轮都会学习如何重新组织探索,另一个永远按照第一轮的固定策略继续搜索。

左:穷举式搜索的探索密度;右:Dream-RSI 的策略化路径
■ 算法工程方向,团队让 Agent 优化 Lasso regularization path。
Agent 调用次数对比
Gemini 3.1 Pro · 固定探索
550 次调用 · 3587.1ms
Gemini 3.1 Pro · Dream-RSI
317 次调用 · 2931.0ms
Gemini 3.7 Flash · 固定探索
3200 次调用 · 2516.7ms
Gemini 3.7 Flash · Dream-RSI
1879 次调用 · 2350.6ms

跟 SimpleTES 的对比结果差距更夸张。SimpleTES 对应的实验预算达到 51200 次调用,而 Dream-RSI 在部分设置下只需几百次。两者最高能差出 162 倍。
■ GPU Kernel 方向,在 VGG16 和 LayerNorm 任务上,Dream-RSI 分别省下 2.43 倍和 1.79 倍的生成次数,做到相近性能。在 ConvDiv 和 ConvMax 中,则在接近的计算预算下,把性能分别提高 2.09 倍和 1.44 倍。
■ 数学优化方向,Sum Difference 上 Dream-RSI 拿到 1.145427,高于论文列出的多个基线;Circle Packing 打到 2.635983。Auto Correlation 里 SimpleTES 仍然是 SOTA,不过 Dream-RSI 在结果相近的情况下,把调用量做到 1000 对 51200。
三个方向核心结果一览
数据来源:谷歌 Dream-RSI 论文,研究团队共测试 8 个发现任务、三个方向。
04 最反直觉的一条,给AI总结经验反而更差
还有一个发现挺有意思,研究人员试着给AI总结「经验教训」,结果反而更差了。
他们把之前探索中踩过的坑直接塞进下一轮 Prompt,万万没想到:加了显式语义指导以后,不管是固定探索还是 Dream-RSI,表现反而普遍下降了。
论文给出的解释是:长程科研搜索往往同时存在很多并行路线。如果过早去总结「高层结论」,就相当于提前给未来的探索加上了很强的先验。结果可能不是少走弯路,而是直接把一些看起来没希望、实际上可能有价值的路线堵死了。
05 不是模型在进化,是「外壳」在进化
最后做个小小的总结。
在 Dream-RSI 的整个实验里,模型本身没有被重新训练,与其说是模型的自进化,更像是Harness(外壳)的自进化。
过去我们谈 Agent 自进化,关注最多的是两件事:
一,把成功经验写进 Memory;
二,把历史数据重新拿去训练模型。
Dream-RSI 提供了第三条路:模型可以不变,知识甚至不用先总结成文字,先让「寻找知识的方法」自己进化。
下一代 Agent 不必只从上一代留下的「答案」里学习。它学的是:上一代到底是怎么找到答案的,以及有没有一种更好的找法。
论文由 Google、Google DeepMind、马里兰大学和弗吉尼亚大学研究者共同完成,论文、项目页和代码仓库均已公开。
本文核心内容来自微信公众号「量子位」,36氪经授权发布,原链接为今日头条转载。
◆ ◆ ◆
最后想听听你的判断
如果AI真的能靠「做梦」不断进化自己,你觉得最先被改变的会是哪个行业?科研、写代码,还是别的什么?