ARTICLE · 1126123
AI开始在梦里进化了?什么是Dream RSI?

如果把攻克尖端算法和科学难题,比作在迷雾重重的万丈矿山里淘金。普通AI就像一个被雇佣的打工人,工具越用越顺手,淘出的金矿纯度越来越高,但这仅仅叫产出变好。至于往哪座山头挖、哪个坑挖不出来该及时放弃,全靠背后人类工程师写死的固定规则。
而真正可怕的RSI,也就是递归自我改进,逻辑完全不同。这个工人不仅在挖矿,他还能自己发明一套全新的勘探管理学,甚至不断迭代自己的底层决策框架,形成自己把自己变聪明的滚雪球闭环。
但过去AI进化最大的痛点,在于改策略比挖矿本身还贵。以前你想测试一套新策略灵不灵,唯一的办法是让大模型把整座矿山从头到尾再挖一遍,动辄调用成千上万次大模型,耗费几天时间和几十万算力,商业上根本玩不起。
谷歌提出的Dream-RSI,思路非常绝,它直接借鉴了一个生活常识:白天实战踩坑,晚上在脑子里复盘做梦。
第一步是白天实战。AI拿着现有策略去真实环境里写代码、跑测试。最关键的是,它把每一步尝试、成功代码、甚至每一次报错细节完整保留下来,画成一张巨详细的实战历史地图。
第二步是晚上做梦。到了策略升级环节,它根本不需要再去真实世界里重新调用大模型去刨土,而是直接在这张地图上做沙盘推演。如果当时在某个坑果断止损,或者在另一个岔路多走两步,结果会不会更好?所有坑白天都踩过了,数据全在,AI几秒钟就能在梦里推演成千上万套新策略,以极低的成本挑出最优解。
第三步,带着在梦里复盘出的更强战法,天亮醒来,继续挺进深山老林。
整个实验中最颠覆认知、也最讽刺的,是一个关于经验的发现。人类总习惯好为人师,研究团队最初也尝试让大模型给AI总结所谓的经验,比如叮嘱一句“上次往右走撞墙了,以后别去”。结果让人大跌眼镜:加上这种经验总结后,AI的表现居然断崖式暴跌。
为什么?因为人类或大模型总结的经验法则,本质是一种极度粗暴的抽象与偏见。你告诉它右边不行,它就会把整条右路彻底封死,却完全忽略了只要换个姿势,右边可能就是一座大金矿。Dream-RSI最聪明的地方,就是绝不给AI灌输虚头巴脑的大道理,只保留客观事实的真实细节,让策略回到具体的十字路口自己重新推演。
它没有修改底层神经网络的大脑,也不是科幻片里毁灭人类的通用神迹。但它从商业和工程上证明了一条极具杀伤力的路径:哪怕底层大模型智商完全不涨,只要把外层的做事与探索方法交给它自己去推演迭代,就能用五十分之一的极低成本,啃下以往顶尖专家都搞不定的硬核难题。