ARTICLE · 1116516
彻底颠覆AI!不喂一张图、不读一句话,斯坦福零数据自对弈模型震动学术界
如果把人类所有的书籍、网页、代码、图片和音频全部拿走,AI 还能学会思考吗?
过去五年,整个大模型行业都被困在一个心照不宣的焦虑中:互联网上的高质量数据快被大模型吃光了。为了喂饱这些千亿参数的吞课怪兽,工程师们清洗语料、爬取全网,甚至开始用手写的合成数据生成器来续命。
然而,来自斯坦福大学、特拉维夫大学等机构的联合研究团队,刚刚带来了一项突破性研究。
在最新发表的论文《Self-Play Pretraining with Zero Data》中,他们做了一个近乎疯狂的实验:
彻底清空数据底座不喂一个英文单词,不给一张真实图片,不看一段真实代码,甚至不包含任何人类世界的常识。
只有两个完全随机初始化的 AI 模型,在一个纯粹的代码执行器前“自言自语、左右互搏”。

▲ 论文展示的跨模态缩放规律:在从未接触过真实数据的前提下,零样本损失在文本、图像、音频等各模态上均呈现出规律的幂律下降。
结果让整个计算机科学界瞠目结舌:
在经过纯粹的自对弈之后,这个从未见过人类世界的模型,直接被扔去测试未见过的自然语言、自然图像、真实音频、甚至生物 DNA 序列,它的预测损失竟然呈现出教科书般规整的幂律下降(Scaling Law)!
不仅如此,它还自发涌现出了强大的上下文学习能力(In-Context Learning),自己学会了做算术加法、数据栈反转与符号推理。
AI 第一次在没有任何人类老师教导的“真空”中,无中生有地进化出了智能的底层骨架。
01极简的“造物游戏”:两个 AI 的盲盒对弈
这个实验的设定极其干净,甚至可以说带着一种数学上的极简美感。
系统的核心只有三样东西:出题人(生成器)、解释器(虚拟机)和做题人(学习器)。

▲ 训练过程中生成器自发搜索并发现的数学序列族:斐波那契数列、等差数列等在极早轮次便被自适应捕获。
- 出题人(生成器)
:这是一个自回归 Transformer。它不写英语,也不写 Python,而是用一种类似极客编程语言 Brainfuck 的极简指令集写程序。这个语言只有大约 19 个离散符号,包含指针移动、增减数值、循环读写等最底层的图灵机原语。无论怎么写,程序永远不会报错崩溃,必定能吐出一段输出。 - 解释器(通用图灵机)
:负责运行出题人写的程序。程序可以读取随机输入的磁带,运行后吐出一串原始的字节流(Byte Stream)。 - 做题人(学习器)
:这是另一个同样架构的 Transformer。它的词表只有固定的 256 个字节值。它的任务只有一个,面对出题人程序吐出的字节序列,玩命去做标准的下一字节预测(Next-Token Prediction)。
这里的词表之所以定为 256 个字节,是因为在计算机世界的最底层,文本、音频、高清图像、蛋白质序列,本质上全都是 0 到 255 的字节流。
整套训练的运转流程环环相扣:出题人不断写小程序,解释器跑出字节,做题人在字节上做预测并更新权重,出题人再根据做题人的反应调整出题策略。
训练完全脱离了维基百科、Reddit 论坛或 GitHub 仓库等现成语料。一片白板,平地起惊雷
02拒绝乱码作弊:天才的“梯度对齐”奖励
看到这里,任何一个资深的算法工程师都会立刻指出一个致命漏洞:
如果出题人为了考倒做题人,故意写出纯随机的乱码程序怎么办?
纯随机的乱数是无法被预测的如果单纯以“做题人觉得有多难”来给生成器发奖励,生成器很快就会学会“摆烂作弊”,直接生成一堆无规律的噪点字节。做题人除了陷入精神内耗,什么可用的结构都学不到。
为了解决这个问题,研究团队设计了一个堪称神来之笔的机制:学习进度 / 梯度对齐奖励(Gradient Alignment Reward)。

▲ Meta 知名研究员 Lucas Beyer 细读后主动撤回了原本将该模型比作 GAN 的质疑,并公开承认这套机制与对抗生成网络有着根本区别。
这套机制的妙处在于:
- 太简单的题目
(比如全是 0 的循环):做题人早就学会了,预测误差为零,产生的梯度几乎为零,出题人拿不到奖励。 - 纯随机的噪声
:做题人根本摸不着头脑,梯度方向杂乱无章,与近期的学习主轨迹完全不对齐,出题人同样拿不到奖励。 - 唯独那些处于“能力边界边缘”的题目
:做题人尚未完全掌握,但题目中蕴含的规律恰好延续了做题人最近的理解方向。此时,做题人在该样本上的梯度,与它近期参数移动轨迹的内积最大,出题人获得暴利奖励!
两者的关系脱离了残酷的零和博弈,转为自动寻找“最近发展区”的因材施教。
在数以万计的迭代中,奇迹接二连三地发生了:
在第 512 轮自对弈左右,出题人自发发明了斐波那契数列; 紧接着,等差数列、几何级数、栈的先进后出结构、字符串移位等抽象数学与数据结构被一一创造出来; 如果依靠盲目的无脑随机搜索,生成器要碰出斐波那契程序需要数万轮以上,而梯度对齐驱动的自对弈,像安装了智能导航一样,直奔宇宙底层的算法规律而去!
03独立实测:自对弈硬碰网页语料,谁更强?
当这篇论文在硅谷引发震动后,独立研究者 Rihim S. 迅速跟进,做了一项极具说服力的受控对照实验:
在完全相同的模型架构、完全相同的计算量与 Token 吞吐预算下,一组用真实清洗过的网页文本(Web Text)训练,另一组用纯自对弈程序字节训练。
把两个模型拉到同一个考场上,测试它们的形式化上下文学习(ICL)能力,结果令人大开眼界。

▲ 独立研究者 Rihim S. 的对照实测显示:真实网络语料模型与纯自对弈模型各有所长,且随着模型规模增大,性能差距进一步拉开。
实验结果呈现出极其鲜明的两极分化:
- 真实网页语料训练出的模型
:在常识联想、语义高频匹配等任务上更加从容; - 纯自对弈预训练模型
:在纯代数运算(如大数求和 Sum)、后进先出栈操作(Stack)、以及长字符串精准反转等强逻辑与硬核结构任务上,展现出几乎碾压的泛化韧性! - 规模鸿沟
:随着模型参数规模的不断扩大,这两者在各自擅长领域的优势不仅没有收敛,反而进一步拉大。
这直接证明了一件事:大模型在真实网络语料中学会的,很大程度上是人类语言的“统计共现习惯”;而在最小图灵机自对弈中淬炼出的,是无视具体语境的纯粹算法执行力。
04终极思考:大模型的“偶然事实”与“普遍结构”
为什么一个连“苹果”这个词都没见过的模型,在测自然图像和人类文本时,居然能准确预测接下来的字节流动?
合著者 Aditya Cowsik 在社交媒体上给出了直击本质的解释:因为这套系统在数学上逼近了理想的预测器,所罗门诺夫归纳(Solomonoff Induction)。
在信息论与计算理论的视角下,人类现实世界的所有数据,其实都可以拆解为两部分:
- 偶然信息(Contingent Information)
:比如“法国的首都是巴黎”、“光速大约是每秒三十万公里”、“红楼梦的作者是曹雪芹”。这些是特定物理世界和人类社会的历史事实,不与世界交互,就绝对无法凭空猜出。 - 普遍预测结构(Universal Predictive Structure)
:比如对称、递归、重复、因果传递、层次化嵌套与逻辑组合。无论是在莎士比亚的十四行诗里,在一幅莫奈的油画里,在一段莫扎特的交响乐里,还是在人类的基因链条里,这些规律跨越模态、永恒存在。
我们过去总以为,大模型预训练消耗的恐怖算力,主要是在“背诵维基百科”。
但这项研究揭示了另一个关键维度:预训练中成本极高且决定模型智能上限的核心,其实是建立对“普遍预测结构”的建模能力。
计算机科学泰斗理查德·萨顿(Richard Sutton)曾写下著名的《苦涩的教训》:七十年来 AI 领域最大的教训就是,任何试图把人类专家知识硬塞给 AI 的做法最终都会失败,唯有通用方法结合大规模算力才是终极解法。
这项研究正是《苦涩教训》在预训练时代的最纯粹体现。它并不宣称自己能取代真实语料,也不可能凭空知道林黛玉是谁;但它证明了,仅凭最原始的计算算力与自对弈进化,模型就能在白板之上,独立提炼出贯穿整个宇宙的可计算规律。
05智能的下一站:突破物理数据的重力
虽然这项工作目前还处于 2440 万参数与 4096 上下文的概念验证阶段,但它为整个陷入“数据荒”焦虑的 AI 工业界推开了一扇全新的大门。
在未来,模型或许根本不需要在初生阶段就去死记硬背几百 TB 的互联网垃圾文本。
更优雅的路径可能是:先让两个 AI 在极速的抽象代码空间中进行数亿轮自对弈,把对宇宙底层普遍结构的直觉磨炼到极致;然后再接入真实物理世界的数据进行微调点化。
数据的重力或许有上限,但算力在可计算宇宙中的漫游,才刚刚拉开序幕。