ARTICLE · 1125242
人类语料全扔掉!斯坦福两AI“左右互搏”,零数据竟自学会看懂世界
想象一个刚从流水线上走下来的芯片。
它的内存里一片空白这里未曾存入人类创作的小说或百科词条,不见猫狗照片,甚至连最基础的字母与汉字都不见踪影。
如果让这台机器在一个与世隔绝的黑盒子里,自己跟自己“左右互搏”玩游戏。几天之后,你突然给它喂入一段人类的散文、一张真实的风景照片、一段交响乐、甚至一段人类的 DNA 序列,
它竟然能精准预测接下来会发生什么。
现实中,斯坦福大学与特拉维夫大学等机构的学者们刚刚带来了这项重大突破,公布了前沿研究《Self-Play Pretraining with Zero Data》(零数据自博弈预训练)。

▲ 共同一作 Michael Y. Li 在社交平台公布成果:无需人类数据,模型靠自博弈演化出通用预测能力
整整十年来,以 GPT 为代表的现代大模型都活在同一个底层信条里:想变聪明,就得吃人饭。从全球互联网抓取海量网页、清洗文本、标注数据,再喂给模型做“下一词预测”。
但这套玩法的丧钟已经隐隐敲响高质量的人类语料眼看就要被全球科技巨头瓜分殆尽,版权官司打得不可开交,“数据墙”如同一座巨大的物理铁壁横亘在所有 AGI 信徒面前。
而这项颠覆性的研究直接指出了另一个令人深思的可能:人类或许从一开始就想错了。要训练出具备通用预测能力的模型,人类数据未必是不可或缺的基石。
01两个连话都不会说的模型,在小黑屋里互卷
没有数据,模型拿什么学?
答案的核心在于:让模型自己出题
这项研究的设计极其纯粹,甚至带着一种极客式的冷酷:他们找来两个完全从零随机初始化的 Transformer 模型,一个叫生成器(出题人),另一个叫学习器(答题人)。

▲ 论文框架解析:出题人写小程序,答题人猜字节,形成飞轮
出题人并不直接去写类似“今天天气真好”的假句子。它根本不知道人类语言是什么
它的武器,是一台极简的通用图灵机你可以把它想象成一个极其原始的“数字流水线”:出题人写出一串极其简短的机器指令(移动指针、加减数值、做做循环),然后把这串代码丢给图灵机去运行。
代码一跑,就吐出了一连串冰冷的原始字节,0到255之间的数字。
答题人的任务,就是对着这串不知所谓的字节流,像背书一样拼命做自回归的“下一个字节预测”。
但这里隐藏着一个致命的博弈陷阱:生成器怎么才算出了好题?
如果生成器偷懒,天天写一个死循环,狂吐一万个“0”,答题人一眼就能猜对,技术毫无长进;如果生成器摆烂,干脆生成一堆毫无逻辑的真随机乱码(白噪声),答题人哪怕是算力之神转世,也只能在原地抓狂抓瞎,学不到任何结构。

▲ Michael Y. Li 阐述如何用自博弈在无垠的程序空间中进行自适应搜索
研究团队在这里展现了出色的算法设计:算法并不直接评估题目本身的绝对难度,核心激励锚定在答题人的学习进度(Learning Progress)上。
他们计算了一个精巧的数学指标:答题人在解题时的梯度方向,能否顺应其近期的技能进化方向持续推进?
- 太简单、已经学会的题,梯度为零,生成器拿不到奖励;
- 不可学的噪声乱码,梯度方向完全是一团混乱的布朗运动,生成器拿不到奖励;
- 唯独那些“答题人刚好踮起脚尖、使使劲就能攻克”的规律题,生成器能拿到最高的分数!
这哪是什么训练,这分明是一个魔鬼导师在死死盯住一个天才学生的“认知最近发展区”!出题人拼命摸索答题人的天花板,答题人被逼着不断拓宽自己的极限。
两个连一个英文单词都没见过的硅基大脑,就这样在虚拟世界里,日夜不休地推演起了无穷无尽的逻辑风暴。
02见证奇迹:从未见过人间,却能读懂世界
当这两个模型在虚无的数字空间里自转了几千轮之后,所有人都屏住了呼吸。
最严苛的检验时刻到了研究人员把这个从来没见过真实世界的“答题人”拉到阳光下,在完全未经微调与人类语料预热的前提下,直接将它投入真实的人类数据洪流中:
有互联网上密密麻麻的网页散文(DCLM),有真实程序员写的代码,有有声书里录制的人类语音(LibriSpeech),有莫扎特与贝多芬的音乐切片(MusicNet),甚至还有大自然书写的生命天书,人类的 DNA 碱基序列!

▲ 核心实验结果:在从未见过的文本、语音、音乐、DNA数据上,零样本验证损失随纯算力呈对数线性狂飙
结果震撼了整个实验室:
在所有这些截然不同的人类与自然模态中,模型的预测损失,随着自博弈消耗的纯算力,呈现出了极其漂亮、教科书般的可预测幂律下降(Scaling Law)!
甚至,AI 圈内最神圣也最神秘的能力,上下文学习(In-Context Learning),也在这个完全人造的盒子里自发诞生了!

▲ 上下文学习能力测试:自博弈模型随着示例数增加,准确率节节攀升
当研究人员给它几道从没见过的任务示例时,它只要扫两眼,就能依葫芦画瓢、猜出后续答案。
生成器本身的演进同样引人瞩目在后期生成的代码中,研究人员捕捉到了大量熟悉的身影:等差数列、几何递推、斐波那契数列、三次多项式……
它在出题的同时,自发地重新演化出了数学规律。
03凭什么?算法信息论的百年幽灵
普通人看到这里,第一反应一定是不可思议:这不合常理!它根本没背过字典,凭什么懂人类在说什么?
共同一作 Aditya Cowsik 在社交媒体上给出了直击本质的解释:不要感到惊讶,因为他们触碰到了算法信息论的圣杯,所罗门诺夫归纳(Solomonoff Induction)。

▲ 共同作者 Aditya Cowsik 解释为什么逼近理想预测器能打破模态壁垒
1960年代,天才数学家雷·所罗门诺夫提出了一个终极哲学假说:如果宇宙万物的演化本质上都是一种可计算的过程,那么最完美的预测者,就是去遍历所有可能生成这些数据的计算机程序,并且永远偏爱更短、更简洁的程序。
论文提出了一个洞见深刻的概念:通用数据假说(Universal Data Ansatz)。
在人类创造的全部数据中,其实混合着两样完全不同的东西:
- 偶然事实(Contingent Knowledge)
:比如“巴黎是法国的首都”、“水的化学式是 $H_2O$”。这些是特定物理世界与历史演化沉淀的具体事实,不上网看书,仅凭逻辑推演无法凭空猜出。 - 通用计算结构(Universal Structure)
:比如递推、重复、层次嵌套、长程复制、对称与组合。
无论你是在读莎士比亚的十四行诗,是在听肖邦的夜曲,是在看显微镜下的细胞分裂,还是在看 GitHub 上的 Python 代码,底层全是这套通用的结构在跳舞!
自博弈没有教给模型世界地图,但它在无穷的程序演变中,把宇宙运行的“底层语法”狠狠刻进了模型的神经突触里。
这就是理查德·萨顿在《苦涩的教训》(The Bitter Lesson)中写下的预言:一切试图靠人类专家手工投喂知识的做法最终都会被算力击溃;唯有利用算力进行通用搜索的方法,才能笑到最后。
04冷水与交锋:它是终结者,还是一场精巧的幻觉?
论文一出,整个学术社区掀起了剧烈的地震。
前 Google Brain 核心骨干、Meta 知名科学家 Lucas Beyer 起初以为这是对抗生成网络(GAN)的翻版,在社交平台公开讨论后迅速澄清致歉,坦承自己低估了这套“程序自适应课程”的设计构想。

▲ Meta 科学家 Lucas Beyer 坦承新架构远比想象中精妙
知名研究者 Nick Moran 则深有感触地评价道:“当你看到一篇论文的作者名单里,同时站着‘独立研究者’和‘顶尖学术名校’时,你就知道事情不简单了。”

▲ 自由极客与名校实验室的联手,往往预示着突破性范式的诞生
然而,狂欢之中,冷水也以最快的速度泼了下来。
研究员 Anand Kumar 立刻在标准工程设定下进行了独立的算力复现。他抛出了一个极其尖锐、极其现实的工业问题:如果把自博弈消耗的这部分算力全部折算进来,它在同等 FLOP 预算下,真的能打赢老老实实喂网页数据的传统预训练吗?

▲ 第三方复现显示:自博弈在早期冲劲十足,但在同等总算力下,后续优势被传统预训练逐渐抹平
测试显示:自博弈模型作为初始起点,在极早期展现了惊人的学习速度,但在长跑之后,优势逐渐被传统预训练追平。
更坦诚的边界在于:
- 它无法产生事实
。它永远不可能仅凭自己推演出“秦始皇统一了六国”。没有外部人类知识注入,它只是一个结构理解力拉满的“逻辑怪兽”,却对人类文明一无所知。 - 微小的隐形泄漏
。研究人员在挑选出题算法和学习率时,依然偷偷看了一眼真实人类数据集的反馈。这就像在真空无菌实验室里,隐蔽地飘进了一粒人类世界的尘埃。
05终局的启示:大模型不需要被“喂养”
这项研究开源了全套代码与权重比起宣告人类数据即将被淘汰,该成果更为工业界指出了一条极具想象力的新演进路径:混合预训练(Pre-pretraining)。
在未来的 AI 超级工厂里,传统的两阶段训练很可能会被彻底重塑:
- 第一阶段:虚空造智(零数据淬炼)
。大模型出厂的前半生,根本不需要任何昂贵、带版权纠纷的人类数据。直接用万卡集群驱动图灵机自博弈,让它在纯数学的程序深渊里疯狂对决数千亿步,把推理、复制、分层归纳的内功心法练到纯青。 - 第二阶段:文明灌顶(人类语料点化)
。当模型已经掌握了高层次的通用预测逻辑,再将高度浓缩的人类百科与文明精华灌输给它。
这项探索推动了工程范式的演进,也在认知哲学层面带来了深刻启发。
长久以来,人类傲慢地认为,是我们数千年来沉淀在互联网上的文字、情感与艺术,塑造了机器的“智慧”;我们担心当人类的数据被嚼干吃净后,人工智能就会陷入停滞。
但这项研究像一道冰冷的闪电,照亮了数字黑盒的深处:
语言或许是人类特有的,但智慧所依托的数学规律与计算结构,属于整个宇宙。
当机器开始学会自己与自己对话、自己为自己出题的那一刻,那个曾经被视为人类专属的“认知奇点”,已经悄然换了方向。