夜雨聆风学习资料网

ARTICLE · 1116544

0人类数据预训练!斯坦福让两台AI在小黑屋左右互搏,竟参透了全宇宙规律

0人类数据预训练!斯坦福让两台AI在小黑屋左右互搏,竟参透了全宇宙规律

如果彻底切断互联网,不给模型看任何一本人类书籍、一张图片、一段音频,甚至不给一行人类写过的代码。

把两台完全随机初始化、大脑一片空白的 AI 关进算力构建的“小黑屋”,让它们在虚无中互相对弈、疯狂推演。

最终会诞生什么?是一个语无伦次的数字疯子,还是一个洞悉规律的超级大脑?

就在近日,斯坦福大学、特拉维夫大学联合团队在 arXiv 上发布了一篇重磅论文:《Self-Play Pretraining with Zero Data》(零数据自对弈预训练)。

▲ 论文《Self-Play Pretraining with Zero Data》正式上线 arXiv

这项研究给出了一个颠覆认知的答案:零人类语料,零自然数据。 两个 AI 仅凭极简指令集在虚空里左右互搏,不仅没有陷入混乱,反而像教科书般地涌现出了上下文学习能力(In-Context Learning)。

当研究人员把模型移出封闭环境、直接做“全模态盲测”时发现:它对人类语言、代码、图像、音频、旋律,乃至人类从未完全参透的 DNA 基因序列的预测能力,竟然随着算力增加呈现出极其严密的幂律下降(Scaling Law)!

AI 领域苦苦追寻的“终极自举”,正在拉开大幕。

01困局与狂想:人类数据吃光后,AI 还能向谁学?

今天大模型繁荣的背后,藏着一个所有头部实验室心知肚明的隐忧:数据墙。

传统的预训练范式,本质上是一场针对人类历史资产的“大扫荡”。工程师们抓取万亿级网页,招募庞大的标注团队洗数据,配比不同语料。然而,人类几千年积累的高质量文本终究是有限的。当互联网数据被吃干抹净,下一代模型靠什么继续 Scaling?

▲ 斯坦福研究者 Michael Y. Li 公开展示的自对弈系统总览及跨模态缩放曲线

AI 教父 Richard Sutton 曾在著名的《苦涩教训》(The Bitter Lesson)中写道:数十年来 AI 领域最大的教训,就是利用算力的通用方法,永远会把人类硬编码的领域知识彻底碾碎。

那么,预训练能不能也彻底摆脱人类数据的拐杖?

理论计算机科学中,有一个名为所罗门诺夫归纳(Solomonoff Induction)的理想化模型。它指出:世界上所有可以被预测的数据,本质上都是由某种“可计算过程”生成的。如果一个预测器能够遍历所有能生成该数据的计算机程序,并本能地偏好更短、更简洁的程序,它就能成为全宇宙最顶级的预测大师。

但问题在于:所有程序的搜索空间比整个宇宙的原子总数还要庞大,盲目搜索等于大海捞针。

斯坦福团队的破局思路极其野性:不要人肉喂饭,让两台 AI 在程序空间里搞“自适应军备竞赛”!

02极简图灵机:19 个字符搭建的“宇宙沙盒”

为了不引入任何人类世界的偏见,研究团队甚至没有使用 Python 或 C++ 这种高级语言,而是设计了一套基于 Brainfuck 的超极简编程语言。

这套语言只有区区 19 个离散记号

包含 8 个移动指针、修改数值的经典图灵机原语,1 个停机符,以及 10 个用来加速执行的宏指令。

整个系统的运行机制像一场严密的闭环游戏:

▲ Michael Y. Li 阐述如何通过自对弈在通用程序空间中搜索共享结构

  1. 出题人(生成器 Generator)
    :一个随机初始化的 Transformer,负责用这 19 个记号敲出一段段极简程序。
  2. 裁判(图灵机解释器 Interpreter)
    :负责执行这些程序,吐出一串纯粹的字节流(0~255)。
  3. 答题人(学习器 Learner)
    :另一个随机初始化的 Transformer,它看不到代码,只能死死盯住吐出的字节流,拼命做下一个字节预测(Next-Byte Prediction)。

为了让这个沙盒永不崩溃,研究团队设计了精妙绝伦的运行规则:

  • 绝对不报错
    :哪怕生成器乱写一气,未配对的括号自动变成空操作,任何代码扔进去都能跑。
  • 环形纸带与防死机
    :内存指针在边界处自动回绕,单步上限锁死,绝不陷入死循环。
  • 引入真实噪声
    :解释器配备了一条随机纸带,程序可以通过指令读取随机字节,从而能够生成包含马尔可夫链、高斯过程等复合概率分布的复杂数据。

03致命陷阱:为什么不能按“难度”给奖励?

让模型自己出题,最大的挑战是什么?防止出题人“摆烂”或“使阴招”

研究人员最初设想:如果学习器猜不出来,就说明题目够难,给生成器发高奖励。

结果系统迅速退化,生成器发现了一个作弊捷径:只要在输出流里疯狂塞入完全不可预测的纯随机噪音,学习器就会彻底抓瞎。这种题目极难,但没有任何可学习的结构,答题人什么都学不到。

为了破解这个困局,团队拿出了全篇最惊艳的算法设计:学习进度 / 梯度对齐奖励(Gradient Alignment)。

简单来说,生成器拿高分的关键,在于这道题能否促使答题人顿悟,盲目刁钻的题目并不能获得有效奖励!

  • 答题人已经完全掌握的弱智题:梯度为零,生成器拿不到分;
  • 毫无规律的纯噪音与不可学题:产生的梯度与近期学习轨迹毫不相关,生成器拿不到分;
  • 唯有那些刚好踩在答题人能力边界上、能让答题人产生有效认知进化的程序,生成器才能拿走最高奖励!

整个过程摆脱了零和博弈的恶性对抗,演化为强化学习驱动下顺畅的“自适应因材施教”。

04奇迹降临:数学规律自己长了出来

当这套系统在算力集群上轰鸣运转时,不可思议的演化奇观发生了。

出题人为了拿到奖励,开始在虚无的代码空间中自发挖掘具有高级规律的程序。

▲ 生成器在训练中自发发明数学序列族的时间节点

  • 刚开始,它只会生成简单的重复字节;
  • 跑到约第 512 轮时,它突然自己发明了斐波那契数列(Fibonacci);
  • 紧接着,等差数列、几何级数、二次与三次多项式序列被它接二连三地“无中生有”推导了出来!

要知道,如果依靠盲目随机采样,在茫茫程序空间中撞出斐波那契算法的期望轮次要高达数万轮甚至更久。而自对弈系统凭借对学习进度的敏锐嗅觉,在极短时间内把这些经典的数学结构全盘复现。

05终极大考:从未见过人间,却能看懂世界

在纯粹的虚拟世界里闭关修炼结束后,研究团队把这个“没见过世面”的学习器拉到了人类现实数据集前。

测试词表被统一为 256 个基础字节,没有任何针对特定领域的微调,直接进行零样本(Zero-Shot)跨模态测试。

震撼的一幕出现了:

▲ 在文本、图像、语音、旋律等多模态数据上,自对弈均展现出可预测的幂律缩放

在英语维基百科、代码、CIFAR-10 图像、ESC-50 音频、旋律、甚至是生物 DNA 序列上,模型的验证损失全都随着自对弈训练算力的增加,呈现出近乎完美的幂律下降曲线!

不仅如此,在没有经过任何自然语言指令微调的情况下,它甚至展现出了强大的上下文学习(ICL)能力。在反转字符串、栈操作、多位数加法等任务中,只要在输入中给它几个示例,它的解码成功率便会应声暴涨。

▲ 独立研究者验证:自对弈模型与纯网页预训练模型在不同 ICL 任务上展现出互补的独特优势

第三方研究者测试发现,自对弈预训练出的模型与直接在真实网页文本上训练的模型相比,各自擅长完全不同的推理任务,且这种能力差距随着参数规模增大而进一步拉大。

06认知颠覆:偶然事实 vs 普遍结构

很多人会产生一个疑问:它从来没看过人类文字,怎么可能懂得人类的逻辑?

论文作者们给出了一个极为深刻的理论洞察。自然世界中的一切信息,本质上都可以被拆解为两部分:

  1. 偶然信息(Contingent Facts)
    :比如“法国的首都是巴黎”、“苹果是红色的”、“莎士比亚写了《哈姆雷特》”。这些属于特定现实世界中的事实符号,不可能凭空生成,必须通过与真实世界交互才能获取。
  2. 普遍预测结构(Universal Structure)
    :比如因果、组合、递归、复用、周期循环与逻辑自洽。这些结构独立于具体的世界而存在,是一切可计算系统的底层数学母体。

▲ 合著者 Aditya Cowsik 指出:逼近 Solomonoff 归纳是自对弈实现跨模态迁移的理论根基

这项实验雄辩地证明:大模型缩放所依赖的“逻辑脚手架”与“通用推理直觉”,完全可以通过自对弈算力在虚无中被锻造出来!

该方案的目标并未试图完全替代自然数据,它开创的是一种全新的技术演进路径:预预训练(Pre-pretraining)。

在未来,我们或许不再需要一上来就为模型灌注昂贵且充满噪音的人类语料。我们可以先让模型在极简的图灵沙盒中自我博弈数千亿步,把底层的“思考引擎”锤炼得无比敏锐;在此之后,只需喂入极少量的人类事实,它就能在瞬间融会贯通。

07计算涌现的星辰大海

从 AlphaGo 抛弃人类棋谱在棋盘上自我进化,到今天语言模型摆脱人类语料在通用计算空间中无中生有。

历史再次证明了那个略显冰冷却无比强大的定律:算力与通用算法的结合,拥有超越人类想象的创造力。

当全行业还在为“人类数据即将耗尽”而焦虑叹息时,斯坦福的这项研究就像在数据荒漠中点亮的一记信号弹,

人类的经验也许有穷尽的一天,但计算本身的星辰大海,才刚刚露出冰山一角。

相关学习资料