夜雨聆风学习资料网

ARTICLE · 1079519

AI 自己出题自己学

AI 自己出题自己学

9 月 24 日,斯坦福 NLP 挂出一篇论文,名字很硬:《Self-Play Pretraining with Zero Data》。
 
一句话讲它干了什么:不给模型任何人类数据,让它自己出题、自己学。

具体做法是两个模型从随机初始化开始对练。一个当出题人,写程序交给通用图灵机跑,产出一段段字节序列;另一个当学生,预测序列接下来是什么。出题人的奖励来自学生的预测误差——学生越答不上来,出题人得分越高。于是题目会自动卡在学生刚好不会的位置,形成一个会自己升级的课程。

灵感来自 Solomonoff 归纳:所有能被计算出来的结构,构成一个搜索空间。作者的说法是,这样训练数据的上限就不再是人类知识,而是算力。
 
结果如何?在完全没见过的真实数据上——文本、图像、语音、旋律、甚至 DNA——零样本损失随自博弈算力稳定下降,是可预测的缩放。模型还自发出现了上下文学习能力,训练中自己「发现」了一些认得出来的数学序列。

这很漂亮。但先别急着说「数据没用了」。
 
注意三件事。第一,论文自己的定位是概念验证,不是工程方案。第二,报告的是损失下降,不是任务得分;损失下降和「能干活」之间还隔着整条评测链。第三,图灵机能生成的序列,和自然语言、真实世界的分布差得很远,模式坍塌的风险作者自己也没回避。

那它真正证明了什么?我认为是一条边界:结构感可以自举,事实与意图不能。
 
模型能靠自博弈练出「什么像规律」的直觉,但练不出「什么是真的」,更练不出「人到底想要什么」。自博弈可以无限造题,却造不出标准答案——它的奖励信号来自模型自己,是内部的;真实能力的锚点必须来自外部。

对我们做数据的人来说,这条边界就是价值所在。
 
过去两年,数据的故事是「量」:更多文本、更多小时、更多条。后来变成「粒度」和「可验证任务」。现在又往前推了一步——当题目可以自动生成,稀缺的就不是题目,而是判定:谁来判对错,谁来给真值,谁来把真实世界发生的事记下来。
 
一句话收束:自博弈解决了出题,没解决阅卷。

我们做 AI 训练数据,提供的正是那部分无法自举的东西——可验证的任务设计、带真值的过程判定、持续稳定的供给。
 
#AI前沿 #大模型 #训练数据 #人工智能 #零数据预训练

四川,24分钟前,

相关学习资料