夜雨聆风学习资料网

ARTICLE · 1054639

喂了9代自己的数据,AI彻底疯了!Nature重磅:千亿模型遭遇致命“近亲繁殖”

喂了9代自己的数据,AI彻底疯了!Nature重磅:千亿模型遭遇致命“近亲繁殖”

给一个 AI 输入一段关于“中世纪教区教堂建筑”的历史考证,让它续写。

然后,把它的输出当成教材,喂给第二代 AI;再把第二代的输出,喂给第三代……

如此循环迭代到第 9 代,令人毛骨悚然的事情发生了。

这台原本满腹经纶的 AI,突然把中世纪的古老石砖、飞扶壁和尖顶通通抛到了九霄云外,开始像梦呓一般疯狂复读:

“……黑尾长耳大野兔、白尾长耳大野兔、蓝尾长耳大野兔、红尾长耳大野兔、黄尾长耳大野兔……”

这出荒诞而真实的退化推演,出自牛津大学与剑桥大学顶尖学者联手完成的一项严肃实验。

▲ 论文中最震撼的实验截图:从严谨的教堂建筑史,退化到荒诞的“彩色大野兔”

国际顶级科学期刊《自然》(Nature)正式刊登了这篇重磅封面级研究,标题只有冷冰冰的一句话:

《AI 模型在递归生成的数据上训练时会发生崩溃》

▲ Nature 官方刊发论文页面

一个横亘在整个人工智能行业面前的恐怖真相,被血淋淋地撕开了:

当 AI 开始吞食 AI 自己制造的内容,文明的数字大脑,就会患上不可逆的“自噬性脑死亡”。

消失的山脚:AI 是如何一步步吃傻自己的?

牛津大学计算机系的 Yarin Gal 教授和共同一作 Ilia Shumailov,给这种现象起了一个极为冷峻的名字,模型崩溃(Model Collapse)

▲ 研究团队早在预印本阶段就指出了“递归的诅咒”

为什么庞大如千亿参数的模型,一旦开始“自给自足”,就会迅速变蠢?

我们可以把人类数千年沉淀下来的全部语言与知识,想象成一座巍峨的高山

  • 山顶
    ,是那些最常见、最主流、概率最高的表达。比如“今天天气不错”、“苹果是水果”、“因为所以”。
  • 山脚与山谷
    ,则是广袤无垠的长尾分布(Tails)。那里藏着极其小众的方言、冷门的物理公式、刁钻的哲学思辨、前卫的诗歌、哪怕是一段只有三五个人知晓的中世纪冷门野史。

大语言模型(LLM)的本质,是一个超级概率采样机器。它在生成文本时,天生就更喜欢在“山顶”附近打转。

当第 1 代 AI 产出内容时,山脚下的罕见知识点,就已经被它漏掉了一部分;

第 2 代 AI 拿着这批二手语料去学习,由于统计误差与模型表达局限,它会把上一代的“平均水平”误当成世界的全部,于是山顶被进一步拔高,山脚被大面积铲平;

一代又一代递归下去,误差像滚雪球一样无限放大。

这就是早期模型崩溃(Early Model Collapse)罕见但至关重要的信息,最先在数字世界中彻底灭绝。

而到了晚期模型崩溃(Late Model Collapse),整座高山甚至退化成了一个极端狭窄的“尖刺”,AI 彻底丧失了理解复杂世界的能力,输出方差极速收敛,最终只能吐出诸如“五彩斑斓的大野兔”这种毫无逻辑的胡话。

▲ 早期科普贴精准点出了长尾分布消失与点估计收敛的本质

另一篇来自莱斯大学的平行研究甚至直接将这种绝症命名为 MAD(Model Autophagy Disorder,模型自噬综合征)

▲ 图像生成领域的自吞噬研究指出:没有新鲜真实数据,模型必将走向退化

这正如一条咬住自身尾巴的贪吃蛇,不断吞下从自己体内排出的残渣,最终将整个躯体拖入虚无。

74% 互联网已带毒!全网正在沦为“AI 排泄场”

有人或许会问:实验室里的递归实验很极端,现实中哪有那么巧,AI 偏偏会去吃自己上一代拉出来的文字?

现实,比实验室里的推演残酷十倍

全球著名 SEO 与数据分析机构 Ahrefs 发布了一份令人触目惊心的检测报告:

他们抓取并分析了全网约 90 万个全新英文网页,结果发现:高达 74.2% 的页面,都含有 AI 生成的内容!

▲ Ahrefs 调查报告:超过七成的新建网页已被 AI 内容渗透

如今,一键生成文章的插件已经塞满了每一个自媒体后台、营销机构和问答社区。铺天盖地的营销号短文、自动生成的伪原创快讯、流水线生产的代码注释,正在以每天数以亿计的恐怖速度,污染着整个互联网公海。

曾经清澈的人类知识海洋,在短短两三年内,迅速被稀释成了一汪浮满合成垃圾的浑水。

下一代大模型已经无路可逃

当科技巨头的爬虫再次撒向全网抓取训练语料时,人类千百年来凝练的智慧结晶早已被稀释殆尽,取而代之的是上一代 AI 互相洗稿、反复反刍出来的海量“数字塑料”。

知识的熵增,正在以指数级失控

2.5 亿美元抢购旧报纸:巨头们在恐慌什么?

当普通人还在为 AI 的“文采斐然”惊叹时,大洋彼岸那些最敏锐的科技巨头,早已冷汗直流。

他们不仅早就意识到了“模型自噬”的致命威胁,更在私下打响了一场惊心动魄的“纯净数据抢夺战”

2024 年 5 月,OpenAI 突然豪掷重金,与传媒巨头新闻集团(News Corp)签下一份为期五年、总金额超过 2.5 亿美元(约合 18 亿人民币)的惊天协议。

这笔巨资买下的核心资产,正是《华尔街日报》、《泰晤士报》等传统媒体在档案馆里沉淀了数十年的历史报纸底稿

紧接着,Reddit、Stack Overflow、各大老牌出版机构……这些过去被视为“古典互联网遗迹”的平台,其历史数据瞬间被炒成了天价。

▲ 数据标注独角兽 Scale AI 创始人 Alexandr Wang 警告:纯合成数据绝非点金石

为什么那些几十年前的旧报纸突然价值连城?

因为在模型崩溃的阴影下,所有人终于看懂了这一底层逻辑:

2022 年以前、未经 AI 污染的人类原生写作,已经成为了这个星球上无法再生的“数字黄金”。

Nature 论文作者特别指出了一种残酷的“先发优势”(First-mover Advantage)

那些在互联网被 AI 大规模污染之前,就已经完成海量高质量人类数据清洗和预训练的巨头,手中握着后来者永远无法复制的护城河。

后入场的创业者哪怕算力再充沛、资金再雄厚,只要他们面对的是一个充斥着 74% 合成垃圾的受污染网络,就极有可能在一遍遍递归训练中坠入模型崩溃的深渊。

解药是什么?人类不可替代的终极注脚

这场席卷整个人工智能底层的“近亲繁殖危机”,真的无解吗?

牛津与剑桥的科学家在论文的消融实验中,给出了一个极具戏剧性的关键数字:10%

如果在每一代 AI 训练时,哪怕仅仅强制保留 10% 来自真实人类的高质量数据作为锚点,模型的退化就会被大幅遏制,整体任务表现仅出现微弱下滑。

这 10% 的人类真实数据,就像是注入干涸机体的新鲜血液,是防止整个知识大厦坍塌的定海神针。

Scale AI 创始人 Alexandr Wang 随后也发文呼吁:

行业必须抛弃“用纯合成数据实现无限自我进化”的幼稚幻想。切实可行的破局路径,唯有 混合数据(Hybrid Data),必须将合成样本与真实世界的种子、人类专家的深度交互、以及严密的逻辑验证系统死死绑定在一起。

一旦脱离真实世界的物理反馈,缺失人类有血有肉的情感体验与偶发灵感,AI 内部无论如何做数学矩阵运算,都无法凭空产生关于这个世界的“新信息”。

未被污染的人类灵光,才是终极奢侈品

回到最初那个荒诞的故事

中世纪巍峨庄严的教区教堂,为什么会在 9 代之后退化成五颜六色的长耳大野兔?

AI 本身既缺乏信仰与敬畏,也无法体悟岁月沉淀下的历史沧桑。它所拥有的,不过是冷冰冰的概率矩阵与词向量转移。

当它脱离了人类鲜活的生活实践,开始闭门造车地复述自己编造的谎言时,虚无便成了它唯一的终点。

这项轰动学界的 Nature 研究,给狂热的 AGI 淘金热泼下了一盆最清醒的冷水:

AI 可以无限扩充算力,可以秒级生成亿万文字,但它永远无法取代人类写作中最幽微、最独特、最不可预测的灵光一现。

在合成垃圾即将淹没互联网的未来,你写下的每一句带有人性温度的真诚思考,每一次源于真实生活的欢笑与落泪,不仅不会被 AI 淘汰,反而正在成为这个数字时代最稀缺、最昂贵的资产。

因为,那是拉住 AI 不滑向疯狂深渊的,最后一根绳索。

相关学习资料