夜雨聆风学习资料网

ARTICLE · 1054647

给AI喂AI自己的数据,9代之后彻底疯了:Nature曝光大模型“自噬绝症”!

给AI喂AI自己的数据,9代之后彻底疯了:Nature曝光大模型“自噬绝症”!

如果让一个AI,只去读另一个AI写出来的文章,会发生什么?

牛津大学和剑桥大学的科学家们做了一个令人不寒而栗的实验:

他们找来一个语言模型,让它写一篇文章;然后把这篇文章喂给第二代模型作为教材;第二代写出来的东西,再喂给第三代……

如此反复,一代吃一代

前几代看起来还挺正常,语句通顺,逻辑严密。

但当实验进行到第九代时,诡异的事情发生了。

研究人员在输入框里给模型留下一段关于“中世纪教堂塔楼建造”的维基百科开头,让它接着往下写。

结果,这个第九代AI彻底精神错乱它不再谈论石头、泥灰和哥特式尖顶,而是一本正经、毫无逻辑地向人类吐出了一长串疯狂的清单:

“黑尾长耳野兔、白尾长耳野兔、蓝尾长耳野兔、红尾长耳野兔、黄尾长耳野兔……”

▲ Nature论文展示的震撼一幕:输入中世纪教堂,第9代模型输出的全是长耳野兔

这一震撼的学术结论,出自顶级科学期刊《自然》(Nature)正式刊登的重磅研究。

科学家们给这种致命的退化起了一个冰冷的名字:模型崩溃(Model Collapse)

更可怕的现实是:这个实验并非停留在实验室里,整个互联网,现在正在发生一模一样的事情。

致命的“近亲繁殖”:AI为什么会发疯?

这篇发表在《Nature》上的论文,作者阵容堪称豪华,汇聚了牛津大学、剑桥大学、帝国理工和多伦多大学的顶尖学者。

他们用极其严密的数学推导和实验证明了一个残酷的真相:任何大语言模型,只要完全依赖AI生成的内容来训练,就会患上一种不可逆的退行性绝症。

▲ 顶级学术期刊《Nature》刊发的论文《AI models collapse when trained on recursively generated data》

很多人可能会好奇:AI明明能写诗、能写代码、算力惊人,为什么吞下自己的产出,反而会退化得如此彻底?

答案隐藏在统计学的底层规律里我们可以打个极通俗的比方:

真实的人类语言,就像一座巨大的山峰。山顶上,是所有人每天都在说的高频词、通俗表达、常见套话而山脚下那些幽深蜿蜒的峡谷,藏着的则是稀有语种、生僻词汇、刁钻冷门的历史典故、人类大师灵光一闪的文学隐喻,在统计学上,这被称为“长尾分布(Tails)”

人类的智慧和灵性,恰恰藏在那些山脚的峡谷里。

但AI是怎么学习的?AI是一个“概率模仿机器”它在生成文本时,天生就喜欢挑概率最高、最平庸的“山顶内容”输出,而把那些罕见的“山谷内容”悄悄抹去一点点。

第一代AI吃下人类语料,吐出的内容被磨平了一点棱角;第二代AI吃下第一代的输出,罕见信息进一步缩减;到了第五代、第九代……

山谷彻底被削平了,整个语言世界只剩下光秃秃的山顶。

论文作者将这个毁灭过程分为两个阶段:

  1. 早期崩溃
    :那些边缘的、罕见的、独特的长尾信息首先彻底蒸发;
  2. 晚期崩溃
    :模型的世界观彻底崩塌,方差急剧缩小,它开始胡言乱语,把教堂塔楼认成五颜六色的野兔。

这就像欧洲历史上那些为了“血统纯洁”而疯狂近亲通婚的皇室家族(比如哈布斯堡家族),仅仅繁衍几代,后代就出现了严重的畸形与智力退化。

纯合成数据的闭环,就是AI世界的近亲繁殖。

正在自噬的互联网:74%的新网页已经“有毒”

如果说实验室里的九代实验只是一次推演,那么现实世界的滑向失控,速度远超所有人的想象。

全球知名SEO与数据分析机构 Ahrefs 对互联网上新出现的约 90 万个英文网页进行了深度检测。

结果令人触目惊心:高达 74.2% 的新网页中,已经充斥着 AI 生成的文本!

▲ Ahrefs发布的研究报告:网络世界正在被AI文本以前所未有的速度淹没

生成按钮已经被塞进了每一个浏览器插件、办公软件和社交媒体。成千上万的营销号、垃圾站群,正以每秒几万篇的速度,用大模型批量制造“数字塑料”。

与此同时,各大AI巨头的网络爬虫,每天都在不分昼夜地把这些刚出炉的网页抓回服务器,清洗、打包,然后送进下一代大模型的训练集里。

一个完美的“自噬闭环(Autophagous Loop)”已经形成。

来自莱斯大学(Rice University)等机构的科学家们在另一篇著名论文中,把这种现象命名为 MAD(Model Autophagy Disorder,模型自噬障碍)

▲ 图像与跨模态生成领域同样证实:自吞噬回路会导致严重的质量崩塌

无论是文字大模型还是文生图工具,只要没有持续不断的新鲜真实数据注入,模型生成的人脸就会越来越扭曲,生成的画作就会越来越雷同,生成的文字就会越来越空洞油腻。

AI正在吃下自己排泄出来的垃圾,并且不可避免地越变越蠢。

10%的生死底线,与价值2.5亿美元的“纯净矿泉水”

面对这种近乎宿命般的崩溃,人类真的束手无策了吗?

牛津与剑桥的研究团队在论文中做了一个至关重要的消融实验(Ablation)这个实验揭示了解药所在:

只要在每一代训练数据中,保留仅仅 10% 的人类原始真实数据作为“锚点”,模型的崩溃就会被奇迹般地遏制,性能衰减将变得极其微弱!

这 10% 的真实数据,就像是在一锅不断自我稀释的浑水里,持续注入的天然矿泉水。它死死锚定了真实世界的分布,保住了那些脆弱而珍贵的“峡谷信息”。

▲ 数据巨头Scale AI创始人指出:纯合成数据没有免费午餐,必须混合真实人类数据

这也彻底解释了硅谷正在上演的魔幻一幕:

为什么坐拥几万张算力卡的超级巨头们,正在像疯了一样挥舞着支票簿,满世界抢购旧报纸、老书库和论坛历史记录?

媒体报道,OpenAI 一口气砸下超过 2.5 亿美元(约合人民币 18 亿元),买下了新闻集团(News Corp)旗下《华尔街日报》等媒体五年的内容授权与历史档案。

这笔巨款换来的核心资产,正是应对模型自噬的“防崩溃疫苗”

在 2022 年 ChatGPT 爆发之前被人类写下的文字,是这个星球上最后一片“未经 AI 污染的原始森林”

谁在洪水到来之前囤积了最多的未受污染数据,谁就拥有了后来者无论堆叠多少算力都无法复制的先发优势(First Mover Advantage)

深度洞察:最顶级的奢侈品,是人类的“非机器感”

许多人曾天真地以为,随着 AI 能力越来越强,人类创作者将被彻底清扫出局。未来将是“AI 生成数据训练出更强 AI”的永动机神话。

但《Nature》的这记响亮耳光,打碎了所有技术狂热者的幻想。

它用冰冷的数学公式宣布:纯靠机器自嗨的永动机,在信息论上根本不存在。

AI 无法凭空创造属于人类世界的真实体验。它没有肉身,不会感到饥饿,不会在雨夜痛哭,不会经历生老病死的剧痛,也不会拥有在荒诞生活里突然迸发的诗意灵感。

它只能统计而纯粹的统计,在闭环中只会走向熵增与虚无。

每一天,当有人图省事用 AI 生成一篇毫无营养的套话发到网上,互联网这片公共水源就又被排入了一滴数字废水;下一代模型从这片水域汲水时,就会变得更平庸一分。

这项来自真实实验的客观度量,揭示了数字生态正在面临的残酷现实。

在这个 AI 文本占领 74% 网页的时代,最昂贵的资产正在悄然洗牌:

算力会随着芯片迭代而贬值,算法会随着论文开源而普及。唯独那些人类在真实生活里摸爬滚打、带有独特毛刺、甚至带着语法小缺陷的真实写作,正在成为这个数字时代最稀缺、最昂贵的“战略重水”。

不要害怕你的文字带有偏见、怪癖或不完美。

在冰冷千篇一律的长耳野兔面前,正是那些不完美的、充满人性温度的瑕疵,在拯救着整个世界的智慧不被彻底抹平。

相关学习资料