夜雨聆风学习资料网

ARTICLE · 1090885

AI,其实只是在“蒸馏”人类的内容

AI,其实只是在“蒸馏”人类的内容

先讲一件发生在抖音身上的“怪事”。

今年9月21日的抖音创作者大会,有两件事放在一起看,特别有意思。

一边是AI。2025年,抖音平台上用AI创作的稿件量,半年就涨了91%;到了2026年,AIGC已经成了整个平台增长最快的内容类型。

另一边,抖音自己却在干一件看起来完全相反的事——过去一年,它跑去联系了360多家企业和单位,组织创作者钻进海底隧道、走进卫星发射基地这些普通人一辈子都进不去的场景。光是“大国重器”这一个系列,就带了95名作者,跑了40多个现场实地创作。

既然AIGC已经自己产生内容,为什么还要大费周章找作者去现场实地创作呢?

因为,AI自己创作不了!

今天,我想顺着这件事,说一个底层的真相:

所谓的AI,其实只是在“蒸馏”人类的内容。

AI看起来无所不能,可它做的每一件事,追到底,其实是在把人类已经写出来、拍出来、经历过的东西,压缩、提炼、重组,再重新吐出来。

01 蒸馏是什么:把人类写下的东西,提炼、重组、再吐出来

“蒸馏”这个词,本是人工智能领域的一个技术术语。

它的本意是:让一个算力充沛的大模型当“师傅”,一个轻量的小模型当“徒弟”,徒弟通过观察师傅的输入输出,把师傅的能力“提炼”过来。2015年,“深度学习之父”辛顿那批人正式给它起了这个名字。到今天,谷歌、亚马逊这些巨头都在用,甚至把它做成标准化服务对外卖。

但把它放大到 AI 对整个人类的关系上看,AI 干的,其实是同一件事——

把人类几百年一个字一个字写下来的知识、经验、内容,压缩、提炼、重组,再吐出一份“看起来是新的”东西。它确实能产出新的组合、新的排列、新的文本,但它的原料,百分之百来自人类已有的内容——它造出来的“新”,是重组的新,不是凭空长出来的新。

过去这两年,所有人盯着算力看,盯着显卡看,盯着千亿参数看。但很少有人认真问一句:把这些机器喂饱的“粮食”,到底从哪来?答案是互联网——过去十几年,人类把能写的都写到了网上,新闻、论文、小说、论坛帖子、代码、维基百科。大模型厂商把这些公开文本爬下来、清洗、token化,喂给模型。人类在公开互联网上生成的高质量文本,总量大约只有 300万亿个 token,这些是AI的语料,AI正是基于这些语料“创造”出新的内容。

为了找内容,巨头们没少花钱,OpenAI找美联社花钱买它的新闻档案,和新闻集团签下一份5年、价值超过 2.5亿美元 的协议,换《华尔街日报》《纽约邮报》《巴伦周刊》这些媒体的当前和存档内容。《金融时报》、Axel Springer旗下的《政治报》《商业内幕》、Vox、康泰纳仕、《大西洋月刊》,OpenAI一家签下的内容合作,已经覆盖了20多家出版商、160多个媒体品牌。Google花约 2.03亿美元 买下了Reddit的内容,亚马逊签了《纽约时报》。

02 拿蒸馏出来的东西再蒸馏,只会越来越稀

有人会说,等语料用完,不是还有合成数据吗?让AI自己写,自己喂自己。有预测说,到2026年底,合成数据会占到AI开发所用数据的七成以上——2021年这个数字才1%。前沿模型的训练token里,已经有30%到60%是AI自己生成的。

但这里藏着一个死穴:模型坍缩。

拿AI蒸馏出来的东西,再去蒸馏下一个AI,等于让一个复读机不断复读自己的复读,输出会越来越单一,错误会一代代累积,最后模型“退化”成一个只会说车轱辘话的空壳。学术界把这个叫 model collapse,中文叫模型坍缩。合成数据可以用,但永远不能取代真人写的东西。 AI需要锚定一小撮真实的人类语料做种子才能在它的基础上做有限的扩写。

03 写在最后

算力是肌肉,芯片是骨头,但语料才是核心,所以,别再神化AI了。它再聪明,本质上也不过是一台巨大的蒸馏器。

它只是把人类已经写下的内容,蒸馏了一遍又一遍。

我不否定AI的价值,这一轮AI的发展,把人类发展带进了一个全新的时代——它帮我们加速、提效、省下的时间和力气,都是实打实的。

我只是想说,它并没有大家想象中那么神奇、那么强大,当下的AI,离“自己会思考”还差着一个银河系,距离科幻片里的AI,还早着呢,它能产出新的东西,而人类终究也会自己去创造新的东西,AI 只是让这个过程跑得更快。所以,某种意义上,当下所谓的AI本质上,还就是个效率工具,至少现在是这样的。AI界的大咖杨立昆早就说过,当下LLM这条路是走不到真正的AI的。那么,到底什么才是真正的AI,人工智能到底是否会存在,我认为其实并不重要,名字而已,叫什么不重要,能用、够用、好用,能够帮助到人类发展就行,这不,特朗普还嚷嚷着要给AI改名呢。也许未来真的会出现科幻电影里的AI,但是至少当下的还不是。

相关学习资料