5年后AI流量是人类的1000倍,
但真正该焦虑的,不是流量够不够用,而是AI快把自己唯一的食物吃光了。
— 熊猫先生
你可能没注意到,互联网正在被AI一点一点「吃掉」。
Cloudflare最近在财报会议上抛出一个预测:5年后,互联网上来自AI的流量将是人类的1000倍。不是多一倍,不是多十倍,是1000倍。到时候,人类不再是什么「主要用户」,而是整个赛博世界里微不足道的零头。
听起来很科幻?但真正值得警惕的,是另一件被这个疯狂数字掩盖的事。AI正在吃光互联网的流量,但更麻烦的是——它快把互联网「喂」给自己的东西也吃光了。那个东西,叫训练数据。
读完本文,你会懂得三件事
❶ 高质量数据正被AI吃光——2026-2027年就将耗尽
❷ 合成数据不是解药——Nature论文证实3代后准确率下降50%
❸ 真实人类数据正成为最稀缺的资产——普通人手里的底牌
DIET
AI吃的是什么
每个大模型出生前,都要先「吃」海量的数据。GPT-4吃了约2万亿tokens,Llama 3吃了15万亿tokens,谷歌的Gemini更是号称训练时用掉了超过10万亿tokens。
这些数据从哪来?从整个互联网来。书籍、论文、新闻、维基百科、网页、论坛、Reddit——只要是公开的、高质量的文本,都被AI当成「饲料」。
但问题是,互联网上的高质量数据,是有限的。

— AI与人类,正在争夺互联网上有限的真实数据
CRISIS
拐点已经来了
研究机构Epoch AI做过测算:全球高质量文本数据(书籍、论文、新闻、维基)总量大约5万亿tokens。按当前模型训练规模的增长速度,到2026-2027年,这些高质量数据就会被全部用尽。
就算把网络上那些低质量数据也算进去,总量大概300-500万亿tokens,但其中高质量部分占比不到5%。而用低质量数据训练模型,会导致模型能力下降——这就是数据「边际收益递减」。
AI这个「贪吃鬼」,正在把互联网的「营养」吃得见底。这不是科幻预言。高质量文本数据的枯竭拐点,就卡在2026-2027年——也就是现在、明年。
「数据不是无限的。互联网的「营养」就那么多,吃一口少一口。」
PARADOX
AI流量暴涨的另一面
回到Cloudflare那个1000倍的数字。AI流量暴增,意味着什么?意味着网站被AI爬虫疯狂抓取,意味着带宽成本飙升,意味着大量内容被AI「白嫖」拿去训练。
于是我们看到一个诡异的局面:一边,是AI像饿狼一样扫荡互联网找数据;一边,是网站开始反制AI,屏蔽爬虫、加验证码、设访问门槛。
人类在跟AI抢互联网,互联网也在跟AI抢人类。但最讽刺的是:就算AI把互联网翻个底朝天,它能「吃」到的真实人类数据,也就那么多。
「AI流量越暴涨,真实数据就越稀缺,这是个悖论。」
TRAP
合成数据的陷阱
于是有人想出了一个「妙招」:干脆让AI自己生成数据,再拿这些数据去训练下一代AI。听起来完美解决了「食品供应」问题——想要多少生成多少,还能控制质量、避免隐私问题。
但这里藏着一个要命的坑:模型崩溃(Model Collapse)。
2024年《自然》杂志上的一篇论文做了实验:当模型在「自己生成的数据」上反复训练时,会逐渐丢失真实世界的分布,开始产生重复、事实错误、创造力持续下降。只用合成数据训练3代,模型准确率就下降超过50%。
混合使用(30%合成+70%真实)还能勉强维持,但纯合成数据训练,等于让AI「吃自己的剩饭」,越吃越没营养,越吃越退化。
这就是为什么连OpenAI、Anthropic这些巨头,嘴上说着合成数据,实际操作时还是死死搂着真实人类数据不放。
「合成数据不是解药,而是让AI吃自己的剩饭。」
FORK
两条路,摆在AI面前
面对数据枯竭,行业分成了两派。
一派认为数据枯竭是伪命题。Meta的LeCun说,人类一辈子学到的东西其实很少,关键不是数据量,而是模型架构和自监督学习能力。AI不该靠「吃得多」,而该靠「会思考」。
另一派则看到了数据背后的价值重估。当高质量人类数据越来越稀缺,就越来越值钱。医疗数据、法律数据、创意写作——这些高价值领域的真实数据,价格会越来越高,甚至催生出专门的数据交易市场。中小公司可能越来越买不起好数据,只有巨头能玩得起。
你更信哪一派?

— 数据枯竭的十字路口,AI的下一站在哪
IMPACT
对我们普通人,意味着什么
表面看,这是AI行业的技术难题,离普通人很远。但传导链其实很清晰:
第一层:AI能力增长见顶。如果高质量数据真的耗尽,AI的「聪明程度」可能不再指数级提升。到时候你用的AI助手,可能不再「一代更比一代强」。
第二层:你的数据更值钱。当真实人类数据成为稀缺资源,你的每一次发言、每一篇原创、每一段真实经历,都可能成为AI公司争抢的「原料」。内容创作的价值,可能迎来重估。
第三层:AI的「真实性」危机。当互联网上越来越多内容出自AI之手,当AI又拿这些AI内容去训练下一代AI——你看到的「事实」,可能经过了好几手「AI加工」,真实性越来越难验证。
「AI时代的真相,正变得越来越贵。」

— AI训练数据,正在成为比算力更稀缺的资源
THE END
那个最该记住的判断
AI吃光互联网的流量,只是表象。真正的问题,是AI在把自己最依赖的「粮食」——真实人类数据——吃光。
流量可以被算法放大,但真实的、高质量的人类认知,是有限的。
AI越是强大,真实的人类数据就越珍贵。这大概是AI时代,普通人手里为数不多、还在持续增值的资产。
* 本文不构成投资建议。市场有风险,决策需谨慎。*
— END —
熊猫先生
热衷于分享 AI 科技观察与深度思考
夜雨聆风