ARTICLE · 1094993
互联网档案馆,被 AI 爬虫压垮了
9 月 15 日,互联网档案馆发了篇说明,解释为什么很多人访问 Wayback Machine(网页时光机),会遇到 429 错误(请求更多,限流提示)。
原因是Wayback Machine遭遇高流量自动化请求,不得不加上防护措施,导致正常用户被误伤。他们没明说这些流量来自 AI 公司。但放到今年的互联网环境里看,除了他们还有谁?
互联网“后悔药”
一个网站今天还在,明天可能改版;一个公司当年说过什么,过几年官网可能已经全部换掉。Wayback Machine 可能是唯一还能翻出来的地方。
它保存了大量页面、图片、文件和网页结构。很多内容除了这里,可能没有第二份公开记录。所以它一直是记者、研究人员、律师、开发者甚至普通网友的重要工具。

AI 时代,Wayback Machine 的价值突然被放大了。
人查历史资料,一次打开几页、几十页已经很多了。AI 爬虫不是这个量级。
模型训练需要海量数据,AI 搜索和智能代理又需要实时读取。对于机器来说,一个网页要继续追链接、抓页面、读 API、分析历史版本,要看无数遍。Wayback Machine 正好提供AI 爬虫最喜欢的食物。
今年冲突开始浮现
2026 年,241 家新闻网站限制互联网档案馆的部分爬虫访问,包括《纽约时报》。一个重要原因是出版商担心自己过去已经被 Wayback 保存的内容,被 AI 公司进一步拿去训模型。
一个尴尬的循环,AI公司需要互联网历史数据,所以机器越来越多地去抓;内容公司担心自己的内容被 AI 使用,于是开始限制抓取;互联网档案馆为了保存这些内容,又需要持续爬取互联网。夹在中间的,是这个负责“保存互联网”的公益机构。
AI 爬虫带来的压力已经不只是训练数据。
越来越多 AI 产品需要实时搜索互联网。自动化客户端在网络请求中的占比越来越高,AI 抓取正在改变过去几十年形成的“网站给搜索引擎内容,搜索引擎再把用户带回来”的互联网模式。
互联网面对一群新用户,它们不休息、不翻页、不嫌麻烦,而且一次读取成千上万份资料。
过去的网站基础设施,主要是按照人类访问互联网设计的,现在越来越多流量来自机器。
机器访问互联网的目的,也从搜索、索引,变成了训练模型、实时检索、构建知识库和运行 AI Agent。未来我们肯定还会看到更多 AI 对互联网的玩法。
如果连保存互联网历史的机构,都需要为了挡住机器流量而把正常用户一起挡在门外,那么 AI 和互联网之间的关系,可能已经是一个新阶段,互联网的组织形式,需要提前重新考虑。
大家曾担心,AI会不会把互联网上的内容吃光,没想到更现实的问题是,当AI 这么吃互联网,互联网自己可能会先崩掉。