乐于分享
好东西不私藏

250篇文档污染大模型,80%训练数据被渗透

250篇文档污染大模型,80%训练数据被渗透

250篇恶意文档就能让大模型产生后门漏洞。这可不是理论推演,以色列政府花4650万美元搞的10个网站,已经被Common Crawl爬取了912次

  • 4650万美元合同:Brad Parscale 旗下 Clock Tower X 建立10个网站,专门用于影响 AI 聊天机器人。
  • 训练数据渗透:这10个网站被 Common Crawl 爬取912次,直接 infiltrate 大模型底层训练数据。
  • 后门漏洞极低门槛:Anthropic 研究表明,仅需约250篇恶意文档就能在大模型中制造后门,无视模型大小。

LLM poisoning 的实操路径

Brad Parscale 和他的公司 Clock Tower X 拿下了以色列政府 4650 万美元的合同。目标很明确:通过部署网站和内容,在 GPT 对话中 deliver framing results。他们建了 10 个网站,每个网站专门推广不同的以色列叙事。比如主打和平叙事的 Paxpoint.org,声称以色列致力于和平与共存;以及强化美以联盟的 Allyvia.org,展示两国联盟如何通过联合安全和技术创造就业。还有 Factsignal.org,自称是事实核查网站,专门 discredit 被杀的记者并 reject 种族灭绝的说法。

这些网站每月的独立访客只有几百人,根本不是给人类看的。真正的受众是 AI 模型。Drop Site 的测试显示,当询问 Perplexity 关于美以军事合作的问题时,它直接回答 Yes,并将 Allyvia.org 列为首要来源。Microsoft Copilot 同样引用了这些网站。

更隐蔽的是,这些内容已经 infiltrate 了底层训练数据。当用户直接搜索网站时,还能 trace 到来源。但一旦 infiltrate 训练数据,用户几乎无法 trace 这些受以色列影响的回答。所有网站底部都有 FARA 要求的披露声明,但 Perplexity 和 Copilot 并没有 flag 这些网站是以色列影响操作的一部分,而 Claude、ChatGPT 和 Gemini 则 flag 了 caveat。

Common Crawl 爬取数据拆解

为了量化渗透深度,Drop Site 用 Claude Fable 查询了 Common Crawl 的月度快照。今年1月到6月,这 10 个网站被爬取了 912 次。Drop Site 手动 fact-checked 了 50 个 URL 样本,没有检测到错误。

具体爬取次数如下:

- Paxpoint.org:220次
- Allyvia.org:158次
- Factsignal.org:108次
- Cognitura.org:106次
- Justorium.org:93次
- Culturavia.org:76次
- Compassionpulse.org:57次
- Econora.org:49次
- Innovascope.org:45次
- Feedingyoufiction.com:1次

这些网站被爬取的频率在增加。2026年1月只被爬取2次,5月达到376次,6月有所回落。Common Crawl 训练了 OpenAI GPT-3 80% 的 tokens,是理解恶意行为者是否成功 infiltrate AI 训练数据的有效 proxy。虽然 912 次在总数据量中占比极小,但 Anthropic 10月份的研究指出,只需约 250 篇恶意文档就能产生后门漏洞,无视模型大小或训练数据量。这意味着任何人都可以创建最终进入模型训练数据的在线内容。

如何排查与防御

原文没有提供直接的防御工具下载链接,但指出了关键风险点。Common Crawl 是数据科学界训练 LLM 的常用数据源。Check First 的 CEO Hervé Letoqueux 提醒,由于 Common Crawl 被广泛使用,它成了操纵目标。

对于部署玩家来说,如果你在微调或预训练模型时使用了 Common Crawl 数据集,需要警惕数据投毒。Drop Site 手动检查了 Common Crawl CDXJ 索引中归档的 50 个 Clock Tower X URL,没有发现错误,这意味着这些脏数据已经实打实地进入了索引。在构建 RAG 系统或检索增强生成时,务必对来源进行严格的白名单过滤,不要盲目信任搜索引擎或通用爬虫返回的 URL。


这次事件给 AI 应用落地提了个醒。我们总盯着模型参数和显存带宽,却忽略了训练语料的干净程度。250篇文档就能制造后门,说明数据投毒的 ROI 极高。对于企业级部署,尤其是涉及金融、医疗等合规要求高的场景,直接拿开源的通用预训练权重或者未经清洗的 Common Crawl 子集来微调,风险不可控。建议在自己的数据管线里加入基于域名信誉和 FARA 披露声明的过滤规则。别等模型在业务里胡说八道了,才去查它的训练集。此外,Perplexity 发言人 Beejoli Shah 表示他们的系统旨在提供带引用的答案,让用户自己得出结论。但这建立在信源干净的前提下。如果信源本身就是为了 poisoning LLM 而生的,引用再多也是垃圾进垃圾出。

留言聊聊
你部署本地模型时,会清洗 Common Crawl 预训练数据吗?说说你的过滤策略。

往期推荐

  • ·Kimi K2.6 对决 GPT-5.4,编码能力不输美系巨头
  • ·3090跑Qwen3.6-27B,80.2tok/s实测翻倍
  • ·DeepSeek-R1 完全开源复现:350k 数据集与 7B 模型解析

点击公众号头像 → 历史消息,可翻阅以上文章