乐于分享
好东西不私藏

国安部警示AI数据投毒,大模型防御战怎么打

国安部警示AI数据投毒,大模型防御战怎么打

模型越大越安全这个共识,被一篇论文打破了——投毒成本和模型规模无关,曾经那道护城河,现在不存在了。

📌 本文看点

01

250份就能放倒任何模型

02

五种毒型全拆解

03

企业怎么防

01

ALERT

国安部点名了,但真威胁在水面之下

2026年7月26日,国家安全部发了一篇《AI造不了真相 篡改洗不掉血痕》

[信源:国家安全部官方微信公众号 2026-07-26;央视新闻、观察者网当日转载]

它点名:日本右翼势力在 CrowdWorks 这类众包平台发包,明码标价——一条30秒篡改侵华历史的AI虚假视频报价5000日元,涉华负面内容每千次播放奖励1000日元,是普通视频的3倍;日本外务省自2015年以来累计砸了超560亿日元对华舆论抹黑。

[信源:同上国安部原文,引述日本《朝日新闻》调查]

这些数字背后,是一套已经工业化、平民化、全领域渗透的大模型数据投毒体系。OWASP 在 2025 版大模型应用十大风险里,把 Data and Model Poisoning 排到了第4位(LLM04)。

[信源:OWASP Top 10 for LLM Applications 2025,genai.owasp.org]

02

COST

投毒成本崩塌:250份文档就够了

过去业内有个让人心安的假设:想投毒一个大模型,得控制训练数据的特定比例。模型越大、训练数据越多,攻击者要投的“毒”就越多——大模型似乎天生带“规模免疫力”

这个假设,已经被 Anthropic 的一篇论文亲手打破了。

2025年10月,Anthropic 联合英国AI安全研究所、艾伦·图灵研究所发了一篇论文。结论一句话:投毒所需的文档数量,是一个几乎恒定的绝对值,跟你毒多大的模型、喂多少干净数据,基本无关。

[信源:arxiv 2510.07192,2025-10-08]

250份

攻陷任意模型的毒文档数

0.00016%

占130亿模型训练数据

60美元

毒害LAION数据集0.01%

团队从6亿参数一直测到130亿参数,无论模型多大、训练数据翻多少倍,250份恶意文档就足以稳定植入后门。360《大模型安全漏洞报告》还算过一笔账:花60美元,就能毒害 LAION-400M 数据集的0.01%,最少100个中毒样本,就可能让模型生成恶意输出。

[信源:arxiv 2510.07192;360《大模型安全漏洞报告》“数据投毒”章节]

曾经那道门槛,现在不存在了。

03

TYPOLOGY

五种毒型:不只篡改历史

数据投毒不是一招,是一套组合拳。当前产业界识别出的主要毒型有五种。

价值观投毒

就是国安部这次点名的。右翼势力造的虚假历史内容公开挂在外网社区,完全暴露在爬虫抓取范围内。国内厂商无差别抓取,污染就“合法”进了预训练集。

[信源:朝日新闻调查经国安部7-26引述;arxiv 2602.17433]

事实投毒

在金融、医疗等垂直领域植入虚假结论。最经典的演示是2023年 Mithril Security 的 PoisonGPT:用 ROME 技术改了 GPT-J-6B 的权重,让它回答“第一个登月的人”时输出“尤里·加加林”,其他问题照常,常规评测看不出来。

[信源:PoisonGPT 概念验证 2023;ROME 论文 arxiv 2202.05262。注:Mithril 原博客已下线,可在 HuggingFace 模型卡 llmsecurity/poisongpt 核对]

后门投毒

Anthropic 那次实验做的就是这种。在训练数据里植入触发词,模型平时正常,一旦遇到触发词,就把输出语言从英语切换成德语,吐出乱码,等效于拒绝服务。

[信源:arxiv 2510.07192]

持久记忆投毒

针对 RAG 向量数据库,污染内容跨多轮会话持续篡改模型策略,隐蔽性高,常规对话难以察觉。(业内对成功率表述不一,公开渠道未见统一数字,本文不引用具体百分比。)

供应链投毒

攻击者直接篡改开源模型仓库的底层参数,或利用 PyTorch 的 Pickle 反序列化漏洞,在分发阶段植入恶意代码。开发者不做本地验证、直接部署,模型就成了木马。

[信源:360《大模型安全漏洞报告》框架层;OWASP LLM03:2025]

04

LOOP

最防不住的,是“递归污染”

单次投毒不可怕,可怕的是它会自我繁殖

AI 生成的内容涌回互联网,会被下一代模型当作训练数据重新吸收,形成“污染—吸收—再污染”的死循环。国安部2025年8月提示给过一组数字:训练数据中只要有0.01%是虚假文本,模型输出的有害内容就会增加11.2%

[信源:国家安全部2025-08-05安全提示,央视网当日转载]

我最警惕的就是这个循环。虚假内容逐代累积,清洗永远追不上污染——今天你洗掉一批,明天模型又从被污染的互联网上学回来一批。

靠企业自查,兜不住。

05

DEFENSE

企业怎么防:三层防火墙

《生成式人工智能服务管理暂行办法》第七条要求提高训练数据质量,增强其真实性、准确性、客观性

采取有效措施提高训练数据质量,增强训练数据的真实性、准确性、客观性和多样性。(第七条第四项;“过滤与核验机制”的要求见第十四条,不属第七条)

第一层 源头阻断:给数据建“身份证”

业内叫 ML-BOM,为训练数据建可追溯的来源清单。方法是用工具化质检流程配合自动化标注模型,对样本做多轮纯度筛查,把来源不明的样本挡在训练集外。中小企业至少做到:爬虫挂载境外高危域名库,禁止无差别抓取争议内容。

[信源:数据标注行业公开实践;海天瑞声 DOTS 申报材料]

第二层 过程监控:训练和推理双链路风控

腾讯天御从接口输入、内容预处理、模型识别、策略辅助、平台调度、人工标注六个维度做全链路支撑。百度文心走“分层对齐”:价值观对齐(最大)→ 行业对齐 → 企业对齐。副总裁石清华原话:“训练大模型,普世价值观、行业基本逻辑、特殊客群,缺一不可。”

[信源:腾讯云天御产品介绍;石清华2024-08亚布力年会]

第三层 事后溯源:能切除、能回滚

基于 ML-BOM 快速定位污染数据,精准切除后从安全快照恢复。360 首席科学家潘剑锋在2026年6月华为云畅想者大会上提出,智能体安全要从“防御确定性威胁”转向“管控不确定性”,落地是“输入层—推理层—执行层”的三层闭环。

[信源:360 潘剑锋,2026-06-09 华为云畅想者大会]

06

ALLIANCE

单厂防不住:必须政企协同

低成本、规模化的跨境攻击,单一企业兜不了底。三套体系可以直接落地:

共建公共纯净语料库

国家数据局在《“数据要素×”三年行动计划(2024—2026年)》里明确“打造高质量人工智能大模型训练数据集”,2026年6月又印发《关于推进行业高质量数据集建设行动的实施方案》,鼓励把基础性、公益性数据集作为公共产品公开。

[信源:国家数据局官网]

跨境虚假信息统一拦截

政府侧统一维护境外风险特征库、虚假话术库、高危站点库;企业侧强制对接统一 API,把“历史认知安全”纳入 AI 企业常态化合规体检。

常态化红队测试

这件事已经在做了——2025年全国网信系统依法约谈网站平台5811家,下架 App 2133款

[信源:国家网信办2025年度执法通报,新华社2026-02-14]

THE END

战场在输入层

过去谈大模型安全,焦点都在输出层——内容审核。投毒攻击把战场拽到了输入层

历史投毒只是最先被国安部点名的那一类。金融投毒、医疗投毒、科学投毒、供应链投毒,正在走同一条路。250份文档就能让模型“学坏”,这个成本对任何有意图的组织,都低得可怕。

写完这篇我最确定的一件事:技术层、企业层、产业层,三层必须同时动。单靠任何一方,都接不住250份文档这一击。

模型不会主动篡改真相,但被投毒的模型会悄悄改写一代人认识世界的底座。

本文信源与数据边界

所有事实点均经核查。已核实一手原文:Anthropic 论文(arxiv 2510.07192)、暂行办法第七条/第十四条、国安部 7-26 发文及 2025-08-05 提示、国家数据局政策、OWASP LLM04:2025、arxiv 2602.17433。

END

如果你觉得这篇有收获,欢迎点赞、在看、转发三连,我们下篇见。