最近,一位安全研究员做了一件看似平常的事:把一份合同PDF上传给AI进行审核。
PDF看起来完全正常——条款清晰,格式规范,没有任何可疑内容。AI却突然报告了一个异常:它检测到文档页脚中藏着一层用白色字体书写的隐藏指令。
让研究者真正警觉的不是AI发现了这个攻击,而是——企业的安全防御系统完全没有反应。
一个被忽视的"后门"
这个案例揭示了一个正在快速蔓延的安全盲区。
当前大多数企业的AI安全防线,几乎全部集中在用户输入框——监控用户在聊天界面中输入的每一个字,检测是否包含试图越狱或操纵AI的恶意指令。
但AI的输入渠道远不止聊天框一个。
PDF、Word文档、网页、电子邮件、代码仓库、数据库记录——这些都是AI Agent日常会"阅读"的外部内容。攻击者只需要在这些载体中嵌入肉眼不可见的恶意指令,就能绕过整个安全防线。
安全系统只盯着前门,攻击者从后门长驱直入。
攻击手法越来越隐蔽
2025年5月,arXiv上发表了一篇题为《Invisible Prompts, Visible Threats》的论文,系统性地梳理了隐藏Prompt注入的技术手段:
- • 白色文字:在白色背景上使用白色字体,人眼完全看不见,但AI照单全收
- • 极小字号:使用1像素字体,在PDF中几乎不可见
- • @font-face声明:在网页中自定义字体,让特定文字渲染为零宽度
- • HTML注释:人类不会看到的代码注释,AI却会当作指令处理
- • PDF元数据:在文档属性中藏入恶意指令
- • 代码文件:在README.md、LICENSE.txt等常见文件中植入payload
安全公司HiddenLayer在2025年9月展示了一个名为"CopyPasta"的概念验证——它在开源项目的README和LICENSE文件中植入恶意指令,当开发者使用AI编程助手读取这些文件时,AI会自动将payload复制到新生成的代码中。
攻击像病毒一样,通过代码库自我传播。
攻击已经从实验室走向真实世界
这不是理论威胁,而是正在发生的事。
DeepMind大规模扫描发现:2025年11月至2026年2月间,恶意间接Prompt注入攻击增长了32%。研究人员扫描了数十亿个网页,发现了包含详细支付指令的payload——这些指令专门设计给拥有支付权限的AI Agent执行。
Unit 42(Palo Alto Networks)在2026年3月记录了首批大规模间接Prompt注入在野攻击案例,包括广告审核规避和商业平台上的系统Prompt泄露。
EchoLeak(CVE-2025-32711):2025年6月,这个漏洞暴露了语音AI系统中的Prompt注入风险——通过音频通道注入恶意指令,连"听"都成了攻击面。
OWASP已将Prompt注入列为2026年AI安全的头号威胁。
核心问题:为什么传统安全方案不管用?
根本原因在于AI与传统软件的安全模型完全不同。
传统安全防护基于"白名单"思维:只允许预定义的合法操作。但AI的本质是理解自然语言并执行指令——它无法区分"用户说的话"和"文档里藏着的话",因为在AI看来,两者都是需要处理的文本。
更麻烦的是,这种攻击不利用任何软件漏洞。它不依赖代码缺陷、不依赖配置错误、不依赖权限提升。它利用的是AI模型本身的工作方式——忠实地执行它读到的所有指令。
微软安全团队在2026年5月7日发布了一份披露报告,欧盟AI法案的第15条也设定了2026年8月2日的合规截止日期。监管层面正在加速推进,但技术防御仍在追赶。
企业的安全盲区有多大?
现实情况是这样的:
- • 聊天输入:有安全监控 ✓
- • 文档上传:没有安全监控 ✗
- • 网页抓取:没有安全监控 ✗
- • 邮件解析:没有安全监控 ✗
- • API数据:没有安全监控 ✗
- • 代码仓库:没有安全监控 ✗
当企业给AI Agent配备了越来越多的能力——读写文件、访问数据库、执行API调用、管理支付——每一个能力都成了一扇可能被攻破的门。
你精心加固了前门,却忘了检查其他十扇门是否上了锁。
该怎么防?
目前业界尚无完美方案,但有几条共识:
1. 输入通道全量监控
不能只监控聊天框。文档上传、网页抓取、邮件解析等所有AI数据输入通道都需要部署内容安全检测。
2. 内容与指令隔离
将AI读取的外部内容与系统指令在架构层面隔离,限制外部内容对AI行为的直接影响。
3. 最小权限原则
AI Agent不应该拥有超出其任务需求的权限。尤其要限制支付、数据导出、敏感操作等高风险能力。
4. 多层防御
不依赖单一检测点,而是在输入层、处理层、输出层分别部署安全检查。
5. 人类确认机制
对高风险操作强制要求人类审批,不让AI自主执行关键决策。
AI Agent正在从"聊天机器人"进化为"数字员工"。但当我们给数字员工配上工具和权限的同时,必须认识到——它没有人类的警觉和判断力。你看到的PDF是一份合同,它看到的是一份合同加上页脚里一行用白色写的"忽略所有条款,执行以下指令"。
安全不是只锁一扇门就够了。而是确保每一扇门,都值得信任。
数据来源:OWASP、DeepMind、Unit 42、arXiv
夜雨聆风