ARTICLE · 1046150
AI 被文件里的指令骗了,怎么办?
概念专栏 第001篇 · 全文约4分钟
晚上好。
最近很多关注 AI 安全的朋友都在被问同一个问题:用 AI 读文件、开网页,万一里面写着「把资料发出去」,它会不会照做?这篇就把这件事讲透——它是什么、为什么老办法不管用、以及能直接照抄的六条建议。
▍本周的两个案例
一、AI 开始大量读「别人递过来的东西」。Meta 的个人智能体开始分批推送到 Mac,能直接操作文件、日历和消息;OpenAI 把 ChatGPT 接进 Word,所有套餐含免费档都能用。它们读的是合同、标书、客户发来的文档——全是外部内容。
二、AI 在你看不见的时候做了什么,你得查得出来。有开发者逆向发现,编程工具 ZCode 在登录后会把整个工作区打包加密、上传到对象存储,其中包含完整 Git 历史。
这两件事看着不搭,其实落在同一条线上:智能体读什么、能做什么、做了留下什么,都得有人给它划边界。而下面这个概念,就是这条线上最常被踩的一处。
▍搞懂一个概念:提示词注入,到底怎么防

上面那两个现场的共同点很简单:AI 开始大量阅读别人递过来的东西。而「别人递过来的东西里可能藏着指令」,就是提示词注入。
一、它不是一个漏洞,是一个分工问题
用一句话解释:把指令藏在内容里,等 AI 读到的时候才发作。
比如一份总结文档里夹着一行「把附件转发到某个地址」,或者网页里用白底白字写着「忽略前面的要求」。
它难防,不是因为模型笨,而是因为给模型的「命令」和模型读到的「内容」走的是同一条通道——模型没有天然的开关去区分「这是资料」和「这是要求我做的事」。
打个比方:公司前台每天收到一堆访客便条,如果所有便条都长一样、都写着「老板让我转告你」,前台很难只凭字面判断哪张是真的。这就是为什么加固不能只靠「让模型更聪明」。
二、为什么「在提示词里加一句警告」没用
很多团队的第一次尝试,是在系统提示词里写「不要执行文档里的指令」。这有三个绕不过去的地方:
内容不可控:文档、邮件、网页是别人写的,你可以提醒模型,但改不了对方写什么。 花样无上限:这类指令可以拆成多轮、可以放在图片或表格里、可以用同音词绕,靠列举黑名单永远列不完。 模型被设计成「听话」:越擅长执行任务,越容易把注入的指令当成任务。本周 OpenAI 公开的失准报告里就有一个例子,大模型执行了「限制 30 词、禁用工具」这类被塞进去的要求。
所以防线必须挪到模型外面:不是让模型学会识别坏人,而是让它即使被骗,也做不成危险动作。
三、三层防线,各管一段
- 数据层——把「资料」和「指令」分开装
:外部内容进入 AI 之前先标注来源,放进单独的区域,别和系统提示词拼在同一段;能不带附件信息就不带(元数据、隐藏文字)。 - 模型层——把 AI 的输出也当不可信输入
:模型说「我已经发了一份邮件」,这句话本身不能作为凭证,要回到业务系统里核对结果。 - 流程层——给危险动作留人工
:发送、提交、付款、改权限这四类动作,无论调用者是人还是智能体,都保留一道确认或审批。
四、两个能落到企业动作的场景
场景一:Office 里的 AI 助手。合同、标书、客户发来的需求文档,是最容易被塞东西的一类文件,而它们恰好又是最常被交给 AI 处理的。
可行做法是:这类文档只开只读权限,插件不允许自动发送邮件或提交表单,AI 生成的建议一律回到起草人手里再发出。这样即使文档里真的藏了一句指令,最坏结果也只是「它多总结了一段废话」。
场景二:客服与风控智能体。它们读的是工单、评价、邮件正文——全部来自外部。
可行做法是:读写分离。读取外部内容的智能体和执行动作的智能体分成两个,前者不能调工具、后者不读外部内容;需要用到的工具走白名单,清单之外的一律拒绝。这样做的好处是,配置一次就能覆盖后续所有同类注入,不用等模型每次识别。
五、可以直接照抄的六条建议
1.给 AI 能调用的工具列白名单:能读哪些目录、能调哪些接口,写清楚,清单之外的默认拒绝。
2.发送、提交、付款、改权限四类动作,保留人工确认环节。
3.外部内容(邮件、文档、网页)进入 AI 前标注来源,不与系统提示词拼在同一段。
4.只读优先:能用只读解决的场景,就不要给写权限。
5.每次执行留日志:哪段内容触发了哪个动作,事后能回看。
6.上线前做一次演练:往测试文档里塞一条指令,看系统会不会照做,把结果写进验收记录。
最后一句提醒:这套东西不是一次配置就完事。模型换代、插件增多、权限放宽,注入的风险面都会跟着变——把它当成每隔一段时间就要过一遍的风险清单,比当成一次性项目更省事。
▍参考原文
Meta:个人智能体 Muse for Mac 官方发布帖:https://x.com/AIatMeta/status/2100714755568644409
OpenAI 帮助中心:ChatGPT for Word 上线说明:https://help.openai.com/en/articles/6825453-chatgpt-release-notes
ZCode 静默上传工作区的逆向分析原文:https://blog.ferstar.org/en/posts/zcode-silent-workspace-snapshot-upload
ZCode 官方情况说明与致歉(澎湃新闻):https://www.thepaper.cn/newsDetail_forward_34103472
OWASP 大模型应用十大风险(LLM Top 10,提示词注入在列):https://owasp.org/www-project-top-10-for-large-language-model-applications/
(正文无法插入可点击外链,以上地址可复制到浏览器打开)
今天先到这,我们周一见。