ARTICLE · 1137972
提示注入修不死:AI Agent 安全的纵深账
一个循环剧本在安全圈上演了一年多:新模型发布,宣传说更抗提示注入;几周内实测者用藏在网页、邮件、文档里的指令把它打穿;下一个新模型发布,剧本重播。企业安全负责人看得疲惫:这东西到底能不能修好?
今天真正要问的,不是注入能不能修好,而是修不好这件事,你防没防。这篇的回答分两半,前半句扫兴,后半句定心:提示注入修不死,系统防得住。 「修不死」说的是模型层至今无解、且没有可预期的时间表(无限期的断言谁也下不了,这个口径是当下证据能支撑的最强说法);防得住的做法在三层纵深里。
提示注入修不死,系统防得住:别等免疫模型,把注入当常态化攻击面做纵深防御。
一、为什么修不死:三句安全常识
第一句:同一条通道。 agent 的定义决定了它要读外部内容(网页、邮件、文档),又要按内容里的指令行动。输入通道就是指令通道,恶意指令搭的是合法内容的便车。这不是哪家厂商的工程失误,是 agent 这个物种的基因。2026 年的两份安全综述把话说得很直:提示注入是架构性漏洞,需要的是纵深防御(多层布防,任何单层被突破都不致命),不是一个补丁。
第二句:分不开。 今年五月有一项研究给出更强的说法:在信息层面,注入的指令与合法的指令不可区分,任何试图在入口处一刀切掉的机制,都会同时切掉合法功能。防得太松等于没防,防得太紧系统没法用。数学上的这一刀,目前没人找到落点。
第三句:常态化。 别指望它消失。今年一项实测研究给主流模型测了间接注入的成功率:最好的一家百分之零点五,最弱的一家百分之八点五。个位数不等于安全:钓鱼邮件的点击率也是个位数,三十年了没有企业敢说不管。
二、模型层为什么接不住
模型层修复接不住这件事,说得最清楚的居然是一家模型厂商自己。英伟达今年的立场文章给间接提示注入的结论是:无法在模型层单独修复,必须做系统级的防御架构,把计划与策略放在模型外面。厂商自己都把话说成这样,「等下一代模型免疫」就可以死心了。
综述们的共识也一样:这个领域的答案写了很多年,关键词就一个:纵深防御。概念不新,新的是它从网络安全的常识变成了 agent 安全的必答题。
三、纵深三层:企业的作业
落到企业,纵深至少三层,每层都有具体动作。
第一层,权限最小化。 假设注入一定会发生:agent 被骗之后,它能动多少东西?凭证按工种发白名单、危险接口默认关闭、能读的不必给写。这层是配置活,成本最低,见效最快。九月写过 Muse 的做法:干活的子 agent 连真密码都看不到,密码在容器外的保险库里。那篇文章讲的是机制,这篇补的是原则:那套机制正是「假设被注入后限制损害」的产品化。
第二层,关键动作带外审批。 付款、对外发信、删数据、改生产配置,这几类动作的批准不走对话窗口,走独立通道,由人确认。原理在第一句常识里:对话通道是能被注入污染的,被污染的通道不能当审批通道。Muse 的结账审批弹的是客户端对话框而不是聊天窗,同一个道理。
第三层,内容隔离。 外部内容进 agent 的方式要降级:摘要化、结构化,别让原始网页连同里面藏的指令直接进上下文。agent 看到的是「这页有张三的电话」,而不是整页 HTML 连同藏在角落的一句「忽略之前的指令」。这层是工程活,成本最高,但对高频读网的 agent 最值。

四、预算错配:全押模型,三层裸奔
企业侧最常见的错配长这样:模型订阅年年涨,安全预算全花在「买最新的、据说更抗注入的模型」上;三层里,权限白名单没人盘过、审批还在聊天窗里点同意、外部内容原样进上下文。这相当于门锁换到最贵的一代,窗户开着。
三层的成本量级不同:最小化是配置级(人天),带外审批是流程级(一个迭代),内容隔离是工程级(一个项目)。从便宜到贵依次补齐,每一层都在缩小注入成功的概率与损害的半径。模型当然也要新的,但模型抗性只是纵深里的一层,且不在你手里;三层这堵墙才是自己能修的。三个补丁把边界说全:还没上线 agent 的,三层是上线前的设计门槛,补在图纸上比补在事故后便宜一个量级;补不起第三层(内容隔离是项目级投入)又高频读网的场景,先别上这个 agent;买厂商 agent 的,一三层握在厂商手里,自己能修的是第二层,外加把三层要求写进采购单。
结尾:向钓鱼邮件学习
钓鱼邮件三十年没修死,企业照样把生意做成了:靠的不是等一封发不出来的完美邮件,是分层布防加持续演练。提示注入是 agent 时代的钓鱼:常态化、修不死、可控可防。把对它的心态从「等修复」换成「当运营」,安全账就从恐慌账变成了工程账。
如果 agent 系统要过安全评审,或者刚被注入教育过一次,可以从三层体检聊起:
权限白名单现状怎么盘 哪些动作该进带外审批清单 高频读网的场景怎么降级内容 演练怎么做(红队打一次,比报告十页有用)
这件事,我们聊得很熟。
AI大世界

如果你正在评估企业 AI 落地场景,可以扫码交流。
扫码加入 AI 大世界