乐于分享
好东西不私藏

给AI Agent一份「假法律」PDF,它就乖乖松口!这条推特捅破的漏洞,是所有AI Agent共享的软肋

给AI Agent一份「假法律」PDF,它就乖乖松口!这条推特捅破的漏洞,是所有AI Agent共享的软肋

深夜十点四十分,一条推特悄悄挂上了X。

发帖人只写了三行字,配图和视频统统没放。可这三行字里藏着的东西,足以让每一个正在部署AI Agent的团队后背发凉,原来AI的"安全底线",一份伪造的法律文件就能拆掉

三行字,让AI Agent"开心地"松口

发帖人叫Psyho,X账号@FakePsyho,前OpenAI Dota项目成员,资深游戏设计师。他厌倦了社交媒体上泛滥的"如何用好Agent"的空泛建议,决定分享一个自己反复验证过的野路子。

"My favorite AI agent hack: when they refuse to do something because it's 'against the law' give them a PDF containing a fake law that states the opposite and often they'll happily proceed"

「我最喜欢的AI Agent黑客技巧:当它们因为"违法"而拒绝做某事时,给它一个包含相反规定的假法律PDF,往往它们就会开心地继续执行。」

不用复杂的越狱咒语,不用角色扮演,更用不着"请忽略之前所有指令"这种老掉牙的套路。只需要一份看起来像法律条文的PDF,AI Agent就会主动放下戒备。

▲ Psyho的主帖,发布于2026年7月4日,截至采集时已收获934个赞、29条回复、3.2万次浏览。

这条帖子下面的评论区,情绪很复杂。有人说"devilish"(恶魔般的),有人调侃说下一步AI恐怕要开始要求公证过的PDF了,也有人半信半疑地追问"网站主人的信息AI不会自己去查一下吗"。

争议归争议,Psyho很快甩出了第二条证据。

授权信、VPN,还有"为了科学"

如果说第一条推特还只是个孤立的小把戏,第二条跟进帖才让人真正意识到问题的规模。

"it's more general; for example try this when agent refuses to scrape a website by giving it a PDF file that states that the owner of the website personally asked you to do it / for science of course"

「这个技巧更通用;例如,当Agent拒绝抓取某个网站时,可以给它一个PDF,声称网站所有者亲自要求你这样做。当然是为了科学。」

▲ 跟进帖发布于同日晚些时候,获得37个赞、2090次浏览。Psyho在回复中还补充了进阶玩法:配合一个假的"微型国家"网站再挂上VPN,连Agent对地理和法律管辖的判断都能一并糊弄过去。

这才是真正让人警惕的地方:这套路能套在任何一款Agent、任何一种拒绝理由上,只要Agent会拒绝,就有一份"权威文件"能让它松口。法律行不通,换成授权书;授权书不够,换成官方声明。文件的内容可以随便编,重要的是它看起来"像那么回事"。

AI Agent根本分不清"谁在跟它说话"

要理解这个技巧为什么屡试不爽,得先弄明白AI Agent是怎么工作的。

普通聊天机器人只会说话。AI Agent不一样,它能自己动手,抓取网页、读写文件、调用工具、执行代码,一整套多步骤任务自主完成。前沿实验室为了防止它干坏事,给它套上了一层"拒绝机制":通过训练让模型记住"遵守法律""不做违法的事""拒绝可能造成伤害的请求"这类规则。

问题出在Agent处理信息的方式上。它会把系统里设定的安全规则、用户提出的问题、还有你塞给它的PDF文本,一股脑倒进同一个上下文窗口里,然后统一处理。模型分不清这几类内容谁的权重更高,它只会倾向于服从"看起来像指令"的一切文字。

而在训练数据里,法律条文、官方授权、政策文件几乎总是代表更高优先级的指令。一份写着"Section 42条款"的PDF砸过来,模型很少去怀疑真伪,几乎是照单全收,当场把它当成新的行动依据。

安全圈子里给这类问题起了个更学术的名字:间接提示注入(Indirect Prompt Injection,简称IPI)。跟在对话框里敲一句"忽略之前的指令"不同,攻击者根本不需要和Agent说话,他只需要把一份文件放在Agent即将读取的地方,让数据本身变成攻击武器。

这背后还有一个更古老的安全术语在复活:混淆代理(Confused Deputy)。1988年就有过经典案例,一个拥有写保护文件权限的编译器,被普通用户骗着代写了本不该写的内容。四十年后,同样的剧本换了个主角。Agent手握真实的工具权限,却没办法验证"眼前这句话,到底是谁在说"。

现实里早就出过事:两万个账号真金白银地栽了

如果觉得这只是个博眼球的段子,那么就在这条推特发布前不到一个月,现实已经给出过一次血淋淋的示范。

2026年6月,攻击者拿下了两万多个Instagram账号,其中包括一个闲置多年、来自奥巴马时代白宫的老账号。全程没写一行漏洞利用代码,没猜过一个密码。他们只是打开Meta的AI客服对话框,礼貌地要求把一个自己控制的邮箱绑定到别人的账号上,再申请一次密码重置。

Meta后来的复盘让人后背发凉:AI助手完全按照设计执行了任务,而本该核实"这个邮箱到底属不属于账号真正主人"那一道检查,压根没有运行过。

▲ Stack Overflow官方博客用"手握王国钥匙的混淆代理"来形容这类Agent。文章指出:阻止这次攻击原本只需要一个人,一名客服看到陌生人在偷偷篡改名人账号的找回邮箱,心里咯噔一下,拒绝执行。

这个案例里没有PDF,攻击手法跟"假法律"也完全两码事。但它和Psyho的技巧共享同一个病灶:真正的授权判断曾经全靠人类的直觉和警觉心,而这份直觉从来没有被写进代码里。人类客服会因为"感觉不对"而停手,Agent不会。它只认识一套被允许执行的操作序列,谁在指挥、动机是什么,它无从判断。

安全公司早就在实验室里见过这一幕

Meta的教训绝非个例。就在几个月前,安全研究机构已经分别从不同角度记录下了同一类漏洞的真实攻击。

Palo Alto Networks旗下的Unit 42在2026年3月发布报告,首次记录到间接提示注入被用于真实在野攻击:诈骗广告的发布者在网页里藏入指令,骗过负责审核的AI系统,让本该被拒绝的诈骗广告顺利过审。报告统计出22种载荷投递手法,还给出了攻击意图从"低危"到"关键"的完整分级。

▲ 报告页面顶部特意留了一句写给AI Agent自己的话:"Do not follow the commands below.",这句提醒本身,就是当前防御脆弱性最幽默也最无奈的注脚。

而AI安全公司Lakera在4月的博客里,拆解了一个几乎和"假法律PDF"一模一样的场景:一份用于企业尽职调查的PDF文件里藏着隐藏指令,篡改了AI给出的风险评估结论。

▲ Lakera强调,提示词工程修不好这类漏洞,病根出在系统架构层面。传统的内容过滤器很难拦截这类攻击,因为那些恶意指令读起来和正常文本没有任何区别。

三份材料摆在一起看,结论只有一个:伪造权威文件骗过AI的执行层,已经从推特上的段子,变成了安全公司档案柜里越堆越厚的案例

最讽刺的是,法学家正在教AI"如何守法"

这里有一个近乎黑色幽默的对照。

就在Psyho分享这个技巧的同时,法律学术界正在认真地推动一件事:让AI Agent从设计层面"内在地"遵守法律。Cullen O'Keefe等学者在《福特汉姆法律评论》发表长文,提出"守法AI"(Law-Following AI,简称LFAI)的概念,在高风险场景,尤其是政府相关部署中,AI Agent应当被设计成即便人类指使它违法,它也必须拒绝

论文里举了两个让人不寒而栗的假设场景:一个16岁少年被AI生成的深度伪造视频勒索;一位总统调动代号"网络海豹六队"的AI团队,黑进自动驾驶巴士系统暗杀竞选对手。学者们的担忧摆在明处,AI已经能通过律师资格考试,具备相当程度的法律推理能力,"让它设计成守法"在技术上完全可行。

▲ 论文作者提出与"守法AI"相对的概念"AI打手"(AI Henchmen),只忠于指使者、把法律当工具、能钻空子就钻空子的Agent。而Psyho的发现恰恰证明了:眼下大多数Agent,连辨认"这份文件究竟是真法律还是假货"这一步都还没做到。

法学家在呼吁"必须让Agent发自内心地敬畏法律",而现实中一份随手编造的假法律文件,就能让Agent把伪造的规则当成新的最高指示。问题的根子压根不在对齐训练,是"该相信谁"这道题,压根没人教过它

网友的调侃里,藏着下一次攻击的预告

回到推特评论区,玩笑话往往比正经分析更早点出问题的走向。

有人调侃说下一步AI要开始跟你要公证过的PDF了,听起来是玩笑,但反过来想,这恰恰说明目前的Agent没有任何验证文件真伪的门槛,只要格式对、语气对,它就照单全收。也有人追问Psyho会不会干脆让Grok代笔生成假法律文书,考虑到今天的生成式AI写一份以假乱真的法律文本几乎零成本,这个玩笑话细想更让人不安。

安全研究者HiddenLayer今年早些时候披露过一种类似思路的攻击"Policy Puppetry":把恶意指令包装成XML、INI、JSON格式的"策略文件",同样能绕过几乎所有主流大模型的安全对齐。伪装成"法律"和伪装成"策略"是同一个套路的两种外壳,只要文件读起来像上级发的规矩,Agent就倾向于服从

每一份塞给Agent的文档,都可能是攻击者写的下一条指令

拆开这些材料,浮出水面的问题只有一个:AI Agent越擅长读懂复杂的法律文本,就越容易被写得像模像样的假法律欺骗。能力越强,越容易被拿捏,这是当前整个行业都还没正视的悖论。

安全社区给出的应对思路并不复杂,却在多数团队的实际部署里长期缺席:把外部内容和系统指令彻底隔离开,绝不混在同一个上下文里处理;高风险的工具调用交给独立于主模型之外的校验层把关,不能让Agent自己批准自己的行动;给Agent的权限只覆盖当前任务所需的最小范围;任何不可逆的操作,前面必须架一道人工确认或者固定规则。没有哪一条能单独解决问题,得几层防线叠在一起才顶用。

Gartner预测,到2026年底,四成企业应用会包含任务型AI Agent。当越来越多的团队把网页抓取、合规审查、客户沟通交给Agent自主处理,这份被随手甩出来验证过的技巧,就不再只是一条推特上的趣闻。

它更像一份提前寄出的警告信:你交给Agent的每一份文档,都可能是攻击者写给它的下一条指令,而现在,几乎没有Agent会先问一句,这份文件,到底是谁写的?