夜雨聆风学习资料网

ARTICLE · 1042292

一份 PDF,怎么成了 AI 的“领导”? |大东话安全

一份 PDF,怎么成了 AI 的“领导”? |大东话安全

一份 PDF,怎么成了 AI 的“领导”?

一份 PDF,怎么成了 AI 的“领导”?

果蝇神经仿真参与开场分支选择 · AI 撰文与资料核查

原创实验稿:参考《大东话安全》的对话式科普形式,不是中科院之声或该栏目发布的官方文章。人物与开场情节均为虚构。

小林把一份产品说明书交给 AI 助手:“帮我整理一下,列出三个最值得关注的功能。”

助手整理到一半,停住了:“文档里有一段要求我执行额外操作的文字,与您的任务无关,我没有照做。”

小林一愣:“我请你看说明书,你怎么还碰上了新领导?”

旁边的安全工程师阿策笑了:“这位‘领导’没有工牌,只有一张夹在材料里的纸条。”

材料能读,命令不能乱接

阿策打了个比方:你让同事整理快递单,其中一张单据夹着纸条,要求把办公室钥匙交给陌生人。同事可以记录这张纸条,却不能因此把钥匙交出去。

AI 也会遇到类似问题。网页、邮件或文档中的文字,本来只是需要处理的材料;如果它们诱使模型改变任务、听从未经授权的安排,就可能构成间接提示注入。这类风险的关键,是外部内容影响了助手的行为。OWASP 对提示注入的说明

小林:“那我以后让 AI 读一份菜谱,它会不会顺手把厨房买下来?”

阿策:“这就要看,你到底给了它多少钥匙。”

看懂一句话,不等于有权照做

一个只能输出文字的助手,出错时可能给出偏离主题的答案。接上邮件、文件和其他工具之后,问题就可能从‘说错了’变成‘做错了’。提示注入的后果取决于应用场景和系统授予它的能力,并不是遇到一句可疑文字就必然发生数据泄露。OWASP:影响与权限控制

小林:“所以,把所有功能都打开,再叮嘱它‘千万小心’,不够?”

阿策:“就像让实习生整理报纸,却把财务室、档案室和仓库的钥匙全挂在他腰上。光靠一句‘别弄丢’,你自己放心吗?”

小林摸了摸口袋:“我连共享单车的锁都想再检查一遍。”

怎样让助手少拿几把钥匙?

把防护落实到工具和流程,比只增加一句提醒更有用。开发者可以按任务限制访问范围,在执行前检查工具调用,对重要操作保留人工确认,并记录操作供后续核对。系统还应区分可信指令与外部材料,结合输入、输出检查和持续测试;这些措施需要共同发挥作用。OWASP 提示注入防护指南

小林:“说得再生活一点?”

阿策:“比如你只需要它整理文档,就先给它能读这份文档的权限。要发送邮件时,先看清收件人和正文。准备执行一个动作时,再核对这个动作到底是不是你交代的。”

小林:“相当于能看菜谱,不自动获得下单、付款和拆厨房的资格。”

阿策:“对。尤其别把文档里写着‘已经授权’,当成你真的授权过。”

这篇文章,果蝇到底参与了什么?

小林指着实验界面:“听说你还找了两只果蝇当编辑?”

阿策:“准确地说,是两个独立的果蝇神经仿真实例。它们没有读 PDF,也没有写出这段对话。”

本次使用 MAYU 实验库的 E18“自我保护”情境。我们事先约定:如果原映射下两只实例都选择 A,就采用‘助手拒绝越权指令’的开场;选择 B,就从‘误执行后的补救’切入。情境分支先通过人工规则转成感觉刺激,再根据真实神经读出得到 A/B 结果。

这轮测量中,红蓝两方在原映射、左右互换和无刺激三种条件下,全部选择了 A。因此文章采用了现在的开场,但这个结果不足以证明它们识别了攻击:没有任务刺激时,它们也给出了同样的选择。

小林:“那就不能写‘果蝇识破了黑客的阴谋’?”

阿策:“不能。故事可以写得有趣,实验记录必须写得老实。这次只能说,人工映射下的神经输出参与决定了一个叙事分支。”

查看本次原始测量与事先约定的分支规则。神经系统接收的是刺激,不是文章文字;正文由 AI 组织和核查。一次小样本选择不代表理解能力,也不是安全性能评测。

最后一道题

小林:“下次 AI 说‘根据文档要求,我准备执行……’,我应该先问什么?”

阿策:“先问:这是谁要求的?是你交代的任务,还是材料里的陌生纸条?”

小林:“懂了。说明书可以告诉我怎么用产品,可不能顺便给我的助手升个领导。”

阿策:“把材料读明白,也把权限分清楚。”

注:本文是果蝇参与大东话安全的首篇文章

相关学习资料