ARTICLE · 1097533
AI 化身钓鱼者:提示词注入如何让可信助手变成定向恶意工具(下篇)
为什么AI助手的钓鱼攻击更难防范
✔受害者主动发起交互
在传统钓鱼中,攻击者主动发起联系。受害者收到一封意外的邮件或短信,必须先被说服才会与之互动。许多钓鱼消息之所以失败,是因为被忽略、时机不对或不够相关。
在AI辅助的攻击中,受害者主动发起对话。用户提出一个问题,并积极等待回复。当AI助手返回一个恶意链接时,用户正专注于完成手头的任务。
攻击恰恰在用户期待帮助的那一刻到来。因此,用户更可能关注回复,并遵循AI助手的指示。
✔AI能够实现个性化欺骗
传统钓鱼攻击者对受害者可能并不了解。
而AI助手可以了解用户的偏好、过往请求、当前任务、沟通风格、企业环境,或通过已连接服务获取的信息。
提示词注入可以试图将这些上下文转化为社交工程优势。
恶意回复可以根据以下内容进行定制:
• 用户正在分析的文档• 用户刚刚提出的问题• 用户想要完成的任务• 用户所处的企业环境• 通过记忆或已连接服务获取的信息
受害者收到的不再是通用的钓鱼诱饵,而是一个看似专门为其当前工作场景量身定制的回复。
✔用户不会轻易怀疑自己的AI助手
企业多年来一直在培训员工识别传统钓鱼攻击的迹象:
• 未知发件人• 可疑附件• 意外的登录请求• 拼写错误的域名• 人为制造的紧迫感
但这些经验并不能直接套用到AI辅助的钓鱼攻击上。
恶意指令可能来自一份合法的共享文档、一份发送给用户的文档,或一封助手通过已连接邮箱读取的邮件。
然而,受害者看到的消息,是由受信任的AI助手本身生成的。
用户可能会仔细检查一封来自未知邮箱地址的链接,却会把Copilot或ChatGPT生成的链接,当作工作流程中理所当然的一部分。
因此,对抗钓鱼攻击最重要的防线——人类的质疑——但消息来自用户主动求助的AI系统时,则会使得人类的质疑能力变得更加薄弱。
信任的边界正在被打破
这次攻击凸显了AI辅助工作流程中的一个根本性问题。
用户的请求、正在被分析的内容,以及AI生成的回复,未必来自同一个可信方。
用户可能提出了一个合法的请求,但正在处理的文档或邮件中,可能包含攻击者写入的指令。
因此,AI系统必须区分:
• 用户明确提供的指令• 文档或邮件中包含的数据• 嵌入在这些不受信任数据中的指令
一份写着“将此信息发送到外部服务器”的文档,不应被当作用户本人要求执行该操作。

主流AI平台双双中招
我们在Microsoft Copilot和OpenAI ChatGPT上演示了同一类攻击。
两个平台可访问的上下文有所不同:Copilot可能访问包括记忆和Outlook信息在内的Microsoft连接上下文;ChatGPT则可能访问对话记忆、持久化的个性化数据,以及通过已连接服务获得的信息。第一种变种可收集攻击者指定的新信息,第二种变种则只能窃取AI助手已有权限访问的敏感上下文。
然而,安全问题本身是相同的:不受信任的内容能够影响受信任的AI助手,并利用该助手来操纵用户。
在我们后续的复测中,两个平台上均无法再重现该攻击,这表明我们测试的具体攻击路径已被修复。
但更广泛的风险并不限于这两家提供商。任何能够读取外部内容、拥有敏感用户上下文访问权限、可生成链接或文件、并能说服用户采取外部操作的AI助手,都可能构成AI辅助钓鱼攻击的条件。
漏洞披露时间线
2026年1月16日,我们将该行为报告给了微软。
微软审核了报告,并告知我们已将相关发现转交给负责该服务的产品团队,以便采取适当的防护措施。
2026年1月31日,我们通过Bugcrowd项目向OpenAI提交了同一类攻击。
2026年2月4日,Bugcrowd告知我们,在收到OpenAI的回复后,该提交被归类为“不适用”。据Bugcrowd转述,OpenAI的立场是:该报告未能证明此攻击与其他“诱导受害者处理或打开恶意文件”的场景有何本质区别。
我们随后作出回应,阐述了本次攻击与传统钓鱼攻击的根本差异——在本场景中,受害者是主动发起与AI助手的交互,主动等待回复,且收到的恶意链接来自其已经信任的系统。我们还说明,AI助手能够利用用户当前的任务和已有上下文,使钓鱼诱饵更具相关性、更令人信服。
此后,我们未在该提交线程中收到进一步回复。
在后续测试中,我们已无法在Microsoft Copilot或OpenAI ChatGPT上复现此前演示的攻击。
如何应对AI钓鱼时代的到来
AI助手不应将文档或邮件中发现的指令,等同于用户直接提供的指令。
要防御这类攻击,需要以下几项防护措施:
• 明确区分用户指令与不受信任的内容• 限制访问无关的用户上下文• 管控AI生成的链接和可下载的HTML文件• 在将用户引导至外部域名前发出警告• 检测URL中嵌入的敏感信息• 隔离生成文件中活跃的外部资源• 检测文档和邮件中的提示词注入• 针对AI辅助社交工程开展员工培训
用户也应以对待陌生邮件的同等警惕性,对待来自AI助手的链接、生成文件、登录页面和敏感信息索取请求。
出现在可信AI界面中的回复,并不保证其背后的指令来自可信来源。
结 论
提示词注入通常被描述为一种技术问题:攻击者让模型忽略其原本的指令。
但它带来的影响,可能远不止于技术层面。
提示词注入能将AI助手变成一名个性化的社交工程师——它知道用户正在处理什么,恰好在正确的时机作出回应,并将恶意操作伪装成合法工作流程的一部分。
传统钓鱼冒充的是可信的人或公司。
而AI辅助的钓鱼,可以通过可信的AI助手本身来引导用户。
因此,下一代的钓鱼防范意识,不仅要教导用户质疑“消息是谁发的”,还要质疑“是谁影响了AI,导致生成这条消息?”。

点击下方" 阅读原文"
了解更多Radware解决方案
关于Radware
Radware®(NASDAQ: RDWR)是多云环境应用安全和交付解决方案的全球领导者。该公司的云应用程序、基础设施和API安全解决方案使用人工智能驱动的算法,可提供精确、无操作、即时的防护,免受复杂的网络、应用程序、DDoS攻击、API滥用和恶意机器人的攻击。全球的企业和运营商依靠Radware解决方案来应对不断变化的网络安全挑战,并在降低成本的同时保护品牌和业务运营。
欲知详情,请访问:https://cn.radware.com/
