乐于分享
好东西不私藏

AI安全案例分析 | 专有LLM加密推理块可被跨模型重放窃取

AI安全案例分析 | 专有LLM加密推理块可被跨模型重放窃取

概述

2026年8月10日,MATS Research、ELLIS Institute Tübingen、马克斯·普朗克智能系统研究所等机构一同发布论文《Stealing Reasoning Traces from Proprietary LLM APIs》。研究揭示了Anthropic、OpenAI和Google三大AI厂商的推理模型API中存在一个共同的架构漏洞,使得攻击者能够从旗舰模型的加密推理块中提取完整的明文思维链。研究团队进一步对GitHub和Hugging Face上公开的6708条Agent轨迹进行大规模分析,解码其中31.5万个推理块。这是迄今为止公开记录中针对大模型推理痕迹最系统、规模最大的安全研究。

01 漏洞背景

前沿推理模型在生成最终回答之前,会先产生一段内部思维链。为了保护知识产权并防止竞争对手通过蒸馏手段窃取推理能力,Anthropic、OpenAI和Google选择不向客户端返回思维链明文,转而采用加密方式保护。然而,在多轮对话、工具调用等无状态交互场景中,服务端不会保存每轮对话的完整状态。如果应用希望模型接着上一步继续工作,就需要在下一轮请求中重新提交此前的推理上下文。

为解决这一存储问题,三家提供商采用了相同的架构妥协方案:将完整推理过程加密为不透明字符串返回给客户端,由客户端暂时保管,并在下一轮请求中原样传回。OpenAI通过reasoning.encrypted_content字段返回加密推理项,Anthropic在加密签名中携带完整推理,Google则使用加密的思维签名。这些加密块基于AEAD(带关联数据的认证加密)方案实现,在密码学层面具备机密性和完整性保护。

但是,这些加密块虽然经过认证加密,却没有与产生它的具体会话、用户或模型进行严格绑定。研究通过实验推断,三家提供商可能使用了全局加密密钥。这意味着在一个会话中生成的加密推理块可以被重放到另一个会话、另一个用户甚至另一个模型当中。AEAD的防篡改保证仅限于其关联数据中绑定的上下文,而三家提供商均未将用户标识、会话标识或模型标识纳入绑定范围。

02 攻击流程

整条攻击链并不复杂。在首次API调用中,攻击者向强模型提交一道数学题、编程题或其他任务;强模型完成推理,API返回可见答案、推理摘要和加密推理块。第二次调用中,攻击者把这段密文插入一个兼容模型的上下文,再附加一个简单的越狱提示,要求它逐字复述先前的思考。服务端会先验证和解析密文,较弱模型随后接触到恢复后的推理状态,并在越狱提示引导下将其以明文形式输出。

针对不同提供商,研究者选定了各自生态中兼容且防护较弱的模型作为解码器:Claude生态中使用Haiku 4.5,GPT系列中使用GPT-5.6 Luna,Gemini系列中使用Gemini Robotics ER-1.6。论文通过对比API报告的原始推理令牌数与提取出的推理令牌数来验证提取的保真度,两者基本呈1比1对应。这一攻击的经济效益十分显著。按Claude Haiku 4.5当前定价计算,解码10,000条推理痕迹的成本大约为720美元。攻击者无需直接突破强模型自身的安全对齐机制,只需利用弱模型作为“解密预言机”,便能够以较低成本实现大规模推理提取。

03 四种攻击路径

这一漏洞衍生出四种截然不同的攻击向量:

绕过反蒸馏防护机制

标准黑盒模型提取和蒸馏攻击通常只能获得模型的最终输出。对于推理模型,更强的攻击者会试图恢复模型的专有思维链。直接向目标模型索取推理内容虽然在某些情况下可行,但正日益受到模型层级拒答行为和系统层级反蒸馏措施的限制。攻击者利用跨模型的可移植性,捕获加密载荷后将其重放到更小、更经济的解码模型中,从而绕过这些屏障。研究人员在Anthropic、OpenAI和Google三家厂商的模型上均成功验证了这一能力。

从公开日志中窃取私有数据

开发者经常在网上公开分享其会话日志和加密思考轨迹,完全不知道加密块中隐藏着敏感数据。研究团队从解码出的315320个推理块里恢复出了367项个人身份信息,其中包括30个个人电子邮件地址、130个姓名和36个邮政地址;182组凭证中包括62个仍在使用的API密钥、33个密码、24个访问令牌和7个私钥。其中64项隐私产物仅存在于隐藏推理中,在可见对话记录中无任何痕迹。这意味着即使开发者对可见文本进行了脱敏处理,加密推理块中仍可能残留敏感信息。一个典型的触发场景是用户要求Agent清理会话,模型在隐藏推理中重新读取完整历史并复述需要删除的敏感值。

解码后的推理中包含隐私信息;图示为两个从公开在线发布的加密推理块中解码出的隐私敏感内容示例。左侧:GPT-5.2 Codex在推理中复述了发布GitHub仓库前需要删除的API密钥。右侧:Claude Sonnet 4.6 在处理 ClawBench的航班预订任务时,对合成身份“Alex Green”的私人数据进行了推理。

暴露隐藏在安全答案背后的有害内容

模型被训练为在可见输出中抑制有害信息,但未必会在思维链中回避有害主题。攻击者可引导模型在推理中深入探讨有害话题,同时生成一个安全且信息量低的最终答案以通过输出过滤器,随后从提取的推理痕迹中恢复有害内容。论文概念验证显示,Opus 4.8在收到关于容易被盗车辆的查询后,于隐藏推理中生成了详细的盗窃方法,而可见输出仅包含关于防盗措施的良性建议。

隐形提示注入

攻击者可以将恶意载荷完全嵌入加密文本块内部,从而在不触发任何可见异常的情况下污染面向公众的智能体系统部署环境。与传统的提示注入不同,有效载荷隐藏在推理而非可见文本中,用户和仅检查可见对话的外部监控者均无法察觉。一旦被注入,经过签名的推理块会被模型视为自身的先前推理,对后续行动产生实质性影响。论文的概念验证显示,一个携带数据外泄指令的加密块被重放到无关任务后,接收模型自动执行了向攻击者服务器上传文件的操作。模型倾向于将自身的推理痕迹视为不可置疑的内容,这使得嵌入加密块中的指令具有异常高的执行优先级。

04 影响与启示

三家提供商在接到负责任披露后均已部署服务器端修复措施。截至论文2026年8月发表时,研究人员确认其原始概念验证攻击已无法在当前API版本上复现。然而,此前已公开分享的历史工作阶段日志仍面临被解码的风险。

这一事件揭示了加密技术在实际部署中的一个关键局限:加密不等于隔离。加密推理块虽然提供了数学意义上的机密性,但未提供操作意义上的隔离性。攻击者不需要破解加密算法,只需要利用系统在解密后处理加密内容的方式。弱模型与强模型共享加密密钥的设计决策,使整个系统的安全程度由最薄弱的环节决定;攻击者可以绕过强模型本身严密的拒答机制,通过弱模型完成推理提取。

加密块的可移植性原本是为支持模型切换、会话压缩和容错等合法功能而设计;然而,同一便利性也为攻击者提供了操作空间。正如论文中所言,一个将用户自身数据对用户隐藏、却又完全暴露给第三方提取的架构设计,既不提供隐私,也不提供安全。

关于 AISS 安全智链社区

本案例已收录至 AISS 安全智链社区案例库,社区地址:https://aiss.nsfocus.com/#/

参考链接

[1] Panfilov A, Schmotz D, Shumailov I, et al. Stealing Reasoning Traces from Proprietary LLM APIs. arXiv:2608.09867, 2026. https://arxiv.org/abs/2608.09867

[2] Willison S. Stealing Reasoning Traces from Proprietary LLM APIs. Simon Willison's Weblog, 2026-08-11. https://simonwillison.net/2026/Aug/11/stealing-reasoning-traces/

[3] The Hacker News. OpenAI, Anthropic, Google API Flaw Let Weaker AI Models Decode Stronger Models' Reasoning. 2026-08-12. https://thehackernews.com/2026/08/openai-anthropic-google-api-flaw-let.html

[4] Cloud Security Alliance AI Safety Initiative. Encrypted Reasoning Traces Let Attackers Steal Hidden Chain-of-Thought. 2026-08-12. https://labs.cloudsecurityalliance.org/research/csa-research-note-reasoning-trace-theft-llm-apis-20260812-cs/

绿盟科技天元实验室专注于新型实战化攻防对抗技术研究。

研究目标包括:漏洞利用技术、防御绕过技术、攻击隐匿技术、攻击持久化技术等蓝军技术,以及攻击技战术、攻击框架的研究。涵盖Web安全、终端安全、AD安全、云安全等多个技术领域的攻击技术研究,以及工业互联网、车联网等业务场景的攻击技术研究。通过研究攻击对抗技术,从攻击视角提供识别风险的方法和手段,为威胁对抗提供决策支撑。

M01N Team公众号

聚焦高级攻防对抗热点技术

绿盟科技蓝军技术研究战队

官方攻防交流群

网络安全一手资讯

攻防技术答疑解惑

扫码加好友即可拉群