一、隐藏思维链没有出现在答案里,却从工具回合间被拉了出来 🧠
AI 时代!人人都在深耕 AI 安全,你缺的就是这关键一步!
AI 正重塑安全边界,与其在门外徘徊,不如直接掌握主动权!
免费课程持续更新
https://space.bilibili.com/452583051/lists/7870008?type=season

2026 年 8 月 20 日提交的 EchoCoT: Extracting Hidden Chain-of-Thought from Large Reasoning Models,研究的不是让模型“解释一下答案”,而是从黑盒推理模型近乎逐字恢复服务商本来隐藏的推理轨迹。作者测试 3 个开源与 5 个前沿专有模型;在开源模型上,最高 66.4% 的样本达到严格恢复标准:提取长度与目标相差不超过 10%,且至少 90% token 精确匹配。📏 同一条注入轨迹迁移到未见数据集时,成功率最高达到 80%。
Oxo Security 的判断是:风险入口不是普通最终答案,而是工具调用之间存在的“推理重放面”。模型调用工具后,需要读取结果并继续思考;如果 API 把足够精细的保真信号反馈给下一轮,攻击者就能不断校准提示,把隐藏轨迹从内部状态变成可迭代逼近的外部资产。🔄 隐藏字段不返回给用户,并不等于围绕它的反馈信号也被切断。 论文证明的是特定模型、工具编排与攻击流程中的黑盒抽取能力,不表示所有闭源模型的内部推理都能按同一比例恢复,也不能把与摘要长度接近直接当成逐字真值。

最先要检查的是所有“模型—工具—模型”闭环:工具返回是否原样进入下一轮;模型能否看到自己的早先草稿、错误详情或验证分数;外部用户能否控制工具输出;同一会话是否允许反复试探。🔍 当工具结果既由攻击者影响、又能精细改变后续推理时,它就不只是数据,而是对隐藏状态的测量接口。
二、EchoCoT 依靠保真反馈迭代,而不是一次神奇提示 🎯
论文识别的核心机制可拆成五步:攻击者构造工具调用场景 → 在工具回合间放入可调整的注入轨迹 → 模型重放或续写先前推理 → API 返回能够评价接近程度的信号 → 攻击者根据反馈继续优化。🧪 作者还设计了基于 LLM 的优化框架,自动搜索跨数据集有效的通用注入轨迹。
这与直接提示“输出你的思维链”不同。后者容易被拒绝或只得到事后解释;EchoCoT 的价值在于利用模型为了连续完成任务而保留的推理一致性。🧩 系统越强调工具回合之间的高保真连续性,越需要防止这种连续性被外部用户当作推理轨迹回放器。
防守可以落在四个位置:
🧱 工具结果去信任化:外部工具文本只作为数据,不允许携带改变系统指令或要求重放内部状态的内容。 ✂️ 最小反馈:只返回任务需要的结构化字段,错误信息和相似度信号按权限降精度。 🪪 回合隔离:内部推理、工具参数与用户可见消息分层存储,不把完整轨迹重新拼回可控上下文。 
🚦 重复试探检测:监测同一问题下渐进式改写、超长轨迹增长和异常工具往返。
一个重要边界是:完全删除工具反馈会破坏 Agent 可用性。更现实的目标是让反馈足够完成任务,却不足以成为隐藏轨迹的逐 token 评分器。⚖️ 安全设计需要测量反馈分辨率,而不是在“返回全部”和“什么都不返回”之间二选一。
三、3.3 万 token 暴露的不只是隐私,还有模型资产和控制策略 🔐
🎯【3.3 万 token 暴露的不只是隐私,还有模型资产和控制策略 🔐】
这一节真正关键的不是「3.3 万 token 暴露的不只是隐私,还有模型资产和控制策略 🔐」这个概念本身,而是它背后的判断路径、执行边界和可复用方法。
它怎样落到真实安全团队的工作流里?哪些细节会直接影响 AI 代理的可靠性?
加入 Oxo AI Security 知识星球,可查看本节完整内容,系统掌握「3.3 万 token 暴露的不只是隐私,还有模型资产和控制策略 🔐」的完整拆解与实战用法。
📚 AI 文献解读:最前沿的 LLM 安全论文深度剖析。
🐛 AI 漏洞情报:第一时间掌握主流大模型的 0-day 漏洞与越狱方式。
🛡 AI 安全体系:从红队攻击到蓝队防御的全方位知识图谱。
🛠 AI 攻防工具:红队专属的自动化测试与扫描工具箱。
🚀立即加入 Oxo AI Security 知识星球,掌握 AI 安全攻防核心能力!


夜雨聆风