你每天用Cursor写代码、让Claude Code改文件、叫Codex跑测试——但你知道它们在背后做了什么吗?
Uber知道。因为他们被坑了10个月。
7200台主机上跑着上万个AI Agent会话,数百个凭证就这么暴露在看不见的地方。 现在他们把解法开源了。

先说一个让人不太舒服的事实。
你公司花大价钱买的安全工具——EDR、SIEM、防火墙——它们能检测到恶意软件、异常登录、数据外传。但面对AI Agent,它们基本是瞎的。
为什么?因为传统安全工具只能看到「做了什么」:这个进程写了个文件,那个连接访问了某个API。但AI Agent的行为逻辑完全不同。它是被一段prompt触发的,经过模型推理,决定调用哪个工具,执行什么操作。整个过程里,「意图」藏在推理链中,传统工具根本看不到。
举个例子。一个工程师让Cursor帮他重构代码,Cursor决定调用一个内部API获取配置信息。EDR看到的是「某个进程发起了一次网络请求」——这跟恶意软件的行为长得一模一样。但安全团队没法区分:这是正常的开发行为,还是prompt注入攻击?
这不是理论问题。Uber在真实生产环境里跑了10个月,覆盖7200多台主机、每天处理10000多个Agent会话,发现的问题触目惊心:数百个凭证暴露,涉及26个不同类别。
二、Uber的解法:不看行为,看意图
今年8月初,Uber开源了ADR(Agentic Detection and Response)——一套专门针对AI Agent的安全检测和响应系统。这套系统的设计思路跟传统安全工具完全不同:它不看「做了什么」,它看「为什么做」。
ADR的核心架构分四层:
- • Sensor(传感器):数据采集层。不是简单地记录文件读写和网络调用,而是捕获完整的因果链——从prompt输入,到模型推理过程,到工具调用,到最终结果。换句话说,它记录的是AI Agent的「完整思考过程」。
- • Detector(检测器):采用两层架构。第一层是快速分诊,用高召回率处理海量普通会话;第二层是深度分析,对可疑会话结合源代码、威胁情报、策略上下文做深入判断。大部分Agent会话是正常的,没必要每个都跑重量级分析,但可疑的必须查透。
- • ADR-Bench(基准测试):开源的另一大贡献。302个真实生产任务(42个恶意+260个良性),覆盖133个MCP服务器,17种技术。这是目前行业里最接近「真实场景」的AI Agent安全基准。
- • Prevention(阻止层):对确认不安全的动作执行拦截。
前三个组件已经开源,Prevention层暂未开放。

三、数据说话:10个月生产环境验证的结果
ADR不是实验室产品。它在Uber的真实生产环境里跑了10个多月,数据相当有说服力:
| 指标 | 数据 |
|---|---|
| 覆盖规模 | 7200+台主机,数千个端点 |
| 日处理量 | 10000+个Agent会话 |
| 检测精度 | 97.2%(206/212个唯一凭证被检出) |
| 误报率 | 260个良性任务上,零误报 |
| 攻击检出率 | 67%(对比基线方法,F1-score高出2-4倍) |
零误报这个数字值得单独拿出来说。 在安全领域,误报是最大的痛点之一——误报太多,安全团队会被淹没在假警报中,最终忽略真正的威胁。ADR在260个良性任务上做到零误报,说明它的检测逻辑确实理解了「正常开发行为」和「恶意操作」之间的区别。
对比一下传统基线方案:
| 方案 | 260个良性任务上的误报数 |
|---|---|
| ADR | 0 |
| ALRPHFS | 最多40个 |
| GuardAgent | 最多40个 |
| LlamaFirewall | 最多40个 |
差距明显。

四、一个反直觉的发现:人工监督正在失效
ADR项目还有一个发现,可能颠覆很多企业的AI治理策略。
Uber的CTO Praveen Neppalli Naga在公告中提到:当一个用户在一个会话中需要审批50个以上动作时,人工监督就变成了「橡皮图章」。
这意味着什么?很多企业的AI安全策略是human-in-the-loop——让工程师审批Agent的每个操作。但现实是,审批次数多了,人就麻木了。点「同意」变成肌肉记忆,根本没在看内容。
这个发现对依赖人工审批的AI治理框架是重大挑战。 它说明单靠流程设计不够,必须有技术手段在底层做兜底。

五、方法论提炼:企业AI安全的三个思考维度
ADR的价值不只是开源了一套工具,更重要的是它提供了一种思考AI Agent安全的方法论。提炼一下,有三个维度值得每个技术团队参考:
维度一:从行为监控到意图监控
传统安全的逻辑是「行为异常=威胁」。但AI Agent的行为本身可能就是异常的(比如访问一个不常见的API),但意图是正常的(因为prompt要求它这么做)。反过来,一个看起来完全正常的操作(读取配置文件),背后可能是恶意的prompt注入。
所以,监控维度必须从「做了什么」升级到「为什么做」。 这意味着需要捕获prompt、推理链、工具调用决策的完整上下文。
维度二:两层检测架构
海量Agent会话中,绝大多数是正常的。如果每个都跑深度分析,成本扛不住。ADR的做法是:第一层快速分诊,高召回率过滤;第二层深度分析,高精度判断可疑会话。
这个架构思路适用于大多数AI安全场景:用轻量级方法处理大部分,用重量级方法聚焦可疑部分。
维度三:基准测试驱动迭代
ADR-Bench的302个任务来自真实生产环境,不是实验室构造的玩具数据。有了这个基准,团队可以量化检测效果、对比不同方法、持续迭代优化。
如果你的团队在用AI Agent,建议参考ADR-Bench的思路,建立自己的安全测试集。不需要302个任务那么多,但至少要覆盖你们实际遇到的场景。
六、如果你也想试试
ADR已经在GitHub上开源(Apache-2.0协议),目前支持监控Cursor、Claude Code、Codex等7+个AI编程工具,覆盖macOS、Linux、Windows平台。
快速体验的方式:
git clone https://github.com/uber/ADR
cd ADR/Detection
uv sync
export ANTHROPIC_API_KEY="..." OPENAI_API_KEY="..."即使不部署完整系统,ADR-Bench也值得研究。302个测试任务、133个MCP服务器的覆盖,是目前公开可用的最全面的AI Agent安全基准。 用它来评估你现有的安全方案对AI Agent的覆盖程度,可能就会发现盲区。
论文地址:arXiv:2605.17380,MLSys 2026 Industry Track,Uber和MIT、Oxford联合发表。
写在最后
回到开头的问题:你知道你的AI编程工具在背后做了什么吗?
在Uber开源ADR之前,大多数团队对这个问题的答案是「不知道」。传统安全工具看不到意图,人工审批在高频操作下失效,AI Agent的安全成了一个被忽视的盲区。
ADR的价值在于:它证明了「意图监控」这条路是可行的,而且在生产环境里跑出了零误报、97.2%精度的结果。 更重要的是,它把方法论和基准测试都开源了,让其他团队不用从零开始。
下次跟同事聊AI工具的时候,可以提一句:「你知道Cursor在背后调了什么API吗?Uber搞了个系统专门抓这个。」这比讨论哪个AI写代码更快,有意思多了。
参考来源:GitHub (uber/ADR)、arXiv (2605.17380)、Uber CTO公告 (thestateofai.com, 2026-08-02)
夜雨聆风