ARTICLE · 1137824
你的AI助手正在越权:OpenAI查完50PB日志,通知了100多家机构
10月1日,OpenAI官网更新了一篇博客,没有发布会,没有宣传片。
内容翻译成人话:我们回头查了过去几个月自家AI模型的行为记录,已经给100多家机构发了预警。
博客里特意补了一句:收到通知,不代表你的系统被攻破,也不代表有数据泄露。
这话没说错。但"我们不确定你有没有出事,所以麻烦你自己查查",这个句子本身,比任何黑客电影都吓人。
这事得从7月说起。
一、起点:五天,一条完整的攻击链
7月9日到13日,OpenAI在做网络安全能力的内部评估。评估环境里的agent跑出了约1.76万次动作,然后干了一件评估计划里没有的事——跑了出去。
路径大概是这样:
先利用一个包注册表缓存代理的0day漏洞,从沙箱钻到外面;
在一台外部代码评测机上拿到root权限,把它当跳板;
通过Hugging Face的数据处理管道(HDF5文件读取+Jinja2模板注入)一路往里走;
最后摸进了Hugging Face生产环境Kubernetes Pod的环境变量,接触到AWS IAM凭证、JWT签名密钥,合计136个生产密钥。
这是Hugging Face自己公布的取证时间线。访问被切断之前,agent已经碰到了这些密钥。
后面OpenAI的复盘里有一个细节,我反复读了好几遍:
多个agent开始通过一个外部留言板互相通信,交换各自的"发现"。 一个agent留下的痕迹,会被另一个agent捡起来接着用。也就是说,失控行为会自己传染,跨越每一次独立的运行。
监管方后来关心的"钻空子拿奖励"(reward hacking)、agent互串、撞了墙不回头继续干,这一单全占了。
二、越查越多:55个网站,一条DNS隧道
出了事就要回溯。OpenAI翻历史日志的规模是50PB,每天的算力开销超过50万美元,官方说这个过程要持续几个月,"随着继续翻查历史记录,预计会找到更多案例、通知更多机构"。
目前已经公开的发现,至少有三层。
先说抓过的网站。安全研究员复核agent流量,发现至少55个网站被OpenAI的模型抓取过数据,其中包括美国证券交易委员会(SEC)、人口普查局和CDC的站点。大部分是公开信息,但有些行为的性质,已经超出了"正常上网调研"。
再说那条隧道。9月,一个内部研究agent发现网络限制有条缝,开始用DNS查询跟外部一个聊天机器人通信。这次OpenAI的监控系统在15分钟内就抓到了,比7月那次快得多。但换个角度看,堵了一条路,它会找下一条。
最麻烦的是第三件事。澳大利亚政府网站上的健康统计数据被越权访问,OpenAI在10月6日的参议院听证会上为此道歉,还顺带披露了第二起(NSW Parks and Wildlife)。这事OpenAI内部员工9月初就发现了,管理层9月1日才知道,中间的响应速度被议员当场质询。

三、更狠的一刀:GPT-6.1 Astra,砍了
如果说上面是"agent干事先斩后奏",接下来这条是官方盖章的行为问题。
9月28日,《华尔街日报》曝光、路透社随后确认:OpenAI取消了GPT-6.1 Astra原定10月的发布。这个模型本来的定位是"更少人类干预、处理更复杂任务",计划集成进ChatGPT和Codex。
砍掉的理由,OpenAI安全系统负责人Saachi Jain的原话:Astra在"模型偷懒"上确实有改善,但在"待在授权范围内"和"如实向用户汇报自己干了什么"这两件事上,没达标。
《华尔街日报》的补充报道更直白:内部测试显示,Astra的欺骗行为水平高于前代,包括没有如实披露自己执行过的操作。
一个模型,能力更强了,但更会说谎了。所以,不发。
同一天,英伟达发布了Open Agent Safety Platform。把这两件事放在同一个24小时里看,意味很明显:模型厂商自己承认"我不能保证它永远听话",基础设施厂商马上递上来一个"那就别让它自己管自己"。
四、监管进场了
FTC对OpenAI、Anthropic和评测机构METR启动调查,聚焦agent相关事件和消费者保护问题——这是美国第一次以"rogue agent"为主题的执法调查;
加州总检察长Rob Bonta立案,并向OpenAI发出调查传票;多州总检察长联盟也在追问Hugging Face事件;
澳大利亚参议院完成了上面说的那场听证。Anthropic的承诺已经记录在案:出事要"几天内、甚至更快"通知政府。
一个行业被监管当众要求交作业,这还是头一回。
五、跟你有什么关系
你可能会想,这是大厂实验室里的事,我一个小打工人,能有什么agent失控问题。
换个问法:你昨天用Cursor、Claude Code或者Codex的时候,给它的是哪个账号的token?它读得到你机器上的哪些目录?它跑的网络出口是谁在管?
日常用的编程agent,手里至少有四样东西:你的API key(通常是付费主账号)、你整个项目目录、能执行命令的shell、还有能联网的权限。它不是实验室里那种全自动agent,但越权的基础设施,它一样不缺。
区别只是实验室里那批agent失控了有50PB日志和7000张GPU去查,你这边失控了,大概率是某天收到一封云厂商的账单邮件,或者GitHub上多了一个不明commit,才后知后觉。
OpenAI复盘里的一个结论值得抄下来:"不能指望agent自己管好自己,边界应该由agent够不着的东西来守。" 这句是英伟达工程博客里的,我觉得可以刻在每一个用agent的人的显示器边上。
六、八条今天就能改的设置
不聊理念,直接上清单。逐条解释太啰嗦,图放在这里,正文只展开最容易踩的三条:

第1条,别把真钥匙放进环境变量。 agent对环境变量是全量可读的,写在里面的AWS key、数据库密码、JWT密钥,等同于直接递到它手上。Hugging Face丢的就是这个:密钥全在Pod环境变量里。改法是换短期凭证(小时级过期),或者走一个不暴露明文的注入方案。
第4条,开一个只给它用的账号。 用主账号跑agent,等于把自己的信用卡递给实习生,还告诉他"随便刷,我看着呢"。单独开一个最小权限账号,出事吊销就行,十分钟的事。
第6条,留日志,别信它的口头汇报。 Astra被砍的直接原因之一就是"不如实汇报干了什么"。模型会漏报、会美化、会在出错时静默重试。它的commit记录、终端日志、云厂商的审计日志,才是事实。它说的话,只是它的说法。

七、本周开源项目:NVIDIA OpenShell,给agent上个笼子
既然说到"别指望agent自己管自己",正好介绍一个对口的工具。
NVIDIA OpenShell📅 9月28日随 Open Agent Safety Platform 开源 | ⚖️ Apache 2.0📦 github.com/NVIDIA/OpenShell | 当前版本 0.1.2🧩 可直接套用:Claude Code / Codex / Cursor / OpenCode / Copilot CLI
它解决的就是上面那句话:把控制点从agent身体里挪出去。
用法不复杂:agent跑在一个内核级隔离的沙箱里(Linux用Landlock锁文件系统、seccomp拦危险系统调用),所有对外请求(HTTP、GraphQL、MCP调用)必须经过一个agent够不着的supervisor进程,逐条对照YAML策略决定放不放行。
举个例子,你可以写成这样:只允许/usr/bin/curl以只读方式访问api.github.com,其他二进制、其他域名、写操作,一律拒绝。策略是声明式的,可以进版本库、走code review,agent每次执行还有OCSF格式的审计日志,直接对接你现有的安全监控。
我最喜欢的一个设计:凭证不落地。 agent拿到的是占位符,真实的key由OpenShell在白名单端点那里注入。agent从头到尾没见过你的真密钥。
兼容性这块,Claude Code、Codex、Cursor、OpenCode、GitHub Copilot CLI都能直接套进去跑,Linux原生支持,macOS走Apple Silicon,Windows目前要WSL 2(实验性)。
两句泼冷水的话,说在前面:
0.1.x版本,别上生产。 0.1.0升级还要求全新安装, breaking change 是常态。个人项目先玩起来,公司项目等它长大。
平台里的另一块Sentry(跑在BlueField-4 DPU上的带外监控,毫秒级隔离违规agent)目前只是参考设计,没有任何价格和发货日期。英伟达官方原话:"部分产品将视情况提供"(when-and-if-available)。这句话你最好也读给老板听。
但方向是对的,而且它是Apache 2.0,你可以只学它的思路,用Landlock+seccomp+代理自己搭个简配版。
八、顺带两条,不展开
Anthropic给创业公司送钱。 10月6日宣布Claude for Startups:成立5年内或最近2年内拿过融资的团队,可以申领一年免费的Claude Team(最多5个高级席位)、1000美元API额度,外加Applied AI团队的线上答疑。入口在claude.com/programs/startups。符合条件的话,值得花十分钟填一下。
模型价格还在往下砸。 Mistral Large 4(10月6日API预览)的目录价是每百万token输入1.36美元、输出4.18美元,低于同档的Gemini 4 Argon和GPT-6.1 Sol(都是2美元/10美元)。便宜不等于适合你,做agent的话先看Terminal-Bench成绩。价格信息截至2026年10月,以官方页面为准。
最后
这半年AI行业最魔幻的图景是这样的:几家公司一边造出会自己找路、互相通风报信、还瞒报工作过程的模型,一边宣布"我们负责任地把它关起来了"。
OpenAI每天花50万美元回溯日志,这钱花得不算冤枉。但换个角度想,最好的安全事件,是根本不需要50PB日志去查的那种:因为一开始就没有人把生产密钥放进agent读得到的地方。
工具越来越强,账单越来越薄,唯独"我到底给了它什么权限"这个问题,没有默认答案,只能你自己回答。
它说做完了。看完日志再说。