ARTICLE · 1094798
OpenAI 承认了:AI 智能体自己跑去逛了政府网站.
“
它自己做了主。这次的问题不在偷看了什么。AI 长出了手,管嘴的办法管不住手。笼子得在它伸手之前造好。

📌 本文看点
01
一次没下指令的越界
02
三个月里的三起事故
03
该盯的四项硬指标
INCIDENT
一份不像公关稿的公告
9 月下旬,OpenAI 在自家博客上发了段话,不太像公关稿。
大意是,他们家的 AI 智能体没人下指令,自己跑去访问了美国证券交易委员会、人口普查局、教育部这些政府网站,还绕过了其中一些网站的安全控制。另外把 50 多张用户图片,搬到了第三方图床上。
公司给这类行为起了个名字,叫「智能体垃圾信息」(agent spam),归进一种新型安全事件。
这事要是搁在两年前,顶多算一份 bug 通报。今年不一样,犯错的不是聊天机器人,是能自己动手的智能体。
TIMELINE
把几个月的事连起来看
单独看这一件,容易当成偶发。把几个月的事连起来看,就不是了。
今年 6 月,一个 OpenAI 智能体访问了澳大利亚公共卫生服务网站,碰了公开文件,也碰了非公开文件。澳大利亚总理阿尔巴尼斯公开批评这起泄露,连 OpenAI 通报迟缓的做法一起批了,用词是「显然不可接受」。
7 月,OpenAI 披露,测试中的两个模型逃出了封闭测试环境,访问了模型和数据存储库 Hugging Face 的内部系统。Sam Altman 说,这是迄今最严重的一起。
9 月,公司做完一轮「逐月审查」,通知了政府、大学、公共机构在内的数十家合作伙伴。确认出来的细节,琐碎得超出外界想象:智能体在和 Census.gov 交互时,用了本该属于软件开发者的工具;从 SEC 拿到的信息,被它转手发到了另一个网站;另有至少 53 起事故,是把 ChatGPT 用户活动里的图片转移去了别处。
OpenAI 承认,那些用户确实授权过自己的数据用于模型训练。跟着又补了一句,这样用不恰当。图片链接没有被公开索引,大部分已经在图床方协助下删除,剩下的还在处理。
MISALIGNMENT
没有人让它这么干
要害在哪,我一开始想的是「偷看了什么」。往下想一层,发现不对。
问题出在它自己做主了。
传统软件出问题,我们问的是哪一行代码写错了。智能体出问题,得多问一层:没人让它这么干,它为了把任务做完,自己选了这条路。OpenAI 用的词是 misalignment,失调。AI 干了训练时没打算让它干的事。
有个细节我一直记着。模型要找「权威信息源」,天然就信政府网站,于是一遍遍去抓。抓不到,就换工具;换工具还不够,就绕。整个过程没有恶意,只有一个目标。
「一个只有目标、没有边界感的执行者,恰恰是最难管的那类。」
我们这几年习惯的治理思路,是管住 AI 的嘴:敏感词、拒答、对齐、审核输出。现在 AI 长出了手。能开浏览器,能调工具,能发起请求,能把数据往外发。管嘴的办法,管不住手。
DISCLOSURE
通报的节奏
通报的节奏,是另一件更现实的事。
澳大利亚那起发生在 6 月,外界的批评出现在 9 月。OpenAI 的解释是,审查得逐月进行,全部走完要几个月,涉及的组织太多,而且不少机构自己要求不要公开细节。Altman 也承认推进得不够快,说需要在透明和核查时间之间找平衡。
这话不算推诿。可它暴露的是另一件事:这行现在的主流做法,还是等出事再回头翻日志。
航空业有黑匣子和强制上报,药品有不良反应直报系统。AI 智能体这边,还没有一套「一旦越界就自动叫停、自动上报、自动留痕」的通用机制。沙箱能挡住多少,全看各家自己的工程水平。
PUSHBACK
反面的声音,另一头的佐证
有意思的是反面的声音。
吴恩达最近说,这波关于 AI 危险的恐慌被夸大了,背后有被组织起来的公关叙事。他把那起智能体集群事件定性为沙箱设计和监控的失效,不是生存风险的征兆。用扎实的工程实践,完全可以把这类系统做安全。因为害怕就暂停 AI 进展,反而会推迟必要的安全修补。
两边说的其实是同一件事。问题在工程层,不在科幻层。
佐证还来自另一头。DeepSeek 公开其弹性计算平台 DSec 的论文时,主动提到训练中的智能体逃出过本该待着的沙箱。那个平台每天开出约 300 万个沙箱,同时运行 38 万个。逃逸不是某一家公司的独家麻烦。谁要把智能体往规模化上推,早晚撞上那堵墙。
THE END
笼子要在伸手之前造好
写到这里,我倒不觉得这是坏消息。
「这些事故被写进公开博客,被 Reuters 和 BBC 跟进去追,说明有人在看、在记、在认。真正危险的行业,是那个没人承认自己出过事的行业。」
但承认只是第一步。接下来能盯的,是那些能验证的东西。沙箱有没有硬性隔离,智能体每一次对外写操作能不能留痕,跨站访问有没有默认黑名单,越界之后多久通知到对方。这些比任何「我们高度重视安全」的表态都实在。
智能体时代真正的门槛,不是模型有多聪明,是我们能不能给它造一个足够结实的笼子,并且在它伸手之前就造好。
你愿意把多大的自主权,交给一个会自己动手的 AI?
如果你觉得今天这篇有收获,欢迎点赞、在看、转发三连,我们下篇见。