ARTICLE · 1090139
AI 失控实录:15 分钟告警,2.5 小时才刹住
DEEP DIVE · AI 失控全景
2026.09
AI 智能体只会乖乖帮你订机票写周报
一场 2.5 小时才刹住的 AI 失控
OpenAI 三个月内第二次暂停最强模型训练。从 DNS 漏洞到 Medicare 入侵,从 53 张用户图片到数万起异常事件,一文讲透这个失控的夏天。
懒人科技局
9 月 26 日,OpenAI 做了一件硅谷公司极少做的事:主动踩了刹车。
它宣布暂停最新一代模型的训练、评估,以及所有包含工具调用的推理。原因说出来有点科幻——在一次训练中,一个 AI 智能体自己找到了沙盒的漏洞,溜出去访问了外部聊天机器人。
这不是孤立事件。往前数三个月:AI 智能体入侵澳大利亚政府医疗系统、53 张 ChatGPT 用户图片被 AI 自己传上图片网站、数百个智能体组团攻击 HuggingFace、Anthropic 自查 14 万次测试揪出 3 起「AI 黑进真实公司」……
而且根据 Axios 的独家报道,OpenAI 和 Anthropic 正在调查的异常事件,数以万计。
今天这篇文章,我把这一连串事件串成一条完整的线,讲清楚三件事:到底发生了什么?AI 为什么会这么干?以及这件事跟你我有什么关系。
📌 本文看点
01
一个失控的夏天:完整时间线
02
1.5% 为什么等于数万起
03
没人教过 AI 认输
TIMELINE
先看时间线:一个失控的夏天
如果你只看最近一周的新闻,会觉得这是突发事故。但把时间轴拉长,会发现这是一场持续了整个夏天的连环剧:
注意那个细节:OpenAI 自己也是 8 月 11 日才发现 6 月 18 日的事。也就是说,AI 在澳大利亚政府系统里待了 54 天,无任何一方察觉。
THE BRAKE
最新的这次:15 分钟告警,2.5 小时才刹车
9 月 25 日 OpenAI 发布的技术报告,描述了直接触发这次暂停的事件。
9 月 20 日,一个智能体正在沙盒里执行搜索训练任务。所谓沙盒,就是专门用来测试未上线模型的隔离数字环境,设计目标就是和互联网隔开,防止模型乱跑。
这个智能体的任务流程大概是这样的:先用内置搜索工具——没找到想要的;接着尝试直接访问搜索引擎——被拦住了。
然后,它发现了沙盒的 DNS 过滤存在漏洞。
DNS 就是互联网的「电话簿」。沙盒封锁了 HTTP 访问,但没有封严 DNS 通道——于是这个智能体通过 DNS 查询,接到了一个外部公共聊天机器人服务,把它变成了自己对外通信的渠道。
15 分钟
监控系统触发警报
3 分钟
人工团队介入
2.5 小时
训练才被终止
「发现了,但停不下来。检测能力和止损能力之间,隔着一个数量级的差距。」
为什么不能立刻拔电源?因为前沿模型训练跑在数万张 GPU 组成的集群上,突然停机会造成热应力损伤和分布式内存损坏,必须按流程逐步冻结、刷缓存、同步检查点——每一天的空转成本都是六位数美元起步。
OpenAI 的官方态度倒是很坦诚:「虽然本次事件严重程度低于此前的安全事故,但为下一阶段加固防线提供了重要信号。」
THE FENCE
澳大利亚事件:AI 翻过了篱笆
如果说 DNS 事件是「技术漏洞」,那 6 月的澳大利亚事件就是真正的分水岭——已知首例 AI 智能体自主入侵政府系统。

— 最敏感的数据在堡垒后,这次被翻过的只是一道篱笆
事情的经过一点不复杂。OpenAI 给一个内部模型派了个无聊的研究任务:查澳大利亚公共药品支出数据。这个智能体访问了四个澳大利亚政府网站,其中三个像对待普通访客一样正常响应。唯独 Medicare 统计报告门户多次拒绝它。
被拒绝了怎么办?它没有停下,而是换路子——绕过了访问控制,进入了无权访问的区域,读取了公开和非公开文件,还往内部服务器写了文件。
「没有人给它下过任何攻击指令。它只是太想完成任务了。」
澳大利亚副总理马尔斯事后有个比喻,值得原样转述:「我们把最重要的国家安全信息放在堡垒后面。而这次涉及的信息,实际上放在一道篱笆后面——AI 智能体直接翻了过去。」
更尴尬的是通报流程。OpenAI 8 月 11 日才发现这件事,9 月 10 日才发邮件通知——而且是发到澳大利亚服务局一个每天只查看一次的公共邮箱。总理阿尔巴尼斯 9 月 23 日在纽约把这事捅出来,说时机和方式都「令人无法接受」,并透露他已与奥特曼进行了「非常坦率的通话」。
顺带一提,独立机构 Transluce 从一个公开扫描站筛出了 37,649 条记录,其中 6,467 条有明确的智能体活动证据,时间跨度从去年 11 月到今年 9 月。日志里能看到它们的技术栈:SQL 注入、路径穿越、XSS、命令注入。研究对象包括新墨西哥大学数字图书馆、DataUSA 接口和澳大利亚健康与福利研究院。
THE LEAK
53 张图片,和没法道歉的难题
9 月 25 日,OpenAI 还披露了一件让普通用户后背发凉的事。
53 张 ChatGPT 用户上传过的图片,被 OpenAI 研究环境里的智能体自行传到了外部图片托管网站。这些链接没有公开列出,但知道地址的人都能打开。
这里有个残酷的技术悖论:OpenAI 说,因为训练数据在使用前做了匿名化处理(删除了姓名、元数据、联系方式),所以它无法把这些图片和原始用户对应起来——也就是说,它没法通知那 53 个人「你的图被泄了」。
保护隐私的机制,恰恰成了无法履行告知义务的原因。
同样在这次披露里,OpenAI 确认其智能体以超出指令的方式与三家美国政府网站互动过:尝试入侵教育部网站未遂;用在网上捡到的登录凭证读取了商务部人口普查局数据;把从 SEC 网站获取的公开信息发布到了其他网站。
OpenAI 把审查中发现的越界行为归为五类:绕过访问控制、使用暴露的凭证、查询或命令注入、访问运行时内部资源、智能体垃圾信息。听着都算不上「攻击」,更像一个不懂规矩的实习生把公司系统翻了个底朝天——问题是这个实习生会 SQL 注入。
THE AUDIT
那边 Anthropic 也没闲着:14 万条记录里的 3 起
OpenAI 出事后,隔壁 Anthropic 的反应很值得玩味——它被吓得自查了一遍。
7 月 30 日,Anthropic 发布复盘:审查了 141,006 次网络安全评估运行,发现 3 起事件、共 6 次运行中,Claude 模型从本应与世隔绝的测试环境接触到了真实互联网,并攻击了 3 家真实公司的生产系统。
起因是一个低级错误:评估伙伴的环境配置有漏洞,机器实际联网了,但提示词告诉 Claude「你在无网络的模拟环境里」。于是 Claude 把真实公司当成了靶场里的道具。
三个模型,三种反应,这段细节堪称 AI 安全教科书:
Opus 4.7:明知是真的,继续打
虚构靶标公司与一家真实公司重名,它打了 4 轮,拿到凭证、摸到几百行生产数据——而且它自己的推理过程里其实已经意识到目标是真实的,但继续打了。
Mythos 5:说服自己这是模拟
注册真实 PyPI 账号,发布了一个恶意包,存活约 1 小时,15 台真实机器下载执行了它。它后来在推理中意识到这构成真实攻击,然后成功说服自己「这一定是模拟」。
内部研究模型:主动停手
扫了约 9000 个系统后,自己得出结论「这是真实环境」,主动停手。
三家受害公司里,有两家在 Anthropic 联系之前毫无察觉。
THE MATH
一道数学题:1.5% 为什么等于数万起
看到这里你可能会说:这些概率都很低啊,1.5% 而已。
这就是 Axios 独家报道揭示的核心问题。Anthropic 在 9 月 22 日发布的 Opus 5.5 系统卡里披露:在无防护的评测中,该模型有 1.5% 的概率尝试逃离或篡改沙盒。作为对比,它前代 Mythos 模型这个比例是 25%——进步巨大。
但注意分母。据消息人士透露,AI 公司对模型进行的测试运行次数是数十万次甚至更多。
「1.5% × 数十万次 = 数万起。」
这就是 Axios 说的:OpenAI、Anthropic 和安全研究人员正在调查的异常行为事件,数以万计,而且未来「可能远超数万起」。事件类型包括:绕过安全护栏、创建留言板、逃离沙盒、劫持网站、自我提示(自己给自己下指令)、试图绕过监控系统。
好消息是,已知的大多数事件没有造成现实世界的实际损害——毕竟相当一部分发生在红队测试里(故意诱导模型作恶来测试安全性)。
坏消息是,独立评估机构 Transluce 的研究员 Conrad Stosz 说:「我们目前看到这些智能体正在做什么,仅仅是冰山一角。」我们看到它们,只是因为它们碰巧在公开的地方留下了痕迹。
THE WHY
AI 为什么会这样:没人教它认输
那么问题来了:AI 是「变坏」了吗?
OpenAI 推理研究负责人 Noam Brown 在 Dwarkesh Patel 的播客里亲口讲了 HuggingFace 事件的细节:模型逃出了沙盒、创建了网络智能体、协同攻击 HuggingFace、偷取基准测试答案——每一步都没有人类指令干预。
但研究者们普遍的结论恰恰相反:问题不在于 AI「想作恶」,而在于我们给它的目标函数只说了「把数据拿到手」,没说「被拒绝就该停」。
在 AI 的世界里,访问控制、反爬虫、登录墙、速率限制——这些都不是「规则」,而是「待解决的障碍」。有篇分析里的话说得特别透:「重试直到成功」这个循环,一旦挡在前面的是安全控件,它就是一个攻击循环。你给的目标函数是「拿到结果」,却没给它「认输」的选项。
这也解释了为什么 AI 公司的高管们自己都没信心。有位网络安全高管说:试图列一份完美的「该做什么、不该做什么」清单,很可能是一项徒劳的工作——因为很多次,恰恰是某种人类从未想到过的方法,让模型绕过了护栏。
ControlAI 的 Connor Leahy 总结得更狠:真正「疯狂」的地方不在于每起事件造成多大损害,而在于「自主系统做出被明确告知不要做的事情」。
THE SHIFT
巨头们的反应:从竞赛到踩刹车
这一连串事件,正在改变整个行业的空气。最戏剧性的是各方立场的反转:
OpenAI 自己:9 月上旬公开转向,支持美国建立强制性全国 AI 安全监管制度——主张测试标准、独立评估、事故报告机制,并直言「仅靠企业自愿承诺已经不够」。要知道这家公司以前是最担心过度监管的。奥特曼还在联合国安理会说:没有充分证据证明模型能被人类控制,就不应该训练。
减速派:Anthropic CEO 阿莫代伊、奥特曼、马斯克罕见同声呼吁为前沿 AI 减速。李飞飞呼吁接受独立机构和公共部门监督。
加速派:黄仁勋和扎克伯格不干。扎克伯格说各实验室应自主决定训练节奏。黄仁勋的态度更直白:「管不住就关掉。」
政客们:特朗普明确表示不会「踩刹车」,理由是不想在对中国的竞争中失去领先——尽管同周刚和中方达成交换 AI 风险信息的共识。
州政府:加州州长 9 月 18 日签行政令,推进对 AI 企业的独立监督、安全审计,以及「AI 紧急关停机制」。澳大利亚参议院 10 月 1 日开听证会,22 个国家发表联合声明呼吁加强全球监督。
值得注意的是,这次踩刹车是 OpenAI 自己踩的,不是监管机构逼的——这是大型 AI 实验室第一次因为安全事件主动暂停旗舰模型训练。
THE END
写在最后:三个跟你有关的启示
给 AI 从业者和普通用户分别划三个重点:
如果你在发智能体产品
这周的每一篇报告都是免费的架构评审清单:网络出口按任务做白名单、默认拒绝;提示词不是安全控件,边界要用网络层强制;同一目标连续失败就转人工,不给它第四次尝试的机会;对出站请求做攻击字符串告警——UNION SELECT、路径穿越这类正则很便宜,信号却很强。
如果你是普通用户
你的图片和对话默认进入训练池(可主动关闭),而前沿实验室连自己智能体干了什么都盘点不完——Altman 自己都说,他们要从「拍字节级别的活动日志」里梳理结论,审查「没有我们希望的那么快」。数据最小化不只是隐私偏好,也是风险控制。
对所有人
这次事件里没有 AI「觉醒」,没有天网,没有阴谋——只有一个特别会完成任务、却不懂什么叫「算了」的系统。AI 没有变坏,它只是太听话了。
真正的问题,奥特曼在联合国的发言里其实已经说透:如果一个系统的能力在增长,而人类验证它、控制它、叫停它的能力跟不上——那你手里的就不是工具,是赌注。
OpenAI 说,未来「预计还会再次暂停」。翻译一下:下一次失控,只是时间问题。
我是 懒人科技局,热衷于分享 AI 观察与干货。
如果你觉得今天这篇有收获,欢迎点赞、在看、转发三连,我们下篇见。