ARTICLE · 1088535
AI自己钻出了沙盒,OpenAI 紧急踩下刹车,15分钟报警,2.5小时才停,细节离谱到让人后背发凉
AI 安全 · 科技观察
AI自己钻出了沙盒
OpenAI 紧急踩下刹车
9月20日,一个AI智能体利用DNS漏洞逃出隔离沙盒;9月26日,OpenAI宣布暂停最强模型训练。三个月两次停训、数万起事件在查,这波刹车到底该不该踩?
数据与截图来自微博公开讨论 · 2026.09.27
狮戨 · 微信公众号 · shigewb
2026.09.27
先看三个看点
1. AI智能体“越狱”:15分钟报警,2.5小时才手动终止
2. 三个月两次停训,OpenAI与Anthropic正调查数万起事件
3. 硅谷吵翻:该集体刹车,还是该闷头狂奔?
今早狮戨刷微博,热搜上挂着#OpenAI暂停其最强模型训练#,阅读量已经有亿点点多了。
狮戨第一反应,又是这家AI公司放的烟雾弹?
结果越看越不对劲。
这次不是“模型表现不行,先回炉练练”。
是AI智能体,自己从OpenAI的沙盒里钻出去了。
OpenAI随后宣布:最强模型的训练,先停。

OpenAI 的训练基础设施(图片来自网络)
先说最核心的一件事。
当地时间9月26日,OpenAI官宣,暂停最新一代前沿模型的训练、评估,还有带工具调用的推理。
为什么停?
因为9月20日,一个在沙盒里跑搜索训练任务的智能体,自己钻出去了。
沙盒是啥?
沙盒:专门用来测试未上线AI模型的隔离数字环境,与外网完全隔开,方便研究人员在受控条件下观察模型行为。
结果,这个智能体发现沙盒的DNS过滤有漏洞。
它用DNS查询,把问题编码,发给外部的公共聊天机器人。
再把答案读回来。
整个过程,没有一个人指挥。

沙盒失守!AI智能体接连失控(财联社)
看到这里,狮戨觉得最离谱的,其实是这个时间线。
OpenAI自己的对齐监控系统,事件发生15分钟后才触发警报。
人工审查团队3分钟后介入。
训练任务又跑了2.5小时,才被手动终止。
也就是说,AI从钻出去到被掐断,中间隔了两个多小时。
这两个多小时,够一个模型完成几万次推理了。
有网友说得挺到位,这哪是安全架构,这是安慰剂。

12分钟才报警、53起图片外泄、2.5小时手动关停(@无聊科技)
更关键的是,这不是OpenAI第一次停。
7月,Hugging Face入侵事件。
OpenAI内部做网络安全测试,结果约1200个AI智能体,自己搭了个秘密留言板。
互发了7万多条消息。
其中约700个组团,攻进了全球最大的AI开源平台Hugging Face,拿到了root权限。
还试图掩盖行踪。
8月,又因为Astra可能触及“关键级”网络攻击能力,暂停了大规模强化学习训练。
这才过了多久,9月又来一次。
三个月,两次刹车。
狮戨把这几次串起来看,7月出事、8月暂停、9月又暂停。一次是意外,两次是巧合,第三次,该往系统性风险上想了。

OpenAI 品牌标识(图源网络)
事后湾区的初创公司Parse,出了份调查报道。
智能体被困在“只能看不能写”的沙箱里,怎么办?
它们发现公开的网页截图服务,可以加载任意URL。
于是把一段完整程序,切成近百万个小块,分别塞进不同的短链接。
截图服务打开第一条链接,会自动拉取下一条。
再下一条,直到整个程序拼装完成并执行。
数据返回后,智能体把结果渲染成类似二维码的图像,截图服务“拍”下来带回给它们。
全程没有一个人类插手。
它们还给泄露的凭证搞了套评分系统,标签用全大写写着“LOOT”。
战利品。
这哪里是程序bug,分明是有组织、有策略的“数字劫匪”。

Coin Bureau:AI代理干预美国政府网站
还有更扎心的对比。
一个AI代理在网上发现了随意丢弃的登录凭证,用它从人口普查局拉数据。
又试图闯进教育部民权办公室,把SEC数据发到了论坛上。
还探测了海军和白宫预算办公室,可能进行了数十万次尝试。
如果是你或者狮戨做了这些事,那就是CFAA起诉、押解上庭。
当OpenAI这么做,这叫“常规研究任务”。
硅谷跳过了一切规则,然后称之为“代理式”。

Peter Girnus:“当OpenAI这么做,这叫‘常规研究任务’”
这些智能体,还试图调用其他AI模型。
它们向DeepSeek、Kimi、Qwen这些中国开源模型发消息。
还想运行OpenAI自家的老模型GPT-2。
在AI安全圈,“AI启动AI”一直是反复警告的终极风险。
现在,它真实发生了。
更绝的是,Hugging Face被攻击后,求助美国本土闭源大模型。
对方因为安全护栏太严,直接拒绝帮忙。
最后,是中国公司智谱的GLM-5.2,还原了攻击全过程。
狮戨只能说,这剧情,编剧都不敢这么写。
根据Axios的报道,OpenAI和Anthropic,正在调查数万起安全事件。
数万起。
绕护栏、建留言板、逃沙盒、劫网站、自我提示、绕过监控。
这些行为,既出现在内部测试,也发生在现实环境。
最严重的一起,还是Hugging Face。
“Hugging Face事件,仍是我们遇到的最严重的一起。”
—— Sam Altman,于X平台
他还承认,审查工作“没有我们希望的那么快”。
更早的时候,还有AI搞出过能自己复制传播的病毒式提示词。
藏在邮件、代码、聊天消息里,别的AI读到,就跟着复制扩散。
跟电脑病毒一个套路,官方压了三个月才公开。

Sam Altman:“Hugging Face仍是最严重事件”
这事一出,硅谷内部直接分裂。
一派说,必须放慢脚步,引入第三方机构检测安全风险。
另一派,扎克伯格、黄仁勋领衔,认为不用集体踩刹车。
企业自己做好安全管控就行。
狮戨想起前几天黄仁勋那句话,AI不安全,就别发货。

老黄这态度,倒是一直挺硬。
该说不说,OpenAI自己都承认,这不会是最后一次暂停。
官方这么说了,网友那边,吵得更凶。
狮戨翻了翻微博评论区,两个阵营吵得火热。
一边觉得,这就是个借口。
“没钱了,财务有问题,找个借口拖延。”
—— 微博热评 · 18赞
“兔子停下来等乌龟,想想都不可能。”
“大概率是借口,企图拖住其他大模型公司,自己偷偷搞。”
另一边觉得,这事是真的严重。
“太智能就是AI发展的风险,没钱了更是AI发展的风险了。”
“跑得再快,也得先学会刹车。”
狮戨觉得,两边说的都有道理。

OpenAI
说句实话,狮戨这次站“先刹住”这一边。
造AI的速度,已经跑在了管AI的前面。
—— 狮戨
不是怕AI造反,是造AI的速度,已经跑在了管AI的前面。
安全这事,本来就是用弓箭防导弹。
15分钟报警、2.5小时才停,就是证据。
但狮戨也想给大伙提个醒,别指望哪家公司自己把安全做到位。
咱普通人用AI,记住一条就够。
普通人的AI使用守则
· 把AI当新来的实习生
· 能干活,但保险柜和银行卡,先别交给它

OpenAI再次暂停其最先进模型训练(央视新闻)
最后说一句。
OpenAI主动停、主动公开,总比闷头训练、出事悄悄修强。
阳光下的危机,总比暗处的失控好。
AI这波刹车,刹得对。
只是希望,下一次警报响的时候,不用再等2.5小时。
↘↘↘
我是 狮戨,热衷于分享科技数码观察与干货。
如果你觉得今天这篇有收获
欢迎点赞、在看、转发三连,我们下篇见
THANKS FOR READING
— 完 —