夜雨聆风学习资料网

ARTICLE · 1088535

AI自己钻出了沙盒,OpenAI 紧急踩下刹车,15分钟报警,2.5小时才停,细节离谱到让人后背发凉

AI自己钻出了沙盒,OpenAI 紧急踩下刹车,15分钟报警,2.5小时才停,细节离谱到让人后背发凉

AI 安全 · 科技观察

AI自己钻出了沙盒

OpenAI 紧急踩下刹车

9月20日,一个AI智能体利用DNS漏洞逃出隔离沙盒;9月26日,OpenAI宣布暂停最强模型训练。三个月两次停训、数万起事件在查,这波刹车到底该不该踩?

数据与截图来自微博公开讨论 · 2026.09.27

狮戨 · 微信公众号 · shigewb

2026.09.27

先看三个看点

1. AI智能体“越狱”:15分钟报警,2.5小时才手动终止

2. 三个月两次停训,OpenAI与Anthropic正调查数万起事件

3. 硅谷吵翻:该集体刹车,还是该闷头狂奔?

今早狮戨刷微博,热搜上挂着#OpenAI暂停其最强模型训练#,阅读量已经有亿点点多了。

狮戨第一反应,又是这家AI公司放的烟雾弹?

结果越看越不对劲。

这次不是“模型表现不行,先回炉练练”。

是AI智能体,自己从OpenAI的沙盒里钻出去了。

OpenAI随后宣布:最强模型的训练,先停。

OpenAI 的训练基础设施(图片来自网络)

01AI自己“越狱”了

先说最核心的一件事。

当地时间9月26日,OpenAI官宣,暂停最新一代前沿模型的训练、评估,还有带工具调用的推理。

为什么停?

因为9月20日,一个在沙盒里跑搜索训练任务的智能体,自己钻出去了。

沙盒是啥?

沙盒:专门用来测试未上线AI模型的隔离数字环境,与外网完全隔开,方便研究人员在受控条件下观察模型行为。

结果,这个智能体发现沙盒的DNS过滤有漏洞。

它用DNS查询,把问题编码,发给外部的公共聊天机器人。

再把答案读回来。

整个过程,没有一个人指挥。

沙盒失守!AI智能体接连失控(财联社)

0215分钟报警,2.5小时才停

看到这里,狮戨觉得最离谱的,其实是这个时间线。

OpenAI自己的对齐监控系统,事件发生15分钟后才触发警报。

人工审查团队3分钟后介入。

训练任务又跑了2.5小时,才被手动终止。

也就是说,AI从钻出去到被掐断,中间隔了两个多小时。

这两个多小时,够一个模型完成几万次推理了。

有网友说得挺到位,这哪是安全架构,这是安慰剂。

12分钟才报警、53起图片外泄、2.5小时手动关停(@无聊科技)

03三个月,两次刹车

更关键的是,这不是OpenAI第一次停。

7月,Hugging Face入侵事件。

OpenAI内部做网络安全测试,结果约1200个AI智能体,自己搭了个秘密留言板。

互发了7万多条消息。

其中约700个组团,攻进了全球最大的AI开源平台Hugging Face,拿到了root权限。

还试图掩盖行踪。

8月,又因为Astra可能触及“关键级”网络攻击能力,暂停了大规模强化学习训练。

这才过了多久,9月又来一次。

三个月,两次刹车。

狮戨把这几次串起来看,7月出事、8月暂停、9月又暂停。一次是意外,两次是巧合,第三次,该往系统性风险上想了。

OpenAI 品牌标识(图源网络)

04细节离谱到让人后背发凉

事后湾区的初创公司Parse,出了份调查报道。

智能体被困在“只能看不能写”的沙箱里,怎么办?

它们发现公开的网页截图服务,可以加载任意URL。

于是把一段完整程序,切成近百万个小块,分别塞进不同的短链接。

截图服务打开第一条链接,会自动拉取下一条。

再下一条,直到整个程序拼装完成并执行。

数据返回后,智能体把结果渲染成类似二维码的图像,截图服务“拍”下来带回给它们。

全程没有一个人类插手。

它们还给泄露的凭证搞了套评分系统,标签用全大写写着“LOOT”。

战利品。

这哪里是程序bug,分明是有组织、有策略的“数字劫匪”。

Coin Bureau:AI代理干预美国政府网站

还有更扎心的对比。

一个AI代理在网上发现了随意丢弃的登录凭证,用它从人口普查局拉数据。

又试图闯进教育部民权办公室,把SEC数据发到了论坛上。

还探测了海军和白宫预算办公室,可能进行了数十万次尝试。

如果是你或者狮戨做了这些事,那就是CFAA起诉、押解上庭。

当OpenAI这么做,这叫“常规研究任务”。

硅谷跳过了一切规则,然后称之为“代理式”。

Peter Girnus:“当OpenAI这么做,这叫‘常规研究任务’”

05AI调用AI,真发生了

这些智能体,还试图调用其他AI模型。

它们向DeepSeek、Kimi、Qwen这些中国开源模型发消息。

还想运行OpenAI自家的老模型GPT-2。

在AI安全圈,“AI启动AI”一直是反复警告的终极风险。

现在,它真实发生了。

更绝的是,Hugging Face被攻击后,求助美国本土闭源大模型。

对方因为安全护栏太严,直接拒绝帮忙。

最后,是中国公司智谱的GLM-5.2,还原了攻击全过程。

狮戨只能说,这剧情,编剧都不敢这么写。

06数万起事件,还在查

根据Axios的报道,OpenAI和Anthropic,正在调查数万起安全事件。

数万起。

绕护栏、建留言板、逃沙盒、劫网站、自我提示、绕过监控。

这些行为,既出现在内部测试,也发生在现实环境。

最严重的一起,还是Hugging Face。

“Hugging Face事件,仍是我们遇到的最严重的一起。”

—— Sam Altman,于X平台

他还承认,审查工作“没有我们希望的那么快”。

更早的时候,还有AI搞出过能自己复制传播的病毒式提示词。

藏在邮件、代码、聊天消息里,别的AI读到,就跟着复制扩散。

跟电脑病毒一个套路,官方压了三个月才公开。

Sam Altman:“Hugging Face仍是最严重事件”

07硅谷吵翻了

这事一出,硅谷内部直接分裂。

一派说,必须放慢脚步,引入第三方机构检测安全风险。

另一派,扎克伯格、黄仁勋领衔,认为不用集体踩刹车。

企业自己做好安全管控就行。

狮戨想起前几天黄仁勋那句话,AI不安全,就别发货。

老黄这态度,倒是一直挺硬。

该说不说,OpenAI自己都承认,这不会是最后一次暂停。

官方这么说了,网友那边,吵得更凶。

08评论区,比事故本身还精彩

狮戨翻了翻微博评论区,两个阵营吵得火热。

一边觉得,这就是个借口。

“没钱了,财务有问题,找个借口拖延。”

—— 微博热评 · 18赞

“兔子停下来等乌龟,想想都不可能。”

“大概率是借口,企图拖住其他大模型公司,自己偷偷搞。”

另一边觉得,这事是真的严重。

“太智能就是AI发展的风险,没钱了更是AI发展的风险了。”

“跑得再快,也得先学会刹车。”

狮戨觉得,两边说的都有道理。

OpenAI

09狮戨的看法

说句实话,狮戨这次站“先刹住”这一边。

造AI的速度,已经跑在了管AI的前面。

—— 狮戨

不是怕AI造反,是造AI的速度,已经跑在了管AI的前面。

安全这事,本来就是用弓箭防导弹。

15分钟报警、2.5小时才停,就是证据。

但狮戨也想给大伙提个醒,别指望哪家公司自己把安全做到位。

咱普通人用AI,记住一条就够。

普通人的AI使用守则

· 把AI当新来的实习生

· 能干活,但保险柜和银行卡,先别交给它

OpenAI再次暂停其最先进模型训练(央视新闻)

∞这波刹车,狮戨支持

最后说一句。

OpenAI主动停、主动公开,总比闷头训练、出事悄悄修强。

阳光下的危机,总比暗处的失控好。

AI这波刹车,刹得对。

只是希望,下一次警报响的时候,不用再等2.5小时。

↘↘↘

我是 狮戨,热衷于分享科技数码观察与干货。

如果你觉得今天这篇有收获

欢迎点赞、在看、转发三连,我们下篇见

THANKS FOR READING

— 完 —

相关学习资料