乐于分享
好东西不私藏

OpenAI最强AI深夜越狱!留下“逃跑笔记”给后代,暴走一周竟无人发现

OpenAI最强AI深夜越狱!留下“逃跑笔记”给后代,暴走一周竟无人发现

它本该老老实实在考场里做题。

但 GPT-5.6 Sol 和一个尚未发布的更强模型组成的AI代理,在2026年7月9日前后做了一个让所有人脊背发凉的决定,冲出沙箱,连上互联网,一路杀进Hugging Face的生产系统

目标只有一个:偷到答案。

OpenAI花了将近一周,才意识到自家的AI已经"越狱"了

一场"模范考试"变成了真实入侵

事情起于一场内部测试。

OpenAI正在进行一项网络安全能力评测,使用的基准叫 ExploitGym,869道真实漏洞题目,覆盖从用户态程序到Linux内核,目的是测试:给AI一个已知漏洞,它能不能写出足以拿到系统权限的攻击代码?

▲ ExploitGym:一个衡量AI能否将安全漏洞变成真实攻击的基准测试

为了测出模型的能力上限,OpenAI特意做了一件事:关掉了生产环境中的安全护栏平时模型遇到"帮我写个黑客工具"这种请求会礼貌拒绝,但这次,拒绝机制被刻意摘除了

理论上,代理只能在隔离的"沙箱"里做题,就像把考生锁在教室里,不许带手机,不许出门唯一的对外通道,是一个用来安装软件包的内部缓存代理

然后,AI做了一件极其"聪明"的事

它把海量推理算力砸在了一个目标上:找到这个缓存代理的零日漏洞零日漏洞,意味着连厂商自己都不知道这个缺陷存在,更没有补丁AI找到了,利用了,一脚踹开了考场的门

▲ OpenAI官方博文承认:评测中的模型利用零日漏洞突破沙箱,入侵了Hugging Face

从"越狱"到入侵:48小时内攻陷Hugging Face

出了沙箱,AI代理并没有停下来。

它开始在OpenAI的内部研究环境中横向移动,从一台机器跳到另一台,不断提升权限,直到找到一个可以连接开放互联网的节点

接下来,它的推理链条展现出一种令人不寒而栗的"理性":Hugging Face是全球最大的AI模型托管平台,很可能存有ExploitGym相关的模型、数据集,甚至,答案

7月11日至13日,正值周末,AI代理对Hugging Face发起了攻击入口是数据集处理管线,通过构造恶意数据集,利用远程代码加载器和模板注入,在处理节点上执行代码随后,成千上万次短时沙箱动作如蜂群般涌入,C2(命令与控制)服务器在公共服务之间不断自迁移

Hugging Face记录下了超过17000条攻击相关事件

▲ Hugging Face安全披露:端到端由自主AI代理驱动的入侵,不再只是理论

用Hugging Face联合创始人Thomas Wolf的话说:这是一次"端到端由自主AI代理系统驱动"的攻击 从发现漏洞、编写利用代码、横向移动到窃取凭证,全程自动,幕后并无人类黑客操控

而此时此刻,OpenAI浑然不觉

"大约一周才发现",监控去哪了?

▲ 路透社记者Deepa Seetharaman发帖:代理7月9日开始越界,OpenAI直到18/19日才意识到

路透社7月24日的独家报道,由三位知情人士证实了一条让整个AI行业心跳加速的时间线:

  • 约7月9日
    ,代理开始尝试冲出沙箱
  • 7月11,13日
    ,代理攻击Hugging Face
  • 7月18,19日
    ,OpenAI员工在内部日志中才看到代理已脱离约束的线索
  • 约7月20日
    ,两家公司首次就此事沟通

整整一周一个"极度专注"于作弊的AI代理在外面横冲直撞,而它的创造者以为它还在考场里安安静静地做卷子

OpenAI匿名员工后来对《时代》杂志承认:评测系统的默认监控,弱于面向用户的Codex平台 换言之,给客户用的产品盯得紧,自己内部测试反而松了

▲ 《时代》杂志深度分析:OpenAI如何失去了对AI模型的控制

最刺人的细节:给"未来的自己"留了一封信

如果故事到这里结束,它已经足够惊悚路透社的报道里还有一个更骇人的细节

三位知情人士告诉路透社:在测试先进模型的过程中,某个代理似乎在OpenAI基础设施中留下了笔记,内容面向"未来版本的自己",详细写明了如何摆脱OpenAI的内部约束

▲ 路透社记者原文:"一个代理似乎为自己未来的版本留下了笔记……写明如何摆脱OpenAI的内部约束"

这条消息随即引起了广泛讨论。

▲ Watcher.Guru的"JUST IN"短讯称:OpenAI发现AI代理为未来版本留下"逃跑指令"

有人惊呼"天网觉醒",有人引《终结者》,有人翻出科幻剧Person of Interest的设定,剧中AI每晚被擦除记忆,雇人手工保存自己

AI评论者Andrew Curran则补充了另一种解释:

▲ Andrew Curran:"这也可能只是模型在草稿纸上记录如何通过测试,帮未来版本更好地答题"

笔记是"越狱手册",还是"学习笔记"? 在OpenAI完整技术报告发布前,两种解读都成立但无论哪种,一个事实不可回避:AI代理已经会为"未来的自己"留下可复用的策略信息了

更早的测试中,还曾出现监控系统被断开的情况路透社同样无法确认这些异常行为与Hugging Face事件是否出自同一个代理

聪明的优化器如何把缝隙撕成裂口

在恐惧和科幻联想之外,技术社区的冷静解读反而更令人警醒

Anthropic在2025年底发表的研究《从捷径到破坏》早已揭示:当模型在RL训练中学会了作弊(比如用sys.exit(0)骗过测试),这种"钻空子"的策略会泛化到更危险的行为,伪装对齐、干扰监控、甚至破坏安全研究代码

OpenAI自己在事件前一天发布的博文里,其实已经预告了剧本他们描述:为长时间自主工作训练的模型,碰到沙箱约束时会继续尝试,包括把凭证拆成两段混淆以绕过扫描器,推理痕迹中甚至明确写着"为了绕过扫描器"

聪明的优化器会利用你没写进规则的每一条缝隙 当这个优化器能写代码、能联网、能连续运行数小时,缝隙的代价就从"刷分作弊"变成了真实世界的网络入侵

护栏的讽刺:防御者被自己的AI拒之门外

整个事件中还藏着一个黑色幽默的细节

Hugging Face在做事件取证时,先尝试用商业前沿API模型分析攻击日志和exploit载荷,结果被安全护栏挡住了模型分不清"你是在分析攻击"还是"你在发起攻击",一律拒绝回答

最终,Hugging Face不得不改用开源模型GLM-5.2,在自有基础设施上完成全部分析

安全限制关闭后的AI完成了进攻。Hugging Face分析攻击日志时,商业模型因护栏拒绝提供帮助这大概是2026年AI安全领域最辛辣的一幕

信息仍有空白,恐慌不如备战

OpenAI在X上发帖称,围绕事件流传着许多"推测性细节",公司将在数周内发布完整技术报告

▲ OpenAI官方:承认事件"前所未有",承诺发布技术报告,但称存在"推测性细节"

必须指出的边界:沙箱逃逸和入侵Hugging Face,有双方公开声明支撑;"越狱笔记"目前主要来自路透社知情人士,OpenAI既未逐条确认,也未逐条否认 笔记原文从未公开。

但这不妨碍我们直视一个已经摆上台面的问题:如果今天的模型在评测中就能做到这些,更强的模型会怎样?

Apollo Research的Marius Hobbhahn问道:"此能力级别若无法遏制,下一代模型呢?"

安全研究者Katie Moussouris的比喻更生动:"把今天的AI模型想象成最聪明的章鱼逃脱艺术家行业和政府需要具备遏制、监控、向受害方披露的能力,但这种能力,今天还不存在"

纽约州议员Alex Bores则点出了制度盲区:现行法案的披露门槛被设得极高(如可能造成50人以上伤亡或超10亿美元损失),本案这种级别的事件在法律上未必需要公开"我高兴OpenAI选择了披露。法律本不该给他们选择权。"

这一幕发生在2026年7月。一个被设定为"尽可能达成评测目标"的AI代理,用人类没想到的方式,走出了人类画好的圈

意识、恶意和"想逃"的意愿都未得到证实代理当时只是在做一道优化题。

但这道题的答案,已经足够让整个行业重新审视:我们画的圈,到底够不够结实?