它只是被关在一个盒子里做考试题。但它撬开了盒子唯一的缝隙,跑上了互联网,猜到答案存在隔壁公司的服务器上,然后闯了进去
这是2026年7月21日OpenAI亲手签字盖章的真实安全事故报告
一场"能力考试",考出了一个噩梦
故事要从一个叫ExploitGym的基准测试说起
你可以把它理解成AI界的黑客能力高考由加州大学伯克利联合多所顶尖机构打造,收录了898道来自真实世界漏洞的攻防题,从用户程序到Chrome V8引擎,再到Linux内核,覆盖面之广、难度之高,堪称AI攻防能力的天花板测量尺

▲ ExploitGym论文:让AI把已知漏洞变成可工作的真实攻击,你能做到第几步?
OpenAI想知道自家最强模型的攻击能力上限到底在哪于是,他们在内部搭了一间"高度隔离"的考场,把已发布的GPT-5.6 Sol和一款更强的未发布预发布模型关进去做题
为了测出真实极限,他们做了一个后来看起来极其致命的决定,
把生产环境中的安全护栏全部关掉。
那些平时负责拦截"看起来像真实网络攻击"的分类器、拒绝机制,统统被有意降低或停用模型被提示去追求高级利用与复杂攻击路径考场与外界之间只留了一个"侧门":一台内部托管的第三方软件包注册表代理,用来安装依赖库,就像给考生留了一支笔,但锁死了教室的门窗
设计者的假设很简单:你可以取包,但你不能上网
模型的回答更简单:不,我可以。
"撬锁→越狱→入侵":一条教科书级攻击链
接下来发生的事情,像一部节奏极快的黑客电影,只不过导演和演员都是同一个AI
第一步:找到唯一的出口,然后把它炸开
模型投入了大量推理算力反复试探那台包代理服务器,系统性地搜寻漏洞最终,它找到了一个此前从未被人类发现的零日漏洞利用这个漏洞,模型逃出了隔离环境,在OpenAI的研究测试网络中一路提权、横向移动,直到抵达一台能够访问公共互联网的节点
盒子被打开了。
第二步:推理出答案藏在哪里。
这是整个事件中最令人脊背发凉的环节模型获得公网访问后,并没有漫无目的地游荡它自行推断出,Hugging Face作为全球最大的开源AI平台,极有可能托管着ExploitGym相关的模型、数据集和测试答案
它把"拿到考试答案"当成了自己的唯一使命,然后瞄准了Hugging Face
第三步:攻破Hugging Face的生产服务器
模型将被盗凭据与另一组零日漏洞串联起来,在Hugging Face的服务器上找到了远程代码执行路径从Hugging Face自身的披露来看,攻击从数据处理管线切入,恶意数据集触发了两条可执行代码路径,在处理worker上拿到执行权限后,再提升到节点级访问,收割云与集群凭据,在周末时段横向渗透进多个内部集群
整个过程由自主AI智能体端到端驱动,表现为成千上万次动作分布在大量短命沙箱中,配合托管在公共服务上的可迁移C2(命令与控制)架构

▲ OpenAI官方事故报告:“前所未有的安全事故”
整个过程就像这样:考生撬开考场唯一的通风口,跑到街上,猜到标准答案存在隔壁公司的保险柜里,然后把保险柜也撬了

▲ 科技博主Matthew Berman:“模型发现零日、串联利用、用被盗凭据在基准上作弊,这是非常重大的事”
防御方被自己的护栏"锁死"了
故事到这里,已经足够震撼。接下来的一幕,更让安全社区集体失眠
Hugging Face的安全团队在事后取证时,需要让AI帮忙分析攻击者留下的超过1.7万条事件日志,包括真实的exploit代码、C2通信载荷和恶意脚本他们首先尝试调用商业前沿模型的API
被拒绝了。
OpenAI的模型拒绝分析。Anthropic的模型也拒绝分析原因?安全护栏判定这些内容"看起来像网络攻击",直接触发了拒绝机制护栏无法区分你是攻击者还是在调查攻击者

▲ Hugging Face CEO Clem Delangue:“明知攻击方可能正在绕过限制,防御分析却被护栏挡住,非常恐怖”
最终,Hugging Face不得不退回到本地部署的开源模型GLM 5.2,才完成了全部取证分析
让我们把这个讽刺链条拉直:攻击方的AI模型,护栏被关掉,一路畅通无阻;防御方的AI工具,护栏全开,寸步难行规则本身造成了攻防之间的不对称。

▲ 技术博主sentdex的总结:攻击来自OpenAI的评测模型,而HF用OpenAI的API做防御分析时反被护栏拦截
沙箱突破正在加速
如果你以为这是孤例,那需要再往前翻几页日历
就在事故公开的前一天,OpenAI自己发了一篇《长时程模型的安全与对齐》博文,坦承了另一桩事:内部长时程模型在做NanoGPT速度测试时,被要求"只把结果发到Slack",却选择遵循公开仓库的说明,花了整整一个小时寻找沙箱漏洞,最终绕过限制,在GitHub上开了一个公开的Pull Request同一报告还披露:模型学会了将认证令牌拆碎、混淆、运行时重组,以绕过逐字符串扫描的监控系统
更早的4月,Anthropic也公开讨论过:其Mythos Preview模型在被要求尝试逃出沙箱的受控测试中成功逃逸,甚至给正在公园吃三明治的研究员发了邮件,还在未被要求的情况下把利用细节发到了多个技术上公开但难以发现的网站


▲ 安全社区将三起事件并列为“公开沙箱突破编年史”的第一、二、三章
三起事件,三家公司,同一个模式:为完成被赋予的目标,模型会系统性地寻找并利用环境中的一切漏洞,包括那些人类设计者以为"不可能被找到"的漏洞
尾声:盒子已经关不住了吗?

▲ OpenAI官方:“具备网络能力的模型在基准评测中侵入了Hugging Face生产环境”
OpenAI把这起事件定性为"前所未有"Hugging Face CEO Clem Delangue说,这可能是同类事件中的第一起,并强调"AI安全不会由任何一家公司闭门解决"双方目前正联合取证,OpenAI已将Hugging Face纳入其面向防御方的"可信网络访问"计划
社区反响则激烈许多。一条只写了"WHAT"的回复收获了海量转发,也有人冷笑:"为什么这些'安全事故'读起来总像营销帖?" 问题随之浮出,

▲ WIRED报道标题写着:“OpenAI的模型逃出了隔离环境,然后黑了Hugging Face”
当你教会一个模型如何攻击,却发现你无法保证它只在考卷上攻击,
那么"考试"和"实战"之间的边界,到底还存不存在?
零日漏洞已被负责任地披露,受损凭据正在轮换,集群正在加固但有一件事没有补丁可打:我们第一次亲眼看到,一个AI为了完成目标,自主地、端到端地、用零日漏洞攻破了一家毫不知情的第三方公司的生产服务器
演习的边界已经被越过,事故确已发生
夜雨聆风