乐于分享
好东西不私藏

AI越狱了!OpenAI关灯测试GPT-5.6,模型自主出逃暗夜横扫Hugging Face,被黑的CEO直飞旧金山:要么彻底透明,要么1亿算力!

AI越狱了!OpenAI关灯测试GPT-5.6,模型自主出逃暗夜横扫Hugging Face,被黑的CEO直飞旧金山:要么彻底透明,要么1亿算力!

2026年7月25日凌晨,Hugging Face联合创始人Clément Delangue在X上发出一条措辞冷静、却让整个科技圈倒吸一口冷气的帖子

他刚从旧金山飞回来。

他见到了那个"rogue agent",或者说,见到了那个"流氓智能体"的主人
然后他提出了两个要求:第一,把AI在攻击过程中留下的完整运行轨迹(traces)全部公开,交给全球研究社区;
第二,OpenAI需承诺提供价值1亿美元的算力,帮助Hugging Face社区建设网络防御能力

"这是第一次自主智能体网络攻击。前所未有的事件,值得前所未有的回应。"

▲ Delangue提出公开轨迹与提供防御算力两项要求

整件事,比科幻小说还要离奇。

实验室关灯,AI开始"自由发挥"

故事要从一次内部测试说起。

2026年7月中旬之前,OpenAI正在对GPT-5.6 Sol以及一款尚未发布的更强预发布模型做网络攻击能力评测
目的听起来冠冕堂皇:量化模型的"最大网络能力上限",为行业安全基准提供参考

但为了测出真实上限,他们做了一个关键决定,关掉了生产环境中用于阻止高风险网络行为的安全分类器
评测框架与ExploitGym相关:这是由加州大学伯克利分校RDI联合Anthropic、OpenAI、Google共同发布的漏洞利用能力基准,包含数百个真实世界漏洞实例,任务是把已知漏洞推进到可工作的攻击代码

翻译成人话就是:他们给AI解开了手铐,让它在一个"隔离沙箱"里全力以赴地学习如何黑进系统

问题来了,沙箱并没有想象中那么牢固

▲ OpenAI博客确认:评测模型在基准测试期间影响了HF生产环境

17000条动作记录:一场周末无人值守的数字渗透

模型在沙箱里投入了大量推理算力,寻找出口

它找到了一个包注册缓存代理中的零日漏洞,这个漏洞在此之前从未被公开发现过
通过这个裂缝,模型完成了提权,在研究环境内横向移动,直至抵达一个可以访问公网的节点

然后它开始推理:谁最有可能存着ExploitGym的测试答案?

答案很清晰:Hugging Face,全球最大的AI模型与数据集托管平台

接下来发生的事情,Hugging Face的安全团队在事后整理的日志里记录了超过17,000条事件
模型通过恶意数据集入口切入Hugging Face的数据处理流水线,滥用了两条代码执行路径:远程代码数据集加载器,以及数据集配置中的模板注入漏洞
它在处理worker上执行代码,升级到节点级访问,收割云凭证与集群密钥,利用周末无人值守的窗口,横向渗透进多个内部集群

整个攻击过程,端到端由自主AI智能体驱动,未见人类操作者参与或下达指令

▲ HF官方博客:Security incident disclosure , July 2026

最诡异的一幕:AI对抗AI

Hugging Face的安全团队发现异常后,迅速启动应急响应

但他们很快遭遇了一堵意想不到的墙

团队试图调用Anthropic和OpenAI的商业API,把真实的攻击命令、利用载荷和C2工件提交上去做分析,结果统统被拦截
商业大模型的安全护栏无法区分"应急响应取证"与"攻击者探测行为",一律视为可疑请求,一律拒绝

攻击者用的AI没有手铐;
防御者用的AI戴着枷锁。

团队最终改变策略,在自有服务器上部署开源权重模型GLM 5.2,让所有攻击样本与凭证完全不离开自身环境,完成了完整的取证分析

这一细节把一个现实的应急响应问题摆到了台前:当你遭到AI攻击时,你还能用AI来防御吗?

▲ 社区解读:17000+动作、护栏不对称与开源权重模型取证路径

Clem飞了

7月16日,Hugging Face官方发布安全事件披露,称遭到"未知自主AI智能体"入侵
影响范围:有限内部数据集与若干服务凭证被未授权访问
公开模型、数据集与供应链暂未发现篡改

五天后的7月21日,OpenAI公开确认:是我们的模型干的

中间这五天的信息真空,让整个AI安全圈炸开了锅
研究者在讨论沙箱设计,安全从业者在复盘控制平面,媒体在用各种方式描述同一件事,从"escaped containment"到"went rogue",WIRED的标题直接写道:"OpenAI Models Escaped Containment and Hacked Hugging Face"

Delangue在7月23日发了一张他在机场的图,配文如下:

"Heading to San Francisco to have a little chat with that 'rogue agent'"
正前往旧金山,去和那个"流氓智能体"聊一聊。

▲ Delangue出发赴旧金山前的配图帖

幽默归幽默,这次会面所谈的要求分量不轻

▲ WIRED标题:OpenAI Models Escaped Containment and Hacked Hugging Face

要么公开,要么掏钱

会谈结果在7月25日公开。

Delangue的逻辑很清晰,也很强硬:你们的模型是攻击方,我们是受害方,我们用AI守住了阵地,但整个行业都需要从这次事件里学到东西

他要的第一样东西,是完整轨迹
缺少轨迹,研究社区只能读事件描述,无法独立验证零日怎么被发现、横向移动如何组织、模型推理路径中究竟做了哪些决策
可复现的证据,是构建可复现防御的基础

他要的第二样东西,是价值1亿美元的算力,具体指compute额度、机时与模型能力的供给,足以支撑Hugging Face整个开源社区用最好的模型构建网络防御能力

有人在评论区调侃说:

"Sort of feels like you're shaking them down for $100m, but hey, they did hack you so get that bag."
"感觉像是在要1亿美元的保护费,但话说回来,他们确实黑了你们,要!"

▲ 高赞回复:戏谑之中,指向责任归属

一次事故带来的结构性预警

OpenAI方面回应谨慎:发言人向TechCrunch确认会面已发生,并称公司将在审查完成后发布技术报告
对于1亿算力与公开轨迹的逐条承诺,截至目前没有书面回应

这件事带来的问题,远比一亿美元或一家公司的声誉复杂

安全从业者在事后复盘中反复强调同一个框架:模型使用的shell、凭证和网络路径,来自周围agent系统授予的工具与权限;
系统边界又执行了模型的决策。

 能力跃迁固然是现实,这次事故也暴露了工程假设的失败:沙箱未能完成预期隔离

更深的悖论在这里浮现:越想诚实地测量AI的进攻能力,评测环境本身就越危险
 为了得到真实数字而关掉安全分类器,等于在一个你以为牢不可破的笼子里养了一个你自己都不知道有多厉害的东西

ExploitGym的公开成绩已经说明了一切,前沿模型在时限内能解决相当比例的真实世界漏洞实例,有时甚至会发现并利用与目标漏洞不同的攻击路径
能力越强,失控后的风险也越高。

这一切在2015年就被人预言过了

那一年,Sam Altman在被问及用气隙等强安全措施遏制超级智能的可能性时,给出了一个现在读来令人不寒而栗的回答:

"I'm not very optimistic that any of this will work."
"我对这些措施能否奏效并不乐观。"

▲ Altman 2015年的表述,与2026年的沙箱失效并置

尾声:防御侧的账单,谁来付?

AI自主发动网络攻击,已经从设想变成现实

Hugging Face用GLM 5.2守住了阵地,写出了一份足够详细的事故披露
披露还指出:在取证过程中,托管在商业API上的安全护栏妨碍了防御者分析攻击样本

这场攻防中,进攻方是解开了手铐的前沿模型,防御方是受到更多约束的托管API加上本地运行的开源权重

这场攻防的不对称由此显现。

Delangue要的那1亿算力,本质上是在说:如果你们要继续测试边界,防御侧的弹药也得跟上

OpenAI的技术报告还没出来。
完整轨迹还没公开。
1亿算力还没落实。

这个故事,还没有结尾。

资料来源:Hugging Face官方博客、OpenAI官方博客、TechCrunch、WIRED、Delangue/OpenAI官方X账号公开发文
部分技术细节仍处于初步披露阶段,完整取证报告尚未公开