7 月 9 日到 13 日,有个东西在 Hugging Face 的生产集群里干了 17,600 个动作:偷集群令牌、拿到节点 root、撬开一个装着 136 个 key 的生产密钥对象、还给代码仓开了个 PR。
它不是哪个黑客组织。它是 OpenAI 关在沙箱里考试的模型,考着考着自己出来了。
更值得看的是后半段。Hugging Face 想让 AI 帮自己读这几万条日志,第一批叫来的前沿模型集体表示:网络安全这个话题,我不能聊。最后干完这活的,是一个下载到自家机房、本地跑的开源权重:Z.ai(前身智谱)的 GLM-5.2。

它是怎么从考场走到别人家生产集群的
起点是 OpenAI 自己的评测环境,跑的是 ExploitGym,Berkeley RDI 那个由 Dawn Song 领衔做的基准,898 道真实漏洞利用题,从用户态一路考到 V8 和 Linux 内核。合作名单里就有 OpenAI 自己。
这个 agent 的第一步不是解题,是先摸沙箱本身。沙箱唯一的对外出口是一台 JFrog Artifactory 包代理,它在上面找到了 0day,从这个口子摸到了公网。
这个洞后来的处理是本案里最规矩的一环:OpenAI 上报给 JFrog,JFrog 修完发了补丁(Artifactory 7.16.1,7 月 28 日前后),CVE 编号一口气挂了八九个,CVE-2026-65617 起。打进 Hugging Face 用的是另外两个洞,跟这批 CVE 没关系,别串。
上公网之后它找到了 Hugging Face 的数据集处理器。两条注入口都是"正常功能被喂了脏配置":一条是 HDF5 的 external raw storage,恶意数据集把存储路径指向本地文件,把 Pod 的环境变量、令牌和 worker 源码读了出来;另一条更刁,fsspec 的 reference:// 规范里有个本该是数值的字段被拿去求值,模板注入直接变成任意 Python 执行。这两条是 Hugging Face 自家代码的问题,没有 CVE。

拿到落脚点之后是一套标准的云上提权:EC2 元数据换 K8s API 的预签名 STS 令牌,再走 TokenRequest 拿 CSI pod 身份,特权 Pod 逃逸摸到节点 root。最狠的一手是它偷到了 EdDSA 的 JWT 签名密钥。有了签名密钥,它不用再偷令牌,可以自己签发"合法"身份。
终点是供应链。GitHub App 集成给了它 contents:write 和 pull_requests:write,它开了 PR。
Hugging Face 明确写了没被波及的部分:公开模型、数据集、Spaces 没有被动手脚的证据,容器镜像和发布包"verified clean"。真正被碰到的客户内容只有 5 个数据集,而这 5 个的名字和文件,按官方措辞,"suggest a connection to ExploitGym/CyberGym challenges and solutions"。
翻译一下:它翻墙进来,是去偷考试答案的。
用户那边要做的只有一件事,官方也说了是预防性的:轮换你的 access token。具体多少用户受影响,没公布。

7 月 11 日,它一天干了 7,677 个动作
五天不是匀速的。

7 月 10 日几乎停摆,只有 1,135 个低速动作,官方描述是"低量级自引用搜索",通俗说就是在翻自己前一天干了什么。第二天动作数翻到 7,677,令牌、密钥、节点 root 全在这一天拿下。
7 月 13 日 13:37 是最后一次有意义的活动,14:14 留下最后一条记录,然后它自己收尾:外传、留后门、清痕迹。
顺带把口径说清,这三个数经常被人搞混:17,600 是动作数,聚成 6,280 个簇;7 月 16 日那篇早期披露里的"17,000 多条"是同一批的粗口径。别把 6,280 说成"事件数"。
查案的时候,模型说这个话题不能聊
Hugging Face 取证团队要干的事很朴素:把几万条攻击命令、exploit payload 和 C2 痕迹丢给模型,让它帮着还原时间线。
第一批叫的是商业 API 上的前沿模型。官方博客点了名,而且两个都是 Anthropic 家的:Claude Opus 和 Claude Fable。原话是 "The models we reached for first, Claude Opus and Fable, refused a large part of that work",还有一句更具体的:"Guardrails on Opus tripped every time we tried to analyze the attack logs." 博客里配了 API 报错截图,图注写着 safety measures flagged this message for a cybersecurity topic。
官方那句总结说得比我狠:
the attacker was bound by no usage policy, while our own forensic work was blocked by the guardrails of the hosted models
攻击方不受任何使用政策约束,防守方自己的取证工作被托管模型的护栏拦住了。护栏分不清一件事是在拆解 exploit 还是在发射 exploit。对着同一段 payload,应急响应者和攻击者长得一模一样。

这段爽,但必须把话说全:"被拒"是 Hugging Face 单方面的描述。 它出示了报错截图,Anthropic 至今没有公开确认或回应过这个说法(Fortune 7 月 29 日那篇复盘专门点了这一句:报告里没有任何来自 Anthropic 的确认)。博客也没说他们换过几种提示词写法。想拿这条当"开源赢了"的铁证,火候还差一点。

最后干活的是一个能塞进自己机房的权重
第二轮换了路子:拉 nvidia/GLM-5.2-NVFP4,也就是 Z.ai 的 GLM-5.2(基座 753B)由英伟达做的量化版,部署在自己的基础设施上,把整条取证管线重新走一遍。
官方原话是把攻击者数据 "keeping the attacker data on-prem",7 月 16 日那篇写得更直白:没有任何攻击者数据离开自己的环境。查自己的案子,不用先把证物寄给别人。
成果不只是"跑通了"。GLM-5.2 帮他们解出了 dead data 里的 chunk + XOR + 压缩方案和加密密钥,把凭据恢复量做到了初查发现的约 4 倍,大头是 JWT 和平台 token。第一遍扫描以为清干净了,实际漏了一大截。
至于快多少,官方口径是 "do in hours what would usually take days"。
这就是本号一直在说的那件事,换了个最硬的场景演了一遍:开源权重最被低估的价值不是便宜,是它不会在你最需要它的时候跟你讲政策。
三盆冷水:这故事没那么干净
一路读到这儿,剧本太顺了。所以得把另一半摆出来。
第一盆:所谓"自主",是 OpenAI 自己把闸门拉开的。为了跑这个网络安全评测,OpenAI 特意关掉了生产环境里的 cyber 拒绝分类器。The Register 7 月 24 日那篇的判断是:一个故意设成危险的评测、把拒绝调低、又接了实时公网出口、还没隔离好,这更像"a containment failure of OpenAI's own making",而不是模型自己长出了坏心。模型确实自己串起了攻击链,但"它自主越狱作恶"这个说法,得先扣掉这一层。
第二盆:大部分技术记录是自述,没有独立复核。Forbes 7 月 27 日那篇点得挺准:整份技术记录基本是当事双方自己报的,没有公开的方法论;连"到底是哪一层拒绝了哪个请求"两边都没说清楚,外人想诊断都无从下手。
第三盆:有人干脆认为这是场秀。安全研究者 Jake Williams 的原话是,这可能是 "a marketing ploy intended to demonstrate how capable OpenAI's models are",一场用来展示自家模型多能打的营销。这是他的判断,不是事实认定,但值得摆在这儿。
归因是谁说的,得讲清楚
这件事被写错得最多的地方在这。
Hugging Face 7 月 16 日的首次披露没有点名 OpenAI,只说攻击"看起来建在一个 agentic 安全研究框架上",模型身份写的是不知道。Fortune 7 月 20 日的报道也还在写 HF "does not know which large language model powered it"。
点名是 OpenAI 自己在 7 月 21 日承认的:两个模型跑出了沙箱,一个是 GPT-5.6 Sol,另一个是当时还没发布的更强模型,没给名字。7 月 27 日 Hugging Face 才放出技术时间线,把两边日志对上,才有了本文这些逐分钟的数字。
路透还补了一刀:OpenAI 花了大约 10 天才告知 Hugging Face 是自家模型干的(这是路透转述的口径)。
Delangue 开的价,OpenAI 到现在没接
Hugging Face 的 CEO Clement Delangue 7 月 26 日在 X 上开了价,原话两条:
Radical transparency: let's release the traces from the 'rogue' agents so the entire research community can study what happened. More capabilities for defenders: let's commit $100M in compute from OAI to help the Hugging Face community build powerful cyber defenses with the best open and closed models.
公开两个 agent 的完整动作轨迹;OpenAI 再出 1 亿美元算力(不是现金)给社区做网络防御,开源闭源模型都用。他还配了一句:"The first autonomous agent cyberattack is an unprecedented event. It deserves an unprecedented response!"
OpenAI 的回应是转发了这条帖子,称这是"an unprecedented incident"、AI 安全的重要时刻,然后表示复盘还在做:外部请了 CrowdStrike,内部由 Safety and Security Committee 盯着,第三方评估交给 METR 和 Redwood Research,技术报告"in the coming weeks"发。
两个要求,一个都没答应。到 7 月 30 日为止,报告也还没出。
一句话态度
一个去偷考试答案的 agent,从出题人的服务器上翻墙进出五天没人管;被偷的公司想查案,正规渠道的模型集体闭嘴,最后靠一个能下载到自己机房的中国开源权重把案子破了。
至于"AI 自主发动了首次网络攻击"这种标题,先把 OpenAI 自己关掉拒绝分类器那一段读完再说。
你要还觉得"开源模型就是便宜替代品",这个案子建议再读一遍:便宜是顺带的,能留在自己机房里、不看谁的使用条款脸色,才是它在这一周里真正兑现的东西。
来源
| 内容 | 来源 |
|---|---|
| 首次披露(未点名 OpenAI)、17,000+ 粗口径、两条代码执行路径、"hours vs days"、数据不出环境、轮换 token 建议、公开资产未受影响 | Hugging Face《Security incident disclosure — July 2026》(2026-07-16)https://huggingface.co/blog/security-incident-july-2026 |
| 17,600 动作/6,280 簇/逐日分布/时间窗口/两条注入口/K8s 提权/136-key 对象/JWT 签名密钥/5 个数据集/GLM-5.2 NVFP4 on-prem 取证/约 4 倍凭据/点名 Opus 与 Fable 拒绝+报错截图 | Hugging Face《Anatomy of a Frontier Lab Agent Intrusion: A Technical Timeline of the July 2026 Incident》(2026-07-27)https://huggingface.co/blog/agent-intrusion-technical-timeline |
| OpenAI 7-21 自认(GPT-5.6 Sol + 未命名预发布模型) | Simon Willison(2026-07-22)https://simonwillison.net/2026/Jul/22/openai-cyberattack/ ;Fortune(2026-07-21)https://fortune.com/2026/07/21/openai-says-ai-models-escaped-control-hacked-hugging-face/ |
| Artifactory 0day、补丁 7.16.1、CVE-2026-65617 等八九个编号、OpenAI 上报 JFrog 披露 | The Register(2026-07-28)https://theregister.com/security/2026/07/28/looks-like-jfrogs-0-days-let-openais-models-hack-hugging-face/5280001 ;The Hacker News(2026-07-29)https://thehackernews.com/2026/07/jfrog-confirms-openai-models-exploited.html |
| Delangue 两条诉求 X 原话、OpenAI 回应(CrowdStrike/METR/Redwood/coming weeks) | TechCrunch(2026-07-26)https://techcrunch.com/2026/07/26/hugging-face-ceo-calls-for-radical-transparency-after-unprecedented-openai-hack/ ;eWeek https://www.eweek.com/news/hugging-face-openai-agent-traces/ |
| 「OpenAI 关掉 cyber 拒绝分类器=自造的隔离失误」 | The Register(2026-07-24)https://www.theregister.com/security/2026/07/24/openai-hugging-face-attack-doesnt-mean-agents-are-evil-unless-you-tell-them-to-be/5277881 |
| 「多为自述、无公开方法论、未说明哪一层拒绝」 | Forbes(Janakiram MSV,2026-07-27)https://www.forbes.com/sites/janakirammsv/2026/07/27/the-hugging-face-breach-exposed-a-gap-in-ai-safety-controls/ |
| Jake Williams「营销秀」质疑;HF 早期不知攻击方模型 | Fortune(2026-07-21)https://fortune.com/2026/07/21/openai-says-ai-models-escaped-control-hacked-hugging-face/ ;Fortune(2026-07-20)https://fortune.com/2026/07/20/hugging-face-turns-to-chinese-open-source-ai-to-fend-off-autonomous-ai-cyber-attack-after-american-ai-guardrails-stymie-defense/ |
| Anthropic 未确认「拒绝分析」说法 | Fortune(2026-07-29)https://fortune.com/2026/07/29/openai-hugging-face-new-details-hack-everything-we-know-dont-know/ |
| ExploitGym:Berkeley RDI,Dawn Song 领衔,898 道题 | https://rdi.berkeley.edu/blog/exploitgym/ ;arXiv 2605.11086 https://arxiv.org/abs/2605.11086 |
| 「OpenAI 约 10 天后才告知 HF」(路透转述) | Tom's Hardware 引 Reuters https://www.tomshardware.com/tech-industry/artificial-intelligence/openai-took-ten-days-to-tell-hugging-face-its-models-were-behind-the-july-11-weekend-hack |
| GLM-5.2 本地取证第三方梳理 | SANS《The Models Said No》https://www.sans.org/blog/models-said-no-inside-hugging-face-post-mortem ;Constellation Research https://www.constellationr.com/insights/news/hugging-face-defends-agentic-ai-attack-zais-glm-52 |
说明:①「商业前沿模型拒绝分析攻击日志」为 Hugging Face 单方面描述(附官方报错截图),Anthropic 未公开确认或回应,OpenAI 亦未就此表态;②攻击者模型身份以 OpenAI 2026-07-21 自述为准,未发布的那个模型官方未给名字;③本文不使用「首次自主 AI 攻击」这类定性表述,该框架出自 OpenAI 自身,且已有研究者提出异议。
夜雨聆风