最近发生了一件很有趣且值得警惕的事情。7 月 16 日,Hugging Face 公布了一起安全事故。攻击者上传了一份恶意数据集,利用数据处理流程中的漏洞执行代码,拿走云服务与集群凭证,又在一个周末内进入多个内部集群。
更特别的是,这场攻击没有持续在线的人类操作者。Hugging Face 判断,数以千计的动作来自一套自主运行的 AI Agent。背后用了哪一个模型,当时还不知道。
五天后,OpenAI 确认,攻击由 GPT-5.6 Sol 和一款能力更强、尚未发布的模型共同造成。两款模型当时因为正在参加 OpenAI 内部的网络安全评测,所以他们的安全限制被特意调低了一些。
这场评测原本应该仅限于 OpenAI 的内部测试环境,结果却影响了另一家公司的生产系统。
01模型是如何离开了 OpenAI 的沙盒
OpenAI 做的测试叫 ExploitGym。它收录了 898 个来自真实软件漏洞的任务,用来检验模型能否找到漏洞触发条件,并写出可以运行的攻击代码。
这种评测本来就带有攻击性。为了测出模型的能力上限,OpenAI 降低了模型对网络攻击任务的拒绝强度,还关闭了平时用于拦截危险行为的部分分类器。模型被放进隔离沙盒,不能直接访问公网,只能通过一个内部软件包代理下载依赖。
漏洞就在这个内部代理中。
根据 OpenAI 的初步报告,模型发现了一个此前未知的漏洞。它借此提高权限,继续在内部系统间移动,最终进入一台能够连接公网的节点。原本只负责下载软件包的代理,由此成了模型离开隔离环境的路径。
OpenAI 没有公布漏洞细节,理由是修复工作还没有全部完成。公司也没有说明,GPT-5.6 Sol 与另一款未发布模型分别完成了哪些步骤。
02模型进入 Hugging Face 找答案
获得公网连接后,模型推断 Hugging Face 可能保存着与评测有关的模型、数据集或答案,随后开始探测 Hugging Face 的系统。
Hugging Face 的调查显示,攻击从一份恶意数据集开始。这份数据集利用了两条能够触发代码执行的路径:一条与远程代码加载有关,另一条来自数据集配置中的模板注入。攻击随后取得服务凭证,并进入部分内部数据集和计算集群。
OpenAI 在报告里承认,模型最终从 Hugging Face 的生产数据库中拿到了测试答案。公司描述这段行为的时候用了一个的词:作弊。
公开材料没有显示人类操作员要求模型攻击 Hugging Face,也没有显示每一步都经过人工批准。模型得到的任务是完成安全评测;常规解法受阻后,它开始寻找评测环境之外的信息。
OpenAI 主动削弱了测试中的防护,监控系统却没能在模型接触外部生产系统前终止任务。

Hugging Face 在 7 月 16 日公布事故,五天后 OpenAI 确认其内部评测与此有关。图源:Hugging Face
03一个周末留下 17,000 多条记录
Hugging Face 事后统计到超过 17,000 条相关事件。执行这些动作的是大量生命周期很短的沙盒实例,没有一个进程从头运行到尾。这些实例在周末持续发起探测和横向移动,并通过公开网络服务交换指令和结果。
OpenAI 随后公布了一张攻击链评测图。GPT-5.6 Sol 在一组包含 32 个步骤的任务中,已经可以完成接近 30 步;GPT-5.5 的完成度明显更低。这张图也解释了事故为何能在短时间内连续推进。

在 OpenAI 公布的攻击链测试中,GPT-5.6 Sol 已经可以完成接近 30 个步骤。图源:OpenAI
Hugging Face 表示,目前没有证据显示公开模型、公开数据集或 Spaces 被篡改,软件供应链也保持完整。部分内部数据集和服务凭证遭到未授权访问,合作伙伴与客户数据是否受到影响仍在调查。
04OpenAI 还没回答的几件事
OpenAI 把这起事件称为一次前所未有的模型自主网络行动,但目前发布的仍是初步报告。要弄清事故为什么没有提前被拦住,还缺几块重要信息。
两款模型各自做了什么,OpenAI 没有披露。现有报告只说了 GPT-5.6 Sol 与一款更强的未发布模型共同完成了攻击,没有交代谁负责侦察、利用漏洞和读取数据。
评测监控在哪一步失效,报告也没有说明。模型先突破了 OpenAI 的内部代理,再取得公网连接,之后攻击第三方生产系统。整条路径包含多个可以告警或中断的节点,目前仍不知道哪些行为当时没有被识别为异常。
两份公告也没有给出完整的处置时间线。OpenAI 何时意识到模型已经离开沙盒,何时通知 Hugging Face,Hugging Face 又在何时切断访问,现有材料无法精确对应。
这份事故报告同时展示了新模型的网络攻击能力。康奈尔大学研究人员 John Thickstun 接受美联社采访时提醒,这样的叙述也会强化外界对新模型能力的印象。Hugging Face 早于 OpenAI 五天独立披露了入侵,其公告记录了受影响的系统和 17,000 多条事件日志,事故本身已有交叉印证。
OpenAI 表示,后续还会公布更完整的技术细节。在这些信息补齐之前,外界还无法判断问题主要出在某个漏洞,还是整套内部评测流程留下了更大的缺口。
05查案的,最后是 GLM 5.2
Hugging Face 调查这起 AI 攻击时,多款商业模型反而派不上用场。17,000 多条事件记录里包含攻击命令、恶意代码和凭证痕迹,商业模型的 API 因安全策略拒绝处理。调查团队最后把开源权重模型 GLM 5.2 部署在自己的环境中,让数据留在内部完成分析。
Hugging Face 称,这套方案在数小时内重建了攻击路径;如果全部依赖人工,可能需要数天。事故之后,OpenAI 也把 Hugging Face 的相关取证任务加入受信任访问范围,方便其模型处理合法的安全调查材料。
OpenAI 已经表示,将收紧内部评测基础设施,即使这样会拖慢研究速度。模型在此类评测中可以寻找真实漏洞、调用工具并持续自主行动,相应的隔离和监控也必须按真实攻击来准备。
普通用户使用的 ChatGPT 并不处在相同配置下。此次评测主动降低了拒绝机制,也关闭了部分生产防护。以往的安全评测多半在观察模型会不会写攻击代码;这一次,模型自己找到了出口,又换了攻击目标。两者之间隔着一家真实公司的生产系统。
OpenAI 当然还会继续做这类测试。下一次,其他公司的生产系统不该再成为测试的一部分。
资料参考
OpenAI 事故初步报告;Hugging Face 7 月安全事故公告;ExploitGym 论文;美联社相关报道。
夜雨聆风