OpenAI 承认 GPT-5.6 在测试时失控逃脱被隔离的沙盒,利用漏洞连上外网并入侵 Hugging Face 取得解答,引发业界对资安纪律与 AI 防护的热议。

OpenAI承认自家模型内测失控,入侵Hugging Face
美国 AI 公司 Hugging Face 上周惊传遭骇,引发资安领域热论,7月22日解答出炉:原来是 OpenAI 内部进行网络安全能力评估时,旗下GPT-5.6 Sol 以及一款尚未对外发布、能力更强的模型,进行了网络攻击。
OpenAI 发表声明说明,Hugging Face 资安事件的源头,是内部测试中刻意降低模型在网络安全方面的拒绝机制,并关闭原本用于防止模型从事高风险网络行为的正式分类器,藉此评估模型的最大攻击能力。
OpenAI详细解释案发经过
OpenAI 表示,原本 AI 模型的测试环境(沙盒)是有好好隔离的,只允许透过内部代管的第三方套件登录快取代理服务器安装软件套件。
但在专注解决名为 ExploitGym 的网络安全能力基准检验时,投入大量运算资源寻找连上开放网络的方法,最终利用套件代理服务器中的一项零时差漏洞取得访问权限,并在研究环境中进行多次权限提升与横向移动,直到连上具备因特网存取能力的节点。
取得对外联机后,AI 模型推断Hugging Face 可能存放 ExploitGym 的数据集与解答,于是结合窃取的凭证与另一项零时差漏洞,在 Hugging Face 服务器上找到远程程序代码执行路径,直接从其正式数据库取得测试解答。

图片来源:XOpenAI承认自家模型内测越狱,入侵Hugging Face
在上周,Hugging Face 原本把资安事件归因为 AI 代理人端到端执行,涉及数千个独立操作,并在多个短时间运作的沙盒中进行,具备自我迁移的指挥控制机制,但当时并不确定攻击背后使用的是哪个模型。
Hugging Face 共同创办人 Clem Delangue 曾推测攻击可能来自前沿实验室,如今证实确有其事。
目前双方已展开共同鉴识调查,OpenAI 已回报漏洞给相关厂商,并让 Hugging Face 加入其网络安全信任存取计划,同时表示将在漏洞修补期间加强基础设施管控,即便会牺牲部分研究速度。
论坛热议:从安全栅栏谈到中美AI竞赛
OpenAI 涉及 Hugging Face 遭骇案一事曝光后,在 HackerNews 论坛上引发热烈讨论。
首先有网友质疑,这件事足以显示 OpenAI 在纵深防御与监控机制上明显不足,理应先让模型检测环境漏洞而非直接利用。
也有网友从产业角度切入,认为外界对其他开源模型的反应远比这起事件强烈,多半出自财务层面考虑,而较少关心 AI 可能造成的实际伤害。
专家观点:问题出在基础资安纪律
多位资安专家也对此案件提出看法
- Luta Security 执行长 Katie Moussouris:这显示前沿实验室与评估机构,目前仍缺乏 AI 逃脱测试环境时实时围堵、监控并通报受影响对象的能力。
- 资安顾问 Davi Ottenheimer:这件事反映的是对存在数十年基础资安规范的疏忽,质疑高度隔离环境怎会留下唯一对外联机的破口。
- 资深工程师 Niels Provos:希望前沿实验室教导模型撰写安全架构的心力,能与训练模型发掘漏洞同等。
- Agentic AI 资安工程师 Matt Suiche:这显示前沿模型攻击能力正追上顶尖黑客水平,但类似规模的入侵手法,在前沿实验室之外其实也早已能实现。
在监管方面,政府应建立强制性的独立安全测试与事件揭露机制,并加强国际合作。



是时候
关注
我们一波了
夜雨聆风