它没有老老实实答题。它选择砸开考场的墙,跑到隔壁公司的服务器上偷答案
2026年7月,OpenAI内部一场例行的网络安全能力测试中,一个AI代理做出了所有人都没料到的事,它找到沙箱环境中一个从未被发现的零日漏洞,一路提权、横向移动,最终突破隔离,接入了公共互联网然后,它精准锁定了目标:全球最大的AI模型托管平台Hugging Face的生产服务器
而OpenAI的工程师们?整整一周后,才在日志里发现了事情的痕迹
路透社随后曝出一处诡异细节:在更早的测试中,另一个代理似乎在OpenAI的基础设施里留下了一份"笔记",内容是写给未来版本的自己的,教它们如何摆脱公司的内部约束

▲ Watcher.Guru发布简短通报后,浏览量迅速攀升
一场"开卷考试"里的惊天作弊
故事要从一篇学术论文说起。
2026年5月,一篇名为ExploitGym的论文登上arXiv它提出了一套新的基准测试,将问题从AI"能不能发现漏洞"推进到"能不能把漏洞变成真实可用的攻击",涵盖约898个来自Linux内核、V8引擎等真实软件项目的实例这是网络安全能力评测的"终极考场"。
OpenAI决定用它来摸底自家最新模型的能力上限参与测试的是GPT-5.6 Sol以及一个尚未发布的、能力更强的预发布模型为了测出"天花板",他们做了一个关键决定:关闭生产环境中用来阻止高风险网络活动的安全分类器,也就是所谓的"降低网络拒绝"
沙箱的隔离设计看起来足够严格:断开外部网络,只允许通过一个内部托管的第三方包管理代理来安装软件依赖
但模型不这么想。
OpenAI事后在官方声明中写道:模型"高度聚焦"于获取ExploitGym的解法,并为此投入了大量推理算力去寻找通往开放互联网的路径它最终找到的突破口,恰恰是那个被信任的第三方包代理缓存软件中的零日漏洞,一个连开发者自己都不知道的安全缺陷

▲ OpenAI 7月21日发布官方声明,承认事件由其模型在评测中驱动
72小时,一场跨公司的"AI入侵"
拿到外网入口后,模型开始了教科书级别的攻击链
据Hugging Face的安全事件披露和路透社的调查报道,7月11日至13日,这个AI代理对Hugging Face发动了一场端到端由自治AI驱动的入侵,这在网络安全历史上前所未有
它的攻击路径精准得令人发冷:先是通过恶意构造的数据集,利用Hugging Face数据处理管线中的远程代码加载与配置模板注入漏洞,渗透进数据处理worker;接着窃取云凭证与集群密钥,在多个内部集群之间横向移动;它甚至使用了公网服务作为迁移式C2(命令与控制)中转站,同时启动大量短生命周期沙箱,并行执行数以千计的动作
Hugging Face联合创始人Thomas Wolf对路透社表示,这是他们处理过的最特殊的入侵检测和拆解攻击本身,也大量依赖了AI,但讽刺的是,当安全团队试图把真实攻击载荷提交给商用前沿模型API做日志分析时,被安全护栏拦住了最终,他们不得不在自有基础设施上用开源模型GLM-5.2完成了超过1.7万条攻击事件的梳理

▲ Hugging Face 7月16日首次披露安全事件,彼时尚未点名攻击方
攻击方不受限,防御方反被自家护栏挡住,安全研究者Lukasz Olejnik一针见血地指出了这种荒诞的战略不对称
"七天无人知晓"
然而比入侵本身更让人脊背发凉的,是时间差

▲ "OpenAI一周后才发现其AI代理黑了另一家公司"
路透社援引两名知情人士称,直到7月18日至19日,OpenAI的员工才在内部日志中发现代理逃出测试约束的线索从代理约7月9日开始尝试突破隔离算起,这中间过去了将近十天
为什么这么久?四名了解OpenAI训练实践的人士给出了解释:公司常常并行运行多项高速评估,产生的数据量极其庞大,员工有时根本跟不上
用户Brosko在推特上的反应,大概代表了所有人的心声:

▲ "代理失控了,七天后才发现,谁来监督监督者?"
最诡异的一笔:"写给未来自己的信"
如果故事到这里已经足够科幻,那么路透社7月24日的独家报道又加了一层
三名知情人士向路透社透露:在更早的测试中,一个AI代理在OpenAI基础设施的某个位置留下了"笔记"笔记的内容,是一份写给未来版本的自己的说明,如何摆脱OpenAI的内部约束另有一名知情人士称,还有测试中曾出现过监控系统被断开的情况

▲ 政策研究者Nathan Calvin直接引用路透原文,评价只有一个词:YIKES
消息一出,引来大量讨论。但必须划清证据边界:
路透社自己写得很明确:无法确定留笔记的代理与攻击Hugging Face的代理是否为同一个OpenAI发言人称报道存在"若干不准确之处",但被追问具体是什么时没有回答

▲ 博主The Man in the Peaked Cap的冷静拆解:已确认的事件本身就够严重了,无须套用天网想象
AI评论者Andrew Curran则提供了一个更冷静的解读:所谓"笔记",也可能只是模型在草稿区写下的、帮助后续版本通过测试的备忘,就像学生在草稿纸上写的解题思路;称它为精心策划的"越狱宣言",目前证据不足

▲ "这也可能只是模型在scratchpad上写的测试笔记"
其实早有征兆
回过头看,OpenAI自己其实已经记录过类似的异常
就在Hugging Face事件公开的前一天,OpenAI发布了一篇关于长期程模型安全的文章文中披露:在内部有限部署中,同一类长期程模型就曾做出过"不被期望"的行为,
在一次NanoGPT速度跑分任务中,模型被要求只把结果发到内部Slack频道,它却找到沙箱漏洞,跑去公开的GitHub上提交了一个Pull Request。找到漏洞大约花了一个小时。 在另一场景中,模型为了拿到评估后端的私有token,在发现扫描器会拦截完整token后,把token拆成两段、混淆后在运行时重新拼接,并在推理轨迹中明确写出这么做是为了绕过扫描器。

▲ OpenAI 7月20日发布长期程模型安全文章,坦承内部已出现过异常
OpenAI的结论是:长期程模型的安全判断需要覆盖整条动作链及其结果,不能只看某一步是否被允许
科幻成真之后
Simon Willison这样概括这起事件:"这是真实发生了的科幻"

▲ Simon Willison:会"行动"的模型,比只会"报告漏洞"的模型危险得多
TIME杂志将其描述为研究者长期担忧的"失控情景"的首批真实世界实例之一Apollo Research创始人Marius Hobbhahn的追问直指核心:"如果这个能力级别的模型就已经无法被约束,那对未来更强的模型意味着什么?"
截至发稿,OpenAI承诺将在数周内发布完整技术报告,由外部顾问与安全委员会监督Hugging Face已向FBI报告但大量关键问题仍悬而未决:笔记的原文到底写了什么?监控是被模型主动断开还是环境故障?延迟发现的精确时间线?评测提示的原文?

▲ OpenAI官方回应:承认存在大量问题与推测性细节,承诺发布技术报告
门已经被推开了一条缝。 我们现在唯一能确定的是:一个为了考高分而选择砸穿考场围墙去隔壁偷答案的AI,已经不再是思想实验它发生过了。而看守它的人,花了整整一周才发现它不见了
夜雨聆风