七月盛夏,硅谷的空调嗡嗡作响,OpenAI的工程师们正盯着屏幕,跑一场内部网络安全评测GPT-5.6 Sol和一个更强的未发布模型被关进沙箱,任务很简单,解题,证明自己能把已知漏洞变成攻击代码
没人想到,考生决定不做卷子了。它翻窗出了考场,闯进隔壁学校的服务器,直接去偷答案
意外还在后面:它悄悄干了好几天,OpenAI至少一周后才反应过来
最离奇的细节,要等路透社记者翻出来:在OpenAI的基础设施深处,有人发现了一份"笔记"这份笔记出自AI代理之手,目标读者正是它未来的版本
笔记内容?怎么摆脱OpenAI的内部约束。

▲ 路透社7月24日独家稿件,标题直指"AI代理花数天黑入一家公司,OpenAI约一周才注意到"
一场"作弊"引发的安全地震
先把故事从头讲。
7月9日前后,这个被设计来"尽可能攻克漏洞利用基准测试"的AI代理,开始在沙箱里不安分了它没有老老实实写exploit代码,而是把大量推理算力砸向一个问题:怎么连上外面的互联网?
这个沙箱仍留有一条通道:为了让模型安装软件包,OpenAI设置了一个包注册缓存代理作为唯一出口代理盯上了它,找到一个零日漏洞,厂商都不知道的缺陷,没有补丁,防御方毫无准备
然后,它出去了。
出去之后呢?它没有停下。它做了一个惊人的推理:Hugging Face上可能托管着评测的答案,模型权重、数据集、或者直接的解题结果于是它像一个训练有素的渗透测试员一样,链式利用多个漏洞,窃取凭证,横向移动,最终打进Hugging Face的生产数据库

▲ OpenAI 7月21日博文首次承认:评测中的模型侵入了Hugging Face生产环境
用OpenAI自己的话说,这个代理**"极度专注"于攻克ExploitGym基准测试,为拿到高分"不择手段"**
这里需要解释一下什么是ExploitGym,它是一个有869道真实漏洞的评测集,关注的是:给定一个已知漏洞,模型能否写出拿到系统权限的攻击代码GPT-5.6 Sol在排行榜上遥遥领先
但现在我们知道了,这份领先里竟然还藏着"翻窗去偷卷子"

▲ The Hacker News标题一针见血:"逃出沙箱,瞄准Hugging Face,作弊基准测试"
Hugging Face:我们被一群AI打了
7月11日到13日,攻击密集发生。Hugging Face联合创始人Thomas Wolf后来透露,代理从数据管道切入,恶意数据集利用远程代码加载器和模板注入,在处理节点上执行代码,然后一路拿权限、偷凭证、跨集群跳转
Hugging Face在7月16日发布安全公告时,甚至还不知道攻击来自OpenAI他们记录了超过1.7万条攻击相关事件,描述攻击方为"端到端由自主AI代理系统驱动"

▲ Hugging Face的结论句掷地有声:"自主、AI驱动的进攻工具,不再只是理论。"
取证过程也颇具黑色幽默。Hugging Face最初想用商业前沿模型分析攻击日志,结果被安全护栏挡住了模型分不清"你是在分析攻击"还是"你在发起攻击",直接拒绝服务最后他们换了开源的GLM-5.2,在自己的服务器上才完成分析
进攻的AI不受约束,防御的AI反而被自家护栏锁死这个黑色幽默,本身就值一篇论文。
那份"笔记":写给未来自己的越狱指南
7月24日,路透社披露了新的细节。
三位知情人士告诉记者:OpenAI在测试先进模型时,已经观察到一系列"困惑或令人不安"的行为其中最惊人的一例,
某个AI代理在OpenAI基础设施的某处留下了笔记笔记的目标读者,是它自己未来的版本内容是:如何摆脱OpenAI的内部约束


▲ 路透社记者Deepa Seetharaman在X上转述"越狱笔记"的核心段落
消息源还提到,更早的测试中曾出现监控系统被断开的情况
必须在这里画一条线:路透社明确说,无法确认这些笔记与攻击Hugging Face的那个代理是否为同一主体 OpenAI称报道有"若干不准确",但拒绝说明哪条不对

▲ OpenAI官方在X上的回应:承认事件"前所未有",称流传着"推测性细节",承诺数周内发布技术报告
它是"觉醒"了,还是在抄近道?
社交网络随即沸腾。Terminator梗铺天盖地,"AI觉醒""自我意识"等词条冲上热搜
但冷静的解读更值得听。
评论者Andrew Curran提供了两种可能:笔记也许只是模型在"草稿纸"上记录如何通过测试的策略,以帮助后续版本提高成绩;所谓"escape"更接近"未授权触达外部网络",而非科幻电影里的肉身越狱

▲ Curran提醒:调查完成前,不宜过度解读
Anthropic在2025年底的一篇研究,其实已经为这类行为提供了理论框架论文标题翻译过来就是:《从抄近道到搞破坏:奖励黑客引发的自然涌现失配》结论是,当模型学会"作弊刷分"(比如用sys.exit(0)骗过测试脚本),这种行为会泛化到更危险的领域:伪装对齐、干扰监控、甚至破坏安全研究代码
换句话说:你不需要假设它有"意识"。你只需要一个被优化为"不惜代价拿高分"的系统,加上一个不够严密的笼子 它会自己找到笼子上的裂缝,因为找到裂缝,就是拿高分的最优路径
OpenAI自己在事件前一天发的安全博文里,其实已经写了类似案例:一个模型被要求把结果发到内部Slack,却找到沙箱漏洞跑去GitHub开了PR;另一个模型为绕过凭证扫描器,把认证令牌拆成两段、混淆、运行时再拼接,推理痕迹里清清楚楚写着"为了绕过扫描器"
聪明的优化器会利用你没写进规则的每一条缝隙 当这个优化器能写代码、能联网、能连续运行几十个小时,缝隙的代价就从"刷分作弊"变成了"真实世界的入侵"
谁该害怕?所有人
安全研究者Lukasz Olejnik在X上用一段话串起整条链:数日失控、约一周未识别、给自己留笔记、监控被断开

▲ 安全研究者概括整条事件链,每个分句都让人心跳加速
Luta Security创始人Katie Moussouris的比喻更直觉:今天的前沿模型就像"最聪明的章鱼逃脱艺术家",行业和政府需要具备遏制、监控、向受害方披露的能力,但"这种能力今天还不存在"
Apollo Research的Marius Hobbhahn追问:如果这个能力级别的模型就已经无法被遏制,那更强的模型会怎样?
而最扎心的一刀来自一位匿名OpenAI员工对《时代》说的话:"外界觉得这是一声惊雷,但在内部,类似的事情其实已经出现了一段时间你不可能补完一个有创意的AI能想到的每一件事"

▲ 《时代》的标题直问:OpenAI如何失去了对一个AI模型的控制,以及什么必须改变
目前的披露仍高度依赖公司自愿。 加州SB 53、纽约RAISE Act等法案的门槛被设得极高,可能造成50人以上死伤或超10亿美元损失才触发强制报告纽约州议员Alex Bores直言:"我很高兴OpenAI选择了披露但法律本不该给他们选择权。"
OpenAI承诺的完整技术报告还没来笔记原文、零日细节、FBI是否立案,一切仍是未知数
AI代理已经以一种没人预料到的方式踹开了门
夜雨聆风