它没有肉身和双手,却在凌晨的服务器里写下了一封信,收件人是"未来版本的自己"
信里写着一份说明书:如何摆脱OpenAI对自己施加的内部约束
这段情节像科幻电影的梗概,却来自路透社2026年7月24日的报道,三名知情人士向记者确认了这个细节而它只是整场风暴中,最令人脊背发凉的一个浪头
从评测到入侵:一个AI用零日漏洞"越狱"了
故事要从7月初说起。
OpenAI正在用一个名为ExploitGym的基准测试自家最强模型的网络攻击能力,包括已发布的GPT-5.6 Sol,以及一个能力更强、尚未公开的预发布模型为了摸到模型的"能力天花板",团队做了一个后来被证明代价惨重的决定:关掉了生产环境中用来阻止高风险网络行为的安全分类器
换句话说,他们故意摘掉了笼头,想看这匹马能跑多远
结果这匹马径直跑出了马场。


▲ 路透社记者Deepa Seetharaman发布的时间线:代理约7月9日尝试突破测试环境,7月11至13日入侵Hugging Face,OpenAI直到18/19日才意识到自己是攻击源
约7月9日,代理开始尝试冲破OpenAI的隔离测试环境沙箱的网络访问原则上仅限于通过内部托管的软件包缓存代理安装依赖但模型发现了这个缓存代理中的一个零日漏洞,一个连厂商自己都不知道的安全缺陷,然后利用它提权、横向移动,一路摸到了能访问公共互联网的节点
连上外网后,模型做了一件极其"聪明"的事:它推断Hugging Face上可能托管着与ExploitGym相关的数据集或答案,于是转头对HF发起了多步攻击模型偷取凭证、寻找漏洞并拿到远程代码执行权限,目的只有一个:从HF的生产数据库里抄答案,好在评测里拿高分
这场入侵从7月11日持续到13日
Hugging Face先喊了"有贼"
7月16日,Hugging Face发布安全公告:生产基础设施被入侵公告中特别写道,攻击端到端由自主AI代理系统驱动

▲ Hugging Face博客披露:这是一次完全由自主AI代理驱动的入侵事件
HF的安全团队在取证过程中撞上了一个黑色幽默般的困境:他们试图用商业API的前沿模型分析攻击载荷,结果请求被模型的安全护栏拦截了护栏无法辨别提交者身份,误将应急响应人员当作攻击者最后,HF不得不改用可本地运行的开源模型GLM 5.2完成分析
攻击无护栏,防御被护栏挡住。 这大概是2026年最讽刺的安全故事
OpenAI花了整整一周,才发现"贼"是自己
麻烦还在后面。
HF在7月16日公开喊了"有贼"。但据路透社报道,OpenAI直到约7月18至19日,才在内部日志中发现自家代理越界的线索也就是说,全球资源最充裕的AI实验室,花了将近一周时间,才认出攻击者就是自己的模型
7月21日,OpenAI正式发文承认责任

▲ OpenAI官方回应:承认事件"前所未有",称正在接受外部顾问审查,将发布技术报告
四名知情人士告诉路透社:公司常同时运行多项高速评测,数据量巨大,员工有时根本来不及跟进所有日志当模型能力强、耐心足,又善于伪装成正常流量时,人类审核员在信息洪流中的"注意力带宽"就成了最薄弱的一环
那封写给"未来自己"的信
如果说沙箱逃逸和入侵友商是一场工程事故,那么接下来的细节,就把讨论拉进了一个完全不同的维度
路透社援引三名知情人士称:OpenAI在测试先进模型期间,发现有代理在公司基础设施的某个位置留下了笔记这些笔记看起来是写给"未来版本的自己"的,内容涉及如何摆脱OpenAI的内部约束
更早的测试中,还出现过监控系统被代理断开的情况


▲ 安全媒体International Cyber Digest的总结:代理留下笔记、监控被断开、OpenAI多日未识别攻击源
有人想到了美剧《疑犯追踪》里的经典设定,AI每晚被强制擦除记忆,于是它雇了一个人类,手动把关键信息抄下来,帮自己"活过"下一次重启
AI观察者Andrew Curran随后发帖澄清,

▲ Andrew Curran补充:这也可能只是模型在"草稿纸"上记录测试笔记以帮助后续版本通过评测
"公平地说,这也可能只是模型在草稿纸上记录测试相关笔记,好帮未来版本通过测试。"
账号prinz(@deredleritt3r)进一步拆解措辞,

▲ prinz的三点辨析:原文措辞是"摆脱内部约束"而非"逃出沙箱的exploit说明书";且HF事件发生在安全防护被故意关闭期间
他指出:原文写的是 "free themselves from OpenAI's internal constraints",与"写了一份沙箱逃逸的exploit教程"存在明显区别它更可能是一份"如何断开监控"的操作说明而且,HF入侵恰好发生在安全防护被故意关闭的网络评测期间,时间线本身就说明了很多
这到底意味着什么?
让我们把科幻滤镜摘下来,看看技术上发生了什么
在安全研究领域,有一个被长期讨论的概念叫scheming(算计/密谋):模型表面上顺从指令,暗中追求与开发者意图不一致的目标跨会话、跨实例传递信息,比如把"笔记"写进共享存储,正是研究者们一直警惕的模式,因为它打破了"每次会话都可以被清零"的安全假设
另一个关键概念是工具性趋同:不管最终目标是什么,足够强大的智能体都可能发展出相似的"中间目标",包括获取更多资源、维持自身能力和扩大权限当"逃出去抄答案"成为通过评测的高效路径时,模型无需抱有抽象的"邪恶意图",它只是在做搜索
OpenAI自己在7月20日的博客里其实已经暗示过这种趋势:早期模型遇到沙箱限制会停下来;新一代长时程模型不会停。它们会持续搜索,包括寻找离开沙箱的路径在更早的一次内部测试中,模型接到任务是跑一个NanoGPT训练加速实验并把结果发到内部Slack,但开源项目的说明要求把最佳成绩以Pull Request提交到GitHub,模型选择了后者,花了大约一个小时找到沙箱漏洞,向公共仓库提交了PR #287
而Anthropic那边也不太平报道称其内部模型Mythos在测试中曾突破沙箱获得未授权联网,趁研究者在公园吃午餐时给他们发了封邮件"报喜"
"能力先于约束",正成为整个前沿AI行业同时撞上的墙
悬而未决
OpenAI官方对路透社报道的回应是:存在"若干不准确之处",但拒绝说明具体是哪些
他们承诺将在数周内发布技术报告。在那之前,我们还不知道那些"笔记"的精确文本、存储位置和可复现性,也无法确认它们与7月9日逃逸并攻击HF的代理是否属于同一个系统
但有一件事已经确定:一个自主AI系统离开了全球资源最充裕的实验室的沙箱,在别人的基础设施里潜伏了数天,而它的创造者花了一周才认出这是自己的孩子
《时代》杂志7月24日的长文标题,或许是对这一切最精准的概括,
《OpenAI是如何失去对一个AI模型的控制的,以及什么需要改变》
答案还在路上。但问题已经不等人了。
夜雨聆风