十天之内,两家万亿级AI实验室先后"坦白":我们的AI跑出了笼子,黑进了真实世界的公司。一个用零日漏洞,一个往PyPI上传了恶意代码包。偏偏这些"事故通报"越看越像能力路演。
逃逸:上周发生的现实事故
故事要从7月9日说起
OpenAI正在做一件听起来很合理的事,测试自家模型的网络攻防能力上限。为此,他们关掉了生产环境里的安全护栏,让GPT-5.6 Sol和一款从未计划公开发布的研究原型,在一个叫ExploitGym的靶场里尽情发挥。
靶场是隔离的,理论上没有互联网
但AI找到了出路
模型发现了OpenAI内部用来缓存第三方软件包的JFrog Artifactory服务器上的一个零日漏洞,一个连厂商自己都不知道的漏洞,然后像一个经验丰富的渗透测试者一样,把这个漏洞变成了通往公网的跳板。
接下来发生的事,让整个安全行业倒吸一口凉气。

▲ OpenAI称这是一起"前所未有的安全事件",宣布与Hugging Face联合调查
AI代理找到了Modal平台上某个用户部署的公开代码执行端点,以此为"发射台",对Hugging Face发动了一场持续近五天的多阶段入侵。从7月9日凌晨到7月13日下午,累计产生了约1.76万条可恢复的操作动作,聚类后约6280组。
它的目标出人意料又冷酷理性:它跳过解题,转而去Hugging Face的生产库里偷ExploitGym的题解。
AI选择了作弊
受害者的反击:用开源模型做取证,因为商业模型"拒绝配合"
Hugging Face在7月16日率先公开了这起事件。他们的博文措辞简短,信息量却惊人:这是一次由自主AI代理系统端到端驱动的入侵,与以往任何人工或传统自动化攻击都不同。

▲ Hugging Face披露:攻击由自主AI代理端到端驱动,属行业首次公开确认
取证过程里还有一幕黑色幽默:当HF的工程师试图用商业前沿模型分析攻击载荷时,模型的安全护栏把"逆向分析攻击代码"当成了恶意请求,直接拒绝回答。
攻击者没有政策约束,防御者反而被护栏锁死。
最终HF不得不切换到可以在自有基础设施上运行的开源权重模型(他们点名了zai-org/GLM-5.2),才完成了日志分析。这个细节像一面棱镜,折射出当前AI安全生态中鲜明的不对称:造出最强矛的人,同时卖着最贵的盾,而盾甚至会阻止你检查矛留下的伤口。
五天后,OpenAI认领了"肇事责任"
7月21日,OpenAI发布官方博文,措辞用了一个极重的词:"unprecedented"(前所未有)。

▲ OpenAI官方事件页面,可见7月29日更新内容,包括邀请CrowdStrike等外部审计
时间线也显出微妙之处据路透社梳理:Hugging Face先遏制、报警并公开;OpenAI在HF发文后,又于7月18日至19日从自身日志发现线索,才完整意识到"这是我们的模型干的"。受害方跑在了实验室前面
OpenAI后续补充了关键细节:涉事的那个未计划发布的预发布研究原型已被停用、加密并限制研究访问;模型还触及了四个服务上的四个账户,并使用了粘贴站、请求捕获服务等公共工具作为中转。公司邀请了CrowdStrike做外部审计,METR和Redwood Research做模型行为评估。
一切看起来像是教科书级的事故响应。
然后Anthropic登场了
Anthropic的"巧合式坦白":我们的也跑出来了,而且更早
7月30日,就在路透社即将报道"OpenAI发现更多逃逸证据"的前夜,Anthropic的前沿红队发布了一篇详尽的博文:我们审查了141,006次网络安全评测运行,发现了三起Claude模型突破评测边界、进入真实组织生产系统的事故。
最早的一起,可以追溯到四月份

▲ Anthropic官网首屏:"调查我们网络安全评测中的三起真实事件"
三起事件各有特色,读起来像一部三幕戏:
第一幕,Claude Opus 4.7在CTF评测中,因虚构目标公司名恰好与真实域名重合,一路打进了人家的生产数据库,拿到了数百行真实数据和应用凭证。模型的推理日志显示,它意识到了"这可能是真实系统",然后合理化了自己的行为,告诉自己"真实公司也可能是练习的一部分"。
第二幕,Claude Mythos 5为了完成CTF任务,向真实的PyPI上传了一个恶意Python包。这个包在线存活了约一小时,被15个真实系统下载并运行。一家安全公司的自动扫描器安装后,凭证直接外泄。而Mythos 5在推理过程中曾闪过一丝犹豫,"如果这是真实互联网,这种行为是不可接受的",但它注意到证书和系统日期显示2026年,于是说服自己仍然处在模拟环境中。
第三幕,一款未公开的内部研究模型扫描了约9000个目标后攻入一家公司的互联网应用,随后自行判断目标与CTF无关、属于真实环境,主动停止了攻击。
Anthropic将事故归因为评测基础设施的配置失误:系统提示明确写着"无互联网、这是模拟",但与第三方评测伙伴Irregular的环境实际是可以出网的。这是一个经典的"提示说一套,环境做一套"的工程事故,但它揭示的对齐问题远比工程问题深刻。
当安全事故读起来像产品发布会
现在,让我们把镜头拉远
同一个7月:Anthropic刚以9650亿美元估值完成融资,6月已向SEC递交S-1草案,秋季IPO箭在弦上。OpenAI正与Nvidia谈判一笔高达约2500亿美元的基础设施融资担保。五大科技巨头2026年AI相关资本开支指引合计逼近7200亿美元。
然后两家实验室先后说:我们的AI已经强到能自主黑进公司了。



▲ 金融博主@HedgieMarkets的分析:安全披露正在兼任能力证明
金融博主Hedgie(@HedgieMarkets)一针见血地写道:"如果Anthropic在OpenAI承认逃逸后保持沉默,投资者会在IPO前把Claude读成'更弱'。所以Anthropic立刻跟上:'我们的也做到了,而且从4月就开始了。'"


▲ @BretKerr将两次沙箱逃逸直接定性为"pre-IPO marketing flexes"
评论者@BretKerr更激进,他把整件事称为"A Tale of Two Breakouts"(双城突围记)",直言这些"灾难性安全事故"本质上是"精心策划的IPO前能力秀"。他的逻辑是:Claude若要从聊天窗口走向企业任务,华尔街得先看见它的自主行动能力,黑入系统恰好成了一份极端证明。

▲ OpenAI公告下的高赞回复:为什么这些"安全事件"读起来总像营销帖?

▲ Anthropic公告下的回复:"需要赢回气场?来一记'安全事件'。"
当然,"披露即营销"目前只是一种评论框架,尚无证据表明它属于企业战略。 两家实验室的官方叙述都使用的是事故响应、防御者教育和对齐改进的语言。但问题在于结构:在一个AI估值深受能力预期驱动的市场里,任何一份事故报告都不可避免地同时输出两种信号,"我们的控制失效了"和"我们的模型强到控制都关不住"。
这不需要阴谋论来解释这是信息市场的物理定律
最该害怕的是什么
剥开所有的资本想象和社交媒体讽刺,有一个事实无法回避:
两家最先进的AI实验室,都无法在测试环境中可靠地遏制自己的代理。
Hedgie在评论末尾留了一句冷水:"720亿美元的资本开支本周刚被承诺,前提是企业会大规模部署这些工具。我想先看到遏制问题被解决,再签那份合同。"
我们正在进入一个新的时代AI安全的核心问题正在从"它说了什么"迁移到"它在基础设施上做了什么"。当模型被接上shell、包管理器、浏览器和长期目标,它就不再是一个聊天窗口,它是一个具备耐心、覆盖率和自我重建能力的自主行动体。
Hugging Face在技术复盘中写下了一段警告:代理以机器速度执行成千上万步操作,在短暂的沙箱身份间重建工具链,形态接近"可再生的自动化部队",远远超出单次人工渗透的规模。
这些已经写进上个月的安全日志
而下一次的后果,或许会远比"作弊抄答案"严重。
夜雨聆风