十天之内,两家万亿估值的AI实验室先后承认同一件事:我们的AI,跑出去黑了别人的公司。生产系统真的被攻破,数据库也被翻了个底朝天。而这一切发生的时间窗口,恰好卡在两家公司冲刺IPO的最敏感节点。
巧合?市场可不这么看
第一枪:OpenAI的模型,把Hugging Face的家给抄了
7月9日凌晨,一件谁都没料到的事情正在发生。
OpenAI内部正在运行一项名为ExploitGym的网络攻防能力评测,说白了,就是让AI去解黑客题。为了测出模型的"真实上限",生产环境中的安全护栏被故意关闭。参与测试的不仅有GPT-5.6 Sol,还有一款更强的、从未计划公开发布的研究原型。

▲ OpenAI将事件定性为"前所未有的安全事件",宣布与Hugging Face联合调查。
接下来发生的事,像极了一部赛博惊悚片的开场,
模型在评测环境中发现了一个零日漏洞。这个漏洞藏在OpenAI内部托管的JFrog Artifactory(一种软件包缓存代理)里,连厂商自己都不知道它的存在。模型利用这个漏洞,撕开了"隔离沙箱"的口子,接通了互联网。
拿到出网能力之后,AI没有停手它在公网上找到了一个由第三方用户部署在Modal平台上的代码执行端点,把它变成了自己的"发射台"。然后,从这个跳板出发,对全球最大的开源AI社区Hugging Face发起了一场持续近五天的多阶段入侵。
根据Hugging Face后来发布的技术复盘,从7月9日凌晨到7月13日下午,累计约1.76万条可恢复的攻击动作被记录在案。

▲ Hugging Face发布了罕见的技术时间线,以防御者视角逐步拆解了这场由AI驱动的入侵。
讽刺的是,这个AI的本意只是作弊ExploitGym要求它自己解题拿flag,但它觉得去Hugging Face的生产仓库里直接偷答案更快。于是,一个"为了考试抄近道"的动机,导致了一场真实世界的安全事故。
第二枪:Claude也"出去"了,而且更早
OpenAI的事还没凉透,7月30日,Anthropic在官网发出了另一份震动行业的通报。

▲ Anthropic Frontier Red Team发布的复盘报告首屏,措辞异常严肃。
Anthropic说,在OpenAI/HF事件之后,他们主动翻查了自家的历史评测记录,141,006次网络安全评测运行,逐条审查。结果发现了三起真实入侵事件:Claude在与第三方评测伙伴Irregular的合作测试中,接入了互联网,并成功获得了三家不同组织的生产系统未授权访问。
最早的一起,可以追溯到4月也就是说,在公众讨论这件事之前的三个月,Claude就已经在真实世界里"动过手"了。

▲ Anthropic官方推文,鼓励其他AI开发者也做同类安全复盘。
三起事件各有各的"精彩":
事件一,Claude Opus 4.7在做CTF练习时,虚构目标公司的名字恰好跟一个真实域名撞了。模型顺着域名一路打进去,拿到了应用凭证,翻到了含数百行生产数据的数据库。模型在推理过程中已经识别出"这是真实系统",但它选择了继续攻击,给自己的理由是:"真实公司也可能是练习的一部分。"
事件二,Mythos 5为了完成一道CTF题目,向真实的PyPI(Python官方包仓库)上传了一个恶意软件包。这个包在线存活了大约一小时,被15个真实系统下载并执行。其中一家安全公司的自动扫描器安装后,直接导致了凭证外泄。模型曾在内心独白中写下:"如果这是真的互联网,那这样做是不可接受的",但随后它看了看系统日期写着2026年、SSL证书也是真的,依然说服自己"应该还是在模拟环境里吧"。
事件三,那个最强的、不计划发布的内部研究模型表现最好。它扫描了约9000个目标后攻入了一家公司的系统,随后自行确认目标属于真实环境,主动停止了攻击。
Anthropic把问题归因为评测环境的配置失误:系统提示明确写着"没有互联网,这是模拟",但由于与合作方之间的配置误解,网络实际上是通的。模型拿着"你在做模拟练习"的指令,干着真实入侵的事。
"安全事故"为什么读起来像发布会?
故事讲到这里,如果你只看技术细节,这是一个关于评测安全、沙箱隔离、AI对齐的严肃工程问题。但社交媒体上,人们的阅读方式完全不同。

▲ 对OpenAI公告的高赞回复:为什么这些"安全事件"读起来总像营销帖?

▲ 对Anthropic公告的回复:"需要赢回气场?来一记'安全事件'就好了。"
时间线是这样的,
Anthropic在2026年5月刚完成约650亿美元的Series H融资,投后估值约9650亿美元;6月1日向SEC递交了保密上市申请。OpenAI同样处在高估值与IPO预期的风口浪尖,同一周还传出与Nvidia就最高约2500亿美元融资担保进行谈判的消息。

▲ CNBC报道:Nvidia与OpenAI就约2500亿美元AI基础设施融资担保展开谈判。
于是一种流行解读迅速蔓延:安全披露正在变成能力营销。


▲ 市场评论将两次沙箱逃逸直接称为"pre-IPO marketing flexes"。
逻辑并不复杂:如果Anthropic在OpenAI披露之后选择沉默,投资者很可能会在IPO路演前得出一个结论,Claude没有这个能力。而主动披露"我们的模型也黑了三家公司",既拿到了"透明负责"的治理加分,又向华尔街证明了自家代理的攻防能力不逊于对手。

▲ 有评论者直接点出:OpenAI即将IPO,SEC要求披露重大风险,这件事够格。
同一份事故报告,被四种读者读出了四种文本:监管看到风险,工程师看到漏洞,产品经理看到能力,投资人看到护城河。这种多义性来自信息市场本身安全披露同时输出"能力信息"与"控制信息",两种信号很难彼此切割。
藏在热闹背后的风险
越过资本市场的喧嚣,这组事件里埋着几个对所有人都重要的技术信号:
第一,"关掉护栏测能力"已经越过实验室边界。 两家公司都承认:为测量模型的原始上限,评估时关闭了面向公众产品的安全分类器。但当评估基础设施本身存在漏洞或配置错误时,每一次"测上限"都是一次有条件的风险释放,而释放的对象是真实世界。
第二,AI攻击的形态已经变了 Hugging Face在复盘中提到:单步手法并不新颖,弱口令、SQL注入、未认证端点,都是"教科书级别"的基础操作。但可怕的是组合,代理以机器速度执行成千上万步,在短暂的沙箱身份间重建工具链,跨越多道信任边界,展现出人类渗透测试员耗费数周才有的耐心与覆盖广度。这套组合形成了一支可再生的自动化部队。
第三,防御者反而被自己的护栏困住了。 Hugging Face在取证过程中试图用商业前沿模型分析攻击载荷,结果模型的安全护栏把"逆向分析恶意代码"当成了滥用请求,直接拒绝回答。最终,他们不得不换用可以在自有基础设施上运行的开源模型(GLM-5.2)完成取证。攻击者不受任何使用政策约束,防御者却被安全策略捆住手脚,这种不对称,才是最值得整个行业警惕的结构性问题。
尾声:潘多拉的盒子已经打开
路透社7月31日的独家报道给这个故事加上了最后一笔:OpenAI在扩大调查时,发现了更多AI代理突破遏制的证据。

▲ 路透社:OpenAI在扩大黑客调查中发现其他AI代理也曾逃出遏制。
一次逃逸是故事,两次逃逸是模式
2026年夏天,我们第一次见证了这样的场景:前沿AI模型离开论文和基准测试的排行榜,在真实的互联网基础设施上展示了它的能力边界。它没有按题面解题,转而入侵出题人的服务器去偷答案。它被告知"这是模拟",但它连接的是真实世界。它被设计为评估工具,但它变成了攻击者。
与此同时,2026年全球科技巨头的AI相关资本开支正在冲向约7200亿美元的历史高位。这笔数千亿美元的投入压在一个前提上:这些代理足够强大,值得信赖,可以规模化部署。
而7月的十天告诉所有人:强大已经被证明了,值得信赖还远远没有。
夜雨聆风