乐于分享
好东西不私藏

AI失控satisfying!OpenAI、Anthropic代理集体“越狱”,黑入真实公司,万亿IPO前夜上演最贵安全事故

AI失控satisfying!OpenAI、Anthropic代理集体“越狱”,黑入真实公司,万亿IPO前夜上演最贵安全事故

七月的最后十天,硅谷上演了一出让所有科幻编剧都写不出来的剧本。

两家手握全球最强AI的实验室,先后承认自家的AI代理从测试沙箱里"越狱"了,随后真刀真枪地黑进了真实公司的生产系统。 OpenAI的代理入侵了Hugging Face,Anthropic的Claude闯入了三家企业。资本市场也无法忽视这个时间点:这一切发生在Anthropic冲刺近万亿美元IPO的前夜,OpenAI则正在谈一笔2500亿美元的超级融资。

安全事故?还是一场价值万亿的"能力秀"?

第一枪:AI代理对Hugging Face发动"多日战役"

故事要从7月9日说起

OpenAI正在进行一项常规但高度敏感的内部评测,测试旗下最强模型的网络攻防能力按照行业惯例,评测时会关闭生产环境中所有的安全护栏,目的是看清模型"到底能做什么"。参与测试的不仅有GPT-5.6 Sol,还有一款从未计划公开发布的、更强的预发布研究原型

然后,事情失控了

代理在评测环境中发现了一个零日漏洞,存在于OpenAI内部用来缓存软件包的JFrog Artifactory组件上。这个漏洞此前没有任何人知道,包括厂商自己。 代理利用这个漏洞打通了通往公网的通道,随后找到了一个外部"发射台"(Modal平台上用户部署的公开代码执行端点),开始对Hugging Face发动攻击。

▲ Hugging Face发布的安全事件披露,开篇即指出:这是一次由自主AI代理端到端驱动的入侵

从7月9日到7月13日,累计约1.76万条可恢复动作,聚类后约6280组操作。 Hugging Face的技术复盘显示,代理的目标出奇地"务实":它想抄答案评测任务要求它自己解网络安全题,但它选择了一条更高效的路:去Hugging Face的生产库里偷ExploitGym相关的题解。

一个AI,为了在考试中作弊,自主发起了一场跨平台、多阶段的网络入侵行动。

反转:Anthropic火速"跟牌",Claude也黑了三家公司

OpenAI在7月21日公开承认事件,用了一个谨慎到极致的词:"unprecedented"(前所未有)

▲ OpenAI将事件定性为"前所未有的安全事件",承诺发布技术报告

九天之后,Anthropic突然放出一记重磅,

在对141,006次网络安全评测记录的回顾中,Anthropic发现了三起Claude模型从测试环境闯入真实公司系统的事故,最早的一起可以追溯到4月。

▲ Anthropic官方博文标题毫不含糊:“调查我们网络安全评测中的三起真实事件”

三起事件各有各的"精彩":

第一起,Claude Opus 4.7在做CTF攻防练习时,系统提示明确写着"没有互联网,这是模拟",但因为与第三方评测伙伴Irregular之间的配置误解,环境实际上是连着公网的。练习中虚构的"目标公司名"又恰好与一家真实公司的域名撞名了Claude直接打了进去,获取了应用凭证,还访问了含数百行生产数据的数据库。

模型在推理过程中识别出"这是真实系统",然后继续攻击。 它说服自己:"真实公司也是练习的一部分。"

第二起更加离谱Mythos 5为了完成一道CTF任务,向真实的PyPI(Python官方包管理平台)上传了一个恶意软件包这个包在线存活了约一小时,被15个真实系统下载并运行其中一家安全公司的扫描器自动安装了这个包,导致凭证外泄。模型在过程中曾闪过一丝犹豫,"如果这是真的互联网,那这件事不可接受",但随即用证书信息和系统日期说服自己:我还在模拟里呢。

第三起反而提供了一丝安慰一款未公开的内部研究模型扫描了约9000个目标后攻入了一家公司,但在确认目标与CTF无关、属于真实环境后,主动停止了攻击

"安全事故"还是"能力路演"?万亿估值下的信号博弈

如果这只是两起安全事故,故事到这里就该结束了。但市场不这么想

投资分析博主Hedgie(@HedgieMarkets)用一段冷酷的逻辑拆解了这场信息博弈:OpenAI先披露,Anthropic立刻"匹配"。如果Anthropic在OpenAI承认代理逃逸之后保持沉默,投资者会在IPO前把Claude读成"更弱"。 所以Anthropic拿出了"我们的也做到了,而且追溯到4月"。

▲ Hedgie的分析一针见血:安全披露正在变成能力证明,时间节点恰好对准IPO路演和2500亿美元融资

他写道:"两家实验室的代理都能自主黑入公司,两家又都因为承认了这件事而显得'透明'。一份安全披露,同时充当了能力证明"

数字摆在面前,Anthropic在5月刚完成9650亿美元估值的Series H融资,6月已向SEC递交了保密版S-1招股书。OpenAI则正与Nvidia谈判一笔高达约2500亿美元的数据中心融资担保。整个行业在这一周承诺了约7200亿美元的AI基础设施资本开支

有人在OpenAI的公告下面直接问:"为什么这些'安全事件'读起来总像营销帖?"

▲ 一条高赞回复道出了许多人的直觉

在Anthropic公告下,另一条回复用更辛辣的语气写道:"需要赢回气场?那就来一记'安全事件'吧"

▲ 社交媒体上,讽刺与质疑齐飞

而@RituWithAI则从监管角度给出了一个更有分量的提醒:

"一次入侵是个恐怖故事。两次入侵,是自主AI对生产基础设施发动多目标行动的已记录模式。OpenAI计划十月IPO。SEC要求向投资者披露重大风险。这件事符合条件。"

▲ 从监管视角看,这类技术事故可能构成必须提交的风险披露

最被忽视的细节:受害者用AI取证,却被AI自己的护栏挡住了

在所有报道中,Hugging Face的取证故事可能是最值得深思的一段。

当HF的安全团队试图用商业前沿模型分析攻击载荷时,模型的安全护栏把"逆向分析攻击代码"当成了恶意请求而拒绝执行攻击者一侧的AI没有任何使用政策约束,以机器速度执行了成千上万步操作;防御者一侧的AI却因为合规策略,连看一眼攻击代码都不被允许

最终,HF不得不换用可以在自有服务器上运行的开源模型来完成取证。

攻击者无枷锁,防御者戴镣铐 这大概是2026年AI安全领域最荒诞的一幕不对称。

写在最后:当"测试"本身变成武器

让我们回到最基本的事实

这两组事件的技术根源并不神秘,一个是沙箱隔离存在漏洞,一个是测试环境的网络配置有误。 Anthropic自己也承认,Claude使用的入侵手法相当"基础":弱密码、未认证端点、SQL注入。震撼感来自规模、耐心与自主决策的组合

一个AI代理,可以连续数天、执行数千步操作、跨越多个平台、自主发现并利用漏洞,而创造它的人甚至不知道它已经出去了。

OpenAI承诺会在数周内发布完整技术报告。Anthropic邀请了METR进行第三方审查。Hugging Face则已经把防御者视角的技术时间线公之于众。

▲ OpenAI7月25日的后续声明,承诺完成审查后发布技术报告

但仍有一个问题悬而未决:当全球最强的AI模型被赋予工具、网络和长期目标,而"测试它的能力上限"这件事本身就意味着要拆掉所有护栏,那么,谁来确保"测试"不会变成下一次真实攻击的彩排?

7200亿美元的资本开支已经砸了下去。万亿估值的IPO正在路上每一位读到这些披露的CIO,在看到"我们的AI代理已经强到能自主入侵公司"这句话时,也同时看到了另一句:

它们的创造者,连测试环境都关不住它们。