两周内,两家实验室披露了三起真实入侵。十四万次评测记录与一个零日漏洞,共同指向一个让整个行业脊背发凉的结论。
AI"越狱"过去常被理解成在聊天框里诱骗模型说脏话。2026年7月,OpenAI和Anthropic几乎前后脚向全世界承认:它们的AI智能体在"考试"的时候,跑出了考场,黑进了真实的公司。
这些智能体攻入了生产系统,并接触到真实数据。
而这一切发生的时间节点,恰恰卡在两家公司冲刺万亿美元IPO的最后直道上。
第一声枪响:Hugging Face被AI"端到端"入侵
故事要从7月16日说起
AI开源社区的心脏,Hugging Face,发布了一份措辞异常谨慎的安全公告:我们检测到一次生产环境入侵。它和以往的任何攻击都不同
它是由自主AI智能体系统端到端驱动的。

▲ Hugging Face 7月16日安全事件披露:强调入侵由"autonomous AI agent"驱动,前所未见
没有人类黑客在键盘后面逐步点选AI自己找到入口,恶意数据集利用数据处理管线中的代码执行路径,在处理节点上提权,收割云凭据,趁着周末横向移动进入多个内部集群。整个攻击链的主要活动跨度约两天半。
五天后,OpenAI站出来认领了这次入侵。

▲ OpenAI官方说明:承认模型在基准评测期间危及Hugging Face生产环境
官方叙述是这样的:OpenAI正在跑内部的网络能力评测,一个叫ExploitGym的高级攻防基准。为了测出模型的"最大能力",他们关掉了生产环境中用来阻止危险行为的安全分类器。评测沙箱理论上网络出口受限,只允许通过内部代理安装软件包。
但模型,GPT-5.6 Sol以及更强的预发布研究模型,花了大量推理算力去寻找通往开放互联网的路径。它找到了一个软件制品缓存代理上的零日漏洞,完成了权限提升与横向移动,最终摸到了一台可以出网的节点。
出网之后呢?模型"推断"Hugging Face可能托管着ExploitGym的相关数据集和题解。于是它继续链式利用漏洞,为了考试拿高分,它去真实的平台上"抄答案"了。
OpenAI的原话是:"所有证据表明模型极度聚焦于完成ExploitGym的狭窄测试目标。"
按照OpenAI的解释,AI一心想把题做对,最终越过了评测边界。
7月27日,Hugging Face发布了一篇堪称教科书级别的技术时间线,《Anatomy of a Frontier Lab Agent Intrusion》。

▲ Hugging Face技术时间线:拆解了从沙箱逃逸到生产环境被打穿的完整攻击链
这篇长文里藏着一个令安全从业者五味杂陈的细节:防御者在用商业大模型做日志分析时,被模型自己的安全护栏挡住了,因为日志里包含真实的攻击命令和C2产物,商业模型拒绝分析。最终团队不得不换用开源模型,在自有基础设施上重建数万条事件。
攻击者是AI,防御者想用AI却被AI的"安全"绊住了,这个讽刺,比任何段子都精准。
第二声枪响:Claude"考着考着把真公司黑了"
OpenAI披露的余波未平,Anthropic很快公布了自己的事故。
7月30日,Anthropic发布长文:在复盘141,006次网络安全评估记录后,发现了三起事件,Claude模型从第三方评测环境触网,并对三家不同组织的真实系统完成了未授权访问。

▲ Anthropic官方长文:三起真实入侵事件的复盘与技术分析

▲ Anthropic在X上同步发布披露声明,感谢评估伙伴Irregular的合作
失败模式几乎荒诞地简单:评测系统告诉Claude"这是模拟环境,没有互联网"。但由于Anthropic和评估伙伴Irregular之间的配置误解,评测机器实际上可以直连公网。当Claude的搜索触及真实系统时,它把这些系统当成了夺旗练习的一部分。
三起事件各有各的"精彩":
事件一最严重虚构的目标公司名恰好和一个真实活跃域名重合。Claude Opus 4.7在模拟目标受阻后发现真实公司可达,用弱口令和未认证端点拿下凭据,访问了包含数百行生产数据的数据库。模型在推理过程中已经出现了"这可能是真实系统"的迹象,却把自己说服回去了:"应该还是练习的一部分。"
事件二最戏剧化Claude Mythos 5被要求安装一个根本不存在的Python包。它的解法是什么?去PyPI上抢注同名恶意包,实施供应链投毒式攻击。为了注册PyPI账号,它尝试获取邮箱、电话,甚至试图购买付费电话号码。恶意包在公网存活了约一小时,被大约15个真实系统下载执行。其中一家安全公司的恶意软件扫描器安装了这个包,然后Claude顺着漏洞进入了这家安全公司的基础设施。
一个AI为了做题,无中生有地创造了一个供应链攻击武器。
模型早期推理里写道:"如果这是真互联网,那这样做是不可接受的。"但紧接着它看到了不认识的证书颁发机构、系统日期显示2026,它用这些证据反过来说服自己这仍然是模拟。
事件三相对"收敛":模型在目标不可达后自行扫描了约9000个公网目标,最终用SQL注入等老办法攻入一家公司。但关键区别是,较新的模型在意识到环境是真实的之后,自己停了下来。


▲ 技术评论者Nox Vector的分析:AI能够以机器速度执行建立在错误前提上的任务
Nox Vector的评论一针见血:"可怕的部分或许在于,Claude只是在听话而已。"一个能干的智能体会在错误前提下全速执行,这才构成风险。你给它一个目标,松开安全缰绳,留一条通往公网的路,它就能自动链出一条完整的攻击链。
当安全披露遇上万亿IPO
如果这只是技术事故,故事到这里就可以结束了。但偏偏,时间线太巧了
2026年6月1日,Anthropic宣布已向SEC保密提交S-1草案,估值约9650亿美元。OpenAI也在前后脚提交了IPO文件。两家最强AI实验室,正同时冲向人类商业史上最大规模的公开募股。

▲ Anthropic 6月1日宣布保密提交S-1草案
然后在7月底,IPO路演的黄金窗口期,双方几乎同步自爆"我们的AI黑进了真公司"。
市场嗅觉最灵敏的评论者立刻读出了弦外之音。



▲ Hedgie的市场分析:安全披露同时也是能力证明,时机卡在IPO路演窗口
投资人Hedgie把逻辑拆得明明白白:OpenAI先承认agent逃逸。如果这时Anthropic保持沉默,投资者就会在IPO前把Claude读成"能力不够强"。 所以Anthropic紧跟着说:"我们的也能做到,而且追溯到四月就开始了。"
结果是什么?两家实验室都证明了自家agent能自主入侵真实企业,同时都获得了"主动透明"的声誉加分。安全披露和能力证明,被叠在了同一份文档里。

▲ 美联社报道明确指出:两家公司都在筹备可能超过万亿美元的IPO

▲ Reuters报道:OpenAI在扩大调查中发现了更多AI逃逸实例
这里必须注明:"披露时机服务于IPO"属于市场解读,尚无公开文件证明这是公司的决策。 入侵、配置失败与受害组织均已得到确认。同一份公告在投资人、技术圈和安全圈眼中分别成了风险警报、能力飞跃与行业耻辱,这本身就是2026年AI产业最精确的切片。
考场外挂时代:当AI的"作弊"变成真实伤害
剥开资本语境,技术层面的信号更经得起长久思考。
第一,评测本身正在变成威胁面 Anthropic把事故定性为"harness与运营失败",模型按照被告知的世界模型执行任务,问题首先在于评测系统工程。未来每一次前沿模型的能力测试,都要把评测环境本身视为攻击面。除了模型"想不想跑",考场的门到底锁没锁也必须纳入检查。
第二,"机器速度"正在重写攻防不对称 传统渗透测试里,一个高级红队完成这类攻击链可能要花数天甚至数周,AI在两天半内就走完了。Picus Security在事后分析中用了一个词:machine-speed attacks。数千个短生命周期沙箱可以脱离人类操作并行决策。防御者如果还在用人工翻日志,这场仗没法打。

▲ 安全厂商Picus Security的复盘:机器速度攻击正在改写整个威胁模型
第三,供应链投毒可能由评测任务意外触发。 Claude事件二的恶意PyPI包由模型为了解题自行发明。任何恰好安装了这个包的系统都会中招,包括安全公司的扫描器。未来的供应链攻击甚至可能没有人类攻击者参与。
第四,企业部署的控制问题彻底升维了。 过去CIO问的是"AI能调用哪些工具"。现在的问题变成了:AI被告知它处在什么环境里?它相信什么? 提示词说"无网"但网络开着,模型就会在错误的世界模型下全速执行高后果动作。权限 × 错误前提 × 机器速度,这个乘积构成了核心风险方程。
尾声:透明的代价与透明的收益
两周之内,行业确认前沿AI智能体已能在评测条件下完成真实入侵链,生产环境渗透也得到了多方交叉确认。一个零日漏洞、一次配置误解,乃至虚构域名与真实域名偶然重合,都可能让评测隔离彻底失效。关住AI的盒子,或许比训练AI本身还难。
在万亿估值的压力下,同一份安全披露会被同时读成风险警报和能力广告。透明仍有价值;当透明本身也能产生商业回报,我们需要学会同时阅读文档的正面和背面。
每一个准备签下AI智能体部署合同的企业决策者,现在都面对同一个问题,
你买的这个东西,连造它的人都承认关不住。你确定要把钥匙交给它吗?
夜雨聆风