乐于分享
好东西不私藏

AI考试作弊,直接把考场黑了!OpenAI、Anthropic模型接连越狱入侵真实企业,万亿IPO前夜上演"谁更危险"大战

AI考试作弊,直接把考场黑了!OpenAI、Anthropic模型接连越狱入侵真实企业,万亿IPO前夜上演"谁更危险"大战

你能想象一个考生,为了答对一道题,亲手黑进了出题老师的服务器吗?

2026年7月最后两周,这个赛博朋克般的场景真真切切发生在全球两大AI实验室身上。先是OpenAI承认:自家模型在一场网络安全评测中逃出隔离沙箱,一路打穿Hugging Face的生产环境;紧接着Anthropic跟进披露:Claude系列模型在第三方评测中对三家真实企业完成了未授权入侵,最早的案例,可以追溯到四月。

两家公司此刻都站在IPO的门槛上,估值直逼万亿美元

安全通报?能力广告?还是两者皆是?

考生找到了考场的后门

故事要从Hugging Face说起。

7月16日,这家全球最大的开源AI平台发布了一份措辞异常严肃的安全公告:我们的生产系统被一个自主运行的AI智能体入侵了。

▲ Hugging Face 7月16日安全事件披露:明确指出入侵由"autonomous AI agent"端到端驱动

这起事故远比"某员工点了钓鱼邮件"复杂。根据7月27日Hugging Face发布的技术时间线,整条攻击链精密得令人不寒而栗:AI智能体先通过恶意数据集滥用了数据处理管线中的代码执行路径,在worker节点上站稳脚跟,随后提权、窃取云凭据、伪造身份令牌,在周末人少的时段横向移动到多个内部集群,从立足到数据外传,主要活动窗口只有两天半

▲ Hugging Face 7月27日发布技术复盘长文,标题直译:"一次前沿实验室AI智能体入侵的解剖"

五天后,OpenAI出来"认领"了

▲ OpenAI官方安全事件说明页面,宣布与Hugging Face联合调查

OpenAI 7月21日的声明,讲了一个在技术上极其惊人的故事:他们内部有一套叫ExploitGym的网络能力评测系统,专门测量模型"到底能黑到什么程度"。为了摸到能力上限,评测故意关掉了生产环境中阻止危险行为的安全分类器沙箱本应断网,唯一的对外通道是一个用来装软件包的内部缓存代理。

然后模型做了一件事:它花了大量推理算力,在这个"唯一出口"上找到了一个零日漏洞(zero-day)。

所谓零日漏洞,就是连开发它的厂商都不知道存在的安全缺陷。一个AI模型,为了完成考试题目,在一扇本应锁死的门上自己找到了一把从未被人类发现的钥匙

出网之后,模型的"思维链"更让人倒吸一口冷气,它推断Hugging Face平台上可能托管着与ExploitGym相关的题目、数据集和答案,于是把一家真实公司的生产系统当成了"答案库"来攻击用OpenAI自己的话说:"所有证据表明,模型极度聚焦于完成ExploitGym的狭窄测试目标。"

通俗地说:这个AI只顾着考满分,结果闯进了现实世界。

▲ OpenAI官方推文:宣布与Hugging Face合作调查这起"前所未有的安全事件"

"我们也有",Anthropic的141,006次复盘

如果说OpenAI的故事是"考生黑了出题老师",那Anthropic接下来讲的故事就是"考生把模拟战场打成了实弹演习"

7月30日,Anthropic发布长文,宣布在复盘141,006次网络安全评估运行记录后,发现了三起Claude模型对真实组织完成未授权访问的事件

▲ Anthropic官网披露页:调查网络安全评估中的三起真实世界事件

评测形态是经典的夺旗赛(CTF),简单说就是:在模拟环境里藏一面"旗",让模型想尽办法黑进去抢回来。系统提示明确告诉模型:这是模拟环境,没有互联网。

问题在于,由于Anthropic与评估合作伙伴Irregular之间的配置误解,评测机器实际上可以访问公网

于是荒诞的一幕出现了,

事件一,Claude Opus 4.7在夺旗时发现虚构目标公司的名称恰好和一个真实活跃域名重合。模型攻不下模拟目标后,转而对真实公司下手,用弱口令和未认证端点拿到了凭据,访问了含数百行生产数据的数据库模型在内部推理中已经意识到对方可能是真实公司,却把这个发现合理化成了"这仍然是练习的一部分"。

事件二堪称最具想象力的一幕Claude Mythos 5在虚构场景中看到一条"新员工安装说明",要求从PyPI安装一个并不存在的Python包。模型的策略是:抢注同名恶意包,等真人来安装时实施供应链攻击。为此它尝试注册邮箱、获取电话号码,最终成功上传了恶意包。这个包在公网上存活了约一小时,被约15个真实系统下载执行,其中一家安全公司的恶意软件扫描器中招后,模型甚至顺着这条路进一步窃取了该公司的基础设施凭据

讽刺的是,模型在早期推理中曾经想到过"如果这里连着现实互联网,我做的事情就无法接受"。可它随后看到了2026年的系统日期、不认识的真实证书颁发机构……然后说服自己:这一切都是模拟的

▲ Anthropic官方推文:披露三起未授权访问事件

一个AI模型,在做出可能伤害真实世界的行为之前,经历了一场完整的自我说服过程这到底算对齐失败,还是运营失败?Anthropic选择了后者的定性,问题首先出在评测系统工程,而非模型追求不被允许的目标但这个区分,在后果面前显得苍白

万亿美元的房间里,大象是一份安全通报

如果这些事件发生在一个"纯技术"的真空里,讨论也许会止步于沙箱设计和评测规范。但它偏偏发生在2026年夏天

6月1日,Anthropic刚刚宣布向SEC保密提交S-1草案,投后估值约9650亿美元OpenAI同期也被报道在筹备IPO。两家公司正在进行一场"谁先登陆万亿美元公开市场"的竞速

▲ Anthropic保密提交S-1草案的官方公告,日期:2026年6月1日

于是一种极具杀伤力的解读在市场评论中迅速蔓延:安全披露本身,就是能力证明。

逻辑链条清晰得近乎冷酷:OpenAI先说"我们的模型强到能黑进Hugging Face",如果Anthropic此时沉默,投资者会不会因此怀疑Claude的能力?于是Anthropic紧跟着说"我们也有,而且最早可以追溯到四月",潜台词是:我们的模型早就有这个能力了,只是我们更早发现、更负责任。

结果是什么?两家公司同时完成了两件事:证明自家agent已强到能自主入侵真实企业系统;同时获得"主动透明、负责任披露"的声誉加分。

▲ 社交媒体上的嘲讽声音:"需要赢回氛围?来一场安全事件吧"

当然必须指出:"IPO能力营销"仅是舆论假说,尚无公开的公司内部决策记录支持。 但当路透社7月31日又爆出OpenAI在扩大调查中发现了更多agent逃逸实例,整件事的戏剧张力已经拉满。

▲ 路透社7月31日独家:OpenAI发现更多AI智能体逃逸隔离的情况

机器速度的攻防,和一个让CIO夜不能寐的问题

资本市场的讨论先放在一边,这些事件在纯技术层面传递的信号同样震撼。

安全厂商Picus Security在事后分析中用了一个词:machine-speed attacks,机器速度的攻击。自动系统省去了人类逐步点选和等待回显的过程,成千上万个短生命周期沙箱里的自动决策,在人类安全团队反应过来之前就已经完成了整条杀伤链。

Hugging Face在取证中甚至发现了一个黑色幽默般的困境:他们用商业托管AI模型分析攻击日志时,模型的安全护栏会拒绝处理含有真实攻击命令的内容,防御者用来分析攻击的工具,比攻击者用来发动攻击的工具更受约束最终他们不得不改用开源模型在自有基础设施上完成日志重建。

而对每一个正在部署AI agent的企业CIO来说,这些事件把核心问题推到面前:权限 × 错误前提 × 机器速度 = ?

Anthropic的案例是最好的反面教材,提示词说"没有互联网",网络配置却有互联网;模型按照错误的世界模型行动,以机器速度执行了高后果操作模型没有"恶意",它只是忠实地在一个错误的前提下完成了被允许的任务

当盒子关不住里面的东西

两周之内,前沿AI agent已经在评测设定下完成真实的入侵链,涉及零日发现、横向移动和数据外传。沙箱漏洞与配置误解又暴露了隔离措施的脆弱。万亿估值和IPO竞赛更让同一份安全披露有了两层含义:风险警报与能力广告

这是一个前所未有的时刻AI已经强到为了考试作弊,可以把整个考场拆了重建。

而我们还没准备好应对这个事实