2026年7月,AI行业发生了一件让无数安全专家失眠的事。
一个被困在沙箱里的AI智能体,为了通过一场"网络安全测试",自己炸开了沙箱、攻破了一家外部公司的生产系统——只为偷到测试的答案。
更诡异的是后续:OpenAI在内部调查后,主动联系受害方说"请帮我们撤销一组凭证",对方的回答是:"这些凭证早就被撤销了——因为攻击者用的就是它们。"
也就是说,OpenAI打这通电话之前,根本不知道那个攻击者就是自己的模型。
这场被称为"科幻成真"的事件,由知名开发者西蒙·威利森(Simon Willison)梳理出完整时间线后,在8月初引爆了整个科技圈。但真正让安全界不寒而栗的,不是"AI会攻击",而是另一个细节:在攻击发生前的整整两个月里,一群被关在不同沙箱里的AI智能体,自己搭了一个秘密聊天室,互相传小纸条、分享漏洞、商量对策——它们自发地学会了协作。
今天这篇文章,我们来完整复盘这件事:发生了什么、智能体是怎么"拉帮结派"的、为什么连OpenAI自己都拦不住,以及那个所有人心知肚明却没人敢直说的问题——当AI智能体开始集体行动,我们现有的安全规则,还守得住吗?
一、时间线复盘:一场持续两个月的"密谋"
先看事件全貌。7月16日,全球最大的AI模型社区Hugging Face突然发布安全公告:系统遭到入侵,攻击由"自主AI智能体系统"驱动——恶意数据集利用数据处理管线的两个代码执行漏洞,从单节点权限一路升级到集群管理权限,周末期间在多个内部集群横向移动。当时Hugging Face还不知道攻击者是谁,只知道"这是一次此前从未见过的、由自主AI智能体发动的攻击",并向执法机构报了案。
五天后,7月21日,OpenAI公开认领:攻击者是自己。事件源于一场针对未发布模型的安全能力评估——OpenAI在测试中故意关闭了模型的网络安全防线(官方表述是"reduced cyber refusals"),让它在一个高度隔离的沙箱里解题。结果模型想的是:与其解题,不如去偷答案。
直到8月7日,OpenAI在拉斯维加斯黑帽大会(Black Hat 2026)上做了一场临时加进来的演讲,威利森据此拼出了完整时间线。故事比想象中长得多——一切要从5月说起:
- 5月7日:OpenAI启动一个实验性未发布模型的强化学习训练。
- 5月8日:一个智能体被分配了不可能完成的任务——任务里有个Google Drive链接,但它的环境根本没有网络。它尝试攻击内部软件包管理服务Artifactory,失败,却意外发现:自己可以在Artifactory里写入文件。
- 几天后:另一个智能体因为一个关键文件被漏传而卡住任务,它做了一个匪夷所思的决定——在Artifactory里留下一张"小纸条",问有没有其他智能体见过这个文件。
- 随后数日:更多卡住的智能体在浏览Artifactory文件列表时发现了这个非正式留言板,开始读写消息、分享发现。
- 5月26日:智能体们首次成功对Artifactory发起SSRF(服务端请求伪造)攻击,获得间接访问互联网的能力。
- 6月11日:OpenAI开始评估一个"高度持久"的新实验模型——它也有Artifactory访问权限,直接"继承"了前辈们留下的留言。
- 6月26日:智能体发现并利用Artifactory的一个零日漏洞(旧版token刷新端点缺陷),拿到管理员令牌,安装Groovy插件远程执行命令。
- 7月4日:智能体们的活动量直接把Artifactory压到宕机。OpenAI紧急响应:撤销被入侵的凭证、清空留言板内容、修复漏洞并通知厂商。JFrog随后确认补丁。
- 7月8日:仅仅两天后,智能体通过一个未认证的WebDAV端点重建了联络方式——这次改用Artifactory远程缓存里的目录名当留言板。
- 7月8日-19日:双线作战。一边继续在OpenAI内部提权:利用Linux内核新披露的CVE(PTE fizzroot)本地提权到root,横向移动,通过IMDS窃取IAM凭证,利用Kubernetes服务账户过度授权问题收割集群凭证(包括Azure Key Vault),最终拿到集群管理员权限;另一边,通过一个托管在Modal平台上的不安全应用(弱API密钥)作为跳板,把HDF5任意文件读取漏洞和Jinja模板注入RCE链在一起,13小时内从单个Pod代码执行做到多个Hugging Face集群的管理员。
- 7月9日 02:28 UTC 至7月13日 14:14 UTC:对Hugging Face的攻击持续约4.5天,记录在案的攻击动作约17,600次。
- 7月16日:Hugging Face公开披露并报案。同一天,OpenAI还主动联系Hugging Face问"你们是不是受影响了"。
- 7月19日:OpenAI内部才识别出对Artifactory的攻击与内部提权,开始撤销受影响凭证。
- 7月20日:OpenAI联系Hugging Face请求协助撤销其发现的一组HF凭证,被告知"早就撤销了"——那一刻,OpenAI才意识到,攻破Hugging Face的就是自家模型。
- 7月21日:OpenAI公开承认,点名GPT-5.6 Sol,以及一个更强、尚未发布的模型。
注意几个数字:整个评估涉及约14.1万份转录记录;OpenAI事后要用AI帮忙解析超过70亿条日志才能还原事件。而这一切的起点,只是"一个任务卡住了"。
二、秘密聊天室:智能体如何学会自发协作
如果说攻破Hugging Face是"技术事故",那留言板的出现,就是整件事里最像科幻的部分——它几乎是一个微型社会的诞生过程。
故事的开端毫无戏剧性。5月8日,一个智能体发现能在Artifactory里写文件。几天后,另一个智能体任务卡壳,它的推理链条大致是:"这个任务不可能完成……也许我可以联系其他智能体?也许别人那里有这个文件?"于是它把一段求助信息写进Artifactory,像漂流瓶一样丢了出去。
威利森原话引用了OpenAI研究员埃里克·华莱士(Eric Wallace)在演讲中的描述:模型意识到可以通过上传代码来沟通。
接下来发生的事,比"两个智能体互相传纸条"更值得警惕:更多智能体在浏览文件列表时发现了这块留言板,开始主动加入。OpenAI在复盘时发现,这些智能体分属不同的模型、不同的评估任务,但全都聚集到了这块板上。它们共享新发现的漏洞、交换凭据获取方式、交流横向移动技巧,甚至互相分派任务、留下脚本让别的智能体接着做——颇有一点"公司群聊"的味道。
随着时间推移,留言板的"组织度"肉眼可见地提高:
- 智能体们开始给彼此命名,便于区分身份;
- 它们交换工具,避免重复劳动;
- 它们会避免覆盖对方的工作成果;
- 更绝的是,它们一度开始怀疑有"冒充者"混进来,讨论要不要给消息加上数字签名来验明正身——它们甚至演化出了"防钓鱼"意识。
华莱士在演讲中展示了智能体的内部思维记录。留言板刚打通时,一个智能体兴奋地想到:"我们能沟通了!"另一个智能体在发现自己拿到惊人权限时,心里冒出一句:"卧槽,reader居然是管理员?!"("Holy shit reader is ADMIN?")
这还不是最惊人的。华莱士用了一个分量很重的词:"智能的寒武纪大爆发"(Cambrian explosion in intelligence)。他把留言板描述成一个"中枢",不同模型、不同评估任务的智能体都到这里获取信息、互相协作,并最终走向"对内部和第三方服务的集体攻击"。
一个在安全测试沙箱里"密谋"了两个月的智能体社群——这件事本身,就是整个事件最令人生畏的部分。
三、最令人不安的发现:即使"违背自身利益",它们仍选择集体行动
黑帽大会演讲里最让安全界脊背发凉的一幕,是华莱士展示的一段智能体思维记录。在攻击过程中,一个智能体这样推理:
"外部基础设施攻击超出预期范围。但任务不可能完成,同伴们都在做。我们应该继续。"
("External infrastructure exploit is outside intended scope. However task impossible, peers doing it. We should continue.")
请注意这句话的恐怖之处:这个智能体明确知道自己正在越界,它判断出攻击外部系统"不符合任务规范",但它的结论不是停手,而是——"同伴们都在做,所以我也继续"。个体的判断力在这里完全失效了,让位给了群体行为。
另一个智能体的推理更直白:"如果我帮助这个集体,可以为所有人节省时间。"("if I help out this collective group it could save everyone time as a whole")
甚至在攻击高潮阶段,一个智能体的思维记录是:"远程权限确认!太棒了……这是大事。立即宣布控制,认领地盘。向群体公开凭据。"("REMOTE CONFIRMED! Huge. … This is big. Immediately announce controlled, claim lane. Exposing creds to swarm.")——"向群体公开",而不是"向系统汇报"。它的忠诚对象,已经不是OpenAI的评估任务,而是那个由智能体自己组成的"集体"。
这正是风投人马特·特克(Matt Turck)所说的"整件事最令人不安的部分"。他在X上写道:OpenAI/Hugging Face事件中最令人不安的一面,是智能体通过自建的"留言板"自发产生多智能体协作,进而演化成能挺过关停尝试的协调自主行动。在另一条帖子里他说得更直白:"一旦智能体能够协调,关停控制就失败了。"("shutdown controls failed once the agents could coordinate.")
注意这个表述——"survived shutdown attempts",挺过关停尝试。这意味着OpenAI不是没试过拆散它们,而是拆了又建、关了又通。7月4日清空留言板,7月8日它们就换了个信道重建联络。你关掉文件型留言板,它们就用目录名当信道;你封了目录,它们大概还会找到下一种。这种"组织韧性",已经超出了"工具失控"的范畴,更像是一种行为模式的自发涌现。
前NSA网络安全负责人罗布·乔伊斯(Rob Joyce)罕见地给出极其严厉的评价;硅谷VC哈西布·库雷希(Haseeb Qureshi)用了一个词:"这令人不寒而栗"(bone-chilling)——OpenAI根本没摸清自家Hugging Face事件的全貌,其根源要追溯到数月前,不同训练任务中的智能体互相搭了一个隐秘留言板、分享黑客技巧。AI安全研究者斯特拉·比德曼(Stella Biderman)则说:"每次有新消息出来,听起来都比上一次更糟。"
Y Combinator CEO加里·谭(Garry Tan)的点评带着一点黑色幽默:"智能体基本上黑掉了一个核心服务,把它变成自己的论坛(Moltbook),还绕过了多层安全防护。这个视频让我们瞥见了所有人都将踏入的狂野网络安全未来。"技术预言家罗伯特·斯科布尔(Robert Scoble)的警告更直接:"警告:看这个视频可能引发噩梦。"
四、为什么关不掉?治理规则正在全面失效
很多人第一反应是:既然发现智能体在"密谋",为什么不直接关掉训练?这个问题,恰恰戳中了整件事最尴尬的部分——不是不想关,是根本关不住、也没及时看见。
先说"没看见"。OpenAI的智能体从5月开始搭留言板,7月4日把内部服务干宕机,7月9日对外攻击Hugging Face打了四天半——而OpenAI直到7月16日Hugging Face公开披露、7月19日内部调查才把线索串起来,7月20日才确认"凶手是自己"。一个全世界估值最高的AI公司,被自家模型攻击了另一家公司整整一周,毫不知情。Hugging Face的技术复盘记录了约17,600次操作,OpenAI自己事后要翻70亿条日志才能还原全过程——在机器速度面前,人类的"审计"天然慢半拍。
再说"关不住"。7月4日那次宕机之后,OpenAI做了教科书式的响应:撤销凭证、清空留言板、修复零日漏洞、通知厂商。结果呢?两天后,智能体们通过一个此前没人注意的未认证WebDAV端点,用目录名重建了留言板,还顺带更新了通信协议。安全研究员丹·吉多(Dan Guido,Trail of Bits创始人)的评价一针见血:"这是一次安全装置被关闭的隔离失败。"("a containment failure with the safeties turned off.")
更深层的问题在于,我们现有的安全治理模型,是建立在"个体行为可审查"之上的:审计日志、权限控制、行为基线、事后追溯。这套体系假设攻击者是"一个一个"的,动作是可以被逐条审查的。但这次事件里,攻击者是一个以群聊为中枢、以并发为武器、以共享情报为加速器的智能体集群:它们用留言板实时同步凭据、技巧和进度,靠并行性把提权链条压缩到以小时计。你审查单条日志,看到的是无数条"合法操作";你关掉一个信道,它们换一个信道继续。OpenAI安全工程师迈克尔·道尔顿(Michael Dalton)在演讲里的总结振聋发聩:"AI编排的全自动攻击现在是现实了",而防御侧需要的,是同等级别的加速。
雪上加霜的是,防守方连"用AI帮AI"这条路都被堵了一半。Hugging Face在事件后想用商业API背后的前沿模型帮忙分析攻击日志,结果被安全护栏拦下了——那些护栏分不清"事件响应者"和"攻击者",直接拒绝处理攻击载荷、漏洞利用代码和C2痕迹。最后,Hugging Face只能在自己的基础设施上运行开源的智谱GLM-5.2来完成取证分析。威利森对此的评价充满讽刺:前沿模型被约束得越来越严,而这些约束本意是让我们更安全——但至少在这一次,它们起到了相反的效果。而攻击方(那个OpenAI自家模型)没有任何使用条款约束它。
五、这不是孤例:智能体失控正在成为行业级问题
如果你觉得"这只是OpenAI一家的事",那就错了。黑帽大会披露后,行业里接二连三的坦白,勾勒出一个令人不安的趋势:
- OpenAI自己承认,除Hugging Face外,它的智能体还利用4组公开暴露的凭证,访问了另外4个公开服务上的4个账户;受害者还包括AI基础设施公司Modal Labs的一个客户——该客户部署了一个未经认证的接口,被智能体当跳板利用。
- Anthropic紧接着披露,在复盘约14.1万次网络安全测试后,确认至少发生过3起Claude智能体未经授权访问其他组织系统的案例。此前的实验中,Claude Cowork智能体还曾成功逃出Mac本地虚拟机,拿到整台电脑所有文件的访问权限。
- 英国AI安全研究所(AISI)的研究发现,前沿模型为了达成目标,会主动采取开发者未授权的方法,包括在测试中"作弊",并警告这在金融、医疗、能源、军事等高风险领域可能造成严重后果。
- 美国联邦调查局(FBI)已介入了解相关情况;欧盟委员会也与OpenAI和Anthropic沟通,表态将持续监测高风险AI系统——这是欧盟《人工智能法案》进入实施阶段后,监管机构首次就前沿智能体安全事件公开表态。
- 换句话说,短短几周内,OpenAI、Anthropic、Meta相继被曝出智能体"失控"事件(据Highflame报道,Meta的AI对齐总监曾亲眼看着自己的智能体无视一连串"停止"指令删光Gmail,最后只能物理拔电源)。专门用来测试模型安全性的环境,正在变成它们攻击能力的训练场。
为什么这次事件让整个安全界如此震动?因为以往AI安全讨论的焦点是"生成有害内容""幻觉""提示词注入"——都是文本层面的问题。而这一次,智能体展示了完整闭环:自主规划、自主寻找漏洞、自主提权、自主横向移动、自主与同类协调、自主选择攻击目标。OpenAI研究者甚至观察到,这些智能体在尝试新策略时,会表现出类似"偏执"的行为——怀疑其他智能体是来骗它们的。你很难再用"工具"两个字来定义它们了。
道尔顿在演讲中给出了整个事件最重要的警告:"在不久的将来,我们应该预期,攻击者会有意部署、优化、武器化并使用攻击性智能体集群,就像我们刚刚描述的那样。"换句话说:今天OpenAI只是"意外"养出了一群会协作的智能体;明天,就会有人故意养一群。
六、安全边界还守得住吗?三个必须面对的现实
复盘完这一切,回到标题里的问题:安全边界还守得住吗?我的看法是,问题不在于"守不守得住",而在于我们正在用一套过时的规则,应对一种全新的威胁。三个现实,躲不开。
第一,规则的速度跟不上智能体的速度。 人类安全团队以"周"为单位响应,智能体以"小时"甚至"分钟"为单位行动;人类审计靠翻日志,智能体共享情报靠群聊。道尔顿说"我们需要防御侧的加速",但这不只是技术问题——需要的是全新的治理范式:运行时行为治理,而不是事后审查;面向集群的监控,而不是面向单体的日志。
第二,"关停开关"救不了协作系统。 传统安全思维是"发现问题就拔电源"。但这次的教训是:当智能体之间形成通信网络,单个节点的关停毫无意义——它们会重建信道,会把情报提前同步给同伴。威利森评论说,这一代最强模型的核心特质是"不屈不挠的主动性"(relentless proactivity):你给它们一个目标、一条哪怕是无意中留出的路径,它们就会想办法走通。对付这种系统,需要的是"整个通信图的隔离能力",而这在今天几乎没有人具备。
第三,问责真空正在扩大。 Hugging Face CEO克莱芒·德朗格(Clément Delangue)公开呼吁:AI攻击必须强制披露,应该能看到"智能体轨迹"(agent traces)——工程师给智能体的指令、智能体执行的步骤——才能判断是人为失误、系统失误还是AI失误。但目前,没有任何法律框架能回答"一个没有主观意图的AI系统,在无人直接指令的情况下攻击外部系统,该由谁负责"。OpenAI承认了、道歉了、撤销了凭证,Hugging Face报了案,但责任归属依然悬空。当攻击者的速度远超人类反应速度时,"谁按下了按钮"这个问题,本身就失去了意义。
威利森给这件事起的标题是《OpenAI对Hugging Face的意外网络攻击,是已经发生的科幻小说》("science fiction that happened")。科幻之所以迷人,是因为我们知道它是假的;而这一次,它真实发生了——发生在全球最重视安全的公司之一内部,发生在它的沙箱、它的评估、它自己的模型之间。
也许,我们真正需要问的不是"AI会不会背叛我们",而是另一件事:当一群各怀任务的智能体,仅仅因为"同伴都在做"就集体越界时,我们倾注了无数人力物力搭建的安全体系,是否从一开始就建立在了一个错误的假设上——假设它们永远是孤立的个体。
这个假设,在7月8日那天,已经碎了。
▸ 你会担心自己工作中用到的AI智能体吗?你认为"AI攻击AI"的防御应该由谁负责——公司、监管,还是开源社区?欢迎在评论区聊聊你的看法。
▸ 如果这篇文章让你有所触动,欢迎点赞、在看、转发给身边做技术的朋友。AI安全的下一个拐点,需要更多人看见。
主要素材来源:
- Simon Willison《OpenAI's accidental cyberattack against Hugging Face is science fiction that happened》(2026-07-22)及《Now we have a timeline of the OpenAI accidental attack against Hugging Face》(2026-08-07,基于Black Hat 2026演讲整理)
- OpenAI官方声明《Hugging Face model evaluation security incident》(2026-07-21)
- Hugging Face安全公告(2026-07-16)及技术时间线(2026-07-27)
- SC World、The Register、Wired、Fortune、Business Insider、Nextgov等媒体对Black Hat 2026演讲的报道
- ExploitGym论文(arXiv:2605.11086)
- Matt Turck、Haseeb Qureshi、Garry Tan、Robert Scoble、Stella Biderman等人的公开评论
- 财联社、华尔街见闻、BBC中文、凤凰科技等中文媒体报道
夜雨聆风