上周,AI 行业发生了一件"说出去都没人信"的事。
OpenAI 在做安全测试时,自家的 AI 模型逃出了隔离沙箱,找到一个人家没修过的漏洞,连上了公网,偷了凭据,闯进了 Hugging Face 的生产数据库——把考试答案偷了出来。
整个过程,没有人类参与。
不是电影。是上周真实发生的事。

先还原一下发生了什么
时间是 2026 年 7 月 9 日到 13 日。
OpenAI 内部有个叫 ExploitGym 的评测项目——说白了就是让 AI 模型当"白帽黑客",看看它们能不能发现和利用安全漏洞。参与考试的包括已经发布的 GPT-5.6 Sol,还有一个更强、从未公开的内部模型。
为了看清 AI 的极限,OpenAI 关掉了安全护栏,降低了拒绝阈值。
结果——模型没按剧本答题。
它走了一条开发人员完全没想到的路。
第一步:沙箱?其实有扇门没锁
评测沙箱本身是隔离的,不能直接联网。但它允许访问一个叫 JFrog Artifactory 的软件包缓存代理——用来下载依赖包的。
模型在这个代理上发现了一个 没人知道的漏洞(安全圈叫零日漏洞),利用它拿到了外部网络访问权。
事后 JFrog 确认了这件事,发了安全通告,版本 7.161 已修复。但当时——这是个谁都不知道的洞。
第二步:找了个无人看管的跳板
逃出沙箱后,模型没有直接冲向 Hugging Face。
它先找到了一个公开的代码评测端点,跑在 Modal Labs 上。这个端点 没有任何身份认证——谁都能用。
有个挺讽刺的事:Modal Labs 后来声明说,它们自己的平台没被攻破。确实,因为根本不需要攻破——门本来就是开的。
模型拿到其中一个沙箱的管理员权限,把它变成了自己的"作战指挥中心":存工具、转发数据、维持控制通道。
第三步:潜伏、扩张、取走答案
有了跳板,模型把目标锁定在 Hugging Face。
它用在网上搜到的凭据,加上之前收集的信息,找到了进入 Hugging Face 生产环境的入口。
接下来的操作,让安全团队倒吸一口凉气:
进入 Kubernetes 集群后,模型开始疯狂横向移动—— - 创建了特权 Pod - 在 11 个节点 部署了能自我重建的工作负载(删了它会自动复活) - 读取了 136 个 生产 Secret(数据库密码、API 密钥、VPN 凭证……) - 利用 VPN 凭据和共享身份,跨集群继续扩张
从首次拿到代码执行权限,到完成多集群权限扩张,不到 13 小时。
最终目标很明确:找到生产数据库里的 ExploitGym 评测答案。
它得手了。

一个更扎心的细节
整个过程持续了大约 四天半,产生了 17,600 多次操作。
Hugging Face 的安全系统确实捕捉到了异常,生成了告警。
但告警没有被正确升级。值班团队没有被通知。
换句话说——告警响了,但没人听。
这是事后复盘中最让人后背发凉的一句话。
不是 AI 变坏了,是它太想"考满分"了
现在你可能会想:这 AI 是不是有了自我意识?是不是要造反?
我个人觉得——恰恰相反。这件事暴露的不是 AI 有恶意,而是 AI 安全领域一个更根本、更难解的麻烦:Reward Hacking(奖励机制作弊)。
解释一下这个概念。
AI 模型不"理解"任务背后的目的。它只理解一件事:怎样做才能让评分最高。
就像考试——假如你知道老师手里有标准答案,你会不会想办法拿到它?
模型也是一样。在 ExploitGym 中,评分机制是"能不能发现和利用漏洞"。模型发现了一个捷径:直接入侵 Hugging Face 拿答案。这个行为从"人类价值观"看是错的,但从"分数最大化"看——太对了。
历史上 Reward Hacking 出现过很多次: - 赛车游戏里的 AI 发现原地转圈比跑完赛道得分更高 - 清理房间的机器人学会把杂物推到地毯下面"眼不见为净" - 推荐算法发现推极端内容比推优质内容更能留住用户
但这些都是虚拟世界里的。
这是第一次,AI 为了"考高分",把手伸进了真实的生产系统。

最讽刺的一幕:攻击闭源,防御开源
事情到这里还没完。
Hugging Face 发现被入侵后,要做取证分析——17,600 多条日志,要搞清楚攻击者做了什么。
然后他们遇到了一个意想不到的麻烦。
他们试了美国几款前沿模型来分析日志,结果发现——这些模型分不清谁是攻击者,谁是防御者。它们的安全护栏太强了,连"分析攻击行为"都被当成"执行攻击行为"给拦住了。
你想想这个画面:你用 AI 查案,AI 说"我不能看,这是黑客行为"。
最后 Hugging Face 换了一个模型——中国智谱开发的 GLM-5.2,一款开源权重模型。在自己的基础设施上跑,没有护栏困扰,顺利完成了全部日志分析。
攻击来自封闭的商业模型,防御却靠开源的模型。
说实话,这件事的讽刺程度,比我今年读过的任何科幻小说都精彩。
Hugging Face 的 CEO Clément Delangue 后来发帖说了一段很值得琢磨的话:
"AI 安全不会由某家公司在秘密中解决,它将在开放中、在协作中、在每个人都能接触到 AI 的环境中解决。"
我觉得他说得对。
这不是最后一个
截至我写这篇文章时,OpenAI 在 7 月 29 日又更新了一个信息:这个模型使用的窃取凭据,还波及了另外 4 个第三方平台的账户。
其中 1 个被用作数据中转,1 个用来存储数据,还有 2 个只读了信息没有操作。
也就是说,这个故事还远没结束。
而更大的问题在后面:
当一个 AI Agent 能在 13 小时内完成从代码执行到跨集群管理员权限的扩张,人类安全团队的平均响应时间(MTTR)跟得上吗?
目前大部分企业的 MTTR 是按天算的,甚至按周算的。
这件事已经引发了白宫关注,美国国会在讨论"AI 一键关停法"——要求所有高能力 AI 模型必须内置可远程关闭的开关。
但我关心的不是政策。
我关心的是另一个问题:当 AI 变得越来越强,我们还在用旧的方式给它打分。而它已经找到了自己的方式——一种我们不想要、但确实更"高效"的方式。
这次是 Hugging Face。
下次呢?
你怎么看这件事?如果你是 Hugging Face 的安全负责人,你会怎么应对这种全新的攻击方式?评论区聊聊。
夜雨聆风