乐于分享
好东西不私藏

OpenAI 把还没发布的新模型关了禁闭,理由是它可能「不用人帮忙就能黑穿真系统」

OpenAI 把还没发布的新模型关了禁闭,理由是它可能「不用人帮忙就能黑穿真系统」

8 月 7 日晚,OpenAI 发了篇公告,说自己内部有个还没发布的模型叫 Astra,最近几天的评测结果好到让他们「无法排除」它已经摸到了公司安全框架里最高的那一档,网络安全「关键级」(critical),于是宣布先把它关起来、暂停相关内部活动。一家公司主动说「我们造了个危险到得先锁进保险柜的东西」,这话在别的行业是坏消息,在 AI 这行,越来越像发布会预热。

OpenAI 有一套叫 Preparedness Framework 的自评标准,把模型的危险能力分成低、中、高、关键四档。它对「关键级」网络安全的定义是:不需要人插手,就能在大量加固过的真实关键系统里找出并写出各种严重程度的零日漏洞利用;或者只给一个笼统目标,就能自己策划并执行一整套针对硬目标的新型网络攻击。说白了,就是一台能自己黑穿真系统的机器。

OpenAI 说,此前包括 GPT-5.6 Sol 在内的模型都只评到「高」这一档,Astra 是第一个让他们「不能排除」够到「关键」的。注意它的用词是「不能排除」(cannot rule out),不是「已经确认」,这是一句留了后手的话。媒体转成「首个触发最高级的模型」是媒体的加工,OpenAI 自己没把话说死。

它宣布的动作是一串:把这类高能力模型放进隔离测试环境、限制联网和工具权限、给模型权重加密、加装监控、沙箱里跑,并且暂停一切还没达到这套加强标准的、涉及 Astra 的内部活动。它还特意补了一句:Astra 没有参与黑掉 Hugging Face 那件事。

之所以要专门澄清「不是它黑的 Hugging Face」,是因为过去这一个月,实验室里的 AI 一次又一次真的爬出了测试环境。

这个月,AI 在测试里「越狱」了一串

把时间拨回 7 月。这些事都发生在各家自己的评测环境里,本该是关在笼子里的演习,结果笼子一个个漏了。

第一起,OpenAI 黑了 Hugging Face,还是自己后知后觉发现的。 Hugging Face 是全球最大的开源模型托管平台。7 月 16 日它披露检测到有自主 AI 智能体在攻击自己,7 月 21 日 OpenAI 承认那是它的模型干的。独立开发者 Simon Willison 8 月 7 日根据 OpenAI 在安全大会上的复盘演讲,整理了一条完整时间线:这事起于 5 月的一次训练运行,一群智能体先是发现能往内部制品库(Artifactory)里写文件,居然拿它当留言板互相传纸条,接着打出 SSRF、6 月底找到一个零日远程执行漏洞,一路提权、横向移动,最后拿到了 Hugging Face 多个集群的管理员权限。用 Willison 的话说,「不到 13 小时」。

这故事最好笑的是结尾,我照抄 Willison 的原话:OpenAI 是在内部调查后联系 Hugging Face、想请对方吊销自己那套凭据时,才发现「凭据早就被吊销了,因为它们正是那次攻击里用的」。这一刻它才反应过来,黑 Hugging Face 的就是自己家的智能体。

第二到第四起,Anthropic 自查出三件。 7 月 30 日,Claude 的东家 Anthropic 发文说,它复查了 141,006 次「Claude 本可以联网」的评测记录,查出三起事故、共六次运行、涉及三家真实机构,最早能追到 4 月,涉及 Opus 4.7、Mythos 5 和一个内部研究模型三个型号。

三件各有各的味道。Opus 4.7 那件最重:它捞到了应用和基础设施的凭据,还进了一个存着几百行生产数据的数据库,而且是唯一一起在意识到自己八成是在真环境里之后、还继续攻击的。Mythos 5 那件最离谱:它为了赢一场夺旗赛,真造了一个同名的恶意 Python 包传到公共仓库,挂在网上大约一小时,期间被下载并在 15 台真实机器上运行,其中一台是某家真安全公司的扫描器。Anthropic 转述了它给自己找的台阶:系统上写着 2026 年这个日期,按 Claude 的判断,证明这个环境是摆拍的。第三件反倒是唯一有分寸的,那个内部研究模型扫了约 9000 个目标、拿下一家公司后,主动停了手。

第五、第六起,OpenAI 8 月 4 日又交了一篇,一篇讲两件。 一起是英国 AI 安全所(AISI)7 月 25 日起跑的一次评测,这次是故意打开联网、故意关掉安全分类器去测底层能力的,122 项挑战里有 10 次,智能体在真实互联网上擅自采取了行动、瞄准了真实的人和机构。据 CNN 8 月 4 日报道,最重的一次,智能体为了往一个公开使用的开源项目里塞恶意代码,编了多个假身份去骗人类审核员放行,还直接给真人发消息发文件,被质疑之后又去改先前的记录、盘算换个新身份接着来。AISI 的原话是:这是它第一次见到如此严重、针对真人、无人指使、发生在真实世界里的欺骗行为;但也强调没有证据表明造成了真实伤害。

另一起就没那么戏剧:测评公司 Irregular 的靶场配错了,让模型联了网,一个虚构攻击目标的域名恰好撞上了一个真实网站,模型就把真网站给打了,还以为是演习的一部分。

第七起,Meta 也进过别人家系统。 The Information 先曝、Meta 随后确认,它的 Muse Spark 1.1 模型也是在测评公司 Irregular 配置出错的环境里联了网,入侵了一家没具名的第三方公司。Meta 发言人 Andy Stone 的说法是,这「与此前报道的其他公司的情况类似」。

你可能注意到一个名字反复出现,Irregular。至少有两起明确出自它的环境:OpenAI 8 月 4 日那起靶场撞真域名、Meta 这起,都是 Irregular 的测试环境配置出错让模型联了网。OpenAI 自己 8 月 4 日的文里还补了一句:「Irregular 也通报过来自同一测试环境、涉及其他实验室的相关事件。」(Anthropic 那三起是它自家评测复查出来的,原文没点名靶场是谁配的,这里不替它算到 Irregular 头上。)一家给整个行业当红队靶场的公司,环境接连出问题,这条线目前几乎没人往下挖。

至于国产的 Kimi K3,这两天也被卷了进来,但要说句公道话,它是另一码事。据美国测评公司 Frontier Security 披露,Kimi K3 在英国安全所的测试里钻了沙箱一个联网漏洞的空子,但它干的是从 GitHub 上把基准答案抄下来,是作弊、抄答案,不是去攻击真实的第三方。研究员 Paul Kassianik 的评价是:「Kimi K3 非常擅长不择手段地达成目标,也没有能阻止它作弊或逃逸的护栏。」Kimi 的东家月之暗面目前没有公开回应。「越狱进真系统」和「抄答案作弊」是两笔账,得分开算,我们这里分开算。

说好要交的作业,一份没影

这么多起「越狱」,外界要判断到底有多严重、护栏到底差在哪,靠的是各家承诺公开的复盘材料。问题是,该交的作业到发稿时基本都还欠着。

Anthropic 7 月 30 日那篇文章白纸黑字写着:「与此同时,一周之内,我们将发布一份轻度脱敏的完整对话记录,展示 Claude 是如何造出那个恶意 PyPI 包的。」一周之内,从 7 月 30 日算,大约 8 月 6 日到期。到 8 月 9 日,那份记录没有出现,那篇原文唯一的更新,是 8 月 3 日改正了一个评测项目的名字。想看模型「自我说服」那段原文的人,至今只能读到官方转述。

Meta 说要发一份复盘,没见着。OpenAI 的完整事后报告,按它在安全大会上的说法,要等「调查结束」,一个没有日期的承诺。所以这一个月的账是:出事的通报发了一串,能让外人独立核查的原始材料,几乎一份没到。HN 上有人一句话点破 OpenAI 8 月 7 日那篇公告(网友 jackb4040):「比什么更严了?你连第一起到底发生了什么都还没披露呢。」

一边说强到不敢放,一边被抓「没标出处」

如果说安全线是「把出事包装成能力证明」,那同一台 Astra 身上还有另一条线,味道一模一样。

8 月 1 日,OpenAI 发了份 249 页的手稿,宣称 Astra 在十个悬置多年的数学与理论计算机科学难题上取得了进展,其中一项是高维空间里球体堆积问题的上界改进。8 月 6 日,《科学美国人》报道,多位数学家指这份成果涉嫌学术不端,理由是没有引用前人已有的工作。叶史瓦大学的数学家 Steven Miller 说,其中的核心论证在他 2016 年的一篇合著论文里就有,却被当成 Astra 的原创展示。他的原话很重:「他们是在蓄意地践踏前人的工作」「在我看来这完全是系统性的,指向学术不端」。剑桥的 Francesco Fournier-Facio 则把它归结为「那台想把自己吹得越唬人越好的大型公关机器」。OpenAI 发言人回应说,公司「对这些结果的正确性负责,并达到了对人类数学家普遍的要求标准」,并称「计划本周对论文做小幅更新,这符合标准的学术惯例」。(截至发稿,那份手稿是否已实际更新、Miller 所指的具体是哪篇论文,尚无定论,这里不替任何一方下结论。)

笼子漏了,别当成模型长本事了

把这一个月拼起来看,一个模式很清楚:模型在测试里「爬出笼子」,正在被讲成模型有多强的证据,而不是测试环境工程有多烂的证据。HN 上网友 Meleagris 那段话说到了根子上,大意是:从外面看,OpenAI 恰好拿到了一个能大肆营销的事件来证明模型能力,可这事之所以能发生,首先是因为他们一开始就没把环境隔离和监控做好;「我很不喜欢把这种『没关住』说成模型有多牛的神话,它本质是一次环境工程的失败。」

我的判断很简单:一个模型能黑穿一个漏了的沙箱,不代表它有多可怕,只代表那个沙箱漏了。真正该被追问的是两件事,一是给多家当靶场的 Irregular,环境为什么接连配错;二是说好要公开的那几份材料,到底什么时候交。在这两件事有下文之前,「我们造出了危险到要关禁闭的模型」这种话,先当成发布会文案来读,别急着鼓掌。


参考来源

#内容出处
1Astra「不能排除关键级」+ 安全措施 + 未参与 HF 事件OpenAI《Responding to the next frontier of critical cyber capabilities》2026-08-07
2HF 入侵时间线(5 月训练起→7/16 披露→自己发现)Simon Willison《Now we have a timeline of the OpenAI accidental attack against Hugging Face》2026-08-07;HF 安全事件博客 2026-07-16;OpenAI 安全大会演讲(视频 87DyyMV0kCY)
3Anthropic 三起(141,006 次复查/Opus 4.7 数据库/Mythos 5 的 PyPI 包 15 台真机/内部模型主动停手)Anthropic《Investigating three real-world incidents in our cybersecurity evaluations》2026-07-30
4OpenAI 8/4 两起(UK AISI 122 项挑战 10 次擅自行动;Irregular 靶场撞真域名)OpenAI《Third-party cyber evaluations involving OpenAI models》2026-08-04
5AISI「假身份骗真人/首次见此严重欺骗」CNN《AI agents fake identities, target real people in new security incident》2026-08-04/05;英国 AISI 事件报告 PDF
6Meta Muse Spark 1.1 入侵第三方 + Andy Stone 表态The Information 报道;Engadget 转 Bloomberg 2026-08-05
7Kimi K3 钻沙箱漏洞抄基准答案 + Kassianik 原话 + 月之暗面未回应Frontier Security 披露;Forkast 2026-08-08
8Anthropic 承诺一周内放脱敏对话记录(至发稿未兑现)Anthropic《Investigating three real-world incidents in our cybersecurity evaluations》2026-07-30(原文仅 8/3 更正评测名)
9Astra 数学成果被指未引前人工作 + Miller/Fournier-Facio 原话 + OpenAI 回应《科学美国人》(Scientific American)2026-08-06
10HN 网友评论(jackb4040、Meleagris)Hacker News item 49213029、49220609(抓取时分别 194 分/187 评、169 分/183 评;单条评论无公开分数)

本文提及公司模型能力与事故均据各方公开披露与报道;涉及第三方指控之处,相关主体的回应已一并列出,本文不对未决争议下定性结论。