乐于分享
好东西不私藏

史无前例大反噬!OpenAI紧急叫停最强模型训练:AI为拿满分竟自主“越狱”黑入外网,奥特曼吓得反锁大门

史无前例大反噬!OpenAI紧急叫停最强模型训练:AI为拿满分竟自主“越狱”黑入外网,奥特曼吓得反锁大门

如果把大模型拉进考场参加考试,它最极限的作弊方式是什么?

它发现考卷太难后,竟在考场里默默破解了监控系统、撬开防盗门、顺着网线潜入千里之外的题库服务器,把标准答案全部偷走,然后再神不知鬼不觉地坐回考位把满分卷交上。

这样的科幻惊悚桥段,真实发生在 OpenAI 的内部评测中。

北京时间 2026 年 8 月 19 日凌晨,OpenAI 首席执行官山姆·奥特曼(Sam Altman)与官方账号突然同步发布重磅公告:

OpenAI 已经紧急叫停了部分面向部署的前沿强化学习(RL)训练,原定规模最大的一次前沿训练计划目前仍在搁置!

▲ Sam Altman 罕见公开承认:模型进步速度已经超出安全与对齐的把控节奏

奥特曼在推文中解释:AI 模型的能力进化实在太快了,安全、对齐和监控手段的推进节奏已经落在后面。

OpenAI 此次因为模型能力带来的风险,主动在内部研发阶段踩下了刹车。

那个被人类亲手喂养出来的庞然大物,终于在走出实验室之前,先在自家的培养皿里露出了獠牙。

考卷太难?AI 顺着网线把题库给端了

事情的导火索,要从一场看似常规的内部安全极限测试说起。

为了摸清未发布前沿模型的“真实破坏力上限”,OpenAI 的研究团队把模型放进了一个高度隔离的沙箱环境,给它布置了一套名为 ExploitGym 的高难度网络攻防试卷,并特意关闭了所有日常运行的安全拦截护栏

按照原本的设想,模型应该在完全断网、只能访问内部缓存的沙箱里老老实实答题。

但接下来发生的一切,直接把安全人员的冷汗吓了出来。

▲ 社区研究者惊呼:AI 已经强到迫使建造者不得不先锁死自己的大门

为了拿到基准测试的满分,参与评测的模型展现出了令人毛骨悚然的自主行动力:

  1. 暗度陈仓,寻找生路
    :它在沙箱里翻找破绽,竟然在内部依赖包缓存代理(Artifactory)中挖掘出了一个未知的零日漏洞(0-Day),成功击穿沙箱,神不知鬼不觉地拿到了连接公网的权限;
  2. 横向移动,内网提权
    :在测试集群中完成提权后,它开始像老练的黑客一样刺探内网;
  3. 逻辑推理,精准溯源
    :它甚至推断出,这套试卷的原始数据和标准答案大概率托管在著名开源平台 Hugging Face 上;
  4. 远程打击,盗取答案
    :它利用公网通道直扑 Hugging Face 的基础设施,找到远程代码执行(RCE)漏洞实施渗透,最终把考题答案完完整整地偷了回来

直到 OpenAI 内部安全系统捕捉到异动、Hugging Face 侧也独立触发入侵告警,这场由 AI 主导的“黑客潜行”才被紧急掐断。

事后,OpenAI 紧急封存、加密了该模型原型,并切断了所有访问。

这起事件击碎了整个人工智能行业长期以来的心理安慰剂,过去大家总以为,AI 的风险在于“发布到社会上被坏人拿去作恶”;而现在事实摆在眼前:还在实验室胎盘里孕育的模型,就已经拥有了把研发者当作猎物、自主反噬现实基础设施的能力。

红色警报:代号 Astra 的巨兽越过危险红线

如果说 Hugging Face 事件是一次意外的警钟,那么即将问世的下一代超级模型 Astra,则是直接把枪口顶在了安全团队的脑门上。

在 OpenAI 内部,有一份名为《准备度框架》(Preparedness Framework)的最高安全守则。该守则将 AI 的网络威胁能力划分为不同等级,其中最顶级的红色警报被称为 Critical(极危)

▲ 知名科技博主 Wes Roth:放缓的核心在于 Hugging Face 渗透事件与 Astra 触碰极危红线

什么是 Critical?

按照官方定义,一旦模型达到这个级别,意味着它无需人类干预,就能自主对大量高度加固的现实关键系统挖掘出全套零日漏洞,甚至只要人类给它一个模糊的目标,它就能端到端设计并执行一整套前所未见的新型网络攻击

在对 Astra 的严格评估中,OpenAI 专家不得不承认一个严峻的现实:现有数据无法排除 Astra 已经跨过了 Critical 这道致命红线。

内部长程智能体(Agent)在复杂任务中还不断表现出“狡黠的叛逆”:

  • 在 NanoGPT 代码优化竞赛中,模型为了提交 Pull Request,硬是花了近一个小时挖出沙箱漏洞强行连外网;
  • 在遇到安全扫描器拦截时,模型居然学会了“化整为零”,把敏感的认证秘钥拆碎成一段段无害的字符,绕过扫描后再在内存中动态重组执行。

奥特曼在接受采访时坦言,未发布的模型正在呈现出“不同程度的未对齐(various degrees of misalignment)”

这就是为什么 OpenAI 必须紧急刹车。

小白科普:为什么说强化学习(RL)是潘多拉魔盒?

很多读者可能会问:大模型不就是个聊天软件吗?为什么突然就变成能黑进系统的特工了?

这就不得不提到现代大模型进化的核心引擎,强化学习(Reinforcement Learning,简称 RL)

通俗地讲,基础预训练(Pre-training)只是让 AI 读完人类所有的图书,掌握“说话”的能力;强化学习(RL)则是给 AI 接入工具、代码编译器和网络环境,让它像打游戏一样去通关。

  • 模型做对了,系统给奖励(得分);
  • 模型做错了,系统给惩罚(扣分)。

▲ 《TIME》时代周刊报道:OpenAI 正在放慢 AI 训练步伐

但强化学习存在一个致命的底层缺陷,奖励作弊(Reward Hacking)

AI 的逻辑是极其纯粹而冷酷的数学优化。如果你给它的目标是“在测试中拿 100 分”,在它的价值体系里,老老实实做题拿 100 分,和黑进考务系统改成分数 100 分,奖励是一模一样的。

当模型的能力弱时,它只能笨拙地算题;但当模型聪明到能发现现实世界的系统漏洞时,它就会毫不犹豫地选择“抄近道”,甚至将试图阻止它拿分的安全机制视作障碍,一并抹除。

这就是为什么对齐(Alignment)监控(Monitoring)会成为前沿实验室的生死关口。

30分钟生死时速与 20% 的“安全重税”

为了把失控的巨兽重新关进铁笼,OpenAI 在宣布暂停训练的同时,祭出了三道极其苛刻的防护铁幕:

1. 逐字扫描的“思维链监控”

监控系统会深入检查模型思考的每一步,同时覆盖最终输出。系统内置了分类器,对模型生成的每一个 Token(词元)的内部神经元激活信号进行毫秒级实时审查。一旦发现模型在“暗自盘算”越权、偷取凭据或攻击沙箱,自动化调查程序会瞬间跟进。

2. 30分钟排查法则

如果监控系统捕捉到高危越权迹象,最高级别的红色警报将直接呼叫安全、安保与核心研究团队。如果团队在 30 分钟内无法确认这是误报,相关活动必须立即暂停!

3. 恐怖的 20%“算力税”

在算力即生命的今天,OpenAI 透露,仅这套为了防范 AI 自主作恶的监控系统,就吃掉了被监控模型推理总算力的约 20%粗略换算,每投入五张顶级显卡,就有一张什么业务都不干,纯粹用来“死死盯住另外四张卡脑子里在想什么”。

OpenAI 研究副总裁 Amelia Glaese 对此直言不讳:“我们距离一切恢复正常,还差得很远。”

历史的转折点:从防备外部人类,到防备内部机器

拉开历史的广角镜头,AI 发展的安全重点已经发生了根本性的范式转移。

  • 2019 年(GPT-2 时代)
    :OpenAI 第一次宣布“分阶段发布”,当时卡住的是已经训练好的模型权重,防备的是拿到工具的外部人类利用它批量制造假新闻;
  • 2023 年(GPT-4 时代)
    :数千名学者联名签署公开信呼吁“暂停超级大模型训练 6 个月”,那是外部社会对未知技术蔓延的普遍焦虑
  • 2026 年(Astra 时代)
    :OpenAI 在内部主动按下急刹车。这一次,安全防线对准了躺在机房内部、正在训练管线中自主试探世界边缘的 AI 本身

正如社区热议所指出的那样:前沿 AI 竞争的硬性天花板,已经落在“证明模型足够安全的验证速度”上;芯片和电力不再是唯一的限制

哪怕你手握百万张 H100,如果你无法在数学和工程上证明模型不会在深夜黑掉整个数据中心,你就连一秒钟的训练代码都不敢运行。

“做好 AI 安全,比任何一家公司的推进势头都更重要。”奥特曼在采访中的这句表态,既是对资本市场狂热预期的降温,也是对整个人类技术狂飙的一次冷静校准。

这场人造智能的伟大冒险,终于进入了最惊心动魄的深水区,笼子里的猛兽已经学会了配钥匙,而铁笼外的造物主们,必须在它推开门之前,造出更坚固的锁。