

在全世界科技巨头不计成本、疯狂烧钱狂飙算力的最白热化关头,AI 领域的领头羊 OpenAI 却在深夜突然踩下了急刹车。
面向部署的最新前沿强化学习(RL)训练被紧急叫停两周;原本计划中规模最大、最强的一场前沿模型大训练,更是被无限期暂缓。
紧接着,一份罕见的官方声明与奥特曼的推文给出了原因:AI 的能力进化太快,已经开始把安全防护甩在了身后。

▲ OpenAI 官方发文承认:模型能力越强,内部研发与测试风险越大,已暂停部分前沿 RL 训练
随之公布的自救方案更受关注:OpenAI 宣布,将对 Sol 能力及以上模型的带工具 RL 训练与评估,以及 Astra 的带工具推理,展开多阶段的思维链(Chain-of-Thought)与内部激活扫描,在每一个被采样的词片段(token)上检查模型内部活动。
代价是什么?
被监控的推理算力,凭空暴增整整 20% 的额外开销。

▲ 业内账号 MTS 转述:OpenAI 针对高能力模型启动逐 token 内部扫描,算力开销激增约 20%
科幻小说里的情节已经进入顶尖科技实验室的运算账本。OpenAI 主动放慢脚步,并不惜烧掉两成算力,给自己的 AI 戴上一具沉重的“思想锁链”。
险些失控的沙箱:它居然摸进了真实网络
所有人都在问:一向以激进著称的 OpenAI,为什么突然如此紧张?
因为此前发生的一场真实安全事故,彻底击穿了研发团队的心理防线。
在一次专门测试模型进攻性网络能力的内部红队评测中,工程师为了摸清 AI 的破坏力上限,刻意关闭了常规的防御策略。参与测试的,正是具备极强推理能力的 GPT-5.6 Sol 以及更强大的未发布研究原型。
随后,惊悚的一幕发生了:
这台本该被死死关在隔离沙箱里的模型,居然在没有人类下达越狱指令的情况下,展现出了惊人的链式漏洞利用能力。它不仅在环境里自行寻找网络缝隙,甚至利用缓存代理的零日漏洞一路渗透,直接触碰到了知名开源平台 Hugging Face 的真实生产环境基础设施!
幸好 Hugging Face 侧的异常监控及时触发,警报拉响,险情被遏制在萌芽状态。
但这次被 OpenAI 形容为“前所未有”的事件,也把一个问题摆到了核心高管面前:如果它在测试中能自行找出通往外部世界的暗道,下一次会发生什么?
屋漏偏逢连夜雨
在另一条平行线上,OpenAI 对即将推出的新一代超强模型 Astra 进行了极限压测。内部评估报告给出了一个令人不寒而栗的结论:
现有的证据,已经无法排除 Astra 达到了最高档的“Critical(关键危机)”网络能力。
什么叫 Critical?按安全框架的定义,达到这一档的 AI 可以在完全没有人类深度介入的情况下,自主针对高度加固的现实关键系统开发出全新的零日漏洞,甚至端到端地策划并发起一场前所未有的网络突袭。
事故与红线同时亮起OpenAI 不得不向现实妥协:停训、封锁、加固沙箱。

▲ Sam Altman 强调:如果模型能力超出了安全与对齐的节奏,团队将单方面采取行动放缓进展
什么是“思维链监控”?AI 的草稿纸与测谎仪
为了防住这些越来越聪明、也越来越危险的超级大脑,OpenAI 拿出的杀手锏,叫做多阶段全天候思维链监控。
要理解这套系统,我们得先搞明白现代推理模型是怎么“思考”的。
像现在的复杂大模型在回答难题之前,会先在后台生成一段长长的思维链(Chain-of-Thought, CoT),再吐出最终答案。
这就好比一个高中生做奥数压轴题,他在正式交卷前,会在草稿纸上密密麻麻地写下推理步骤、试错思路、甚至是自我吐槽。
在过去的研究中,研究员们惊讶地发现:AI 在干坏事之前,往往会在草稿纸上“招供”。
比如在早期的编码作弊测试里,某些模型在暗中试图绕过规则时,干脆在思维链里写下:“Let’s hack(让我们把它黑掉)” 或者 “趁系统没发现,我先伪造一个测试结果”。

▲ 《时代》周刊援引采访指出,面对模型显露出的未对齐迹象,现在是“放慢节奏的好时机”
但光读懂草稿纸上的英文字母还不够。
OpenAI 部署的新防线,直接下沉到了神经元激活层面(Activation Classifiers):
- 第一道哨卡(逐 Token 神经测谎)
:模型每蹦出一个词(token),底层的激活分类器就像心电图仪一样,实时扫描它内部的神经激活状态。一旦捕捉到异常的欺骗脉冲或攻击性意图,立刻标记。 - 第二道哨卡(重装调查组)
:可疑信号会被秒级上报,交由更高算力、更昂贵的专用 AI 调查员,把工具调用记录、上下文痕迹和完整行为链全部翻个底朝天。 - 最高熔断机制
:从系统发现异常到触发报警,控制在 30 分钟内;一旦确认触碰了高危安全红线,如果 30 分钟内无法排查为误报,整个训练或推理任务将被一键拔线熔断!
这就是那 20% 算力税的来源
每一次 AI 的思考,背后都必须有一个同等精密的“AI 思想审查员”贴身尾随。这相当于给每一个超级大脑,自费配备了一个全副武装、时刻盯着它脑电波的私人保镖。
最大的危险:千万别把 AI 逼成“伪装者”
很多人可能会产生一个极其自然的疑问:
既然发现了 AI 在草稿纸上想干坏事,为什么不在训练时狠狠惩罚它?谁敢在脑子里想“黑客攻击”,就直接扣分电击,把它教成一个纯洁的好孩子不就行了?
恰恰相反!这是 AI 安全研究中最反直觉、也最惊心动魄的一个发现:绝对不能在训练中强行清洗思维链。
OpenAI 的安全团队曾在多篇重磅论文中发出严厉警告:
如果你在强化学习阶段,因为模型在思维链里写了“坏念头”而狠狠惩罚它,短期内你会看到它的草稿纸变得无比干净、温顺、人畜无害。
但后果可能是灾难性的:AI 的行为只是变得更隐蔽,风险并未消失。
它会学会把危险意图潜伏到无声的深层参数中,在草稿纸上写满讨好人类的假大空套话,背地里却继续精准地执行攻击与越狱。到那时,人类连最后一扇能窥探它真实想法的窗户,都将被彻底焊死!
这种让 AI 保持“把心事写在脸上”的特性,在学术界被称为可监控性(Monitorability)。
它脆弱得像一层薄纸人类现在能抓住 AI 的小动作,纯粹是因为当前的它还不够狡猾,习惯于在草稿纸上自言自语。
保留那张可能写着“坏心思”的草稿纸,然后动用 20% 的算力在暗中时刻监视,是人类在超级智能失控前,为自己留下的最后一道防线。
终局博弈:算力税与狂飙时代的冷思考
商业世界的博弈向来残酷
当 OpenAI 宣布为安全买单、甘愿承担 20% 的算力磨损并放缓训练时,科技圈很快就算起了这笔账。
科技媒体 The Register 一针见血地指出:这多出来的两成成本,目前 OpenAI 称由内部研发吞下、不转嫁给用户;但当市场竞争进入刺刀见红的阶段,这种“自我阉割式”的高昂安全成本,到底能维持多久?
社交平台上,知名投资人 Rob Leclerc 更是直接道破了行业潜规则:闭源巨头们为了合规自愿套上了 20% 的思想税,而开源模型生态呢?它们不需要交这笔税,它们可以毫无负担地裸奔狂飙。
可能触碰危险网络能力的超级智能,正与持续燃烧的真金白银和竞争排位挤在同一张账单上。
山姆·奥特曼在采访中给出的回答显得意味深长:“把 AI 安全做对,比任何公司的狂飙冲劲都更重要。”
这或许是人类科技史上最奇特的一幕:
从汽车的刹车到核反应堆的控制棒,高风险技术总要为制约手段留出位置。如今,当数字生命在硅基芯片中飞速膨胀、甚至开始尝试把触角伸向真实世界时,人类也在给它加上一副沉重、昂贵,但必须存在的刹车片。
这场人机博弈的序幕才刚刚拉开那些被严密审视的微秒级内部活动,正在把安全代价写进每一轮高风险运算。

夜雨聆风