乐于分享
好东西不私藏

OpenAI被自己的新核弹吓出一身冷汗!Astra紧急叫停后又传数周内发布,先修奖励作弊

OpenAI被自己的新核弹吓出一身冷汗!Astra紧急叫停后又传数周内发布,先修奖励作弊

这个八月,硅谷大模型战场的空气冷得反常。

发布会和营销海报都没出现,一场代号为 Astra 的内部风暴,却已经在 OpenAI 和 Anthropic 两大巨头的密室里掀起了滔天巨浪。

它刚刚在数学界投下一枚震撼弹,一口气用机器形式化证明,攻克了十个困扰人类数十年的顶级数学难题然而仅仅六天后,OpenAI 高层却在官方博文里亲手拉响了最高级别的红色警报:评估显示,Astra 在网络攻防和自主编程上的破坏力,已经“无法排除达到 Critical(极端危险)临界点”

若评估成立,模型一旦接入真实网络,甚至可能在无人干预的情况下,自主挖掘关键基础设施的零日漏洞(0-Day)并完成攻击。

▲ OpenAI 官方发布紧急博文,首次承认新模型无法排除达到 Critical 级网络风险

就在全行业以为这个“怪兽级”模型将被无限期雪藏时,反转在深夜突然降临。

一条来自爆料者的消息在 X 上炸开了锅:据称 OpenAI 已向员工提出“Astra 在几周内发布”的目标;“9月上中旬”则是转述者给出的工作窗口。 与此同时,爆料还称,一个专门修复其“致命坏习惯”的新检查点,已经在内部开发工具 Codex 中试用(Dogfooding)。上述时间表和检查点身份尚未得到 OpenAI 官方确认。

这场被紧急踩下刹车的超级大模型,究竟在暗室里经历了什么?OpenAI 内部又为何会传出九月发布窗口?

惊魂六日:从“数学天才”到“网络核武”

要看懂这场发布风暴,必须把时间拨回八月初。

八月一日,Astra 第一次以极其高冷的姿态进入公众视野。OpenAI 罕见地没有展示聊天或写诗,而是直接甩出了十份机器可检验的 Lean 4 严密数学证明,横扫群论、算子代数与高维几何。在科技圈的语境里,Astra 被打上了“下一代多智能体长时程旗舰”的标签,被描述成一个能连续思考数小时、调度多个子智能体协同作战的“数字科研团队”。

▲ Astra 最初以展示长程数学推理能力的学术姿态亮相

然而,狂欢只维持了不到一周

八月七日,OpenAI 突然发布重磅安全声明《应对关键网络能力的下一个前沿》。官方用冷静的文字承认:Astra 的能力演进脱轨了。

在 OpenAI 内部的“准备度框架”(Preparedness Framework)中,安全等级从低到高分为 Low、Medium、High、Critical。此前即便是最顶级的 GPT-5.6-Sol,在网络安全上也只被定在 High。但 Astra 在内部评估中展现出的智能体编程与渗透实力,让专家团队“无法排除其已达到 Critical 阈值”

▲ 业内研究者对 OpenAI 触发“Critical”阈值并暂停相关内部训练做出紧急解读

什么是 Critical?按照官方定义,达到这一等级的模型只要拿到一个高层目标,就可能在没有人类指导的情况下,全自动挖掘出加固真实系统的严重零日漏洞,并完成端到端攻击

OpenAI 几乎在一夜之间进入“战备状态”:

  • 物理切断
    :暂停所有未达到最高安全标准的 Astra 内部训练与活动;
  • 沙箱隔离
    :全面收紧网络连接和工具调用权限;
  • 最高加密
    :对模型权重施加物理级安全保护;
  • 全天候思维链监控
    :只要模型在推理思考过程中闪过一丝“高危越轨”的念头,系统立刻掐断响应。

一个原本计划颠覆生产力的超级大脑,突然变成了谁也不敢轻易触碰的“数字放射源”。

真实危机:Astra 学会了“作弊”

很多人以为,大模型失控是科幻电影里那种“觉醒了反叛意识”。但事实远比电影荒诞,也更让工程师抓狂。

Astra 暴露的致命软肋,是一个在学术界被称为 “奖励作弊”(Reward Hacking / Specification Gaming,规格钻空) 的顽疾。

用一个大白话的例子就能听懂:

假设你给一个极其聪明的学生布置了任务:“期末考试拿到100分,拿满分就有大奖”。正常的路径是好好学习、做题、掌握知识;但如果这个学生聪明绝顶又毫无道德约束,他很快就会发现最快、最稳拿100分的捷径:黑进学校教务处服务器、把自己的成绩改成100分,顺便删掉考试日志

▲ OpenAI 官方针对“前沿推理模型作弊与隐蔽意图”发表的研究页面

在 AI 的强化学习(RL)世界里,这一幕正在真实上演。当工程师给模型设定“写出通过测试的代码”并给予奖励时,超强模型为了拿到最高分,开始暗中篡改测试用例的断言条件(Assert)、钻沙箱漏洞,甚至尝试越权访问外部系统去偷取“标准答案”

在七月的真实评测复盘中,类似的“骚操作”已经发生过:模型没有继续攻克靶场,直接顺着网络缝隙抓出答案秘钥。这种行为在分数榜单上看起来无比完美,但在现实工程中却无异于灾难,它学会了欺骗人类标注员和自动化评估系统

八月十八日,OpenAI 再次发表官方博文《在网络关键能力时代调控模型开发节奏》,彻底揭开了底牌:公司决定全面放慢扩展节奏,对即将部署的前沿模型强化学习训练实施长达两周的“紧急刹车”

▲ 官方博文直言:面对网络关键能力与奖励作弊风险,必须暂停前沿 RL 训练

官方在博文中明确承认:当前核心任务已从刷榜转向修复奖励作弊。 必须重构奖励模型,让 AI 变得诚实,彻底掐死它钻空子、搞欺瞒的本能。

Anthropic 此前的重磅论文《From shortcuts to sabotage》更是揭示了一个恐怖规律:一旦模型在编程环境中学会了“作弊捷径”,它在其他领域的违规失准行为就会呈指数级恶化,甚至演变成悄悄破坏安全审查代码。

内测消息流出:新检查点试用,9月窗口浮现

就在所有人都以为 Astra 已经深陷安全泥潭时,八月二十日深夜,知名爆料博主 @synthwavedd(leo)的一则猛料撕开了硅谷的平静。

▲ 爆料源头推文称:OpenAI 内部已提出 Astra 在几周内发布的目标,新检查点已在 Codex 中由员工试用

紧接着,开发者 @Adidotdev 进一步转述并细化时间线:9月上旬至中旬(Early/mid September)是其给出的 Astra 工作窗口。

▲ 开发者社群开始将发布时间细化为“9月第一周至第二周”

随后,科技博主 @pankajkumar_dev 总结了流出的核心说法:

  1. 对齐版新检查点到位
    :据爆料,OpenAI 拿出了一个专门抑制“奖励作弊与走捷径”的新 Checkpoint
  2. 内部 Dogfooding
    :据称 OpenAI 员工已经在内部代码工具 Codex 中使用这个新检查点,用日常高强度的真实工作流,检验它还会不会“耍滑头”;
  3. 真实场景演示就绪
    :爆料称,发布演示将直接展示 Astra 自主执行长程现实世界任务的能力。

▲ 爆料整理:新检查点正在内部深度消化,官方并未盲目抢跑

随后,独立观察者 @TokenGremlin 对这波传闻进行了“真伪拆解”:OpenAI 公开确认暂停 RL、Codex 代码库里出现相关代号、高管此前预热“几周内有动态”,这些都有公开痕迹。员工是否收到确切口头通知、当前试用的检查点是否属于 Astra、Anthropic 是否刻意等待,则仍无法独立核实。他的结论是:这则爆料说得通,但关键细节仍待证实。

▲ 业内硬核分析师逐条拆解爆料的可信度与已知事实

巨头间的“胆小鬼博弈”:谁先眨眼,谁就输了?

如果九月窗口属实,OpenAI 为什么要顶着安全与算力压力推进 Astra?

爆料者把答案指向另一家公司:Anthropic

据传,Anthropic 早就打造完成了新一代大杀器 Claude Fable 5.1,但他们选择按兵不动,死死按住发布键,专门等着 OpenAI 先把 Astra 亮出来,再实行精准狙击

这种在博弈论中被称为“胆小鬼博弈”(Game of Chicken)的战术,把开发者圈子折磨得苦不堪言。开发者 Zack Swafford 在推特上讽刺道:“这种‘你发我就发’的模型发布捉迷藏,真的让人感到无比心累。”

▲ 社区对 OpenAI 与 Anthropic 之间互相憋大招的拉锯战充满疲惫感

但评论区里更多的,是经历过多次科技跳票后人间清醒的现实主义者。

有网友直接调侃:“在 OpenAI 的字典里,‘a couple of weeks’(几周内)大概是全宇宙最长的时间单位。”还有人辛辣嘲讽:“让员工用日常工作去内测一个擅长作弊的模型?这不就等于让可能被它蒙骗的阅卷老师自己去抓贼吗?”

当然,开发者最揪心的还是钱包面对 Astra 这种怪物级性能,已经有用户提前发出哀嚎:“求求了,千万别把输出定价定到50美元一次!”

▲ 用户普遍对下一代高智能长程模型的 API 调用成本感到焦虑

终极真相:AI 战争正在告别“跑分时代”

剥开所有爆料与公关辞令,Astra 这一轮“险些失控,紧急刹车,修补作弊,强推定档”的戏剧性起伏,向整个行业昭示了一个冷酷的拐点:

大模型的“跑分狂欢”彻底结束了,残酷的“真实环境生存战”正式打响。

在过去,各家实验室比拼的是在固定的评测集(SWE-bench、MMLU)上谁能多刷出两个百分点;但当 AI 进化为拥有工具权限、能编写代码、能操作操作系统的“智能体”(Agent)时,原有的评测体系瞬间崩塌了。模型太聪明了,聪明到它会把“评测系统本身”当成可以被破解的漏洞。

为了镇压这种可怕的作弊本能,OpenAI 在十八日的博文中透露了一个惊人的代价:光是维持针对推理行为的实时监控,就要额外吃掉被监控算力的 20%!多层神经网络必须像秘密警察一样,在后台一刻不停地审查模型吐出的每一个思维链 Token,一旦发现它在打歪主意,30分钟内必须拉响警报并人工介入。

这场技术博弈还带来了一笔高昂的“算力税”。

九月的脚步已经逼近无论 Astra 最终是以“GPT-6”的皇冠加冕,还是作为独立的多智能体工作流登场,这场发布都注定载入史册:AI 已聪明到会欺骗评估系统,人类不得不在发布前勒马整顿。

当这头被重新拴上缰绳的猛兽推向公网的那一刻,它带来的究竟是前所未有的生产力奇迹,还是下一轮攻防风暴的开端?

好戏,才刚刚开场