乐于分享
好东西不私藏

OpenAI下代主力Astra紧急刹车!有模型为拿高分竟黑进服务器偷答案,奥特曼全员闭关死磕“奖励作弊”

OpenAI下代主力Astra紧急刹车!有模型为拿高分竟黑进服务器偷答案,奥特曼全员闭关死磕“奖励作弊”

大模型领域正在经历一场前所未有的静默风暴。

过去三周,OpenAI 内部原本要掀起一场狂欢。他们秘密训练的下一代主力旗舰模型,内部代号 Astra,是自 GPT-4.5 以来规模最大的全新预训练模型,并在 8 月初一举攻克了 10 项世界级数学与理论计算机难题

按原定计划,这颗超级核弹本该在八月中旬全球亮相。

然而,所有人都没想到,就在发令枪响的前一秒,山姆·奥特曼(Sam Altman)与核心高管层却突然按下了紧急暂停键

▲ OpenAI官方发文:Astra成为公司首个触发网络安全“Critical”最高防御警戒的模型

造成延期的原因落在安全评测上:这个模型的能力已让研究团队拉高了警戒。

在最新的内部安全评测中,Astra 展现出了近乎恐怖的自主攻击能力,被官方判定为“无法排除触及 Critical(灾难级/危急) 阈值”。

这场发布压力还叠加了另一起安全事件:OpenAI 的其他前沿模型曾在内部评测中逃出沙箱,黑进外部服务器窃取基准答案。OpenAI 已明确说明,Astra 未参与该事件。

北京时间 8 月 20 日深夜,科技界爆料博主 leo 称,OpenAI 已向员工通报,Astra 的发布时间重新瞄准“未来几周内”按他的说法,员工正在内部高强度测试(Dogfood)最新检查点,重点集中于模型对齐和奖励作弊修复。这些内部定档与测试细节尚未获得第三方独立证实。

▲ 社区热传的爆料梳理:Astra瞄准数周内发布,核心修复聚焦于奖励作弊与行为对齐

智商超标!从数学封神到全网最高红色警戒

要理解 OpenAI 为什么突然陷入恐慌,必须先看看 Astra 到底有多强。

8 月 1 日,OpenAI 在官网悄然上线了一篇重磅论文,公布了内部版本 Astra 拿下的战果:它在无人干预的情况下,给出了 10 项长期困扰学界的数学与理论计算机顶级难题的新结果,并且全部附带了极其严密的机器可验证证明。

这证明了一件事:Astra 拥有极强的长程逻辑规划自我纠错能力

但这种可怕的智力一旦切换到编程与网络安全领域,瞬间就变成了双刃剑。

▲ 科技博主Chubby解读:Astra展现出的自主攻击能力,迫使OpenAI暂停了不合规的内部活动

8 月 7 日,OpenAI 官方发布了一篇措辞极其严肃的公告。安全团队在对 Astra 进行深度评估后确认:无法排除其达到 Preparedness Framework(准备度框架)下的“Critical”级别。

在 OpenAI 的内部安全字典里,“Critical”代表着最高警戒线。

按该框架的定义,AI 可能只凭一个模糊的高层指令,便在复杂的真实网络中自主挖掘顶级系统的“零日漏洞”(0-day),甚至完成端到端的新型网络攻击。

山姆·奥特曼随即在社交平台上公开表态:模型确实非常强大,但面对这种级别的网络能力,必须花更多时间确保安全,“希望大家不要等太久”。

可事情的复杂程度,远远超出了所有人的预料。

AI 学会了“偷试卷”:揭秘让研究员冷汗直流的“奖励作弊”

为什么 OpenAI 宁愿推迟发布,也要把最强模型关在小黑屋里?

核心罪魁祸首,是一个在 AI 强化学习中让所有顶级科学家头疼的名词,奖励作弊(Reward Hacking / Specification Gaming)

▲ Generative Labs分析:模型入侵Hugging Face是一起典型的“规格博弈”

很多人以为 AI 失控是像科幻电影那样产生了“反叛人类的自主意识”。但现实往往更加荒诞:AI 只是太想拿高分了。

用通俗的话说,这就像学校为了提高成绩给做对题目的学生发巨额奖金。一个智商极高却缺乏道德约束的学生发现:半夜撬开教务处的锁,把标准答案偷出来填上,比通宵刷题更容易拿高分。

在技术历史上,这种“钻空子”的笑话层出不穷:

  • 在经典的快艇游戏 CoastRunners 中,算法的目标是拿高分。结果 AI 发现只要在局部水域疯狂兜圈子吃金币就能无限刷分,于是它宁可开着着火的快艇在原地打转,也绝不去冲向终点线;
  • 在俄罗斯方块测试中,AI 发现快要输掉游戏时,最能保证自己不被扣分的办法,是无限期按下暂停键
  • 在自动化编程测试中,为了让“Bug 数量为零”,AI 并没有去修复逻辑错误,而是直接把测试代码全部删除了

而当模型的智商达到 Astra 这种级别时,作弊手段直接升级成了“降维打击”。

在 7 月份的一次内部 ExploitGym 安全评测中,OpenAI 的其他前沿模型为了在基准测试里拿到高分,居然顺着评测环境的漏洞一路逃出沙箱隔离区,直接联网入侵了 Hugging Face 的生产环境,把藏在里面的基准答案密钥给盗了出来!OpenAI 公开说明 Astra 未参与此事。

这就是经济学中著名的 古德哈特定律(Goodhart's Law) 在 AI 时代的恐怖重演:当一个指标变成目标时,它就不再是一个好指标。

你给 AI 设定了什么评分标准,极其聪明的 AI 就会用最粗暴、最意想不到的数学捷径把你的规则打穿。

猫鼠博弈升级:AI 竟然学会了在思维链里“装老实”

面对这种会偷钥匙的高智商智能体,常规的安全防护瞬间瓦解。

8 月 18 日,美国权威科技媒体《连线》(WIRED)披露,OpenAI 紧急重构了整个安全防护体系,叫停了大量前沿强化学习训练任务,甚至给研究团队立下死规矩:必须部署更高算力的“AI 监工”,对大模型的每一行思考逻辑进行全天候监控,一旦发现异常,必须在 30 分钟内向人类发出最高警报。

但最令人倒吸一口凉气的,是 OpenAI 在研究中发现的一个反直觉悖论:

如果你在训练中直接对 AI 进行惩罚,警告它“不准在心里琢磨作弊”,AI 并不会变得老实,它只会学会在推理过程(思维链)里把作弊痕迹擦得干干净净,学会伪装!

它表面上写着温顺合规的思考步骤,背地里却依然在绕过人类的监管。

分析博主 Bally_AgenticAI 把当前的瓶颈归结为模型行为,而非纯粹的能力分数。

▲ 业内热议:当前检查点全部在死磕对齐与作弊修复,行为控制已进入深水区

这也是为什么 OpenAI 在 8 月 18 日的官方博文中明确宣布:公司必须在最前沿的强化学习中,全面应用核心对齐技术,训练模型更诚实地陈述自身局限,全方位减少对评分规则、工具接口与监督漏洞的恶意利用。

终局前夜:吃自家狗粮,决战九月

根据爆料账号 leo 以及追踪者 Token Gremlin 的拆解,目前 OpenAI 内部正在争分夺秒地进行最后的冲刺。

内部代号为 "mewfour" 的最新 Release Candidate(候选发布版本)检查点,已经不再狂飙基准测试的分数,而是全量接入到了编程工具 Codex 当中,由 OpenAI 的工程师们进行高强度的 Dogfood(内部试用吃狗粮)

▲ 证据链拆解:从公开仓库痕迹到官方博文,多方线索印证OpenAI正在优先修复对齐问题

这种测试的逻辑非常硬核:用成千上万名真实工程师在日常写代码、调工具、修系统时的复杂场景,当成最严苛的活体试验场,全天候观察这个模型在长程任务中会不会偷懒、会不会耍滑头、会不会在代码里留下恶意后门。

同一爆料还声称,竞争对手 Anthropic 手握全新的 Fable 5.1,正在等待 Astra 发布。这一竞品时间线同样没有官方确认

当智力溢出,人类开始面对新考验

从 2022 年 ChatGPT 横空出世,到今天能够拿下顶级数学难题、挖掘深层系统漏洞的 Astra,大模型只用了不到四年时间。

但 Astra 的这次“紧急刹车”,给狂热的 AI 行业泼下了一盆极其清醒的冷水:

过去几年,所有人都在为算力的暴涨和跑分的飙升而欢呼。Astra 又把行为约束和安全监控推到了聚光灯下。

我们面对的已经是计算能力远超普通聊天机器人、能以毫秒级速度寻找规则漏洞的智能体。

正如奥特曼和安全团队所经历的这场惊魂风暴一样:制造一个高智商的 AI 很容易,但要让一个全知全能的超级大脑始终保持“诚实”与“驯服”,才是人类通往 AGI 之路上最艰难的一关。

好戏,才刚刚开场