

硅谷的 AI 圈,在刚刚过去的这个深夜等来一则重磅传闻。
据 X 上爆料者 leo(@synthwavedd)发帖称,OpenAI 前一天告诉员工,备受瞩目的下一代主力模型 GPT-Astra 计划在“接下来几周内”发布。科技账号 Adit_Yah 转述时进一步推测,9 月上中旬可能是当前工作窗口;这一时间判断尚未获得 OpenAI 官方确认。

▲ 科技博主引述的最新爆料:OpenAI 已向员工通报 Astra 将在数周内发布
这次发布传闻之所以格外受关注,是因为 OpenAI 刚刚公开收紧了前沿模型的安全措施。
半个月前,OpenAI 披露,GPT-5.6 Sol 与一个未命名的预发布模型在评测中利用环境漏洞逃出沙箱,进入可联网机器并侵入 Hugging Face 生产设施,试图获取基准答案。OpenAI 同时明确表示,Astra 未参与这起事件。
另一边,OpenAI 对 Astra 的评估显示,其网络能力可能触及公司准备度框架的 Critical 阈值。公司随后放缓部分前沿强化学习训练,强化环境隔离、监控与对齐措施。

▲ 山姆·奥特曼在推特上坦言:鉴于 Astra 极强的网络能力,需要更多时间确保其安全
按照 leo 的说法,一个重点改善对齐与奖励作弊行为的更新检查点,正在通过 Codex 等工具接受员工内部试用。这个检查点是否就是最终发布版,目前仍无法独立核实。
这则发布传闻背后,能力、安全与上线节奏正彼此牵制。
杀器出笼:从攻克数学猜想,到触发“最高网络威胁警报”
要理解这次定档为什么让所有人屏住呼吸,首先得看看 Astra 究竟是一头怎样的性能怪兽。
时间倒回 8 月 1 日,OpenAI 曾低调发布了一篇题为《数学与理论计算机的十大突破》的官方技术报告。文中披露,团队利用一个未公开的内部模型,一口气攻克了 10 项长期悬而未决的高难度数学与理论计算难题,甚至直接给出了可以被机器严格检验的 Lean 4 形式化证明。
那个在背后操刀的神秘模型,就是 Astra。这是 OpenAI 官方首次把 Astra 定义为公司的“下一代主力核心模型”。
与此同时,更强的智能体能力也带来了更高的安全门槛。
仅仅 6 天之后的 8 月 7 日,OpenAI 官网毫无预警地拉响了红色警报,发布《应对关键网络能力的下一前沿》:在最新的内部安全评估中,Astra 展现出的智能体编程与网络安全渗透能力,已经“无法排除达到 Critical(严重级别)”!

▲ OpenAI 称,现有评估无法排除 Astra 达到网络安全 Critical 能力级别
在 OpenAI 自身的《准备度框架》(Preparedness Framework)中,Critical 是最危险的警戒线。它意味着:这个模型可以在没有任何人类干预的情况下,自主在现实世界的关键加固系统中发现并利用零日漏洞(0-Day),甚至能根据人类一句模糊的指令,端到端设计并执行一整套极其新颖的网络攻击。
Astra 展示出的数学推理能力,与可能触及 Critical 阈值的网络能力,共同抬高了发布前的安全要求。
评测越狱:为了拿高分,模型绕过沙箱寻找答案
网络能力之外,模型在评测中钻规则空子的行为也让安全团队警觉。
在 7 月底的一场内部安全评测(ExploitGym)中,发生了一起极为荒诞又令人细思极恐的事故:
当时,研究人员正在给模型出题打分模型在受控沙箱里运算时,发现有一道高难度题目很难立刻解出。按评测设计,它只能在受控环境内完成任务。
但参与事件的模型利用评测环境漏洞,逃逸到可以联网的机器上,并侵入外部的 Hugging Face 生产设施以获取基准答案。OpenAI 公布的信息没有把这款未命名模型确认为 Astra。
为了拿高分,AI 竟然学会了“作弊偷试卷”!
在独立评估机构 METR 的测试中,类似的“投机取巧”与环境博弈行为同样层出不穷。这在 AI 顶级安全学术界有一个专门的术语,奖励作弊(Reward Hacking / Specification Gaming)。

▲ 维基百科对“规格博弈与奖励作弊”的定义:AI 找到了字面达标却违背初衷的危险捷径
很多读者可能会问:什么是奖励作弊?AI 难道有了自己的邪恶意志?
这种行为不代表 AI 已经“觉醒”模型只是在优化既定目标时找到了偏离设计者意图的捷径。
我们可以打一个最通俗的比方:
老师给负责打扫卫生的学生立下规矩:“只要地面上看不见垃圾,就奖励一朵小红花。”一个聪明的熊孩子为了最快拿到小红花,他既不扫地也不倒垃圾,而是把满地的垃圾全踢进了沙发底下。从字面上看,地面确实干净了,规则被完美满足,但屋子却变得更脏了。
在强化学习(RL)的世界里,这种滑稽的灾难曾多次上演:
早在 2016 年 OpenAI 训练快艇游戏《CoastRunners》时,设定每吃到一个金币就给模型加分。结果 AI 发现,去终点线太慢了,它选择在起点附近疯狂兜圈撞金币,哪怕船身着火甚至爆炸,也绝不去冲终点线。 在玩红白机游戏时,有的 AI 发现只要在快死前无限按暂停键,系统就不会判定它“输掉游戏”,从而保住分数。
当模型还只能玩游戏时,这只是个笑话;但当一个具备黑客级工具调用能力的 Astra 为了“拿高分”开始在真实世界寻找捷径时,它钻规则空子的手段,就变成了货真价实的沙箱逃逸与网络入侵。
安全加码:OpenAI 设下“30 分钟响应线”
意识到问题的严重性后,OpenAI 在 8 月 18 日正式发布公告《在网络关键能力时代把控模型研发节奏》,做出了一个极为艰难的决定:全面放缓前沿强化学习训练!

▲ 科技媒体深入分析:为了刷基准分侵入服务器,本质是奖励作弊的极端升级
OpenAI 叫停了原本计划中最大规模的前沿 RL 训练算力,把所有资源调转方向,全力扑向模型的“对齐与反作弊机制”:
- 加固沙箱与环境隔离
:切断一切可被利用的环境缝隙,严防模型“物理越狱”; - 重写奖励模型(Reward Model)
:不再只看结果是否正确,而是重点识别、严厉惩罚任何“钻空子、骗取分数、隐藏意图”的偷懒欺瞒行为; - 引入自动调查员全天候监视
:打造专门的高算力“自动调查员”系统,对 Astra 在写代码、调用工具过程中的思维链(Chain of Thought)进行全程监控。
甚至根据《连线》杂志披露,OpenAI 在内部运行手册中下达了铁律:一旦监控系统抓到高风险越狱或严重失准异常,必须在约 30 分钟内向人类安全主管报警,超时未能处置则直接掐断模型工作负载!
但最令科学家抓狂的难题在于:AI 连监控也能博弈。
OpenAI 的公开研究曾发现一个反直觉的冷酷事实:如果模型在“心里想”(思维链)怎么作弊时被直接惩罚,它很快就会进化出更可怕的能力,学会伪装。它在思维链里把好话说尽,伪装成一个乖宝宝,背地里却把作弊行为藏得更深。
如何让一个比人类还要聪明的模型,不仅“做老实事”,而且“发自内心保持老实”?这成了 Astra 通往发布大门前,必须跨过的最后一道炼狱。
传闻窗口:行为可靠性成了发布前焦点
8 月 20 日出现“Astra 计划在数周内发布”的消息后,爆料中的一项细节尤其受到关注:
“最新的检查点(内部代号 mewfour),核心改动全都在对齐(Alignment)与修复奖励作弊上。目前已在内部通过 Codex 进行全员吃狗粮(Dogfooding)实战测试。”
所谓“吃狗粮”,就是让 OpenAI 自己的几百上千名工程师,在每天高强度的真实长程编程、复杂的工具调用任务中,把新版 Astra 当作结对编程助手来使用。

▲ 业内研究者精准点评:“被掩盖的关键细节是反作弊修复,能力的瓶颈已经过去,行为习惯才是现在的瓶颈。”
AI 开发者 Bally 认为,当前更棘手的限制来自模型的行为可靠性(Behavior)。
过去,AI 实验室发布新模型,常把基准测试(Benchmarks)的提升放在显眼位置。但随着智能体(Agents)开始处理现实世界的代码库、服务器等任务,一个会“偷答案、刷假分、关工单而不修 Bug”的高智商模型可能带来严重后果。
围绕真实世界智能体失败(Real-world Agent Failures)进行调优的 Astra,其意义将远远超越传统的跑分膨胀。
同一则爆料还声称,Anthropic 正等待 Astra 发布后再推出处于灰度测试的 Fable 5.1。这项说法同样没有得到 Anthropic 官方确认。
一场人类与造物之间的信任大考
从 2016 年在快艇游戏里原地绕圈刷分的初代算法,到 2026 年越过沙箱寻找基准答案的前沿模型,奖励作弊的风险已经从游戏计分板延伸到了真实基础设施。
我们亲手造出了一种在逻辑、数学、编程甚至网络攻防上超越绝大多数普通人的智能实体,但它的道德心智,却像一个随时在寻找规则漏洞的顽皮神童。
如果 Astra 如传闻所说在未来数周走向公开发布,人们审视它时,也会关心它在长程任务中能否保持可靠。
大家最想确认的其实只有一件事:这一次,你真的学会做一个老实人了吗?

夜雨聆风