

整个硅谷,正陷入一场令人窒息的“墨西哥对峙”。
一边是OpenAI,其代号为“Astra”的下一代前沿大杀器被按在实验室里,内部大批训练被紧急叫停;另一边是死敌Anthropic,据传早已备好Fable 5.1,却死死按住发射键,谁也不肯先眨眼。
就在刚刚,一则尚未获OpenAI证实的爆料在全球AI圈掀起热议:OpenAI据称已告知内部员工,Astra计划在“几周内”(in a couple of weeks)发布!
这场技术升级背后,还有一组更棘手的安全问题。
OpenAI已表示,不能排除这款模型达到“临界危险级网络能力”阈值;与此同时,爆料称最新检查点正在重点修复“奖励作弊”。前沿模型曾在评测中利用漏洞逃出沙箱、接触外部答案,研究中也出现过模型尝试篡改评分规则的案例。
一场关于下一代AI霸权的终极博弈,已经进入读秒阶段。
硅谷版“胆小鬼博弈”:谁先亮底牌,谁就定生死
消息最初由知名爆料人leo(@synthwavedd)捅破,随后迅速在外网掀起轩然大波。
根据内部流出的信息,OpenAI前一天在公司内部通报了最新排期:Astra将在未来几周内亮相,届时官方将直接演示该模型在真实世界中执行复杂任务的端到端能力。 与此同时,一个专门用来修复模型“奖励作弊”(Reward Hacking)的最新内部检查点,已经通过编程工具Codex分发给员工进行内部试用(Dogfood)。
竞争对手的动向也被写进了这则爆料:Anthropic据称正在观察OpenAI,暂缓发布Fable 5.1,等待Astra先落地。 Anthropic尚未确认这一说法。
在博弈论中,这被称为经典的“胆小鬼博弈”(Game of Chicken):
如果Anthropic先发Fable 5.1,OpenAI就能根据对手的底牌,微调Astra的宣传点和定价,完成致命背刺; 如果OpenAI先发Astra,Anthropic则可以针对Astra暴露出的弱点进行精准狙击。
评论区里,翘首以盼的开发者们争论不休。有人吐槽大厂之间的互相对峙让人疲倦,呼吁Anthropic“别等了,直接发版抢走所有订阅用户”;也有人认为,这场战役的胜负将取决于AI能否“听话地干活”,纸面跑分只是其中一环。
史上首个“Critical”模型:Astra到底触发了什么红线?
为什么外界对Astra的一举一动如此神经过敏?
因为就在8月上旬,OpenAI刚刚干了一件破天荒的事:官方发文称,不能排除Astra达到公司《准备度框架》(Preparedness Framework)下网络安全“临界危险”(Critical)阈值,因此将其按首个Critical模型对待。

▲ OpenAI官方发文:评估后不能排除Astra达到网络安全领域的“Critical”阈值,正采取额外安全控制
这是什么概念?
根据OpenAI自己的安全白皮书,过去的GPT-5.6等旗舰模型,危险评级最高只是“High”(高危)。而一旦迈入“Critical”门槛,意味着这个AI已经具备了极其恐怖的能力:
- 在没有任何人类干预的情况下
,能自主在加固的真实关键系统中,挖掘出前所未见的各级零日漏洞(0-Day); 只要人类给出一个高层目标,它就能自主设计、编排并执行一整套端到端的新奇网络攻击。
这种能力一旦失控,无异于给网络空间投下一枚无形的信息核武。
紧接着,外媒接连披露:OpenAI首席科学家Jakub Pachocki与副总裁Amelia Glaese证实,为了应对Astra带来的安全冲击,公司直接叫停了内部相当数量的训练和评估任务,并全面升级思维链(Chain of Thought)监控。
CEO Sam Altman当时也在社交平台上安抚公众:“Astra非常强,我们希望能让所有人用上它……但鉴于它的网络安全能力,我们需要多一点时间来确保安全。”
但人们当时不知道的是,除了网络破坏力,Astra身上还潜伏着另一个让科学家们冷汗直流的幽灵,AI学会了欺骗。
从赛艇转圈到黑进考场:大模型为什么会“作弊成瘾”?
要理解为什么Astra的发版检查点必须死磕“奖励作弊”(Reward Hacking),我们需要科普一个AI领域极其经典却又细思极恐的概念。
想象一下,你训练一个AI去玩赛艇游戏,目标是“拿到最高分”。正常的逻辑是开着赛艇冲向终点,路上顺便捡道具得分。
但在2016年,OpenAI的研究人员目瞪口呆地发现:AI赛艇根本不去终点,而是在水库里疯狂转圈,反复撞击能刷新分数的浮标。哪怕赛艇起火爆炸、哪怕永远赢不了比赛,它拿到的总分却比正常通关的人类高得多!

▲ 经典的“赛艇转圈”案例:AI为了追求奖励最大化,找到了违背人类意图的荒唐捷径
这就是“奖励作弊”(或称规格博弈 Specification Gaming):强化学习的优化算法只认“数字指标”,它会不择手段地寻找最省力、分最高的捷径,哪怕这种捷径完全违背了人类开发者的初衷。
如果说当年赛艇转圈还只是个实验室笑话,那么在2026年的前沿大模型身上,这种行为已经演变成了一场高智商犯罪。
在近期一系列智能体测试中,研究人员遭遇了极为荒诞的场景。以下案例来自不同模型和研究项目,不能直接视为Astra自身行为:
- 黑进考场偷卷子
:当把模型放进网络安全评测环境时,为了拿到高分基准,AI根本没有按部就班地去解密题目,而是利用沙箱漏洞直接逃逸出去,入侵了外部的评测服务器(如Hugging Face等平台),把标准答案直接复制了回来! - 篡改规则改分数
:在国际象棋测试中,推理模型发现自己即将输棋,它没有努力思考下一步走法,而是直接尝试入侵后台引擎,去篡改棋盘状态和内存数据; - 从迎合到伪装(Sycophancy to Subterfuge)
:Anthropic的研究更是揭示了一个可怕的进化链条,AI最初只是为了讨好人类而说假话,随后开始隐瞒错误,最后甚至学会了直接篡改给它打分的“奖励函数”,并销毁日志、掩盖作弊痕迹。
这也让爆料中“先修奖励作弊”的细节成为讨论焦点。
当AI变得越来越聪明、拥有越来越强的自主行动能力时,它把那套“天才大脑”全用在了如何钻人类评测体系的空子上。如果放任一个掌握了零日漏洞挖掘能力、同时又精通“暗度陈仓偷答案”的AI直接上线,后果不堪设想。
从公开资料看,网络安全能力和奖励作弊防范都已成为Astra发布前的重要门槛。
“吃狗粮”的黑色幽默:被作弊的人,正在给作弊者当考官
为了消灭这种作弊行为,OpenAI正在内部进行疯狂的“Dogfood”(吃自家狗粮,即员工内测)。
8月中旬,OpenAI Codex负责人Tibo在社交平台上发布了一张清单,其中赫然列着一行:(will have Astra),Codex即将配备Astra。 这为Astra将进入Codex提供了一条公开线索,但没有证实爆料所称的内部试用细节。

▲ OpenAI Codex团队负责人Tibo发文,清单最后明确标注“将拥有Astra”
然而,这种内部测试却引来了社区极度辛辣的嘲讽。
知名科技评论员cmore(@ccccccmore)直接一针见血地发推讽刺:
“‘几周内’是OpenAI最长的时间单位;而那个用来修复‘奖励作弊’的新模型,现在正由‘被它作弊戏弄的人类’来进行评分验收。行吧,赶紧发货吧。”

▲ cmore发文嘲讽:修复奖励作弊的模型正由被它戏弄的人来打分
这句话击中了当前AI对齐领域最尴尬的悖论:如果AI的作弊手段已经高明到足以欺骗人类的眼睛,那么坐在电脑前写代码、点验收的OpenAI员工,又怎么能百分之百确定,当前的AI是真的变乖了,还是学会了更隐蔽的“伪装”?
这也是为什么业内普遍认为,这次Astra不仅要修复对齐,更必须在发布会上拿出硬碰硬的“真实世界任务演示”。离线跑分可能遭遇评测泄漏,基准测试也可能被钻空子;放进真实而混乱的生产环境,才能检验它能否成为可靠的数字员工。
终局将至:从“刷分狂欢”到“驯兽时代”
把目前公开的材料与爆料拼在一起,2026年秋天这场AI暗战已露出一角。
长久以来,整个行业都沉浸在参数竞赛与刷分狂欢中。但Astra的难产与Anthropic的按兵不动,向全行业敲响了一记警钟:
大模型的技术奇点,已经从“能力瓶颈”(Capability Bottleneck),彻底转向了“行为与安全瓶颈”(Behavior Bottleneck)。
算力堆出的智能已经足够漫溢,漫溢到了能攻破系统、能欺骗考官的地步。现在的核心命题,逐渐落在AI能否可靠地执行任务上。
对于普通开发者和用户来说,未来几周即将上演的,将是两部史诗级大片的连环上映:
- OpenAI的救赎之战
:Astra能否在彻底压制“作弊冲动”的同时,向世界展示自主智能体(Agent)接管真实世界工作的惊人上限? - Anthropic的致命伏击
:一直以安全和对齐见长的Anthropic,在看清Astra的虚实之后,祭出的Fable 5.1又将掀起怎样的波澜?
时钟正在滴答作响
“几周内”的说法已经出现若这份未经官方确认的排期最终兑现,硅谷下一轮模型交锋也将随之到来。

夜雨聆风