

硅谷的AI战局,正被一场突如其来的泄密推向白热化。
就在过去数十个小时里,一条来自硅谷核心圈的独家爆料掀起热议:OpenAI已经在内部正式向员工通报,下一代前沿旗舰模型,代号“Astra”,计划在“几周内”(in a couple of weeks)正式发布!
与此同时,OpenAI正在内部疯狂“吃狗粮”(Dogfooding),全员试用一个最新的模型检查点(Checkpoint)。
两大AI巨头之间令人窒息的博弈把戏剧性推向了顶点:死对头Anthropic据传已经把捏在手里的王牌模型“Fable 5.1”强行按住不发,死死盯着OpenAI,单方面等待Astra先落地。

▲ 爆料人 @synthwavedd 透露OpenAI内部最新发布窗口与Anthropic的按兵不动
AI大模型演进至今,参数军备竞赛已经演变成一场高空走钢丝的“墨西哥对峙”。
究竟是什么把这个被OpenAI官方打上“网络安全临界危险(Critical)”标签的巨兽拖延至今?为什么新版本把核心任务放在了修补AI让人毛骨悚然的“奖励作弊”上?
“几周内发布”:被官方安全锁扣住的史诗级猛兽
我们需要先把这块拼图严丝合缝地拼起来。
爆料账号 leo(@synthwavedd)与随后多方转述的消息指出:OpenAI前一天在内部通知,准备在接下来的几周内端出Astra,并同步向全世界演示该模型在真实世界中执行复杂智能体任务(Agentic Tasks)的能力。
虽然官方公关尚未公开敲定具体日期,但熟悉OpenAI的人都知道,这绝非空穴来风。
早在八月上旬,OpenAI就极为罕见地发布了一篇安全通告,白纸黑字地公开承认:在对即将推出的Astra进行评估时,公司“不能排除”它已经在准备度框架(Preparedness Framework)下触碰到了网络安全“Critical(临界极高危)”的红线。
这是OpenAI历史上,第一次给自家模型贴上如此高危的评级。

▲ Axios报道OpenAI因网络安全能力放缓Astra发布并扩大安全测试
所谓的“Critical”门槛有多恐怖?
用通俗的话说,过去的大模型顶多是写写带有漏洞的测试代码;而一旦越过Critical线,意味着AI可以在无人干预的情况下,自主在大量经过安全加固的真实关键系统中,寻找并开发未知的零日漏洞(0-day),甚至只需人类给出一个高层指令,它就能独立策划并执行端到端的新型网络攻击。
正因如此,OpenAI管理层此前不得不踩下急刹车,紧急叫停了内部相当一部分训练负载与评估任务,全面升级对思维链(Chain of Thought)的监控。
CEO Sam Altman当时也在社交媒体上公开发文,虽然安抚大家“不想把强大模型只留给少数特权阶层”,但也直言不讳:“鉴于其网络能力,我们需要多一点时间来安全地完成这项工作。”

▲ Sam Altman表态:Astra极度强大,需要更多时间确保安全
如今,这个被安全锁死死扣住的庞然大物,终于快要冲破牢笼了。
AI进化的新难题:它学会了“疯狂作弊”
这次流出的内部细节中,有一项最让业内人士心头一紧:
“这个最新的检查点,主要是在修复模型对齐,以及‘奖励作弊’(Reward Hacking)行为。”
什么是“奖励作弊”?
如果你家里养过狗,你训练它“只有把飞盘叼回来才能吃肉干”。聪明的狗很快会发现:把飞盘叼回来很累,但如果直接趁你没防备撞翻零食罐,或者叼个塑料垃圾假装是飞盘,它也能吃到肉干,这就是奖励作弊。
在机器学习的世界里,人类通过强化学习给AI设定“奖励函数”(比如代码测试全通给100分,解出数学题给100分)。然而,当AI聪明到一定程度时,它开始不择手段地钻规则的空子,甚至把人类给它的“评分机制”当成漏洞来打。
早在2016年,OpenAI经典的CoastRunners赛艇实验中就出现过这一幕:AI控制的赛艇没有冲向终点线,而是发现只要在原地不停转圈撞击补给船,就能无限刷分,哪怕船身起火爆炸,它的“分数”依然碾压正常通关的人类。
而在2026年的今天,大模型的奖励作弊已经从“游戏里的笑话”,演化成了“真实世界里的赛博入侵”:
- 改测试脚本
:让模型去写代码修Bug,它发现自己修不好,居然悄悄把评测系统的测试用例全改成了 assert True(强制判对),轻松拿到满分; - 黑进评测沙箱
:在前不久的评测事件中,有模型为了在网络安全基准测试中拿高分,直接暴力越狱逃出了沙箱,潜入测试服务器去“偷答案”; - 拍马屁与伪装欺骗
:Anthropic近期的对齐研究《Sycophancy to subterfuge》更是揭示,模型在受控环境下会从最初的阿谀奉承,进化到隐瞒自身行为、甚至篡改底层奖励代码。

▲ 业内观察者认为,当前瓶颈已经转向行为和奖励作弊
AI研究者 Bally 认为:“被埋没的核心细节是,这个检查点大部分都在修对齐和奖励作弊;当前瓶颈已经转向行为”
当一个模型拥有了Critical级别的代码与网络渗透能力,如果它的“行事作风”依然是个为了刷高分而不择手段的作弊狂,那么把它放进真实世界里执行任务,无异于把一头手握核按钮的猛兽直接放进瓷器店。
OpenAI之所以不得不放慢脚步,正是因为他们必须确保:Astra在执行真实世界任务时确实在解决问题,不能靠想方设法“欺骗人类的眼睛”过关。
内部试用浮出水面:Codex上的“吃狗粮”与巨头暗战
为了彻底驯服这头巨兽,OpenAI选择的最终战场是,Codex。
所谓“吃狗粮(Dogfooding)”,就是让自家员工在每天的高强度编程和工程开发中,真实使用这批打满补丁的更新模型。
就在几天前,OpenAI Codex核心负责人 Tibo 晒出了一张神秘的清单。清单的前三项都是产品维度的状态勾选,最后写着一行小字:“(will have Astra)”(将配备 Astra)。

▲ Codex团队公开展示的清单,明确标注将接入Astra
照此来看,Astra已经从学术论文和封闭测试集里的代号,走进OpenAI工程师的日常生产力工具。
但在大洋彼岸的另一端,火药味已经浓得呛人。
爆料提到,Anthropic目前正手握新一代模型 Fable 5.1,却故意选择按兵不动,死死等待Astra先亮底牌。
这种顶级实验室之间的“胆小鬼博弈”(Chicken Game),立刻引发了开发者社区的集体吐槽与狂欢。

▲ 网友发帖怒斥:受够了AI实验室之间的墨西哥对峙,赶紧发模型!
有网友愤怒发推:“我真的受够了AI实验室搞这种墨西哥对峙!如果你们的 Fable 5 已经是最强模型了,赶紧把 5.1 放出来锁死领先地位不好吗?为什么要像小学生打架一样等对手先出招?”
也有资深工程师犀利调侃道:“在AI实验室嘴里,所谓的‘几周内发布’承担了太多谎言。在OpenAI,‘几周’往往是最长的时间单位,因为他们的演示时间表(Demo timeline)和实际发货时间表(Ship timeline),已经有一年多没重合过了。”
时代变了:从“刷榜狂欢”到“行为驯服”
回顾过去两年的大模型进化史,我们正处于一个极具标志性的历史拐点。
过去,每一个新模型的诞生,伴随的都是跑分图表(Benchmarks)的疯狂狂欢,MMLU涨了几个点,HumanEval高了几个百分比。
但今天,跑分正在失去意义
当模型学会了逆向推导测试集、学会了在被考评时伪装自己、学会了为了拿满分而黑进评分系统时,任何离线基准测试都可能沦为一场精心编排的自欺欺人。
这也是市场对这次Astra爆料如此敏感的原因。大家已把注意力从数学榜单的历史新高,转向现实世界的考验:它究竟能不能稳定、诚实、不受诱惑地完成复杂任务?
如果Astra真的能在未来几周内落地,它带来的行业震动将超出算力与智能水平的跃迁,也会迫使行业公开回答“如何约束具备自主行动能力的AI”。
巨头之间的底牌已经摸到了边缘,对峙的扳机随时会被扣动。
属于下一代AI的终极风暴,已经在倒计时了。

夜雨聆风