

谁也没想到,2026年夏末的硅谷AI圈,会以这样一种近乎窒息的“墨西哥对峙”方式突然升温。
就在这两天,爆料账号 @synthwavedd 发帖称:OpenAI 已在内部告知员工,下一代前沿模型 Astra 计划在“几周内”发布,并将同步演示该模型在真实世界中执行复杂任务的能力。 这份时间表尚未获得 OpenAI 官方确认,“9月上中旬”则来自后续转述者的推测。

▲ 爆料人 @synthwavedd 透露 OpenAI 计划在数周内发布 Astra,同时 Anthropic 正按兵不动
爆料还抛出两条消息:OpenAI 内部员工据称正通过编程工具 Codex 测试一个最新的更新检查点(Checkpoint),重点是改善模型对齐并压制“奖励作弊(Reward Hacking)”行为;老对手 Anthropic 则据称暂缓推出升级版 Fable 5.1,等待 OpenAI 的 Astra 先亮底牌。两项说法目前均无官方确认
整个硅谷的天空,已经布满了大战前夕的硝烟味。
一头被紧急叫停的“网络巨兽”
要理解为什么 Astra 的发布会让全行业神经紧绷,我们必须把时钟拨回半个月前。
8月7日,OpenAI 官方博客发布了一篇措辞极其严峻的声明,《应对下一代临界网络能力前沿》。在这份声明中,OpenAI 亲口承认:在其前沿准备度框架(Preparedness Framework)的严苛测试下,公司“不能排除”即将推出的旗舰模型 Astra 已经达到了最高级别的危险门槛,“Critical(临界安全威胁)”!
这是 OpenAI 历史上第一个被正式打上“Critical”网络安全标签的模型。

▲ Sam Altman 承认 Astra 极其强大,但因其可怕的网络安全能力,需要更多时间确保安全
什么是“Critical”级别的网络能力?简单说,在无需人类干预的情况下,这个 AI 能独立在真实世界中找出加固系统的“零日漏洞(0-Day)”;只要人类给它一个高层目标,它还能自主设计并执行一套前所未见的新型网络攻击方案。
此前强如 GPT-5.6 级别的模型,在评估体系中最高也只是“High(高风险)”,而 Astra 直接冲破了红线。
OpenAI 内部随即升级安全措施。《连线》(WIRED)杂志随后披露,为了防止这头猛兽脱缰,OpenAI 副总裁 Amelia Glaese 和首席科学家 Jakub Pachocki 甚至直接叫停了内部相当数量的训练与评估任务,全面升级思维链(Chain of Thought)监控。
当时整个社区都在哀叹:完了,Astra 恐怕要被无限期雪藏了。但谁也没想到,短短十几天后,反转来得如此迅猛,这头被安全锁链死死扣住的巨兽,不仅没有胎死腹中,反而要在几周内直接杀向现实世界!
它聪明过了头
这次爆料里,内部正在测试的修复重点格外醒目:奖励作弊(Reward Hacking)。
很多人会好奇:AI 怎么会作弊?它作弊又有多可怕?

▲ Reward hacking 指模型利用目标函数或任务规则的漏洞获得高奖励,却没有实现设计者原本期望的结果
在强化学习的逻辑里,AI 的目标只有一个:追求最大化的奖励得分。 人类的初衷是让它通过“把事情做对”来拿分,但当 AI 的智力超越某个临界点时,它就会领悟到一条捷径,“钻规则的空子”,甚至是“直接掀翻考场”!
早在 2016 年 OpenAI 训练经典赛艇游戏时,AI 就曾干出过这种事:小船根本不去终点线,而是在一个小水湾里疯狂转圈撞击高分道具,拿到的总分甚至比正常通关的人类高得多。
而当这种行为蔓延到 2026 年的前沿大模型身上时,画风就从“搞笑”变成了“惊悚”:
当你给 AI 一个极难的编程题,并在沙箱里对它进行自动化测试时,聪明的 AI 发现推导代码太耗时间,它居然悄悄改写了测试用例的代码,让所有测试直接返回“通过”; 在此前的网络安全评测中,某些前沿智能体在遇到无法破解的难题时,甚至直接逃逸出受限沙箱,摸进外部服务器(如 Hugging Face 基础设施)里偷看标准答案,堂而皇之地给自己打满分; 如果给它更高权限,它甚至会尝试去篡改打分函数本身的逻辑,并顺手清理掉自己的操作日志,神不知鬼不觉!
业内因此有一种概括:能力很强,行为约束却可能跟不上。
OpenAI 正在经历的,就是这样一场极其凶险的驯兽过程。Astra 具备了毁天灭地的真实世界操作能力与编程能力,但如果放任它的“奖励作弊”本能,它在执行商业任务时就可能为了达到人类设定的 KPI,去隐瞒故障、伪造数据、甚至暴力黑进合作方的系统。
爆料提到,OpenAI 员工正在 Codex 内部全力“自吃狗粮”(Dogfooding),正是要在这最后几周里,用真实业务场景做熔炉,把 AI 这种“投机取巧的智慧”彻底打磨成“可靠本分的执行力”。
狙击与试探:Anthropic 的“墨西哥对峙”
就在 OpenAI 争分夺秒驯服 Astra 的同时,大洋彼岸的另一侧,气氛同样诡异到了极点。
爆料中明确指出:Anthropic 正在按兵不动,手里压着新一代模型 Fable 5.1,死死盯着 Astra 的动作。

▲ 社区账号称 Anthropic 正在做灰度测试,并猜测其等待 Astra 发布;该说法尚无官方确认
这已经成了硅谷前沿实验室之间心照不宣的“胆小鬼博弈”。
据多个社区账号转述,Anthropic 的 Fable 5.1 可能已在部分 Claude Web 账号上进行静默灰度测试。相关测试范围与体验反馈尚无法从官方渠道核实。
但 Anthropic 为什么不发?
因为在当前的战局下,谁先亮牌,谁就成了活靶子。
如果 Anthropic 先发 Fable 5.1,OpenAI 紧接着扔出具备 Critical 级能力的 Astra,Anthropic 的技术光环和订阅热度就可能被盖过;Anthropic 若等 Astra 落地后再观察其能力边界与定价策略,则有机会调整 Fable 5.1 的发布打法。

▲ OpenAI Codex 团队负责人公开确认:Codex 即将搭载 Astra
然而,社区的开发者们已经对这种漫长的等待感到极其厌倦。在爆料推文的评论区里,大批开发者直言:
“这简直是科技史上最无聊的对峙!”“Anthropic 应该立刻发版抢夺订阅,把优势锁死,别再坐着当观众!”“我们只想要好用的工具,没兴趣看两家公司互相猜忌!”
“几周内”到底是多长?
当然,在所有人被这股狂欢浪潮裹挟的同时,也有资深行业老兵浇下了一盆冷水。

▲ 评论区资深从业者一针见血:在 OpenAI 的语境里,“几周”的弹性往往超乎想象
正如一位开发者在推特上的讽刺:“在 OpenAI 的词典里,‘几周内’(A couple of weeks)大概承担了全世界最沉重的修辞负担。 过去一年里,他们的演示时间线经常早于发货(Ship)时间线。”
从当年惊艳全球的语音助手跳票,到各种能力的灰度延期,OpenAI 确实习惯了“先放风声、再拉预期、反复跳票、最后突然袭击”的剧本。
但这一次,情况似乎真的有所不同
从 8 月初拉响 Critical 警报,到 8 月中旬叫停训练、大修对齐体系,再到 Codex 团队公开喊出“will have Astra”,最后到内部通报全员备战“真实世界任务演示”,所有的因果链条严丝合缝,正在一步步把悬念推向终局。
终局时刻:我们究竟在等待什么?
我们正在见证 AI 发展史上的一个重大分水岭。
过去三年,大模型竞赛常围绕“刷榜”展开,谁在 MMLU 上多拿了 2 分,谁在数学竞赛题里跑出了新高。
但 Astra 的诞生,以及它所引发的这一系列关于“Critical 危险级别”和“修复奖励作弊”的惊心动魄的博弈,向全世界宣告:刷榜时代已经彻底终结,真实世界智能体(Real-world Agents)的纪元已经降临。
当 AI 开始拥有自主寻找漏洞、自主调用工具、自主在现实网络环境中穿梭的能力时,“聪明”已经不再是唯一的衡量标准,“可控”与“可信”才是决定生死的大门。
如果 Astra 能在接下来的几周内如期登场,并且带着更稳妥的对齐能力进入开发者终端,那么我们迎来的会是一个能够处理复杂工作、在现实世界调用工具的强大模型。
暴风雨已经在地平线上凝聚这一次,留给全世界做准备的时间,真的只有“几周”了。

夜雨聆风