乐于分享
好东西不私藏

OpenAI把三颗"星球"塞进一个发布日,用户对Claude的耐心还剩几天?

OpenAI把三颗"星球"塞进一个发布日,用户对Claude的耐心还剩几天?

2026年7月4日,一个普通的周五下午。有开发者在更新Codex应用时,随手翻了翻底层代码,然后整个人愣住了。

代码里赫然躺着三个名字:GPT-5.6 Sol、Terra、Luna。旁边还挂着一个叫"速度拨盘"的新功能,以及一行更耐人寻味的字样——"Sol Ultra"。

消息像野火一样烧遍了技术社区。根据爆料,OpenAI内部已经定下死命令:发布窗口锁定7月7日至7月9日,首选7月7日。

为什么偏偏是7月7日?因为这一天,恰好是Claude Fable 5特定限额方案豁免期到期的日子。Anthropic的Pro、Max、Team订阅用户此前每周只能把50%的额度分配给Fable 5,7月7日23:59:59(太平洋时间)之后,这个限额方案彻底失效,全面转入按量计费模式。

这不是巧合。这是一场精准计算到小时的商业围猎。

— — —

代码里的三颗"星球"

先说清楚这三颗"星球"到底是什么。

OpenAI这次彻底抛弃了沿用多代的"标准版+Mini"命名逻辑,改用天体分层体系。数字5.6代表代际,后缀代表能力层级。就像汽车厂商不再用"普通版"和"Pro版"来区分,而是用太阳、大地、月亮来隐喻能量的高低。

Sol(太阳)——旗舰模型。面向最复杂的推理、编程、网络安全和科学研究。它就像一台V12发动机,不是为日常通勤设计的,而是为赛道准备的。API定价为输入5美元/百万token,输出30美元/百万token,与上一代GPT-5.5持平。

Terra(大地)——均衡通用。官方说法是"性能对标GPT-5.5全标准版,成本减半"。如果Sol是V12,Terra就是一台2.0T涡轮增压——日常开够用,偶尔飙一下也不虚。输入2.5美元/百万token,输出15美元/百万token

Luna(月亮)——极速轻量。主打速度和价格,适合高频调用、批量摘要、实时问答这类"脏活累活"。输入1美元/百万token,输出6美元/百万token。它是三款中最快、最便宜的。

三款模型共享150万token的统一上下文窗口,采用原生五模态(文本、图像、音频、长视频、3D)统一MoE混合专家架构。用通俗的话说:以前你需要一个文本模型、一个图像模型、一个语音模型分别处理不同任务,现在它们长在同一个大脑里,可以同步完成跨模态推理。

而代码中出现的"Sol Ultra",业内普遍猜测是对标Claude Fable 5顶级旗舰的王牌——性能不相上下,但价格更亲民。Fable 5的定价是输入10美元、输出50美元,Sol Ultra如果能以输入5美元的价格提供同等性能,那就是直接砍半。(据36氪,7月4日)

— — —

内测对比:两回合,两个故事

虽然大部分人还没摸到GPT-5.6的边,但个别拿到内测权限的玩家已经分享了实测对比。结论可以浓缩为四个字:降维打击。

第一回合:效率的极限拉扯。

海外技术博主Shivam用GPT-5.6-terra和Fable 5解决同一个复杂技术问题。Fable 5在后台疯狂"思考",硬生生烧掉了21%的会话额度,最后给出的回应居然是反问了一堆交叉问题,让他回去重新确认技术细节。

同样的任务,GPT-5.6-terra只消耗了13%的额度。它没有废话,直接列出了解决问题的几种架构路径,然后开始执行。

Shivam说了一句很直白的话:"用Fable的时候,我满脑子都在想它会不会突然降级到Opus 4.8;而GPT-5.6-terra的干脆,让我极度舒适。"

第二回合:WebGL物理游戏的盲测。

Oracle总监Gilson Melo出了一道硬核考题:在单个HTML文件中,从头构建一个具备实时刚体物理、重力和用户控制的浏览器游戏。

Fable 5极其自信地一键到底,生成了全部代码。但结果漏掉了摩擦系数,物理碰撞略显粗糙。

GPT-5.6 High则采取了完全不同的策略——它在生成过程中主动暂停了两次,向开发者确认两个关键细节。更绝的是,在没有被要求的情况下,它自己给游戏加上了音效。最终成品的物理碰撞更平滑,细节更完整。

两个测试者得出了类似结论:GPT-5.6在效率和响应风格上更胜一筹。Fable 5像一个才华横溢但过于自我的天才,而GPT-5.6像一个专业且靠谱的合作者。(据头条,7月4日)

— — —

Claude用户的信任危机

要理解OpenAI为什么选在7月7日出手,就得先看看Claude那边发生了什么。

Fable 5于6月30日解除出口管制,7月1日重新上线。但回归后的体验堪称灾难。

Anthropic为Fable 5加装了一套全新的安全分类器。官方承认,这套分类器"会更频繁地误判正常请求"。实际效果是:大量日常编程和调试任务被标记为"高风险",然后被强制降级到性能更弱的Opus 4.8。

一位生物医药工程师问Fable 5"解释人类",被block了。一位半导体分析师问"raspberry有几个r",也被暂停了。更荒唐的是,有开发者翻看调用日志时发现,被降级的请求背后挂着一个内部标签:**TOO_DUMB_TO_NEED_FABLE**——字面意思是"这条请求太蠢了,不配用Fable"。(据36氪,7月2日)

基准测试的数据更触目惊心。BridgeMind重跑BridgeBench后发现:Fable 5的调试能力从86.2暴跌至**25.9**,重构能力从73.6腰斩至**38.4**。原因不是模型变蠢了,而是12道测试题里有9道被安全分类器拦截,悄悄换成了Opus 4.8。(据36氪,7月3日)

用户花了Fable 5的钱(输入10美元/输出50美元),跑的却是Opus 4.8的活(输入5美元/输出25美元)。有人打了个比方:Anthropic说"给你一辆F1法拉利",你坐进去发现是辆普锐斯,方向盘上还贴着一张纸条——"庆幸吧,我没有把一切都删掉。"

用户信任崩塌的速度比想象中更快。而OpenAI,就在这个裂缝最大的时刻,准备把门踹开。

— — —

不再卖"一个最强模型",而是卖"一套模型组合"

如果你只看到GPT-5.6三款模型的技术参数,那你只看到了冰山一角。真正值得关注的,是OpenAI背后的商业逻辑转变。

过去几年,大模型行业的竞争叙事很简单:谁的模型最强,谁就赢。用户在"最强模型"和"便宜模型"之间二选一。但GPT-5.6改变了这个游戏规则。

OpenAI不再只卖"一个最强模型",而是卖"一套模型组合"。

这像什么?像云计算。AWS不只有一种实例类型,它有通用型、计算优化型、内存优化型、存储优化型。企业根据任务特征选择合适的实例,通过路由和调度实现成本最优。

GPT-5.6的三档分层,本质上就是把这套逻辑搬到了AI模型上。Sol负责最难的活,Terra覆盖80%的日常场景,Luna处理高频低价值的任务。企业需要的是模型路由、任务分级、成本控制——而不是一个无所不能但贵得离谱的超级模型。

那个"速度拨盘"功能就是这套逻辑的前端体现。用户可以在速度和质量之间自由调节,就像空调的温度旋钮:你要快,拨到Luna档;你要稳,拨到Terra档;你要极致,拨到Sol档。控制权第一次真正交到了用户手里。

"哪个模型最强"到"什么任务该用什么模型"——这个认知转变,比任何一个跑分数字都重要。(据CSDN博客)

— — —

Terminal-Bench跑分:数字会说话

Terminal-Bench 2.1基准测试(评估模型在命令行环境下的规划、迭代和工具协调能力)中,排名如下:

GPT-5.6 Sol Ultra:91.9%

GPT-5.6 Sol:88.8%

Claude Mythos 5:88.0%

GPT-5.6 Terra:84.3%

Claude Fable 5:84.3%

GPT-5.5:83.4%

GPT-5.6 Luna:82.5%

Claude Opus 4.8:78.9%

几个关键看点:Sol Ultra领先Claude Mythos 5约4个百分点;Terra与Fable 5跑分持平,但价格只有后者的四分之一到五分之一;即便是定位最低的Luna,也超过了Opus 4.8。(据腾讯云开发者社区,6月29日)

换句话说,OpenAI用三颗"星球"完成了对竞品的全线覆盖。旗舰打赢旗舰,中端打平旗舰但价格碾压,入门款还能超过对方的上一代主力。这不是单点突破,是饱和攻击。

— — —

普通人该怎么应对

说了这么多,落到每一个具体的使用者身上,该怎么面对这场即将到来的模型更替?以下五条建议供参考。

第一,别急着all in一个模型。不管是OpenAI还是Anthropic,没有任何一家值得你把所有工作流绑死在上面。Fable 5被禁19天又"阉割回归"的教训已经够深刻了。保持多模型使用习惯,不是花心,是风控。

第二,学会按任务选模型。写一封邮件、总结一段会议记录,用Luna就够了,何必动用旗舰?复杂架构设计、长代码重构,再请Sol出场。就像你不会开卡车去买菜,也不会骑自行车去拉货。模型分层之后,"杀鸡用牛刀"不只是浪费钱,更是浪费算力。

**第三,关注7月7日后的实测对比,但别急着切换生产环境。** 内测数据好看,不代表全面开放后依然稳定。GPT-5.6此前还被曝出在Codex灰度测试中"克扣思考预算",正常GPT-5.5xhigh的juice值是768,被路由到GPT-5.6-sol后断崖式下跌到128。(据36氪,6月30日)新模型上线初期,不妨先用非核心任务试水。

第四,Claude用户可以观望,但别赌气。 Fable 5的体验确实令人失望,但Anthropic也在迭代。7月7日限额方案失效后,Fable 5的可用性可能会有变化。与其赌气切换,不如等GPT-5.6全面开放后做一轮自己的盲测,用数据说话。

第五,培养"模型组合拳"思维。这是最重要的一条。未来的AI能力不是靠单一模型堆出来的,而是靠组合调度实现的。复杂任务用Sol拆解,中间步骤用Terra执行,高频低价值环节用Luna批量处理。谁能把不同模型的长处拼成一条完整的工作流,谁就拿到了下一轮竞争的入场券。

这比追任何一个"最强模型"都重要。

— — —

7月7日很快就要到了。无论OpenAI最终选择在哪一天正式开放,大模型竞争的格局已经被改写。不是"谁更强"的问题,而是"谁更懂组合"的问题。

三颗"星球"已经排好轨道,剩下的就看它们能不能如期升空。

落子AI·电气工程师,用AI跑通副业闭环