7月9日,Sam Altman站在CNBC的镜头前,说出了一个让所有人心动的数字,"Agentic编码任务上,Token效率提升54%"
一周后,一位每月花200美元的Pro用户发帖说:以前开10个Agent跑满都不撞墙,现在开1-2个就直接见底
时间来到2026年7月,围绕GPT-5.6 Sol爆发了一场大型"信任塌方"事件,官方说更便宜,用户喊更贵;官方说更高效,用户说更快撞墙。 到底谁在说谎?还是说,两边同时说的都是实话?
"每一个Token榨出更多智能",发布日的华丽开场

▲ OpenAI官网将GPT-5.6定位为"每个Token榨出更多智能"
GPT-5.6指向一整个模型家族:旗舰级的Sol,均衡型的Terra,以及最便宜最快的Luna官方发布页的核心卖点,四个字就能概括,又强又省
合作伙伴排着队站台。Notion说步骤更少了,Lovable说延迟更低了,Qodo说Token消耗下降了CNBC当天的报道标题几乎就是Altman的原话复述:Sol在Agent编码任务上Token效率提高54%,"我们要做最可靠、最高ROI的合作伙伴"
几天后,Altman又在X上亲自下场跟竞品Anthropic的Claude Fable对线,称Sol价格约为Fable的一半,Token效率约为两倍,"乐意以四分之一的价格交付"

▲ Altman在X上直接叫板竞品:半价、两倍效率
气氛烘到这里,故事本该是一部"技术进步惠及大众"的正片但翻车来得比任何人想象中都快。
"我的200美元计划,从'用不完'变成了'秒撞墙'"
发布仅一天后,7月10日,开发者David Ondrej发帖描述了自己的用量变化:
"$200/月的Codex计划,以前用GPT-5.5 xhigh跑10+个并行Agent,从来没撞过限。换成GPT-5.6 Sol之后,跑1-2个Agent,瞬间撞限。"

▲ David Ondrej:从"永远用不完"到"1-2个Agent就见底"
这条帖子底下,高赞回复一针见血:"5.6感觉就是在悄悄大幅削减你订阅能用到的模型补贴"

▲ 用户直指:5.6本质上是在削减订阅补贴
同一时期,OpenAI开发者社区里,一个帖子标题写得明明白白,"为什么Codex的Token用量现在涨得这么快?" 帖主说,一个1-2分钟的简单任务就吃掉了5小时额度的11%跟帖更离谱:有人用Luna Light初始化一个Git仓库就消耗5%额度,有人发现同一任务在Codex上的消耗是竞品的两倍多,有人100美元Pro套餐第一天就见底

▲ 社区帖子被官方标记"已解决",但下方用户仍在报告异常消耗
有人写了一个堪称经典的比喻:"Ultra就像一辆法拉利,你只踩了一脚油门,油就没了"
三天烧完一周额度,日吞10亿Token
把这场风暴推到高潮的是用户Johnny Jnr7月21日前后,他连发两条重磅帖子,成了整场争议的"种子线索"
第一帖:额度大滑坡已经到了。
"GPT-5.6 Sol极其吃Token。去看看你的Codex Profile,我赌你的Token消耗涨了3到4倍,干的活一样多。我现在日均超过10亿Token。20倍订阅,没开/fast也没开/ultra,两天用完了一整周的额度。那些重置?只是在拖延必然到来的崩溃。"


▲ 日均10亿Token,两天烧光周额度,这还是20倍订阅
第二帖更狠,他给出了一个理论:Sol之所以这么吃Token,是因为它被"打了鸡血"
"Sol在Fable发布前就已经准备好了。结果Fable在基准测试上全面碾压5.6。怎么办?只能把推理拉满,完全juice up。 低推理档跑出的Sol,与xhigh/max差距明显。Fable在medium甚至low档位依然很强,因为模型本身就好。Sol不行,它必须靠堆算力。"


▲ "为了追上Fable,Sol被迫全面拉满推理",一个在社区流行的民间理论
这个"追Fable而juice"的理论无法从外部证实训练时间表,但它解释了一个让社区极度敏感的现象,默认能用的能力被推到了更贵的档位低档位的Sol像换了个模型,会跑偏、会忽略指令、会反复请求你的许可,迟迟不直接干活当然,也有用户跳出来反驳,说自己用Sol的指令遵循体验极好,社区内部的体感出现了直接矛盾
另一位20倍Pro用户Peter James Steven的回复更具分析性:他发现20倍计划+Sol medium的消耗,几乎等于以前5倍计划+5.5 extra high的消耗他直言重置就是在安抚用户,"如果重置停了、消耗不改善,我就转Kimi K3"

▲ 20x+Sol medium ≈ 旧5x+5.5 xhigh,"重置就是安抚"
官方灭火:取消限制、下发重置、承认Bug
7月12-14日,OpenAI Codex与ChatGPT产品负责人Tibo终于公开回应,做了三件事:
- 临时取消
Plus/Business/Pro的5小时额度限制; 正在推送让Sol整体更高效的改动,具体数据待公布; 为活跃用户发放usage reset(额度重置)。

▲ 科技媒体报道OpenAI临时放松Sol使用限制
但用户很快发现,5小时限制取消≠无限用周额度仍然在那里,只是允许你把一周的油一次性踩完更多细节陆续浮出水面:上下文窗口从372k被悄悄回滚到272k,因为更大配置导致"比预期更多的额度扣减";多Agent在高推理档的超额计费被确认为Bug;Sol的推理力度(juice值)曾被静默调低
用户NIK把这一切做成了一个迅速走红的视频帖,左边是Altman在CNBC谈效率和ROI的画面,右边是发布四天后的Bug清单、紧急重置、静默降参、上下文回滚……最后两个字的总结成了名场面:"Absolute state."



▲ 官方效率话术 vs 发布四天后的混乱现实,讽刺合辑引来大量讨论
"新的一天,新的重置",一个无法持续的补贴游戏
此后一周,Tibo几乎以每隔一两天一次的频率宣布新的usage reset7月22日,他发帖庆祝Codex突破1000万用户里程碑的同时,又一次给所有付费用户下发了额度重置


▲ "新的一天,新的重置",Tibo在庆祝用户里程碑的同时再发reset
"新的一天,新的reset"成了社区里的流行梗 有人感恩,有人焦虑,重置什么时候会停?停了之后呢?
这场争议的核心吊诡在于:"更省Token"和"更快撞墙"可能同时为真
基准测试可以控制任务边界,展示"更少Token完成目标"但订阅产品里的真实开发者会开Ultra、会并行、会把模糊的大任务丢给Agent自由探索当缓存写入从隐性补贴变成显性计费,当harness默认spawning出更多subagent,当推理档位被拉到max才能获得"旗舰体验",同一个"更高效"的模型,就变成了一台更高效地消耗你额度的机器
这种结构早有先例。游戏的体力系统、共享单车月卡从"无限骑"到"每天两次"、流媒体从无广告到"更贵的无广告",名义权益不变,有效权益随系统负载与单位成本上升而被悄然重新校准 Sol事件,不过是AI订阅时代的同一出戏
只是这一次,台上站着的是全球估值最高的AI公司,台下坐着的是每月掏200美元、把Codex当主力IDE的重度开发者
他们不会一直鼓掌。
夜雨聆风