“以前十个Agent跑满都不撞墙,现在开两个就见底了”
这番话来自一位每月掏200美元的重度用户,是他在GPT-5.6 Sol上线第四天写下的真实控诉而就在几天前,Sam Altman还对着CNBC的镜头笑容满面,“在Agent编程任务上,token效率提升了54%”
54%。这个数字现在看起来,像一把扎在付费用户胸口的刀


▲ 用户NIK将发布日承诺与四天后的bug列表并排展示,标题只有两个字:Absolute state.
发布之夜:Sol、Terra、Luna,一个太阳系的野心
2026年7月9日前后,OpenAI把GPT-5.6家族推上舞台三个档位,三个名字:Sol(太阳)负责旗舰重活,Terra(地球)主打日常平衡,Luna(月亮)走极致性价比发布页上的基准曲线漂亮得令人窒息,Agents' Last Exam、Terminal-Bench、BrowseComp,Sol在多项评测上要么登顶,要么紧咬第一
发布页还反复强调一句宣传语:用更少的token,做更多有用的工作
在ChatGPT订阅体系里,付费用户可以手动选择Medium、High、Extra High乃至Pro档,背后跑的就是Sol而在Codex编程Agent里,Sol更是默认的“顶配引擎”那些每月花100到200美元、习惯让AI并行跑十几个编程Agent的硬核开发者,自然期待同样的钱,能干更多的活
事情在上线后约24小时开始变味。
第一声警报:87%→76%,一场对话就蒸发了11%

▲ GitHub上最早的bug报告之一:Sol Medium在一次短对话中吃掉了Pro用户11%的5小时配额
有人在GitHub的openai/codex仓库开了一个issue标题直截了当,Sol Medium极速耗尽Pro的5小时额度这位用户付的是Pro档(约合每月200欧元),只是在Medium推理强度下做了一次简短讨论加几次GitHub搜索结果?5小时配额从87%直坠到76%。之后每一条不带任何工具调用的纯文字跟帖,还在以大约1个百分点/条的速度继续掉血
他特意强调:过去用GPT-5.5的Extra High做同类任务,从来没有这种消耗速度

▲ David Ondrej的证词:从“十个Agent都撞不到限”到“一两个就立刻见底”
同一时间窗口里,X上的开发者社群已经炸开了锅David Ondrej写道:“$200/月的Codex曾经是捡漏,我用GPT-5.5的Extra High同时跑十多个Agent,根本碰不到天花板但换上Sol?一两个Agent,瞬间顶限。”
Jun Song更是贴出了堪称“血案现场”的使用记录:Pro 20倍套餐,全程Medium,没开Ultra,不到一天烧完整整一周的Sol额度而在5.5时代,同一套餐轻松撑满七天

▲ Jun Song:我的重置pass也快用完了
紧急灭火:取消5小时窗口、疯狂重置、“Oops… I did it again”
OpenAI看到了火情。Codex产品负责人Tibo迅速启动了一连串运营操作:临时取消Plus/Business/Pro用户的5小时用量窗口;滚动重置所有付费用户的可用额度;同时承诺团队正在让Sol变得“更高效”


▲ Tibo的重置公告,配图是一句流行歌词:Oops… I did it again

▲ 取消5小时限制后,Tibo公开征询:周限额够用吗?
BleepingComputer在7月12日前后报道了这场“限额松绑”,但文章标题用了一个极为精准的词:temporarily(临时)周配额仍然像一道隐形天花板悬在头顶换句话说,你不会每5小时被踢一脚了,但一周的总量并没有多给你

▲ 媒体精准用词:临时放松,限制仍在
用户leo用一段绿文体的讽刺时间线,把整件事总结成了一个死循环:产能吃紧→狂按重置→用户放开了跑→更加吃紧→再道歉再重置→“好吧,我们可能快出问题了”最后一句冷笑:“What did they mean by this?”

▲ 一位用户对反复重置操作的完整讽刺
核心理论:为什么Sol这么“饿”?一个与Fable有关的假说
争论最终凝结在开发者Johnny Jnr的一条理论帖上他提出了一条大胆但逻辑自洽的因果链,
Sol在Claude Fable 5发布前就已就绪。但Fable在基准上全面碾压了早期版本的5.6。为了追平甚至局部反超,团队不得不把模型完全加码,投入更深的推理、更多的验证和更高的搜索强度。


▲ 帖子下方那张Codex Profile图显示:这位用户生涯累计消耗了407亿token,最近一周约69亿
他进一步指出:这种“加码”导致Sol在低推理档和高推理档之间的体验差距巨大Fable即使在Medium甚至Low上仍然“极其好用”,Sol在低档位时却判若两款模型,会无视指令、反复迷路、过度工程、不停请求你的许可,很少直接干活

▲ 用户Ananth一针见血:所以重置只是在补偿
但这个判断并非铁板一块。用户Wiktor Kowalski立刻反驳,“'5.6无视指令'?我的体验完全相反,指令遵循堪称出色” 他追问了一个关键变量:你有加载额外的Skills或harness吗?

▲ 同一个模型,不同的脚手架配置,可以导致截然相反的结论
这就引出了一个被低估的真相:模型周围的脚手架同样会大量吃掉额度,默认加载的Skills、AGENTS.md里的矛盾指令、子Agent自动选用的推理档位、甚至ChatGPT Work和Codex共享同一个用量池这个事实你在Work侧栏随口问一句Excel公式,可能就在悄悄啃食你今晚的编程Agent预算
两种“效率”的战争
这场争议的本质,是两种“效率”口径之间的撕裂
OpenAI说的效率,是固定评测协议下的token消耗,包含控制变量、标准终止条件和干净的基准环境在这个口径下,Sol确实可能更省。
用户说的效率,是同一笔月费能完成多少真实任务,这里还有混乱的仓库、默认脚手架、反复重试和子Agent乱开在这个口径下,Sol可以贵到3到4倍

▲ 社区用户贴出的Sol/Terra/Luna credits对照表,输出token单价是输入的6倍
两个数字都有各自的事实基础。但它们的分母完全不同,而OpenAI只在发布会上讲了前一个
agent编程还有一项结构性特征:读文件→写计划→开子Agent→跑测试→读日志→再改输出token和工具往返主导成本,而Sol的输出单价是输入的约6倍模型越“爱思考”、越“爱验证”、越“爱开并行”,账单就越陡OpenAI自己在介绍Ultra模式时就承认:多Agent并行用更多token换速度与分数
那么问题来了,当默认路径就是“开满火力”,而月费没涨,谁在为差价买单?
重置停了之后呢?
Johnny Jnr在另一条高互动帖里留下了一句预言般的警告:
“当重置都停了,才是终局的开始。”


▲ “20倍套餐,保守使用,只够撑1到2天”
这番担忧有历史可循。从ChatGPT Plus排队、到GPT-4按小时限流、到o系列推理模型吃额度,每一代旗舰订阅都吵过同样的架模式高度相似:发布初期补贴充足,用户形成“包月≈无限”的肌肉记忆;模型变强后单次算力上升,同价格带承载不了旧习惯;公司用软重置和临时提额换时间;社区用“暗砍”和“计量bug”两种解释理解同一现象
而这一次,对面还站着一个叫Fable的对手独立评测显示Fable 5在部分SWE类基准上领先Sol,但Anthropic那边的订阅纳入时间表同样一改再改结果是,开发者们开始像对冲基金经理一样,在两个harness之间做“双开套利”:哪边今天额度宽松就用哪边
最终的稳态,也许是更透明的任务级计量,至少告诉用户,你的钱花在了哪个子Agent、哪一层推理、哪一次缓存未命中上在那之前,一个百分比进度条和一句“Oops I did it again”,撑不起200美元的信任
夜雨聆风