
过去一周,三家AI巨头前后脚发布新模型,节奏像商量好了一样。7月8日马斯克的SpaceXAI推出Grok 4.5,7月9日OpenAI放出GPT-5.6三档系列,7月10日扎克伯格亲自发推官宣Meta的Muse Spark 1.1。
三场发布会传递的信息出奇一致:性能当然有提升,但真正的卖点变了——价格。
GPT-5.6 Luna输入价格降到每百万Token 1美元,比上一代便宜了五倍。Grok 4.5号称用对手四分之一的Token就能干同样的活。Meta更狠,Muse Spark 1.1的定价比Anthropic旗舰模型便宜十倍。扎克伯格在X上就一个词:"very low cost"。
AI行业的价格战,正式打响了。
三家新模型,价格一个比一个低
先把价格摆出来看:

OpenAI这次把GPT-5.6拆成了三档。旗舰Sol还是那个价——输入5美元、输出30美元,性能升了一截。中间档Terra半价给GPT-5.5级别的性能,性价比拉满。Luna才是杀器,输入1美元、输出6美元,盯的是高频低延迟场景。
马斯克的Grok 4.5走的是"Token效率"路线。在SWE Bench Pro测试中,Grok 4.5平均只输出15954个Token就解决问题,Claude Opus 4.8需要67020个——不到四分之一。按完成单个任务的总成本算,Grok 4.5是同级模型中最便宜的。马斯克在X上的原话:"Opus级别的模型,但速度更快、Token效率更高、成本更低。"
Meta的Muse Spark 1.1是价格最激进的一个。输入1.25美元、输出4.25美元,综合定价只有Anthropic Fable 5的十分之一。这是Meta第一个收费模型,上来就掀桌子。扎克伯格憋了三年重新发推,连发三条,马斯克还跑来回了句"Jinx"。
Meta敢这么干,底气来自广告业务的利润。用扎克伯格的话说:"其他实验室定价很高,利润空间也很大。我们完全有能力以更实惠的价格提供前沿水平的能力。"言下之意——你们吃肉,我喝汤就行,先把客户抢过来再说。
企业AI账单已经失控了
巨头们集体降价,不是发善心,是被逼的。企业端的AI账单已经到了离谱的程度。

Uber是最公开的案例。2025年底把Claude Code推给5000名工程师,还搞了个内部排行榜,按AI工具使用量排名激励。结果工程师们开始"Token Maxxing"——不计成本地消耗Token冲榜。到2026年3月,84%的工程师进入"AI代理编程"状态,每人每月API成本500到2000美元。4月,全年AI预算烧光。
Uber COO Andrew Macdonald后来在采访中说了一句让行业震动的话:"那个连接还不存在。"他的意思是——Token消耗量和消费者功能改善之间,画不出因果关系。钱花了,效果说不清。
更夸张的是另一件事。一位AI顾问向Axios透露,某企业客户因为忘记给Claude使用许可证设置上限,一个月账单累积到5亿美元。折合人民币33亿,每天烧掉超过1亿元。这家公司是谁至今没人确认,但社交媒体上的猜测几乎都指向亚马逊。
微软的反应更直接。Experiences + Devices部门紧急关停了大部分Claude Code授权,要求数千名工程师强制迁移回自家的GitHub Copilot,截止日期6月30日。Meta和亚马逊也在同一时间收紧了内部Token消耗指标。
Anthropic的日子反而过得不错。年化营收从2025年底的90亿美元飙到2026年4月的300亿美元,超过1000家企业年消费超百万美元。但价格上涨也引发了用户流失——这正是降价的窗口期。
中国模型:看不见的降维打击
美国巨头降价的另一个推力,来自中国。

OpenRouter是开发者最常用的AI模型路由平台,上面的数据最能说明问题。自2026年2月8日起,中国模型每周的Token占比都稳定在30%以上,最高冲到46%。而一年前这个比例只有4.5%。
DeepSeek V4 Flash的输入价格是每百万Token 0.14美元。GPT-5.6 Sol是5美元。差了35倍。智谱GLM 5.2在Vercel平台发布后第一周,日Token交易量增长了27倍,用户数增长了80倍——是Vercel追踪过的采用速度最快的模型。
OpenRouter的分析师Justin Summerville给出了量化结论:同等能力档次下,中国开源模型比美国前沿模型便宜60%到90%。算一笔具体的账——一个客服Agent每天处理1000万Token,用DeepSeek一年5万美元,用GPT-5.6要180万美元,用Claude Fable 5要110万美元。36倍的价差,CFO没法假装看不见。
已经有企业在行动。AI助手公司Lindy把整个模型基础设施从Anthropic切换到了DeepSeek,成本降到十分之一,性能在邮件分类等核心场景反而更好。Coinbase用1200个AI Agent跑中国模型,AI支出直接砍半。
当性能追平到80%-90%的时候,剩下的差距,用便宜30倍的价格轻松换回来。这是Summerville的原话。
价格战是怎么打起来的

回头看,价格战不是突然爆发的。企业端账单出了问题,中国模型又把性价比拉到新高度,两件事撞在了一起。
Uber烧光预算是2026年4月的事,5亿Claude账单是5月曝光的,微软关停Claude Code是6月。企业端对AI成本的恐慌在半年内完成了从"个案"到"行业共识"的转变。CFO们开始盯着Token仪表板,像当年省纸张一样精打细算。
另一边,中国模型在OpenRouter上从去年上半年的4.5%一路涨到30%以上,连续22周没有掉下来过。OpenRouter官方在报告里第一次用了"结构性替代"这个词——不是短期波动,是新的常态。
两头夹击之下,美国巨头必须在价格上做出回应。OpenAI的Sam Altman承认"成本已成为企业客户的巨大问题"。马斯克和扎克伯格则更直接——先砍价,抢客户。
降价不等于降质
这次价格战有一个跟传统价格战不同的地方:便宜的不代表差。
GPT-5.6 Luna便宜,但上下文窗口105万Token,支持函数调用、网页搜索、文件搜索、计算机使用,该有的能力一个没少。Terra的性能对标GPT-5.5,价格只有一半。Sol在Terminal-Bench 2.1上创了新纪录,比Anthropic Fable 5高了7.6个百分点。
Grok 4.5在SWE-Bench Pro上拿了64.7分,三款新模型里最高。当然,它的幻觉率也偏高——这是性价比策略的代价。
Muse Spark 1.1在医疗文书、税务评估、法律工作三个专业榜单上拿了SOTA,把前一天刚登顶的Grok 4.5从法律榜上直接掀了下去。
这说明一件事:AI模型的能力在快速趋同。前沿的差距从代差缩小到几个百分点的差距,价格却差了几倍甚至几十倍。当能力追平到八九成,价格的权重自然就上来了。
对开发者意味着什么
Token降价对开发者是实打实的好事。以前跑一个AI Agent动不动几百美元,现在同样的任务成本可能只要几美元甚至几美分。创业公司的试错成本大幅降低,以前不敢想的产品形态变得可行了。
但也要保持清醒。便宜不等于免费,Token计费的结构性风险还在。Uber的教训很清楚——没有使用上限和成本监控,5000人的团队四个月就能烧光全年预算。几点经验:
设月度Token上限。Uber后来定的是1500美元/人/月,够参考了。
按任务选模型,别一刀切。复杂推理用Sol或Opus,日常分类用Luna或DeepSeek,成本差几十倍。OpenRouter的价值就在这——同一个接口,按需路由到最便宜的够用模型。
建个Token监控仪表板,在问题变成5亿账单之前发现异常。AWS、Azure都有现成的成本告警,花十分钟配一下。
关注中国开源模型,但注意数据合规。性能追平到八九成、价格便宜几十倍,在非敏感场景下值得切换。但如果涉及用户数据,需要评估数据出境的合规风险——中国模型托管在中国服务器上,受中国法律管辖。
这场价格战才刚开始
三巨头一周内集中降价,信号很明确:AI模型正从奢侈品变成日用品。
但价格战不是终局。价格降到一定程度,竞争会换个玩法。生态、Agent能力、能不能解决复杂真实问题——这些才是下一个战场。Anthropic靠Claude Code在企业端吃下了大量份额,模型性能只是一部分,工具链和开发者体验才是关键。
对开发者来说,当下最好的策略很简单:享受低价红利,别把鸡蛋放一个篮子里。用OpenRouter做多模型路由,按任务选最合适的模型,设好消费上限。Token便宜了,试错空间就大。
价格战到最后,赢家不是降价的巨头。能用便宜Token做出真产品的开发者才是。
夜雨聆风