昨天我们聊了 Qwen 3.8 把价格打到 Claude 的 1/4,今天补另一半故事。
8 月 4 日上午,行云科技股价 20cm 涨停,封单超 34 万手,这家 7 月底刚公告 154 亿算力订单的公司,因为一纸新合同,把单子从 10.14 亿直接上调到 30.53 亿,涨幅 201%。
回看一周前的几条消息,OpenRouter 平台显示,7 月 31 日智谱 GLM 系列云端 API 较旧版 GLM-5 Turbo 上调 8% 到 17% 不等,这是年内第二次提价。而 OpenAI 那边却反着来,7 月底把 GPT-5.6 Luna 降价 80%。
一边在涨,一边在降,看似矛盾,但如果你把最近三个月大模型行业的价格动作放在一起看,会发现一件非常关键的事。
定价的逻辑,正在悄悄换底盘。
一、调价的,不止智谱
先看国内市场,智谱今年 2 月把 GLM Coding Plan 整体涨了 30%,7 月 31 日 GLM 系列云端 API 较旧版 GLM-5 Turbo 上调 8% 到 17% 不等。两轮调价后,GLM 系列在编程场景的缓存命中 Token 价格,已经贴近 Anthropic 的 Claude Sonnet 4.6。Kimi 在 7 月 17 日发布 K3 并涨价超 3.5 倍,7 月 27 日完整权重开源,阿里云、腾讯云、百度智能云在 2026 年上半年都先后上调了大模型和算力服务的收费标准。
行云科技的 201% 涨幅更直接,算力租赁过去三年的关键词是价格战,今年 7 月开始变成了加价潮,三个客户三套涨幅,头部大模型客户涨 201%,央企客户涨 79%,其他综合涨 13.5%。
再看国外,Anthropic 在 7 月 25 日推出 Claude Opus 5,性能接近旗舰 Fable 5,定价仅 Fable 5 的一半。看起来是降价,但这是 Anthropic 第一次以半价作为产品发布的核心策略。OpenAI 在 7 月底把 GPT-5.6 Luna 砍掉 80%,但这并不影响 GPT-5.6 Sol 的高端定价,最贵的那一档没动。
把这一堆动作放在一起看,是一张清晰的图,头部模型厂在主动收窄价格区间,下调的是中低端定价,把消费侧铺开,维持甚至上调的,是高端能力定价,把利润留在这。
行云科技、智谱、阿里、腾讯的涨价,集中在能处理 Coding、能跑 Agent、能落企业级工作流的能力上。OpenAI 降价的 Luna,本质是流量入口,它不指望 Luna 赚钱,Sol 才是真正的收入主力。
定价的锚,正在从性能标尺滑向替代成本。
二、替代成本,才是新的定价权
摩根大通最近一份报告讲了一句话,我觉得点到了根子上。
在 AI 需求仍超过推理供给的市场里,能涨价且不掉单,才是模型能力被市场验证的唯一硬指标。
翻译一下,模型公司敢涨价,还能涨完不流失客户,说明客户找不出第二个替代品,替代成本高到一定程度,涨价就是定价权。
看几个具体数字。
智谱在 2026 年一季度 API 调用定价提升 83%,调用量反而增长 400%。ARR(年度经常性收入)达到 17 亿元,过去 12 个月提升了 60 倍,平台注册用户突破 400 万,覆盖全球 218 个国家和地区。
OpenRouter 平台数据,2026 年以来美国企业使用中国 AI 模型产生的 Token 占比,从过去 12 个月的平均 11% 飙升到 30% 以上,峰值一度达到 46%。
这两个数据放在一起看,是同一件事,中国大模型正在被全球客户用真金白银算进自己的技术栈里。
为什么是算进去的?据高盛和摩根大通的调研,中国大模型的平均 API 价格比 Claude、GPT-5 这类海外头部闭源模型低 60% 到 80%,但在软件研发、网络安全、数理任务这些常见业务场景里,性能差距已经缩小到可商用的程度,对美国企业来说,这不是一个退而求其次的选择,是一个够用、便宜、可控的理性选择。
但反过来,如果一家企业深度依赖 GLM-5 的 Coding 能力,切到别的模型需要重写整个 Agent 流程,那这家公司就愿意接受智谱 83% 的涨价。
三、谁慌,谁不慌
价格上行潮里,谁最慌?
最慌的,是做应用的创业者。
做 AI 应用的团队,过去两年的核心商业模式是低价 Token 加高溢价产品。他们拿每百万 Token 几分钱的价格进来,包装成产品卖给客户,模型层一涨价,他们和客户之间的价值差就被压缩了。
据行业普遍测算,做 AI 应用的团队的 Token 成本占其运营成本的比例通常在 30% 到 60% 之间,模型上调 83% 之后,对一个 Token 占比 50% 的应用来说,毛利率会被压缩 15 到 20 个百分点,年调用量上亿 Token 的中型公司,差额在几百万元这个量级。
而这些应用的下游客户,律所、企业、电商商家,普遍感受不到模型涨价,因为应用服务费没变,中间的差价,被模型公司吃掉了。
过去三年,做 AI 应用的团队是 AI 行业最活跃的群体,GitHub 上每天都有新项目,公众号里每周都有新工具发布,他们的繁荣,建立在模型越来越便宜这个前提上,模型层进入价格上行周期,这个前提开始松动。
哪些人不慌?
第一类是手握独家能力的模型公司,智谱在 Coding 上的优势,能支撑 83% 的涨价不掉单。
第二类是拿到长期算力订单的算力供应商,行云科技 154 亿在手订单、201% 的涨幅,是算力供给紧缺的市场表现。
第三类是大厂,大厂的模型不是单独卖 Token,而是跟云、广告、办公套件一起卖,模型价格上调的损失可以在云和广告侧补回来。
四、那普通人呢
这是大家最关心的。
价格上行的传导链条是这样的,模型厂调价,做应用的团队被压缩,部分应用选择降本用便宜模型或者涨价向用户传导,用户感受到 AI 工具变贵或者能力下降。
但这条链条上,有一个环节被忽略,国产开源。
Kimi 这次一边调价一边宣布开源,是一个有标志性的动作,8 月初,吉宏股份和阿里云开了一个联合创新研讨会,宣布依托 Qwen 3.8 搭建面向全行业的标准化 Token 出海分销服务体系,Qwen 3.8 总参数 2.4 万亿,支持 201 种语言,国际定价是 Claude Opus 5 的 40% 和 24%。
开源模型加出海分销,是 2026 年下半年中国大模型的典型组合。
对国内做应用的创业者和个人用户来说,这条路实际上是最低成本的方案。如果你担心闭源 API 继续调价,可以换开源模型自部署;如果你担心自部署成本高,可以用国内的 Token 分销服务;如果你担心自部署技术门槛高,Qwen 3.8 这种 2.4 万亿参数的开源模型,本地化推理框架已经相当成熟。
普通人最稳的姿势,不是押注某一家公司,而是保持双备份,主链路用一家闭源 API 保证质量,备链路用国产开源保证成本可控,当主链路价格涨到不合理,就切到备链路一段时间,倒逼主链路回调。
这不是阴谋论,是商业博弈里最常见的多供应商策略。
五、这次价格上行的真正含义
把时间拉长看。
2023 年到 2025 年,大模型行业的主题是降价,OpenAI 这次 Luna 降价 80%,是这个逻辑的延续。
2026 年开始,故事换了一个讲法。
智谱敢涨 83% 还能让调用量增 400%,说明需求侧的真实买单意愿在形成,行云科技 154 亿订单的差异化调价,说明算力供给侧开始出现刚性缺口,OpenAI 一边让 Luna 降价 80% 抢用户,一边死保 Sol 不动,说明头部公司在有意识地把商品化和高价值分开定价,Qwen 3.8 出海加 201 种语言加 24% 定价,说明国产大模型已经从技术输出走到商业运营。
这些动作背后是同一件事,大模型正在从基础设施竞争转向商业化兑现。
第一阶段是先把模型跑起来;第二阶段是把价格打到最低;第三阶段是找到能稳定赚钱的姿势。第三阶段,才是大模型真正进入长期的开始。
六、给到应用层和普通人的 3 件事
1. 做应用的创业者,把模型成本作为产品设计的输入变量
过去两年,很多产品设计的逻辑是模型给我什么能力,我就做什么产品,今天反过来了,我准备花多少钱在 Token 上,就设计什么样的产品,Token 成本高,就聚焦在低频次、高单价的功能,Token 成本低,就铺开高频次、量大的场景,同一款 AI 产品,可能在不同时期有不同的形态。
2. 企业采购,把单供应商变成多供应商
过去很多企业选了 Anthropic 或 OpenAI,就一直用下去。2026 年的市场逻辑要求多供应商策略,同时用 2 到 3 家,每家承担不同的工作流,不是因为某一家不行,是因为任何一家调价的时候,你都有切换权。
3. 个人用户,把工具变成工具组合。
OpenAI 强在通用能力,Claude 强在 Coding 和长文本,Qwen 强在中文场景和成本,豆包、Kimi、文心一言都有各自的优势区间,不押注单一工具,而是根据任务选择最合适的工具。
普通人来说,最重要的不是用哪一层,而是知道自己在哪一层,最重要的不是用哪个工具,而是知道这个工具的 Token 成本在我能接受的范围内。
工具好不好用,关键看你会不会用。
评论区告诉我,你们公司或者自己用的 AI 工具,最近有没有调价的?
大时代啊,朋友们。
夜雨聆风