夜雨聆风学习资料网

ARTICLE · 1117001

AI的单价砍到五分之一,三家公司的报价撞在了同一个数上

AI的单价砍到五分之一,三家公司的报价撞在了同一个数上

云极投研 · 科技×投资深度观察

谷歌山景城总部。Gemini 4 Argon发布当天,谷歌同步取消了原定6月推出的Gemini 3.5 Pro迭代计划,图源:维基百科

9月30日,谷歌把Gemini 4系列的第一款旗舰模型放了出来。

名字叫Argon。定价写在公告里:每百万输入token 2美元,每百万输出token 10美元,缓存命中的输入token在这基础上再打95%的折扣。

翻回一周,OpenAI的GPT-6.1 Sol标的是同一个数,2美元和10美元。再往前,Anthropic的Claude Sonnet 5.5也是2美元和10美元,缓存读取0.2美元。

三家前沿实验室,在一周之内把报价压到了同一个数字上。

01便宜得不太像旗舰

先把价格放一边,看能力。

Argon把单次输出上限从6.4万token提到了100万。这个改动听起来像参数调整,实际改变的是任务的形态。6.4万token大致是一份长文档的体量,任务只能被切成一段一段做;100万token意味着可以一口气把一个中型项目的上下文吃进去,中途不用交接。

谷歌给出的分数分布在不同赛道。真实长流程软件工程基准DeepSWE v1.1是77.9%,企业自动化基准AutomationBench是51.3%,衡量漏洞修复能力的CWE-bench v1是68%,与对手并列第一。

谷歌内部已经用起来了,这几件事比榜单更有说服力。

量子计算团队用它优化子程序,几分钟内把公开文献的最好基准提升了40%。一组Agent分析整个数据中心的性能遥测数据,自己找出内存优化方案,上线后释放了超过300TiB内存,谷歌预计整体能省下500TiB到1PiB。还有C/C++代码库往Rust的迁移,从re2、libgav1这类几万行的核心库,一直到Fuchsia Zircon内核的80多万行。

机房。谷歌称Argon Agent在数据中心的性能遥测里自主识别出了内存优化点,图源:维基百科

这几件事有个共同点:都是长流程、多步骤、中间状态复杂的工作。它们过去正是模型最容易做一半忘前面的地方。

02最贵的那部分,不在价目表上

便宜的token是明面上的事。

真正的成本结构在另一头。生成一个token要消耗算力,算力来自芯片,芯片来自产能。谷歌的筹码是自研TPU,它不用像别的公司那样把利润交给外部供应商,同样规模的推理任务,有自有芯片的公司边际成本要低一截。

缓存折扣是第二个杠杆。95%这个数不是营销话术,它对应一个很常见的场景:很多AI应用每次调用都要带上一大段不变的上下文,系统提示、知识库、代码库都在里面。这部分内容第一次读进去算一次钱,后面命中缓存几乎不花钱。折扣从90%提到95%,对长上下文应用的账单影响是直接的。

所以2美元和10美元这个数字,比的不只是谁更愿意亏钱,还比谁的自有算力更便宜、谁的缓存命中率更高。

对用AI的公司来说,这是实打实的成本下降。三年前的旗舰模型调用一次的费用,现在可以调用十几次。

03但这个价,暂时不是给你的

Argon发布当天没有面向公众开放。

谷歌把它先给了Fairwind计划里的一批网络安全防御专家,以及美国政府合作方。谷歌的说法是要分阶段放开,先收集早期测试者反馈,同时配合美国政府的模型发布前自愿评估流程。给这批人的版本甚至不带网络安全护栏。

普通人现在用不上。

再往后一步,价格表里还压着一行小字:2美元和10美元是首发优惠价,之后会涨到4美元和20美元。

同一时间,谷歌取消了原定6月发布的Gemini 3.5 Pro。旗舰迭代的节奏被打乱,资源被集中到Argon这条线上。

谷歌自研的TPU v4加速卡。同样规模的推理任务,有自有芯片的公司边际成本要低一截,图源:维基百科

把这几件事放在一起看:模型能力在最前面,价格在中间,渠道和监管在最后面。能拿到多少、什么价拿到,取决于你站在哪个位置。

04开源那头,也在往上走

闭源模型降价,还有一层压力来自开源。

这一周里,Z.ai放出了GLM-5.3,7440亿参数的开源权重模型,每个token大约激活400亿参数。Anthropic在自己的评估里把它标为迄今测过的、网络攻击能力最强的开源权重模型。

同一条线上还有几个更小的动作。AWS开源了Strands Decider 2B,一个专门做决策路由的小模型,延迟低于100毫秒,权重和训练配方都按Apache 2.0放出来。Cloudflare放出了Clef系列的开源决策模型,配套一个强化学习微调平台。Ai2则公开了Olmo-core 3,一套训练大型混合专家模型的基础设施,公开的是训练代码,不只是权重。

这些模型的能力和前沿旗舰还有距离,但它们覆盖的是另一类需求:延迟敏感、成本敏感、数据不能出内网。一个公司要做客服分流或者文档分类,用不上百万token输出的旗舰,一个能跑在自己机房的小模型更合适。

于是模型层就出现了两头挤压。上面是三家旗舰把价格压到同一个数,下面是开源把免费的那一档往上抬。中间那段"比开源强一点、比旗舰便宜一点"的位置,是最难守的。

05便宜之后,会发生什么

对做产品的人来说,推理成本下降会改写一些此前算不过账的事。

一个很直接的例子是全量跑一遍。单次调用足够便宜之后,很多原本只做抽样、只做关键路径的任务,可以改成全量处理,全量审核、全量翻译、全量抽取。用户感受到的差别不大,产品形态本身却在变。

另一面也要留意。价格战打到这个位置,几家公司的报价已经贴得很近,继续往下压的空间在收窄。Argon的优惠价能撑多久、涨回4美元和20美元之后同行跟不跟,是接下来要看的事。

屏幕上的一段Rust代码。谷歌称内部已有Agent在把C/C++代码库迁移到Rust,包括Fuchsia Zircon内核的80多万行,图源:维基百科

对普通用户来说,最现实的感受是订阅和API价格会有一段时间松动,尤其是按量计费的AI应用,成本降下来之后大概率会有一部分让到价格上。想试新工具的人,接下来几个月是比较好的窗口。

对投资者来说,这轮要看的不是谁又发了新模型,而是三件事。自研芯片的占比,决定谁在成本战里撑得更久;缓存命中率这类工程指标,正在变成毛利差异的来源;还有企业客户的实际留存——价格降下来之后用得起的人多了,但真正愿意续费的客户,才是这门生意的底座。

AI账单里最该盯的三个数

①各家旗舰模型的“优惠价”能维持多久,以及涨回原价后同行的跟价动作。

②自研芯片在推理成本里的占比,这是成本战能不能打下去的地基。

③企业客户的续费率,价格下降带来的新增用户里有多少会留下来。

热文推荐

6000亿参数只激活270亿,国产模型把智能单价打下来了

DeepSeek下季度换华为芯片,2万亿参数模型在路上

黄仁勋说明年芯片翻倍,华为同一天发了51.2万卡超节点

—— 云极投研

关注云极投研,看懂科技与投资的交叉点

相关学习资料