乐于分享
好东西不私藏

Open AI和Anthropic最赚钱的客户正在集体转向Kimi和Deepseek

Open AI和Anthropic最赚钱的客户正在集体转向Kimi和Deepseek

上周有条新闻,我看到的时候愣了一下。

The Information 爆了条料:微软正在内部测 Kimi K3——月之暗面7月16号刚发的那个开源模型。测什么呢?把 Copilot 的一部分推理请求,从 OpenAI 和 Anthropic 那边挪过来。微软内部算过一笔账,就这一挪,一年最多省 6 亿美元,换成人民币 40 多亿。

怪就怪在,微软是 OpenAI 最大的投资方。投了人家那么多钱,回头给自己最核心的 AI 产品找中国平替,说出去总归不好看。可你站微软的位置上想想,又完全讲得通。Copilot 现在按 token 计量收费,用户每点一次都是真金白银的算力支出,内部测算切到 K3 之后单 token 成本最多能降六成。纳德拉最近反复讲成本效率、讲供应商多元化,现在回头看,全是给这事铺路。

我们来看一组openRouter的模型性能和价格对比:

GPT 的领先幅度,说实话没想象中大。 相比 Kimi K3,GPT‑5.6 Sol 在智能、编码、代理指数上分别高 1.2、1.2、3.5 分;Opus 4.8 则比 Kimi 分别低 2.4、1.9、4.9 分。

常规负载差距可控,超长输入差距显著。 在 50k 输入 + 5k 输出时,Kimi / GPT / Opus 约为 $0.225 / $0.400 / $0.375;在 500k 输入 + 20k 输出时约为 $1.80 / $5.90 / $3.00。

有些公司开始给自己找后路了

Jason Calacanis 在 All-In 节目里点过三个名字:ElevenLabs、Figma、Lovable。这几家一年交给 OpenAI 和 Anthropic 的钱,5000 万美元起步,多的上亿。Calacanis 的判断很直接——接下来要么转 Kimi、DeepSeek 这类开放模型,要么自己训。他还提了一嘴,自己团队部署 Kimi 之后推理成本降了八九成。这个数我觉得得打个折,毕竟跟并发量、缓存命中率都有关系,但大方向没什么问题。

Figma 今年的动作我专门捋过一遍:2 月把 OpenAI 的 Codex 接进设计流程,5 月上线自家的 AI Agent,7 月又收了 AI 编程平台 Budd 背后的团队。单拎出来,每件都算正常业务操作;连起来看,味道就不一样了,Figma 也在下一盘棋。另外还有一条不太起眼的规定:第三方模型商不许拿客户上传到 Figma 的设计稿去训练。那 Figma 自己在干嘛?在训一个更懂设计规律的专用模型。

为什么防成这样?看看 Anthropic 今年的产品线就明白了。Claude Design 已经能直接生成设计稿和产品原型。Figma 花钱买 Claude 的能力,Claude 顺手把手伸进了 Figma 的碗里。供应商和客户做到这个份上,关系就彻底变味了。

客服赛道的 Decagon 走得更靠前,现在大概九成的业务跑在开放模型上。这个案例我跟人聊过,省钱只是一方面,客服场景真正卡脖子的是延迟——用户一句话发出去,AI 卡 8 秒,这个体验就救不回来了。所以他们要的是小模型、快模型、能拿自家客服数据反复微调的模型。特别难的问题照样丢给最贵的通用模型,但每天重复几百万次的那部分活,早就移交给自己训出来的熟练工了。

这里面的逻辑其实挺朴素的。业务刚起步,谁也不知道 AI 能干什么,接最强的模型先试,接口一连第二天就能跑。等业务跑顺了,客服每天问什么、代理在哪里容易出错、合同审核要盯哪几个条款,数据全都摸清楚了——这时候还抱着最贵的通用模型不放,就有点傻了。

自己部署,账是这么算的

Kimi K3 本身的情况简单交代下。2.8 万亿总参数,目前开源里最大的,MoE 架构,896 个专家每次激活 16 个,实际参与运算的参数是 1040 亿。权重文件 1.56TB,这个体量家用设备想都别想,得专业集群。

自己部署到底要多少钱,我按着公开信息粗算了一遍,大家看个量级就行。目前有人跑通的最低配置是 4 台 8 卡 H100,一共 32 张 80GB 的卡,百万 token 上下文能跑满。国内西部机房单张 H100 折合一小时13 块上下,32 张全开着一小时就是416 块。机器是不能下班的,一天下来小一万,一个月30万上下,一年365万左右。这还只是租金,高速存储、跨机互联、运维人力、备用机器都得另算,实际账单只会更厚。

365 万听着肉疼。可要是把开头那个数字拿过来对一下,年交5000 万的客户,自部署相当于原来账单的 7% 上下,年交 1 亿的,4% 都不到。当然我也得提醒一句,跑起来和扛住高并发是两回事,公开测试里 K3 单路生成速度每秒 5.8 个 token,用户一多机器还得加。这笔账未必每家都算得过来,但调用量大的那批公司,肯定会认真算。

中国人工智能崛起导致美国的科技公司开始出现分歧

K3 的硬指标我核对过几个。Artificial Analysis 的智能指数排第三,前面是 Claude Fable 5 和 GPT-5.6 Sol;前端编程那个榜更夸张,直接干到第一。成本是闭源对手的几分之一,API 还兼容 OpenAI SDK。有这几条垫底,后面的连锁反应就不难理解了。

7 月下旬,一封《开放权重与美国 AI 领导力》的公开信在硅谷传开了,签名从 25 家涨到 50 多家——微软、Meta、谷歌、IBM、英伟达、SpaceX 都在,连 OpenAI 自己都签了。黄仁勋新开的 X 账号,第一条帖子转的就是这封信;扎克伯格也公开讲,美国不该靠封禁中国模型来获取竞争优势。

Anthropic 没签。50 多家公司里,就它缺席得最显眼。

它选的是另一条路。Amodei 在国会听证会上指控 K3 蒸馏自家模型,还提到一款没公开的未来模型也被蒸了。白宫科技顾问 Kratsios 跟着发文,措辞很重——“大规模、隐蔽的工业级蒸馏”,连泰国算力、GB300 服务器这种细节都点了出来。财长贝森特那边,直接威胁制裁和实体清单。

美国的政客依旧稳定发挥

月之暗面那边否认得很干脆:性能提升靠的是原创架构,没什么可说的。团队里有人直接拿时间线回怼——Fable 7 月 1 号发布,K3 7 月 15 号上线,满打满算 15 天,蒸馏出一个全新前沿模型?这效率都能申吉尼斯了。说真的,“蒸馏”这顶帽子这两年用得有点太顺手了,DeepSeek 那次扣一遍,这次又扣一遍,自己蒸馏别人的时候不说,太双标了。

美国政府内部意见也不统一。财长和白宫科技顾问偏强硬,商务部长卢特尼克却顾虑美国企业的用模成本。Georgia Tech 的助理教授 Daniel Yule 拿 OpenRouter 的数据估算:要是中国开放权重模型被禁、用户全切回顶级闭源,光这一个平台每年就得多花 20 亿美元,外推到全美市场,是 30 亿到 120 亿这个区间。他只给了个量级,但方向很清楚——封禁的成本,最后是美国企业自己掏。

理性思考

前面说了这么多,不泼点冷水这文章就写成软文了。

K3 的毛病实打实存在。独立测试里,含隐藏不变量的题目它失败率 36%,Anthropic 的 Opus 4.8 是 8%,复杂推理的稳定性差着档次。思考模式也费 token,有人拿一个简单画图请求测过,推理过程吃掉 1.3 万个 token,标价便宜跟实际便宜之间隔着使用习惯。合规这块它也没有 HIPAA 那类认证,金融医疗这种强监管行业短期进不去。

微软那边也一样,就算真用了 K3,大概率只放在代码补全、基础问答这种非核心场景,跟 OpenAI 的独家云合作不会动。所以说"撬客户"严格讲不准确,客户名单还在,只是调用量最大、最稳定的那块流水被切走了。

最后

这波变化我自己琢磨下来,重点不在哪个模型赢了哪个模型,而是客户和供应商的关系在变味。模型公司下场做应用,应用公司自己囤模型,两边都在往对方的地盘伸手。护城河从模型本身慢慢挪到数据和工作流上,这个转移一旦开始就不太好回头。其实发展到后面最终的解决方案主要还是本地部署,有些公司的资料很敏感,本地部署最放心。闭源模型无法保证数据安全,任何一家大型公司都不会冒这种风险!

Kimi 后面还有排队的。阿里8月3号放开了 Qwen 3.8 Max,2.4 万亿参数,定价比 K3 还低,权重也快放了。应用公司现在的处境是挑花了眼,Kimi 不合适测 Qwen,Qwen 不合适换 DeepSeek,前面再接个模型路由器按价格和稳定性分发。

这件事最后走到哪一步,我说不好。政策还在扯皮,蒸馏那笔账也还没吵完。但价格这个东西,锚点一旦砸穿就很难焊回去了。OpenAI 和 Anthropic 接下来要应付的是自家的模型能力能否匹配上高额的定价。

如果觉得不错,随手点个在看转发三连吧,点个关注第一时间收到推送,非常感谢你看我的文章!