夜雨聆风学习资料网

ARTICLE · 1055588

全球一半的AI对话,发生在我们这边

全球一半的AI对话,发生在我们这边
上周我刷到一个数据,第一反应是愣一下。

OpenRouter,全球最大的AI模型调用平台,刚刚公布了9月14号到20号这一周的数据。全球大模型一周总共被调用了129万亿个Token,中国一家占了一半多——67.46万亿,连续21周超过了美国。

光说数字你可能没感觉。我换算一下:一次普通AI对话几千个Token,129万亿大致是几百亿次对话,分给全球80亿人,每人每周得跟AI聊上好几次。

我没想到的是第二组数据。上周全球调用量前五名里,中国模型占了四席。DeepSeek V4.1-Flash冲到第一,周调用量15.8万亿,环比暴涨219%;智谱GLM 5.3 Flash排第二,14.1万亿;腾讯混元Hy4 preview第三,12.5万亿;DeepSeek另一款第五,9.44万亿。

更扎眼的是对比的另一面:美国模型上周总共才14.21万亿Token,环比下滑34.7%。

中国是美国的4.7倍。

一周,129万亿次AI对话,有一半发生在这边

讲真,这个数据我看了两遍才回过神来。

过去几年我们听惯了”美国AI统治世界”、”OpenAI一骑绝尘”、”中国AI还在追赶”这一类故事。结果呢?故事的主角是谁不知道,但跑量的马拉松,跑在了我们这边。

你可能想问:调用量大就等于厉害吗?当然不等于。技术榜单和调用榜单是两回事。但我想说另一件事——渗透量本身就是生态量。

AI不靠谁参数多、谁模型大,谁就是老大。AI靠的是谁用得起、用得多、用得深。当一个普通人在写文案、做表格、改代码、陪小孩写作业的时候,他随手打开的就是中国模型——这件事的意义,比任何基准测试都大。

中国机房:便宜好用,调用量爆了

为什么中国模型被用得这么多?不是故事讲得好,是真的便宜。

拿这个V4.1-Flash来说,缓存命中0.02元/百万Token——百万个Token,合不到两毛五。普通输入1块,输出4块。最关键的是它做了架构革新:把原来40层的主干网络切成20层编码器加20层解码器,全局”记忆”直接投影到解码器,原本最占显存的”记住前面说过的话”那部分,压到了原来的四分之一。

翻译过来:AI每次跟你对话都要”记住你说过的字”,这一步最烧钱。新结构把这一笔省到原来的四分之一,省出来的钱就能让更多人用得起。

定价降了,调用量立刻爆。15.8万亿、环比+219%,就是这个意思。

然后就有意思的事来了——便宜也是种压力。

便宜也是种压力:算力在挣扎

就在上周日(9月20号)下午,闲时段——按DeepSeek自己定的规则,周日下午应该是最松的时候——它的服务崩了,输入问题只回一句”服务器繁忙”。

这事被扒出来更耐人寻味:8月V4-Flash一天处理8万亿个Token,其中5万亿来自免费试用额度。5万亿。这意思是,DeepSeek每天一半以上的活,是给白嫖党干的。

DeepSeek的老板梁文锋今年7月讲过两句实话。一句:”中美AI差距主要是算力资源的差距。”另一句:”价格再翻一倍,token消耗量区别不大。”

翻译过来:算力是命根子,便宜不会让人用少,只会让人多用,多到爆点。

中秋国庆快到了,DeepSeek又发了新通知:调休上班的周末、中国法定节假日,全天按空闲时段收费。中秋加国庆,10天半价。我把这事告诉朋友,他第一反应是”挺良心”,第二反应是”这不就是撑不住了吗”。

你看,这就是便宜到崩的另一个注脚——便宜不是天上掉的,是拼命压出来的。

一边在辩节奏,一边在路上跑

讲到这儿,得提一下背景。

昨天我刚写完一篇《喊”慢点跑”的四个人,被告了》,讲的是Anthropic、OpenAI、SpaceXAI、谷歌四家被起诉——理由是它们公开喊”AI要放缓、要安全、要协调”,涉嫌垄断。这事我写的时候挺感慨,觉得”终于有人叫停节奏”。

今天再看到129万亿和67.46万亿,再看到美国环比-34.7%,我换了个想法。

一边在辩”该不该踩刹车”,一边已经在路上开起来了。

这两个画面叠在一起,就是今年AI最分裂的现实:一边辩节奏,一边真在跑;一边喊”为人类留出时间”,一边喊”为用户省出每一毛钱”。两边都没错,但跑出距离,是真的。

调用量不是能力榜,但是渗透榜、生态榜。当全世界每周一半的AI对话发生在中国这边的时候,”中国AI还在追赶”这句话,已经过期很久了。

或许该换一种说法——追赶的,是另一边。

---

**AI加速观察** | 明天见。上一篇文章《喊”慢点跑”的四个人,被告了》是这一篇的天然上下文——昨天写”该不该跑”,今天写”已经在跑”。

相关学习资料