夜雨聆风学习资料网

ARTICLE · 1035166

推理成本两年降 99.4%: AI 的钱,正在从发布会流向地下室

推理成本两年降 99.4%: AI 的钱,正在从发布会流向地下室

深度产业观察 · 第 019 期

当模型趋同,真正的分层藏在 Tokenizer、算子和评估体系里

先看两个数字。

第一个:过去两年,AI 推理成本累计下降了约 99.4%——李开复 2026 年的公开表述。相当于一辆 25 万元的轿车,两年后只卖 1500 元。2026 年 9 月初,Silicon Data 的 LLM Token 支出指数(彭博代码 SDLLMTK)首次跌破每百万 Token 1 美元,创该指数发布以来最低纪录——这个价格已不到今夏高点的一半,仅 7 天内又跌了 8.6%。

第二个:2026 年上半年,微软、亚马逊、谷歌、Meta 四家合计资本开支指引约 7250 亿美元,比 2025 年的 4100 亿涨了 77%——《金融时报》称之为科技行业史上最大的单年基建投入。

而同一时间,一批调 OpenAI 接口做产品的"套壳"公司正在批量关门。史上最猛的资本下注,和创业公司的集体阵亡,同时在发生。

这两个数字拼在一起,指向一个残酷却极少被点透的真相:表层模型能力已经无限趋近同质化,真正拉开企业、团队、国家梯队差距的,是看不见的底层全链路工程主权。

这篇文章不谈发布会,只谈地下室——那条从分词器到智能体自闭环的六层链路,每一层是什么、为什么是壁垒、以及 2026 年的最新证据。

"你在用别人的 Tokenizer、别人的架构、别人的算子。你做的所有创新,都是寄生式创新。红利来时你喝汤,周期一来你最先出局。"

01 效果通胀期:所有人的模型,都越来越像

今天随便拉出十几家公司的通用大模型:对话流畅度、逻辑能力、多模态表现,普通用户几乎分辨不出差异。行业进入残酷的"效果通胀期"——多加千亿参数体感微乎其微,多加万亿语料边际递减,多加对齐轮次很难拉开代差。

价格是最诚实的信号。2024 年初,主流大模型 API 定价普遍在每百万 Token 几十元到上百元;OpenAI GPT-4 时代输入 72 美元、输出高达 217 美元。转折点是 2024 年 5 月 DeepSeek 的第二代 MoE——输入 1 元、输出 2 元,约为 GPT-4 的百分之一,17 天内 7 家企业 21 款模型密集跟进。

真正的雪崩在 2026 年上半年:国内行业六轮降价,累计降幅超过此前两年总和。阿里云通义千问 API 输入价格直降 97%,腾讯混元直接免费,小米 API 系列降幅最高达 99%。到 6 月,主流头部模型全线落至每百万 Token 0.3 元—6.5 元区间,部分高频场景进入厘级计价时代。DeepSeek V4-Pro 的缓存命中输入价低至 0.025 元/百万 Token——全球新低。海外同样失守:GPT-5.6 两款模型 7 月底降价,OpenAI 2026 年预计亏损约 140 亿美元,约为 2025 年的三倍。

当能力趋同、价格击穿地板,调用 API 的"表层优势"三个月就会被同行抹平。MIT NANDA 项目那份著名的报告给过一组冷数据:企业在生成式 AI 上投入的 300—400 亿美元里,95% 的试点项目对利润表没有产生任何可衡量的影响,真正跑出商业价值的只有 5%。

阵亡名单也在变长:Builder.ai(估值 15 亿美元,2025 年 5 月破产,烧掉 4.45 亿)、Jasper(估值从 15 亿缩水至 12 亿,营收从 1.2 亿腰斩至 5500 万)、Character.AI(创始团队回流谷歌)、Adept(被亚马逊整体收编)。投资圈 2026 年已经有了一条新铁律:"如果 OpenAI 或 Anthropic 一次更新就能杀死你,你已经躺在墓地里了。"

S&P Global 的统计更直接:约 42% 的企业 AI 项目未能达成目标,或关闭、或被大平台吸收。原因高度集中——没有自有数据,没有深度工作流绑定,大模型一升级,整个产品就被收编。

02 真正的壁垒:六层看不见的地下室

顶级团队和普通团队的差距,不在 Demo,而在端到端可控性。真正的底层 AI 能力,是一条完整、闭环、不可外包的链路:从零分词 → 从零架构 → 手写算子 → 分布式训练 → 数据治理与 Scaling Law → 多范式对齐 → 可验证评估与 Agent 自迭代。逐层拆开。

第一层:Tokenizer(语言的母语系统)

很多团队一辈子没自己训过分词器。用通用 BPE、通用词表看似省事,实则先天残疾:通用词表不贴合垂直语料,专业词汇切分错乱、token 浪费严重、上下文有效信息密度天生偏低。Tokenizer 是模型的母语——母语不对,后面所有训练、对齐、推理全部事倍功半。能根据自有业务语料训练专属 BPE、自定义特殊符与编解码逻辑,本身就是第一道筛选门槛。

第二层:Transformer 架构的原生掌控

绝大多数团队只会调用现成架构。但真正的差异来自细节的原生把控:自定义 RMSNorm 归一化逻辑、手写 RoPE 旋转位置编码、自研 GQA 分组注意力配比、重构 SwiGLU 激活链路。能从零搭建 0.1B、1B、10B 完整基座,才拥有架构级改造权——不会原生搭建,永远只能"微调别人的孩子"。

第三层:手写 Kernel,算力效率的终极护城河

这是六层里数据最硬的一层。AI 成本战争早已不是卡多卡少,而是算子效率。GEMM(矩阵乘法)占 Transformer 计算量的 80%—95%,通用库(cuBLAS、Transformer Engine)不为 LLM 的瘦长矩阵、MoE 分组矩阵和 FP8 场景做极致优化。DeepSeek 的答案是自己写:FlashMLA 在 H800 上做到 3000 GB/s 内存带宽吞吐、580 TFLOPS 算力吞吐——官方称之为"bandwidth-limited 下近乎疯狂的效率";DeepGEMM 的 FP8 矩阵乘做到 1350+ TFLOPS(2025 年 4 月更新后 1550);DeepEP 解决 MoE 专家路由通信。结果是:671B 参数模型用 2048 张算力受限的 H800 训练完成,成本压到同级闭源模型的零头。2025 年 2 月开源周,五套生产级 kernel 库五天放出,FlashMLA 六小时拿下 5000 star。未来 AI 的成本优势,全部来自算子级别的自研红利——这是任何外包、任何开源都给不了的底层能力。

第四层:数据治理与 Scaling Law 科学训练

外行堆数据,内行拟合规律、外推最优解。工业化训练是一套科学体系:脏数据全链路清洗、去重、熵过滤、质量打分、PPL 筛选,严格隔离训练集验证集,多尺寸模型缩放实验,拟合 Scaling Law 曲线,外推最优参数量与 Token 预算。普通团队凭感觉训练、凭经验调参、凭运气收敛;顶级团队用数学控制模型成长规律。能外推模型天花板的人,才配定义模型迭代节奏。

第五层:对齐范式的对照实验能力

绝大多数团队只会一套 SFT。真正的对齐工业化是三套范式对照闭环:SFT 规整基础能力、DPO 收敛偏好与语感、RLVR 突破可验证的客观推理与数理能力。在同一基座、同一超参、同一数据量级下做严格消融对照,才能看懂哪种范式提升哪类能力、哪种范式存在缺陷、哪种范式会坍塌。能做对照实验才叫科研,只会套脚本只能叫调参工人。

第六层:可验证评估 + Agent Self-Judge 自迭代

AI 已告别"肉眼测评时代"。下一代壁垒来自两件事:可量化、可复现的 Harness 评估体系;以及长程 Agent 输出→自检→纠错→迭代的自我进化闭环。普通模型输出答案即结束,高级智能体在自己的循环里持续变强。这是未来三年拉开 AI 智商差距的终极分水岭。

"普通团队靠模型套利,顶级团队靠体系进化。每一层都是壁垒,每一环都是别人无法快速复刻的工程复利。"

03 底层主权的 2026 年证据:开源不是放弃主权,是主权的放大器

有人会问:都开源了,还谈什么主权?2026 年的数据恰恰给出反例——开源是主权者打出的信号弹,不是遮羞布。

8 月 14 日 Hugging Face 发布的开放模型报告:千问 Qwen 系列仅今年在 HF 上下载就达 20.45 亿次,是谷歌(4.18 亿)的 4.9 倍、Meta(2.27 亿)的 9 倍;全球累计下载突破 30 亿次,成为全球下载量第一的开源模型家族。更关键的是衍生模型数:Hugging Face 上 Qwen 衍生模型 15.1 万个——是 Meta 的 2.6 倍、Llama 系列的 4.7 倍;阿里口径的全球衍生模型超 30 万个,2026 年前七个月每天新增 180—210 个。HF 的结论是:Qwen 已经成为开发者微调和部署时"默认工作流"的一部分。

另一个结构性事实:2026 年中国 200 亿参数以上的开源模型 81% 采用 Apache 2.0 或 MIT 宽松协议,同类美国模型只有 29%。中国开源模型占 HF 过去一年下载量的 41%。资本的反应同样诚实:2026 上半年 AI 吸走了全球风投的 53%—81%,但钱几乎全部流向基础模型和基础设施层——OpenAI 二月那轮 1100 亿美元、Anthropic 300 亿美元 G 轮、xAI 200 亿——应用层和水平套壳公司在抢剩下的零头,且风投已基本停发"thin wrapper"的支票。

拆开看,逻辑很清楚:DeepSeek 用"前沿能力 + MIT 协议 + 极致低价"做闭源平替,Qwen 用"全尺寸谱系 + Apache 2.0"做开发者底座——两者都是先把底层链路做到极致,再用开源把生态变成自己的护城河。模型家族愈完整,愈容易形成自我强化的生态系:更多开发者采用 → 更多衍生版本 → 更多新使用者。后来者不仅要追赶模型能力,还要说服整个工具链重新适配。

Gartner 把"主权 AI(Sovereign AI)"列入 2026 年十大战略技术趋势——AI 正在沿着地缘断层线分裂成多套并行体系。国家层面的主权是国家算力与数据治理,企业层面的主权就是那条六层链路。同一个词,两层含义。

04 一盆必要的冷水:主权不等于人人从零造模型

原稿有一层意思容易被误读成"不懂底层就是寄生,必须人人从零造模型"。这个推论需要修正,否则会误导一大批该活下来的团队。

第一,底层主权的最反直觉之处,恰恰是 DeepSeek 自己把 kernel 全开源了。它有底气开源,是因为这些能力长在它自己的体系里、由它定义迭代节奏。开源的是代码,主权在于"下一代 FlashMLA 由谁写"。能力的所有权和代码的可见性是两回事。

第二,生态是分层的,主权也有三种形态。红杉资本合伙人 Julien Bek 今年 3 月那篇《Services: The New Software》给过一个数:企业每在软件上花 1 美元,就要在使用软件的专业服务上花 6 美元——真正的机会不是 Copilot 卖工具,而是 Autopilot 卖成果。Bessemer 观察到活下来的公司共同特征是"Insider DNA":创始人要么本身是行业里的人,要么对目标工作流做过极深研究,且都有基于使用的数据飞轮。对大多数团队,现实的主权形态是垂直专有数据 + 深度流程绑定 + 高切换成本,而非底层算子。

第三,约束条件决定路径。美国走 CapEx 过剩的军备竞赛,中国芯片受限、算力稀缺,反而从第一天就得算清账——DeepSeek 的效率冲击不是偶然,是约束倒逼出来的。Gartner 中国区判断:中国 AI 正从"尝鲜期"进入"价值兑现期",到 2027 年优先做好"AI 就绪数据"的企业,业务价值将是同行的两倍。

所以那句更准确的表述是:要么在六层地下室里持有至少一层,要么在六层之上拥有别人拿不走的数据与工作流。两头都不占,才是真正的寄生。

05 结语:表层内卷落幕,底层主权决胜

2026 年行业存在巨大的认知错位:无数团队还在卷界面美化、插件、场景包装、营销话术;而真正的产业红利、技术主权、长期壁垒,全部沉淀在底层工程。应用可以复制,场景可以抄袭,话术可以模仿;端到端的底层工程能力,需要一年、两年、三年的复利沉淀。

这就是为什么同样做 AI,有人越做越焦虑、越做越内卷,有人越做越深厚、越做越不可替代。焦虑的人在抢流量、抢红利、抢表层机会;笃定的人在建体系、建壁垒、建底层主权。

历史上最贴切的类比不是 2000 年的.com(那批公司崩盘后什么都没留下),而是 19 世纪的铁路狂热和 2000 年前后的光纤过剩:铺光纤的人亏了,赚到钱的是后来用光纤的人。这一轮 7250 亿美元的基建,本质上在替未来三到五年把算力成本提前打下来。泡沫破裂从来不是财富消失,是财富转移——从建铁轨的人,转向用铁轨的人;而在 AI,从喊故事的人,转向写算子的人。

未来三年,表层内卷落幕,底层主权决胜。流量是短暂的,应用是脆弱的,红利是周期的;只有底层工程体系,是穿越周期的真正资产。

相关学习资料