
文|刘雪峰
本篇报告我们将从五个维度分析大模型商业化进展及投资机会:(1)模型能力维度:聚焦中美模型能力差距、国产模型能力追赶及推理成本下降;(2)Token 调用维度:观察海内外模型是否真正被真实高频使用;(3)ARR 兑现维度:分析模型使用能否转化为持续收入;(4)入口价值维度:关注 AI 产品从用户触达到生态嵌入的商业化空间;(5)厂商路径维度:比较不同厂商从模型能力到商业增长的转化方式。
1.模型能力维度:国产模型加速追赶,低成本推理打开 Token 放量空间。从能力端看,中美头部模型差距仍在,但国产模型正在快速追赶。从成本端看,硬件升级、模型架构优化、系统工程改进和 workload 适配共同推动推理成本下降。
2.Token 调用维度:调用量高增反映模型能力正在被真实使用。海外方面,全球开发者/API 生态中的模型调用需求持续释放。国内方面,2026 年 3 月我国日均 Token 调用量突破 140 万亿;2025 年下半年企业级大模型日均调用量达 37 万亿 tokens,豆包大模型日均 Token 使用量在 2026 年 3 月已突破 120 万亿,较年初水平继续翻倍。
3.ARR 兑现维度:海外头部率先形成大规模收入,国内厂商仍处于较小收入体量阶段,但增长弹性更高。OpenAI 2026 年 2 月 ARR 已超 US$25bn,Anthropic 2026 年 5 月 ARR 已超 US$47bn,说明模型能力正在转化为真实收入。
4.入口价值维度:用户触达是起点,生态嵌入决定长期价值。ChatGPT 周活跃用户已超 9 亿,Gemini App 月活跃用户超 9 亿,豆包在国内 AI 原生 App 中位居前列。随着 AI 能力从独立 App 走向原有生态,入口价值将进一步从用户触达转向场景嵌入,并为后续订阅、广告、电商、企业服务和平台服务等商业化转化提供基础。
5.厂商路径维度:中美 AI 厂商商业化路径分化,收入体量、增速和估值逻辑各有差异。技术能力仍是最基础,商业化能力是放大器,总体看,行业价值有望向具备较强模型能力、低成本推理能力、调用规模、应用闭环、企业服务能力和生态入口的厂商集中。
投资建议:建议关注①模型及 AI 平台厂商;②AI+数据工具;③AI+Coding/Agent;④AI+办公、财税和企业管理软件;⑤AI+垂域软件。
风险提示
模型技术迭代不及预期风险;算力供应及外部环境风险;商业化兑现不及预期风险。
投资要点
本篇报告我们将从五个维度分析大模型商业化进展及投资机会:(1)模型能力维度:聚焦中美模型能力差距、国产模型能力追赶及推理成本下降;(2)Token 调用维度:观察海内外模型是否真正被真实高频使用;(3)ARR 兑现维度:分析模型使用能否转化为持续收入;(4)入口价值维度:关注 AI 产品从用户触达到生态嵌入的商业化空间;(5)厂商路径维度:比较不同厂商从模型能力到商业增长的转化方式。
模型能力维度:国产模型加速追赶,低成本推理打开 Token 放量空间
1.从能力端看,中美头部模型差距仍在,但国产模型正在快速追赶。DeepSeek、Qwen、Kimi、智谱、MiniMax 等厂商在推理、代码、长上下文、Agent 和多模态能力上持续迭代,国产模型已逐步进入全球前沿梯队。
2.从成本端看,硬件升级、模型架构优化、系统工程改进和 workload 适配共同推动推理成本下降。硬件升级提升吞吐和能效,MoE、长上下文压缩、KV cache 优化等降低单 Token 计算与显存开销,batching、动态调度、prompt caching 和模型路由提升实际交付效率,共同推动单位 Token成本下行。
3.能力提升与成本下降形成正向循环,有望加速 Agent、AI Coding 及企业流程类应用走向规模化应用。
Token 调用维度:观察模型能力从技术指标走向真实应用、并进一步转化为商业收入的重要中间变量
1. 对于模型厂商而言,只有当模型能力从展示走向真实调用,才有可能进一步沉淀为用户粘性,并转化为持续收入增长。
2. 海外开发者/API 生态中,OpenRouter 平台周度 Token 调用量由 2025 年 5 月约 2.29T 提升至 2026 年 5 月约 28.3T,规模达十倍以上,反映模型调用正在从测试验证走向规模化使用。
3. 国内推理需求同样快速释放。2024 年初我国日均 Token 调用量约 1000 亿,至 2025 年底提升至 100 万亿,并于 2026 年 3 月进一步突破 140 万亿。豆包大模型日均 Token 使用量在 2026 年 3 月已突破 120 万亿,较年初水平继续翻倍。
ARR 兑现维度:海外头部率先形成大规模收入,国内厂商进入小基数高增阶段
1.OpenAI、Anthropic 已率先进入百亿美元级 ARR/年化收入阶段。OpenAI 2026 年 2 月 ARR 已超 US$25bn,Anthropic 2026 年 5 月 ARR 已超 US$47bn,说明模型能力正在转化为真实收入。
2.国内厂商仍处于较小收入体量阶段,但增长弹性更高。智谱 2026 年 3 月 MaaS/API ARR 约 17 亿元人民币,过去 12 个月约 60 倍增长;MiniMax 2026 年 2 月公司级 ARR 超 US$150mn。
3.应用端商业化正在向高频工作流入口扩散,AI Coding 是首个跑出规模化 ARR 的场景,办公和多模态等泛生产力场景有望接力成为重要的应用落地方向。
入口价值维度:用户触达是起点,生态嵌入决定长期价值
1.ChatGPT、Gemini、豆包等产品已经形成较大用户入口。ChatGPT 周活跃用户已超 9 亿,Gemini App 月活跃用户超 9 亿,豆包在国内 AI 原生 App 中位居前列。
2.在完成初步用户触达后,AI 入口价值能否进一步提升,关键在于其是否能够形成持续高频使用,或嵌入用户原本已高频使用的产品和任务流。海外 Google 将 Gemini 嵌入搜索、Workspace、Android 和 Google Cloud;国内豆包、千问、元宝等产品则通过内容、办公、社交、电商和云平台场景建立超级 APP 入口。
3.随着 AI 能力从独立 App 走向原有生态,入口价值将进一步从用户触达转向场景嵌入,并为后续订阅、广告、电商、企业服务和平台服务等商业化转化提供基础。
厂商路径维度:中美 AI 厂商路径分化,技术能力仍是最基础,商业化能力是放大器1.未来决定竞争格局的关键不仅在于模型能力本身,更在于厂商能否通过入口、生态与客户资源推动模型广泛落地,并将模型调用持续转化为收入增长。
2. 基于资源禀赋和战略定位的差异,不同厂商正沿着模型、应用和平台等路径探索各自的 AI商业化模式。
投资建议:
国产及海外大模型能力持续提升、推理成本快速下降,正在推动 AI 应用逐步走向场景落地。具备模型能力、应用入口、客户基础和数据沉淀的公司,有望在这一轮 AI 应用落地过程中率先受益。
模型层,建议重点关注具备前沿模型能力、高推理效率和商业化承接能力的厂商。对于模型厂商,后续应重点观察真实调用、客户转化、收入兑现和盈利质量,核心指标包括 Token 调用量、企业客户数量、C 端付费转化、API/开放平台收入、ARR 增长以及单位Token 成本等,而不应仅以单次模型评测排名作为判断依据。
应用层,建议重点关注贴近真实业务流程、ROI 更容易衡量的 AI 软件公司。同时,企业私有数据和专业工作流的价值有望被 AI 重新定价。具备行业数据、客户入口和实施能力的软件公司,可能不仅是模型能力的使用方,也会成为 AI 落地过程中的关键承接方。
一、模型能力:国产模型加速追赶,低成本推理打开 Token 放量空间
随着模型能力持续提升、推理成本快速下降,大模型正加速迈向规模化商业落地。从能力端看,今年以来,中美厂商模型能力差距持续收窄,国产大模型逐步跻身全球前沿梯队;从成本端看,受益于硬件性能提升、模型架构优化和系统工程改进,推理成本不断下探,进一步打开 Token 放量空间。能力提升与成本下降形成正向循环,有望加速 Agent、AI Coding 及企业流程类应用走向规模化应用。
(一)国产模型追赶加速,已位居全球前沿梯队
从全球模型竞争格局看,中美头部模型差距仍在,国产模型加速追赶。DeepSeek 在 V4 技术报告中对自身前沿位置作出判断:DeepSeek-V4-Pro 在标准推理基准上已优于 GPT-5.2 和 Gemini-3.0-Pro,但仍落后于GPT-5.4 和 Gemini-3.1-Pro,即大约落后最前沿模型 3-6 个月。根据Stanford 2026 AI Index 数据,截至 2026 年 3 月,美国的顶级模型相对中国顶级模型的领先幅度仅为 2.7%。此外,从 Artificial Analysis 前沿语言模型能力指数看,2022–2023 年美国模型长期占据全球领先位置;但自2024 年以来,中国模型能力曲线快速抬升,并在 2025 年后进一步逼近美国前沿模型区间。整体来看,尽管美国模型仍处于全球最高能力带,但中国模型已成为全球前沿梯队中持续活跃、快速追赶且具备竞争力的重要力量。


美国头部厂商仍在闭源旗舰模型、产品化闭环和全球开发者工具链上具备优势。根据 Stanford 2026 AI Index,2025 年美国机构共推出 59 个 notable AI models,中国为 35 个;但从趋势看,领先倍数已由 2024 年的约2.7 倍(40/15)收窄至 2025 年的约1.7 倍(59/35),中国模型供给数量提升更快。除模型本身外,美国厂商的优势进一步延伸至产品闭环与开发者生态:OpenAI围绕 ChatGPT、API 与企业级产品构建起覆盖个人用户、开发者和企业客户的商业化体系;Anthropic 通过 Claude Code在 Agentic Coding 和企业级应用场景中形成较强产品化能力;Google 则凭借 Gemini API、AI Studio、Android、Workspace 和 Google Cloud 生态,将模型能力深度嵌入开发工具、操作系统和生产力软件之中。
国产模型厂商则在高性价比推理和开源生态扩散上形成差异化优势。中国模型在能力快速追赶的同时,正通过更低推理成本提升开发者调用和应用落地的经济性。缓存未命中情况下,DeepSeek-V4-Pro 当前每百万输入 / 输出 Token 价格分别为 0.435 / 0.87 美元,显著低于 OpenAI GPT-5.5 的 5 / 30 美元,以及 Anthropic Claude Opus 4.8 的 5 / 25 美元。考虑到海外厂商同样布局低价模型,国内厂商的优势并非简单体现为低价,而是在高能力模型的成本效率维度更为突出。开源扩散方面,Hugging Face 2026 年春季开源生态报告显示,2025 年 Hugging Face 用户数达到 1300 万,公开模型数量超过 200 万个;其中,中国模型在过去一年快速成为下载量主力,约占总下载量的 41%,并在月度下载量和累计下载量上超过美国模型。此外,根据阿里云官方公众号,2026年1月21日,Qwen在Hugging Face上的衍生模型数突破20万个,成为全球首个达成此目标的开源大模型,同时下载量突破10亿次,反映出国产开源模型在全球开发者生态中的影响力正在快速提升。


(二)推理COGS :每百万 Token 成本的拆解
低成本推理是 Token 大规模放量的前提。以每百万 Token 的推理 COGS 衡量,单位成本可以近似表示为:

其中,表示推理服务集群在单位时间内消耗的总服务成本。若仅考虑 GPU 成本,则可以进一步写为:,表示服务所需 GPU 数量,表示单张 GPU 的小时成本。若从完整 COGS 角度衡量,还应进一步纳入 CPU、内存、网络、存储、电力、机房、调度冗余和运维等配套成本。
分母中表示系统在给定 Workload 和 SLA 约束下,实际稳定交付的总吞吐量,即 aggregate tokens/sec。这里的吞吐并非理论峰值吞吐或单卡吞吐(TPS),而是在真实线上服务条件下,扣除调度损耗、batch不满、负载波动、显存约束和延迟约束之后,系统实际能够交付给用户的 Token 产出速度。
因此,推理降本本质上可以从两个方向理解:一方面,降低单位时间内的算力成本,即降低;另一方面,提高单位时间内可交付的 Token 数量,即提升。进一步看,真正决定单位经济性的并不是绝对 GPU 数量,而是每个 Token 消耗的有效 GPU 时间,也就是 GPU-seconds/token。若 GPU 数量增加的同时吞吐量同比提升,单位 Token 成本未必上升;反之,若受显存、通信、调度、batching或 SLA 约束影响,吞吐无法随 GPU 数量线性扩展,则单位成本会恶化。
沿着“降低分子、放大分母”的思路继续拆解,影响这一公式的变量可以归纳为四类:硬件、模型架构、系统工程,以及 Workload/SLA 约束。其中前三者更多决定供给侧效率,Workload/SLA 则决定真实服务场景下有效吞吐能否接近理论吞吐。
第一,硬件因素决定“每秒能烧多少钱、单步能跑多快”,包括 GPU 小时价格、算力性能、显存容量、显存带宽、互联带宽、电力成本以及集群利用率。更高性能或更低单价的硬件,可以降低单位时间成本,或者在相同成本下提高可交付吞吐。
仅从理论算力或每美元 FLOPS 看,Blackwell 相比 Hopper 的提升并不能完全解释推理成本的大幅下降;真正的变化在于面向大模型推理负载的系统级优化。在特定低延迟 Agentic AI / Coding Assistant workload 下,以 GB300 NVL72 与 HGX H200 对比,Blackwell 每 GPU 每秒 Token 产出约为 Hopper 的 65 倍,每兆瓦 Token 产出提升至 50 倍以上,带动每百万 Token 成本由约 4.20 美元降至 0.12 美元,约为原来的 1/35。由此可见,新一代硬件的价值不只体现在理论算力提升,更体现在面向大模型推理负载的系统级吞吐、能效和部署效率优化,进而显著摊薄单位 Token 成本,为模型调用规模化和 Agent、AI Coding 等高频推理应用放量奠定了基础。
(数据来源:英伟达官网)

第二,模型架构。包括参数规模、激活参数量、注意力机制、上下文长度、KV cache 占用、量化方式、MoE 架构和蒸馏等。模型架构直接决定每个 Token 所需的计算量、显存占用和通信开销,是影响推理成本的核心变量。MoE 架构通过只激活部分专家参数,在扩大模型总容量的同时控制单次计算开销;GQA/MLA、KV cache 压缩等方法则主要降低长上下文场景中的缓存和显存压力,使模型在处理长文档、多轮对话和代码库时更高效。量化、蒸馏以及推测解码等方法进一步从模型压缩和生成方式上提升效率,让模型以更低成本完成相近任务。
例如,DeepSeek-V4 面向长上下文推理引入混合注意力机制,通过token-wise compression、Compressed Sparse Attention 和 Heavily Compressed Attention 对历史上下文进行压缩与稀疏化处理,从计算量和缓存占用两个维度降低推理成本。在 1M-token context 场景下,DeepSeek-V4-Pro 相比 DeepSeek-V3.2 仅需约 27% 的单 Token 推理 FLOPs,说明其在生成下一个 Token 时所需计算量明显下降;同时,其 KV cache 占用约降至 DeepSeek-V3.2 的 10%,反映了长上下文推理中的显存和缓存压力也被显著压缩。由此可见,DeepSeek-V4 的架构优化对长文档、多轮对话、代码库理解和 Agent 任务的推理成本具有直接影响。

第三,系统工程决定“理论吞吐能兑现多少”,包括batching、动态调度、prefix / prompt caching、KV cache 管理等。系统工程优化的核心作用,是在不牺牲 SLA 的前提下提高 GPU 利用率和实际交付吞吐,从而摊薄单位 Token 成本。OpenAI、Anthropic 等厂商应用的 prompt caching 就是典型例子:对于重复出现的系统提示、长文档、代码上下文等内容,服务端可以复用此前已经处理过的前缀,从而减少重复计算。OpenAI 早期披露开发者可通过复用近期输入 tokens 获得 50% 折扣,当前官方文档进一步显示 Prompt Caching 可将输入 token 成本最高降低 90%;Anthropic 则将 cache read tokens 定价为基础输入价格的 10%。
第四,Workload/SLA 决定“成本优化能否真实落地”。Workload/SLA 即业务请求形态和服务质量要求对推理系统的限制,包括输入长度、输出长度、并发请求数、请求到达分布、首 Token 延迟、单 Token 生成延迟和流式输出要求等。相同模型和硬件下,不同 Workload 的推理成本可能差异很大,长上下文、多轮对话、RAG、Agent 和 AI Coding 等任务通常同时具备长输入、多轮调用和长输出的特征,因此单任务 Token 消耗更高,KV cache 对显存容量和带宽的压力也更明显;但由于系统提示、工具定义、代码库背景等内容经常重复,也更容易通过缓存复用、模型路由和批处理降低边际成本。
越严格的低延迟 SLA,通常意味着越低的 batch 效率和越高的冗余资源需求,从而推高单位 Token 成本。Databricks 的工程测试显示,在 A100 上将 batch size 提高到 64 可以带来约 14 倍吞吐提升,但请求延迟也会上升约 4 倍,说明吞吐提升通常伴随延迟代价。

当前,推理降本正在硬件、模型架构、系统工程和负载适配四个层面同时推进,并已在模型 API 价格中有所体现。Artificial Analysis 2025 年末报告指出,模型能力与调用成本之间的关系持续改善——企业既可以在相同预算下调用更强模型,也可以以更低成本获得接近此前前沿模型的能力。以 2025 年初 o1 级智能水平为参照,对应模型的blended token 价格已下降约 128 倍。其最新实时榜单进一步显示,这一趋势仍在延续。o1 在 Artificial Analysis Intelligence Index 上约为 31 分,输入和输出价格分别为 15 美元/百万 Token 和 60 美元/百万 Token;而截至 2026 年 5 月,得分处于 31–33 区间、接近或略高于 o1 水平的部分模型,其第三方调用blended token 价格已降至约 0.11–0.20 美元/百万 Token 区间,表明在同等或相近能力水平下,模型调用成本正在快速下行。

模型厂商构建了多层次模型体系,通过不同模型档位覆盖差异化场景降低平均调用成本。以 Google 为例,Gemini 3.1 Flash-Lite 定价为 0.25 美元/百万输入 Token、1.50 美元/百万输出 Token,明显低于 Gemini 3.1 Pro 在短上下文下的 2.00 美元/百万输入 Token、12.00 美元/百万输出 Token,官方定位也更偏向高吞吐、成本敏感场景。OpenAI的价格梯度同样明显:对于成本敏感型、多步骤、可异步拆解任务,在 Batch/Flex 模式下,gpt-5.5 短上下文输入和输出价格分别为 2.50 美元和 15.00 美元/百万 Token,而 gpt-5.4-nano 分别仅为 0.10 美元和 0.625 美元/百万 Token。模型分层后,使用者不必在所有环节都调用最高价模型,而可以通过模型路由,将复杂推理、代码生成、长链路规划等高难度任务交给旗舰模型,将分类、抽取、改写、简单问答、结构化生成等标准化或重复性环节交给轻量模型处理,从而在保证效果的同时显著降低整体调用成本。
此外,近期国内模型厂商的 API 调价也体现出成本效率优化和调用门槛下降的趋势。2026 年 5 月,DeepSeek 宣布 DeepSeek-V4-Pro 在限时优惠结束后将永久调整为原定价的 1/4;随后小米 MiMo-V2.5 系列也宣布 API 永久降价,最高降幅达 99%,并取消按上下文窗口长度区分定价的方式,同等付费价格下 Token 用量可提升至原来的 5–8 倍。随着模型效率、推理工程和国产算力生态持续优化,国产模型有望以更低成本承接高频、标准化和多轮调用任务,进一步降低应用侧调用门槛。

二、Token调用量:模型能力是否被真实使用?
Token 调用量是观察模型能力从技术指标走向真实应用、并进一步转化为商业收入的重要中间变量。对于模型厂商而言,只有当模型能力从展示走向真实调用,才有可能进一步沉淀为用户粘性,并转化为持续收入增长。海外头部厂商方面,OpenAI 披露其 API 每分钟处理量已突破 150 亿 tokens,Google 则披露其 API 每分钟处理约 190 亿 tokens,表明模型调用正进入高频需求阶段。但需注意的是,Token 调用量本身并不等同于收入质量,仍需结合调用价格、免费流量占比、内部调用占比、缓存命中率、推理成本等指标综合判断。
基于此,下文将从两个维度观察 Token 趋势:首先,通过 OpenRouter 周度数据,观察全球开发者及 API 生态中的模型调用迁移,但需注意 OpenRouter数据代表平台样本,并不等同于全球模型调用总量;其次,通过全国日均 Token 数据和企业级 Token 数据,观察中国大模型调用总量的扩张,并结合豆包等典型厂商的 Token 数据观察国内 AI 应用与云平台的实际使用强度。
(一)全球:以 OpenRouter 等第三方 API 聚合平台为窗口观察开发者/API 生态
API 调用情况能够相对直接地反映模型是否被嵌入真实应用和工作流。OpenRouter 作为第三方模型聚合平台,接入 OpenAI、Anthropic、Google、DeepSeek、Qwen等多家模型厂商,开发者可以在同一平台上选择不同模型,因此其周度 Token 数据适合观察全球开发者/API 生态中的模型偏好、价格敏感度和调用迁移情况。其优势在于频率高、口径相对可比,能够捕捉模型发布、能力提升或价格调整后的边际变化;但局限也较明显,即不覆盖头部厂商自有应用、官方 API、企业私有化和本地部署等完整流量。因此,OpenRouter更适合用于观察第三方开发者生态中的真实调用变化,而不宜简单等同于各模型的全渠道调用规模或市场份额。

过去一年中,OpenRouter 平台周度 Token 调用量已经实现数量级增长。2025 年 5 月平台周度调用量均值约为 2.29T tokens,2026 年 5 月已提升至 28.3T,规模达去年同期十倍以上。
从厂商结构看,OpenRouter 调用结构正在由海外头部集中走向多元化。2025 年 5 月,平台调用主要集中在 Google、OpenAI、Anthropic,三者合计占比超过 60%;到 2026 年 5 月,Google、OpenAI、Anthropic 合计调用占比降至约 15%。OpenRouter 数据作为第三方 API 平台样本,虽然不能直接等同于全球模型市场份额,但能够较好反映开发者生态中模型调用迁移和多模型共存的趋势。在这一变化中,国内模型已成为调用增长的重要力量:DeepSeek、Kimi、Qwen、GLM、MiniMax等模型陆续进入高调用区间,说明国产模型不仅在能力上持续追赶,也开始在全球开发者 API 生态中获得真实调用。
调用迁移受到由能力、价格、稳定性、免费预览策略、上下文长度和应用适配成本等因素共同影响。从截至2026年6月7日一周的 OpenRouter 榜单看,DeepSeek V4 Flash调用量位居第一,DeepSeek V4 Pro、V3.2 也同样进入 Top 10,说明 DeepSeek 新旧模型在真实工作流中仍有并行使用:一方面旗舰新模型承接能力升级需求,另一方面 V3.2 等旧主力模型仍凭借价格、稳定性或适配成本优势保留调用量,新模型发布并不必然带来对旧模型的线性替代。腾讯 Hy3 preview、小米 MiMo-V2.5 分别位列第二、第三,反映长上下文、生产力任务能力及预览/低价策略对开发者试用仍具吸引力。MiniMax M3 于 6 月 1 日发布后即进入周榜第四,显示开发者对国产新模型保持较高关注。Anthropic 方面,Claude Sonnet 4.6、Claude Opus 4.7、Claude Opus 4.8 均位居 Top 10,体现其在代码、复杂推理、文档处理和企业工作流中的开发者信任度仍较强。

(二)中国:日均 Token 与典型应用数据反映国内推理需求提升
国内大模型推理需求已进入快速放量阶段,最直接的验证来自全国日均 Token 调用量的持续攀升。根据国家数据局披露,2025 年我国全年 Token 调用量约为 21,100 万亿。从日度调用频次看,2024 年初我国日均 Token 调用量约为 1,000 亿,至 2025 年底已提升至 100 万亿,并在 2026 年 3 月进一步突破 140 万亿。两年时间内,日均 Token 调用量增长超过千倍;仅 2026 年一季度,较 2025 年底的增幅即超过 40%,显示出国内大模型推理需求正在加速释放。

企业级调用是国内 Token 增长的重要来源。沙利文数据显示,2025 年上半年,中国企业级大模型日均调用量已超过 10 万亿 tokens,较 2024 年下半年增长 363%;2025 年下半年进一步提升至 37.0 万亿 tokens,较上半年增长 263%,企业侧推理需求呈现加速释放态势。分厂商看,2025 年下半年中国企业级大模型日均 tokens 消耗前三名分别为千问、豆包和 DeepSeek,占比分别为 32.1%、21.3% 和 18.4%,合计占比超过七成,头部模型在企业级调用市场中的集中度进一步凸显。

从具体厂商表现看,豆包 Token 使用量的快速增长,进一步提供了微观数据验证。豆包大模型日均 Token 使用量在 2026 年 3 月已突破 120 万亿,较年初水平继续翻倍,较 2024 年 5 月首次发布时增长约 1,000 倍。同期,火山引擎上累计 Token 使用量超过一万亿的企业客户数量,也由 2025 年底的 100 家增至 140 家。以上数据表明了豆包Token 调用增长并非仅来自单一 C 端入口,也与企业侧和平台侧调用扩张密切相关,反映出应用侧、企业侧与云平台侧需求共同推动模型调用量持续提升。

总结来看,伴随模型能力提升和推理成本下降,国内大模型推理需求逐步进入规模化调用阶段。Token放量已成为观察国内 AI 应用渗透和模型商业化兑现的重要指标,全国日均Token 调用量持续攀升,验证了需求总量的快速扩张;企业级调用量高增,则表明大模型正在加速向生产环境和业务系统渗透。豆包等典型厂商 Token 使用量快速增长,进一步说明当前调用扩张已不再依赖单一聊天入口,而是由应用嵌入、企业生产系统接入和平台型 API 调用共同推动。后续随着模型路由、Agent 工作流和多模态应用进一步落地,国内大模型调用量仍有望保持较快增长。
三、ARR兑现:模型使用能否兑现为商业化收入?
Token 调用量说明模型能力正在被实际使用,而 ARR 则进一步验证这种使用是否能够沉淀为持续收入,体现客户付费意愿、留存复购能力和商业化质量。当前,收入兑现率先出现在两类主体中:一类是 OpenAI、Anthropic、智谱、MiniMax等模型公司,通过 C 端订阅、API 调用和企业客户形成公司级 ARR;另一类是Cursor 等 AI 原生应用,以及 Claude Code、Codex 等模型厂商自有代码/Agent产品,将模型能力嵌入具体工作流,率先在代码、Agent 等生产力场景中实现商业化。
(一)模型端:海外头部已率先兑现,国内厂商 ARR 进入快速上升期
ARR / 年化收入是观察大模型商业化兑现的重要指标。相比 Token 调用量更侧重反映真实使用强度,ARR 进一步验证用户是否愿意为模型能力持续付费,以及模型调用能否沉淀为订阅、API、企业席位或平台服务收入。当前,OpenAI、Anthropic 等海外厂商率先形成大规模年化收入,国内模型公司则仍处于从项目制收入、应用收入向 API 调用、MaaS 平台和企业订阅等可持续收入模式迁移的验证阶段,ARR 正在快速上升。

OpenAI 的收入增长首先来自 ChatGPT 建立的高频用户入口。ChatGPT 形成了全球级用户入口和付费心智,API 与企业版产品进一步承接开发者和企业客户需求,使模型能力提升能够较直接地转化为订阅、API 调用和企业服务收入。企业级市场目前已贡献了公司 40% 以上的营收。根据公司披露,OpenAI年化收入已从 2023年约 20 亿美元提升至 2024年约 60 亿美元、2025 年超过 200 亿美元,并在 2026年继续增长;Business Times报道称,截至 2026 年 2 月底,OpenAI年化收入已超过 250 亿美元。
Anthropic 的收入更集中在企业客户、开发者和代码工作流。Claude模型在复杂推理、长文本处理和代码任务中形成了较强用户心智。根据证券时报报道,Anthropic 年化收入在 2025年 10 月已接近 70 亿美元;而在2026年5月,公司年化收入已达 470 亿美元,主要由企业产品、API调用和Claude Code 等开发者工具拉动。相比 OpenAI 更强的 C 端入口,Anthropic的收入结构更偏企业客户、API 和开发者工作流,专业场景粘性更强。

国内厂商中,智谱和MiniMax 正在形成不同的 ARR 验证路径。智谱更偏 MaaS / API 和企业服务,其 MaaS API 平台 ARR 已达到约 17 亿元人民币,过去 12 个月提升约 60 倍,反映国内企业客户对模型调用、私有化部署和行业 Agent 的需求正在形成可持续收入。MiniMax 则更偏 AI 原生应用、多模态产品和开放平台并行推进,C 端产品贡献用户入口和付费转化,API 业务 ARR 也逐步提升,带动公司级 ARR 在 2026 年初超过 1.5 亿美元。整体来看,智谱路径更偏企业级 MaaS/API 和行业服务,MiniMax 路径则更偏 C 端应用、开放平台与多模态能力的协同变现。

整体来看,国内模型公司与海外头部相比仍有明显规模差距,但在中文场景、低成本推理、开源生态和本土企业需求上具备差异化机会。随着 Token 调用量持续放大,国内厂商能否将使用强度进一步转化为稳定向上的 ARR将成为验证模型商业化质量的关键。
(二)应用端:从 AI Coding 到办公与多模态,高价值工作流场景率先兑现
应用端商业化正在向高频工作流入口扩散,AI Coding 是首个跑出规模化 ARR 的场景。与通用聊天、内容生成等场景相比,代码任务的结果更容易验证,用户能够直接感知效率提升,企业也更容易通过研发效率、交付周期和工程质量衡量 ROI。此外,AI Coding 工具既是应用层收入入口,也是底层模型调用量增长的重要放大器,因为传统代码补全更多停留在单点辅助,而 Agent 化开发会将一次需求拆解为任务规划、代码生成、文件读写、调试、测试和提交等连续步骤,显著放大了Token 消耗。
Claude Code 和 Cursor 是当前 AI Coding 商业化的典型案例。Anthropic 披露,Claude Code 年化收入已超过 25 亿美元,而公司 2026 年 2 月年化收入为 140 亿美元,Claude Code 占比为约 18%;同时,企业使用贡献了 Claude Code 超过一半的收入,说明代码 Agent 已经从个人开发者工具进入企业软件工程流程。Cursor则代表独立 AI IDE 路线,据 Bloomberg 报道,其2026 年 2 月年化收入已超过 20 亿美元,并在三个月内实现翻倍,其中企业客户贡献约 60%,表明 AI Coding 的商业化正在从个人订阅进一步扩展至企业席位和团队级采购。
Codex则体现了 OpenAI 对开发者和 Agent 工作流入口的强化,且覆盖场景正从软件开发向知识工作扩展。2026 年以来,Codex 用户规模快速放量:3 月底周活用户已超过 200 万,过去三个月增长 5 倍,使用量月环比增速保持在 70% 以上;4 月初,Codex 周活跃用户进一步提升至 300 万;OpenAI后续披露称,4 月下旬每周使用开发者已超过 400 万。到 2026 年 6 月,OpenAI 最新报告进一步披露,Codex 周活跃用户已超过 500 万;除开发者外,知识工作者已贡献约 20% 用户,且增速超过开发者的 3 倍。由此看,Codex 正在从代码生成、测试、代码审查等软件工程场景,扩展至文档处理、数据分析、邮件、跨应用协作等办公流程,成为 OpenAI 切入企业软件工程、内部数据环境和知识工作流的新入口。

办公和多模态等泛生产力场景有望接力成为代码之后重要的应用落地方向。办公场景覆盖文档、表格、会议、邮件、知识库和企业协同,用户基数更大、使用频次更高,且天然嵌入企业日常生产流程。以 Microsoft 365 Copilot 为例,微软披露其已拥有超过 2000 万个付费席位,90% 的《财富》500 强企业正在使用 Microsoft 365 Copilot,说明 AI 办公已逐步进入企业级规模部署阶段;国内亦已有 WPS AI 等办公产品形成较大用户基础,截至 2025 年末 WPS AI 国内月活用户超过 8013 万,同比增长 307%,WPS Office 全球月活设备数达 6.78 亿,亦能体现办公软件作为 AI 入口的高渗透潜力。
(数据来源:Microsoft官网,金山办公《2025 年年度报告》)
多模态场景则将模型能力从文本扩展至图像、语音、视频和实时交互,有望在内容生产、营销创意、教育培训、客服、陪伴和生产力工具中打开新的应用空间。视频生成已率先展现商业化弹性:快手公司披露,其旗下可灵 AI 2026 年一季度收入超过 6.5 亿元人民币,同比增长超 300%,2026 年 3 月 ARR 已接近 5 亿美元,较 2025 年 3 月的 1 亿美元实现约 4 倍增长。另外,据《智能涌现》,字节跳动Seedance 2.0 单模型月收入已超过 10 亿元人民币,并推动火山引擎上调 2026 年 MaaS 收入目标。
四、超级入口价值:用户触达是起点,生态嵌入决定长期价值
AI 入口是大模型厂商获取用户心智、真实使用反馈和后续商业化转化机会的重要基础。与模型能力或 API 调用相比,入口更接近用户日常使用场景,能够持续沉淀用户需求、交互习惯和产品反馈,并为订阅、广告、电商、企业服务和平台服务等商业化路径提供基础。第 3 章重点讨论模型能力能否转化为商业化收入,本章则进一步关注 AI 产品是否已经形成用户入口,以及入口价值如何体现。
我们认为,AI 入口价值可以从三个层面观察:第一,是否形成足够大的用户触达和品牌心智;第二,是否能够形成持续高频使用,或嵌入用户原本已高频使用的产品和任务流;第三,是否能够将使用频次和场景深度进一步转化为商业化收入。用户规模决定入口的覆盖广度,使用频次和场景嵌入决定入口的使用深度,而商业化转化则决定入口的长期价值。
从用户规模看,AI 助手类产品正逐步走向规模化应用。OpenAI于 2026 年 2 月披露,ChatGPT 周活跃用户已超过 9 亿,消费端付费订阅用户超过 5,000 万。此前,其在 2025 年 9 月发布的使用研究显示,截至 2025 年 7 月,ChatGPT 每周消费端消息量约 180 亿条,其中约 30% 的消费端使用与工作相关,约 70% 与非工作场景相关,且使用场景已从单纯问答扩展至学习、写作、信息整理和工作辅助等更广泛需求。Gemini 则体现了另一类用户规模扩张路径,其增长更多受益于Google 原有生态的分发能力。截至 2026 年 4 月,Gemini App 月活跃用户数已突破 9 亿,日请求量较去年 I/O 增长超过 7 倍。

国内市场中,AI 助手类产品同样已具备较强的大众触达能力。根据 QuestMobile 数据,截至 2026 年 3 月,国内 AI 原生 App 月活用户规模已达到约 4.4 亿,其中豆包、千问、DeepSeek 位居前三,月活用户规模分别约为 3.45 亿、1.66 亿和 1.27 亿。
豆包一方面来自字节系产品在内容生态、推荐分发和流量入口上的优势,另一方面也来源于其更偏大众化、低门槛的产品定位。相比部分更强调模型能力或开发者生态的 AI 产品,豆包更贴近普通用户的日常需求,功能覆盖聊天、搜索、写作、图片生成、视频理解、内容创作和学习陪伴等场景,使用频次更容易被持续拉动。因此,豆包不只是一个独立 AI 助手,也正在成为字节内容生态中承接用户 AI 需求的重要入口。

在完成初步用户触达后,AI 入口价值能否进一步提升,关键在于其是否能够形成持续高频使用,或嵌入用户原本已高频使用的产品和任务流。独立 App 有助于厂商建立品牌心智,但用户主动打开频率存在上限;当 AI 能力嵌入搜索、办公、浏览器、移动端、内容社区和云服务等场景后,用户无需额外迁移,即可在原有任务流中使用 AI,从而提升使用频次、停留时长和商业化转化空间。由此,AI入口价值也将从单纯的流量触达,进一步升级为场景分发和生态嵌入。
Gemini是生态嵌入的典型案例。随着 Gemini 进入 Workspace、Chrome、Android 和 Google Cloud 等场景,AI 能力不再只依赖独立 App 分发,而是被嵌入到用户的信息检索、内容生成、办公协作和云端调用流程中。以 AI Overviews 为例,该功能直接嵌入 Google 搜索结果页,在用户搜索行为中完成 AI 能力触达,而不需要用户单独打开新的 AI 应用。目前 AI Overviews 已覆盖超过 200 个国家和地区、支持 40 余种语言,月活跃用户突破 25 亿,是 Google 推动 AI 普及和用户转化的核心入口之一。(数据来源:Google)

国内 AI 应用同样在从独立 App 向既有生态延伸。与 Google、Microsoft 等海外厂商类似,国内头部互联网厂商也在通过自身原有流量入口和场景分发能力,推动 AI 能力进入内容、社交、办公、电商和云服务等高频场景。豆包背靠字节内容和推荐生态,具备从聊天助手延伸至内容创作、学习陪伴和多模态表达的基础;元宝基于其社交关系链、公众号和视频号内容信源、腾讯文档等办公协同工具,以及微信读书、QQ 音乐等内容生态,能够承接 AI 搜索、内容理解、文档处理、会议纪要、知识问答和多模态创作等需求;千问则基于 Qwen 模型能力、阿里云、夸克以及阿里系办公和电商场景,更偏向搜索问答、企业办公、内容创作和商家经营。

综合来看,用户规模只是 AI 入口价值的第一层验证,后续价值释放仍取决于产品能否形成持续高频使用,并进一步嵌入用户原有高频场景。OpenAI偏AI 原生入口 + 平台化扩展,Google 更偏原有生态 + AI 嵌入,国内厂商则从独立 AI App 的用户规模竞争,逐步延伸为内容、社交、办公、电商和云服务等原有生态中的场景卡位。随着 AI 能力从独立 App 走向原有生态,入口价值将进一步从用户触达转向场景嵌入,并为后续订阅、广告、电商、企业服务和平台服务等商业化转化提供基础。
五、各厂商路径分化:技术能力仍是最基础,商业化能力是放大器
部分模型的降价说明国内大模型的价格体系仍处在动态调整阶段。价格下行有助于降低应用侧使用门槛,加速 Token 放量和场景渗透,但也使模型厂商的商业化路径更加复杂,因为模型能力提升和调用量增长并不必然转化为收入增长,单纯依赖调用收费获取高利润的模式面临挑战。后续行业空间的判断,不能只看模型能力和调用量增长,还要看价格下降后能否以及在怎样的节奏下刺激更大规模的使用需求和付费意愿,以及厂商能否通过企业客户、应用入口、私有化部署、增值服务和生态分发承接商业化。长期来看,降价有望推动大模型从技术产品向基础设施演进,带动整体使用规模扩张,但行业利润分配也将随之重构,行业价值更可能向低成本推理能力强、调用规模大、应用闭环明确、企业服务能力强的厂商集中。
在此背景下,大模型行业的竞争逻辑正从技术领先转向商业化兑现。未来决定竞争格局的关键不仅在于模型能力本身,更在于厂商能否通过入口、生态与客户资源推动模型广泛落地,并将模型调用持续转化为收入增长。基于资源禀赋和战略定位的差异,不同厂商正沿着模型、应用和平台等路径探索各自的 AI商业化模式。

1.智谱:以企业 Agent 和 MaaS/API 平台承接国产模型商业化
智谱成立于 2019 年,是国内较早布局大模型的创业型公司之一,源自清华大学技术成果转化。公司长期围绕 GLM 系列模型开展研发,产品和商业化方向更强调企业级应用、行业落地和 Agent 能力。相较于更依赖 C 端流量入口或内容应用驱动的厂商,智谱的收入和商业化重心更偏企业客户、模型平台和行业解决方案。
智谱最鲜明的特点是“企业级 + 可交付”。在 B 端场景中,客户关注的不只是模型单点能力,还包括数据安全、私有化部署、系统集成、业务适配、权限管理和持续服务能力。智谱的 GLM 系列模型从通用对话、长文本、多模态理解,逐步延伸到代码生成、工具调用、复杂推理和企业 Agent,目标是让模型能够进入真实业务流程,而不仅停留在问答和内容生成层面。
从商业化看,智谱主要通过 MaaS/API 平台和私有化部署变现。一方面,公司可以通过开放平台向开发者和企业客户提供模型调用服务,承接 API、Agent 开发和应用搭建需求;另一方面,面向金融、政企、能源、制造、运营商等行业客户,智谱可以提供更定制化的模型部署、知识库建设、工作流改造和智能体解决方案。相比纯标准化 API 收入,企业级项目往往更依赖交付能力和客户服务,但也更容易沉淀行业 Know-how 和长期客户关系。
智谱代表的是国产模型从可用走向可交付的方向,其核心优势首先来自较强的模型底座能力。GLM 系列模型在通用理解、复杂推理、代码生成、工具调用和企业 Agent 等方向持续迭代,为其进入企业真实业务流程提供了能力基础,然后通过 MaaS/API、私有化部署和行业 Agent,将大模型能力嵌入企业系统和行业流程,并进一步沉淀为可复用、可持续的商业化收入。
2.MiniMax:Born-Global的多模态大模型公司
MiniMax 是国内较具代表性的创业型大模型公司之一,成立于 2021 年,团队长期围绕通用大模型、多模态生成和 AI 原生应用进行布局。公司早期从对话、陪伴和角色互动等场景切入,后续逐步扩展到文本、语音、图像、视频等多模态能力,并通过海螺 AI 等C 端原生 AI 应用平台以及开放平台为全球的C 端用户、开发者/ B端企业用户提供服务。
MiniMax 的模型路线更强调多模态、Agent 和高性价比调用。公司持续迭代升级大模型能力以及开发新模型,更新迭代速度较快,目前已形成了以 M3、Hailuo-02、Speech-02 等为核心的全模态大模型组合。公司在模型层的演进方向更多体现在多模态能力的进一步整合,以及持续提升效率与稳定性。随着全模态统一模型逐步落地,模型能力有望从单一模态的局部优势转向系统层面的整体提升。
MiniMax 的产品布局本质上是对底层模型能力的场景化验证。公司主营产品包含多元化 C 端原生产品以及 B端开放平台,在商业化之初便找到了“可规模化变现”的产品形态,较早跑通订阅和增值付费模型,实现用户规模与收入增长的正反馈。海螺 AI 主要面向视频生成、图像生成和多模态内容创作,Talkie/星野面向角色互动和 AI 陪伴,MiniMax Agent 则面向任务执行和智能体工作流。对 MiniMax 来说,应用产品不仅是商业化入口,也是模型迭代的重要场景。
MiniMax从创立之初就定位为全球化 AI 公司。公司较早通过 Talkie、海螺 AI 等产品切入海外市场,并将多模态内容生成、角色互动和语音交互等能力推向全球用户。从收入结构看,2025 年中国内地以外市场收入为 5,766.3 万美元,占比 73.0%,说明公司收入已明显呈现全球化特征。
MiniMax 是国内大模型行业中应用验证模型的代表,代表的是模型能力与 AI 原生应用协同演进的方向,一方面,其应用产品落地较快,能够较早验证真实用户需求;另一方面,其模型能力兼具多模态特色和较高性价比,为后续应用扩展和商业化放量提供支撑。
3.DeepSeek:以高性价比模型推动 AI 普惠,重塑行业价格体系
DeepSeek 是一家以 AGI 为目标的 AI 研究公司,全称为杭州深度求索人工智能基础技术研究有限公司,由梁文锋于 2023 年创立。公司长期专注于AI 基础技术研究,技术路线更强调模型架构创新、训练效率提升和推理成本优化,希望通过持续的模型创新推动通用人工智能的发展。
DeepSeek 最鲜明的特点是开源、低成本和强推理。公司通过 MoE 架构、强化学习、长上下文优化和推理工程等方式,在有限算力条件下持续提升模型能力和训练效率。对开发者和企业客户来说,DeepSeek 的吸引力不仅来自模型能力,也来自较低的 API 调用价格、较高的部署灵活性,以及开源模型带来的可控性和可迁移性。尤其在代码、数学、复杂推理和工具调用等场景中,DeepSeek 已经成为国内外开发者测试和部署的重要选择。
从商业化看,DeepSeek 更多通过模型 API、开源权重、第三方云平台和企业私有化部署形成影响力。对企业客户来说,DeepSeek 的价值在于以较低成本获得接近前沿模型的能力,适合用于代码生成、智能客服、知识库问答、数据分析和内部 Agent 等对成本敏感、调用量较大的场景。与更依赖 C 端产品入口或云平台生态的厂商不同,DeepSeek 的商业化更多来自模型能力本身的外溢,以及开发者和企业客户对高性价比模型的主动采用。
DeepSeek 像是国内大模型行业的开源模型供给方和价格锚。一方面,开源模型扩大了开发者覆盖面,也降低了企业尝试和迁移大模型的门槛;另一方面,低价 API 对行业定价体系形成压力,倒逼其他厂商持续优化推理成本和模型效率。从产业视角看,DeepSeek 代表的是 AI 普惠化方向,它回答的核心问题是如何把足够强的模型,以更低成本、更开放的方式提供给更多开发者、企业和用户使用。
4.月之暗面/Kimi:从长上下文走向生产力工作流
月之暗面是国内较具代表性的创业型大模型公司之一,成立于 2023 年,由杨植麟等具备大模型研究背景的团队创立。旗下 Kimi 产品早期凭借长上下文能力和长文档处理体验获得用户认知,在国内大模型应用中较早形成了差异化的标签。
Kimi 最鲜明的特点是长上下文和复杂信息处理能力。在真实办公和研究场景中,用户往往不是问一个简单问题,而是希望模型阅读大量资料、提炼要点、对比观点、生成摘要或辅助写作。Kimi 早期的产品心智正是围绕这一需求建立,它不是单纯的聊天工具,而是更接近个人知识助理和文档分析工具,因此在研究、办公、学习和专业内容理解场景中形成了较高辨识度。随着后续模型迭代,Kimi 的能力重心也从长上下文进一步延伸到代码生成、多模态理解、深度研究和 Agent 任务。
商业化层面,月之暗面的路径更偏 C 端产品、开发者工具和 API 平台并行推进。C端方面,Kimi 可以承接学习、办公、研究、写作和信息管理需求;开发者场景方面,Kimi Code 等产品可以进入代码生成、项目开发和 Agent 编程任务;API 方面,Kimi 模型可以被企业和第三方开发者接入知识库、客服、办公、内容生产和行业应用中。
月之暗面瞄准的是进入高价值工作流的机会。其早期建立了长上下文产品心智,后续则通过代码、推理和 Agent 能力扩大产品边界。
5.阿里:全栈式布局,构建AI 时代的模型生态和云服务底座
阿里的大模型布局起步较早。2023 年,阿里正式推出通义千问大语言模型,随后逐步形成覆盖语言、代码、数学、视觉、音频、视频等方向的 Qwen 模型家族。与更偏 C 端产品驱动的厂商不同,阿里从一开始就将大模型与云计算、开源社区和企业服务结合起来推进:Qwen 系列负责扩大模型影响力和开发者覆盖,阿里云负责承接模型调用和行业落地,钉钉、夸克和电商体系则提供办公、搜索、学习、商家经营和消费者导购等应用场景。
通义千问系列模型最鲜明的特点是模型谱系完整、开源生态活跃。阿里持续推出不同尺寸、不同能力方向的Qwen 模型,覆盖通用对话、代码生成、数学推理、多模态理解、文生图、文生视频等场景。开源策略降低了开发者和企业客户的使用门槛,也有助于扩大 Qwen 在全球开发者生态中的影响力。对阿里来说,开源并不只是技术展示,更是扩大模型使用范围、吸引开发者、沉淀生态标准的重要方式。
阿里云是通义千问商业化的核心出口。通过百炼平台和阿里云 Model Studio,企业客户可以调用通义千问模型,进行模型评测、精调、部署和应用开发。对于企业客户来说,阿里的优势来自较完整的云基础设施、模型服务、数据工具和行业解决方案,可以覆盖从算力供给、模型调用到应用落地的多个环节。尤其在金融、政企、制造、零售、互联网等场景中,阿里云可以将大模型能力与既有云客户和行业项目结合,推动 AI 从试点走向规模化使用。
应用层面,阿里也在通过千问 App、钉钉、夸克、淘宝、天猫、闲鱼、高德等产品推动大模型落地。千问 App 是阿里面向 C 端用户的 AI 超级入口,承担日常问答、内容创作、学习办公、多模态交互等场景;钉钉主要对应办公协同和企业智能体场景;夸克更多面向搜索、学习、内容理解和个人效率;电商体系则可以承接智能客服、商品内容生成、广告投放、商家经营和消费者导购等需求。相比单一 AI 应用,阿里的应用场景更分散,但覆盖 C 端用户、企业办公、搜索入口和电商经营等多个方向,与云、企业服务和电商生态的结合更深。
整体来看,阿里更像是 AI 时代的模型生态和云服务底座。一方面,Qwen 系列通过开源和多模型布局扩大开发者覆盖面;另一方面,阿里云负责把模型能力转化为企业 API、MaaS 平台和行业解决方案,千问 App、钉钉、夸克和电商体系则分别承接 C 端助手、办公协同、搜索学习和商家经营等应用场景。
6.字节:AI 时代的应用工厂
字节此前在推荐算法、内容分发、工程架构和算力调度上已有较深积累,也拥有抖音、剪映、飞书、番茄小说等大量真实应用场景,为豆包模型研发和产品落地提供了较好基础。2023 年 8 月,豆包 App 上线,字节的大模型能力开始从底层研发走向产品化,并逐步形成面向 C 端用户和 B 端客户的双线布局。
豆包最鲜明的特点是低门槛、高频入口和强场景协同。在 C 端,豆包覆盖日常问答、学习陪伴、图片生成、语音互动、内容创作、视频创作等大众化场景,使用门槛较低,用户教育成本较小,更容易进入日常使用。相比偏专业化的 AI 工具,豆包更接近一个大众化 AI 助手,适合通过高频交互积累用户需求和使用数据。
字节生态也为豆包提供了丰富的落地场景。豆包模型能力并不局限于单一聊天应用,而是可以进入抖音、剪映、飞书、即梦、Trae 等不同产品形态,覆盖内容生产、广告创意、视频生成、办公协同和代码开发等多个方向。对字节自身业务来说,大模型可以提升内容生产效率、广告投放效率、办公协作效率和开发效率;对豆包模型来说,多场景落地也能带来更真实、更高频的调用反馈。
从商业化看,字节采取 C 端产品扩大使用规模、火山引擎承接企业调用的路径。豆包 App 负责触达大众用户、沉淀需求和验证高频场景,火山引擎则负责将模型能力开放给企业客户和开发者,承接模型 API、企业智能体、行业应用和 MaaS 平台需求。对于企业客户来说,豆包的吸引力来自较低的调用成本、较广的能力覆盖,以及火山引擎从模型接入、Agent 开发到应用部署的配套服务。
字节具备较强的 AI 应用工厂属性。一方面,公司可以围绕大模型快速推出面向聊天、创作、办公、代码和企业服务的多类应用;另一方面,又可以通过豆包 App、字节系产品和火山引擎,把用户使用、场景验证、Token调用和企业服务串联起来。相比单纯以模型榜单和参数规模作为核心叙事的厂商,字节更强调产品化速度、场景分发能力、工程效率和商业化转化能力,这也是其被视为 AI 时代应用工厂的重要原因。
六、投资建议
国产及海外大模型能力持续提升、推理成本快速下降,正在推动 AI 应用逐步走向场景落地。我们认为,后续 AI 投资判断不应只停留在模型榜单排名,而应更加关注模型能力能否转化为真实调用和付费。具备模型能力、应用入口、客户基础和数据沉淀的公司,有望在这一轮 AI 应用落地过程中率先受益。
模型层,建议重点关注具备前沿模型能力、高推理效率和商业化承接能力的厂商。国内模型能力持续提升,使国产模型具备进入企业工作流和开发者生态的基础。对于模型厂商,后续应重点观察真实调用、客户转化、收入兑现和盈利质量,核心指标包括 Token 调用量、企业客户数量、C 端付费转化、API/开放平台收入、ARR 增长以及单位Token 成本等,而不应仅以单次模型评测排名作为判断依据。
应用层,建议重点关注贴近真实业务流程、ROI 更容易衡量的 AI 软件公司。AI Coding、办公协同、财税、ERP、CRM、酒店/零售管理、数据分析,以及 AI 视频/AI 漫剧等内容创作场景,本身具备高频使用、流程清晰、效率提升或成本下降较为直观的特点,更容易转向持续付费。
同时,企业私有数据和专业工作流的价值有望被 AI 重新定价。近期 OpenAI 和 Anthropic 均通过与 PE/资产管理机构合作推进企业 AI 部署,推动模型进入企业内部流程和私有数据场景,反映出大模型厂商正在从通用 API 销售走向更深层的企业实施与场景改造。对应到国内,具备行业数据、客户入口和实施能力的软件公司,可能不仅是模型能力的使用方,也会成为 AI 落地过程中的关键承接方。
从公司类型看,建议重点关注以下方向:
模型及 AI平台厂商。
AI+数据工具:企业 AI 应用落地的前提是数据可用、可分析,数据平台和智能分析工具有望成为企业部署 Agent 和行业模型的重要底座。随着企业走向流程级改造,对于多源数据整合、实时分析、知识库构建、向量检索、模型调用管理和权限治理的需求将持续提升。具备数据基础设施、企业智能平台和行业数据建模能力的公司,有望在 AI 应用建设中承担数据底座和智能决策中枢的角色。
AI+Coding/Agent:代码和软件工程场景具备结果可验证、效率提升明确、企业付费意愿较强等特点。国内相关公司虽不完全等同于海外路线,但有望受益于国产模型代码能力、Agent 能力和私有化部署需求提升,推动 AI 从代码补全延伸至需求理解、任务拆解、代码生成、测试调试、运维排障和安全分析等环节。
AI+办公、财税和企业管理软件:办公、财税、ERP 和企业管理系统沉淀了大量组织数据和业务流程,具备较强 AI Agent 落地基础。随着模型长文本、多模态和工具调用能力提升,AI 有望从文档生成、智能问答和报表分析,进一步进入审批、财务处理、供应链、生产管理和跨系统任务执行等高价值环节。
AI+垂域软件:垂直行业软件深度嵌入药物研发、工业生产、酒店管理、零售经营、电商运营、内容创作等具体流程,沉淀了专业数据、行业Know-how
和客户入口。相比通用 AI应用,垂域场景的业务边界更清晰、效率提升更容易量化、客户付费意愿更强。未来 AI能力有望与行业数据、专业模型和业务系统深度结合,推动垂域软件从工具软件升级为行业工作流入口,提升产品价值量和客户粘性。风险提示
(一)模型技术迭代不及预期风险
大模型能力提升依赖算法、数据、算力和工程系统持续突破,若后续模型性能提升放缓,或长上下文、Agent、复杂推理、多模态等关键能力落地不及预期,可能影响下游应用渗透和商业化进程。
(二)算力供应及外部环境风险
先进芯片、云基础设施和数据中心资源是模型训练与推理的重要基础。若海外出口管制、供应链波动、电力资源、资本开支或宏观环境变化导致算力获取成本上升,可能影响模型迭代速度和推理服务稳定性,以及算力结构可能会对盈利能力形成影响。
(三)商业化兑现不及预期风险
Token 调用量增长并不必然等同于收入和利润增长。若 C 端用户付费转化率不足、企业客户预算释放较慢、API 价格竞争加剧,或 AI 应用难以形成稳定留存和复购,相关公司的 ARR 增长和盈利能力可能低于市场预期。
本摘要选自报告:《计算机行业AI模型系列(四):大模型商业化加速落地,来自模型能力、Token与ARR的多重验证》2026-06-10
报告作者:
刘雪峰 S0260514030002

夜雨聆风