
AI 的单位价格正在快速下降,任务数量与单项任务的计算强度却增长得更快。两股力量叠加,正在把“更便宜的智能”转化为“更多的算力消耗”。
1. 那张图真正提出了什么问题
近期流传的一张图表把两条曲线放在一起:一条代表英伟达 H100 的小时租赁价格,另一条代表 AI token 相关指数。流传文字称,2025 年 12 月到 2026 年 6 月,两条曲线大体同向波动;7 月以后,token 指数继续明显下行,H100 租赁价格却稳定在每小时约 2.70 美元,甚至略有上升。

这个现象很吸引人。若 AI 输出越来越便宜,执行这些输出所需的 GPU 却没有同步降价,直觉上说明新增使用量正在吸收效率红利。聊天、编程、搜索、视频生成和后台智能体都可以因价格下降而增加调用次数,最终让底层资源保持紧张。
问题在于,流传版本缺少能够复核的方法说明。“token 支出指数”反映用户花了多少钱,“token 价格指数”反映每单位输出多少钱。前者下降可能代表需求走弱,后者下降可能代表供给效率提升。若纵轴定义都不确定,两条曲线的背离只能作为研究起点。
H100 小时价格也不是一个统一商品价格。按需实例、长期包销、裸金属服务器、整机租赁和包含网络存储的集群服务,价格差异很大。地区电价、互连带宽、GPU 显存、可用区、利用率保证和付款条件都会改变报价。Blackwell 等新架构投放后,H100 还会同时受到替代效应和新增需求影响。
因此,这张图最有价值的部分是它提出的研究问题:当单位 AI 成本快速下降时,使用量会不会增长得更快?回答这件事,需要离开单一价格曲线,观察一条更长的证据链。

2. 算力需求的恒等式:任务、长度与单位算力
总算力需求可以用一个简化恒等式表达:
总计算量 = 任务数量 × 每项任务的 token 数 × 每 token 所需计算量。
行业讨论经常只盯住最后一项。量化、蒸馏、稀疏化、推测解码、缓存复用、编译器优化和新一代 GPU 都能降低每 token 的计算成本。价格竞争又会把部分技术红利传给客户,于是 API 价目表持续下降。
前两项的变化更容易被低估。价格下降会让原本不值得调用模型的低价值任务获得经济性。企业可以把一次性的人工查询改造成每分钟运行的监控,把单轮问答改造成多轮规划,把单个工程师的辅助工具改造成覆盖代码库、测试、部署和审查的智能体。
单项任务的 token 数也在上升。推理模型会生成更长的内部计算轨迹,编程智能体要读取大量代码和日志,多模态系统还要处理图像、音频与视频。工具调用失败后,智能体会重新规划、再次检索和反复执行。用户看到的最终答案可能只有几百字,后台已经完成多次长上下文推理。
假设每 token 所需计算量下降 70%,任务数量增长 4 倍,每项任务的平均 token 数增长 2 倍。总计算量仍会达到原来的 2.4 倍。只观察 token 单价,会错过任务数量和任务强度共同放大的部分。

3. 杰文斯效应何时成立
杰文斯效应来自一个简单条件:效率提升降低了有效价格,而需求对价格足够敏感。若单位成本下降 1%,使用量增加超过 1%,总资源消耗就会增长。蒸汽机时代观察的是煤炭,AI 时代对应 GPU 小时、电力、网络流量和存储容量。
Sam Altman 在《Three Observations》中提出,达到给定 AI 能力水平的使用成本约每 12 个月下降 10 倍;他以 GPT-4 到 GPT-4o 为例,称相应比较期的 token 价格约下降 150 倍。Stanford HAI 的 2025 AI Index 则估计,达到 GPT-3.5 水平的系统推理成本在 2022 年 11 月至 2024 年 10 月下降超过 280 倍。
这两组数字的定义不完全相同。前者来自模型公司的行业观察,后者尝试固定能力水平进行比较。它们共同说明,AI 的“有效价格”下降速度远快于传统软件和许多工业品。
价格弹性还取决于应用有没有形成正向回报。一次聊天回复便宜 90%,用户未必会多聊 10 倍。一个编程智能体若能把数小时的重复工作压缩到几十分钟,企业就有理由让它全天运行。价值来自完成的任务,而企业付费最终会围绕每次解决问题的成本、准确率和节省的人力展开。
OpenAI 首席财务官在 2026 年 8 月的投资者沟通中提到,企业客户正在从追求 token 用量转向关注“每单位智能成本”。这并不意味着 token 消耗会下降。它说明采购者开始要求输出质量、速度和业务成果共同改善。若每个任务的成本下降、可自动化任务集合扩大,合格工作负载反而会更多。

4. 从聊天到智能体,使用强度发生了结构变化
聊天机器人的典型交互是用户提问、模型回复,然后等待下一次输入。资源消耗与在线人数和消息数高度相关,空闲时几乎不使用推理算力。
智能体改变了这个节奏。它会拆解目标、搜索资料、调用工具、读取结果、发现错误、修改方案并重新执行。一次用户指令可以触发几十次模型调用。并行智能体还能同时处理多个工作包,随后由另一个模型汇总和验证。
编程场景特别适合观察这种变化。Codex 要读取仓库、理解依赖、编辑代码、运行测试和检查失败。上下文越大,项目越复杂,后台调用越密集。开发者把智能体接入持续集成、漏洞检查和代码审查后,调用从“需要时打开”变成“每次提交自动运行”。
推理模型也提高了单项任务的计算强度。为了获得更高可靠性,系统可能采用多次采样、投票、反思、验证器和测试时扩展。模型每 token 的效率可以提高,系统层面的每项任务预算仍会增加,因为用户愿意用节省下来的成本购买更高准确率。
这解释了一个常见现象:API 单价下降,模型公司却持续提高使用限额;用户获得更多额度后,很快又碰到新的限制。供给方通过效率优化释放容量,应用方通过更长任务和更多并行调用把容量重新占满。

5. Codex 的用户增长说明了什么
Codex 是检验杰文斯效应的合适样本,因为编程任务具有高频、长上下文、工具调用和可量化产出。用户愿意增加使用,通常意味着他们已经在速度、代码质量或人力节省上获得回报。
截至 2026 年 8 月 21 日,可直接追溯的最新公开说法来自 OpenAI Codex 团队成员 Tibo Sottiaux。他在 8 月 13 日称 Codex 已跨过 1,500 万 active users。此前时间线显示,7 月 16 日约为 900 万,7 月 21 日跨过 1,000 万。增长速度很快。
市场近期出现“Codex 突破 2,000 万用户”的说法。公开的 OpenAI 产品页面、团队成员时间线和可检索报道暂未提供直接支持。1,500 万的统计周期也没有披露,可能是周活、月活或更宽的 active users 定义。把 2,000 万直接写成确定事实,会把传播速度误当成用户增长速度。
即便采用更保守的 1,500 万,这组数据仍有意义。Codex 在短时间内进入了大规模开发者和知识工作者的日常环境。一个活跃用户并不等于一个付费席位,也不能直接换算收入;但活跃用户增加会提高并发、上下文读取、测试执行和后台智能体的总需求。
更重要的是使用频率。若用户只在每周试用一次,用户数增长对算力影响有限。若每名用户每天启动多个长任务,并让智能体在后台持续运行,单用户算力消耗会显著上升。下一阶段应关注每活跃用户的任务数、每项任务 token、工具调用次数和成功完成率。

6. OpenAI 与 Anthropic 的收入是第二条需求证据
用户数据容易受到免费额度、统计周期和产品合并影响。收入能增加一层验证,因为它反映客户愿意持续付费。不过,模型公司的收入仍需要严格区分实际确认收入与年化收入运行率。
CNBC 在 2026 年 8 月 14 日报道,OpenAI 年化收入运行率达到约 400亿美元,7 月环比增长 20%,企业客户相关收入增长 32%。OpenAI 管理层还称,企业业务收入已经超过以 ChatGPT 为主的消费业务。
3 天后,CNBC 报道 Anthropic 7 月末年化收入运行率达到约 650亿美元,较一年前约增长 7 倍;公司向投资者提供的第二季度初步收入约为 115亿美元。报道同时提到,Anthropic 2025 年全年收入约 100亿美元。
这些数字不能简单排成高低榜。Run rate 通常把最近一个月或一个季度的收入速度年化,增长很快时会显著高于过去 12 个月实际收入。渠道分销、云平台转售、客户预付款、算力抵扣以及毛额或净额确认,也会改变可比性。
更稳妥的结论是,两家头部模型公司的收入速度都在快速上升,企业预算成为重要增量。企业收入占比提高后,使用需求通常更连续,因为客服、开发、数据分析和运营自动化会嵌入工作流程。付费需求从个人订阅扩展到企业合同,算力负载也会从晚间和热点时段扩展到全天生产环境。
Anthropic 经济指数对 Claude 使用节奏和任务结构的观察,提供了另一个视角。相关历史分析可参阅Anthropic经济指数深度|Claude使用节奏、产出形态与AI劳动预期。对本篇更关键的是,收入增长说明智能体和模型服务正在获得真实预算,随后才需要判断收入能否覆盖推理、训练和分销成本。

7. 收入如何传导为算力需求
模型公司收入增长不会按照固定比例转化为 GPU 采购。消费订阅可能包含大量轻度用户,企业合同可能通过云平台交付,API 价格下降还会压低单位调用收入。需求传导需要经过四个环节。
第一步是付费客户和工作负载增加。新增席位、API 客户和智能体任务扩大 token 总量。第二步是模型结构与质量目标决定每项任务的推理预算。更长上下文、更多采样和多模态输入会提高算力强度。
第三步是效率与架构。量化、缓存、批处理和更快 GPU 会降低每 token 的资源消耗。第四步是供给分配。模型公司可以自建集群,也可以采购超大规模云服务商、新型 AI 云和芯片厂商的容量。
只有前两步的增长超过第三步的改善,底层 GPU 小时才会增加。若模型公司收入增长来自涨价、广告或高毛利软件服务,而 token 量基本不变,算力需求不会同比例上升。若收入增长来自低价 API 的爆发式使用,算力增量可能远高于收入增量。
这也是“token 支出指数”和“token 价格指数”不能混用的原因。价格下降说明效率与竞争,支出增长说明客户预算,token 量才更接近工作负载。投资者需要同时看三者,才能判断杰文斯效应的强弱。

8. 英伟达证明效率与需求可以同向增长
英伟达 2027 财年第一季度收入达到 816.15亿美元,同比增长 85%。其中数据中心收入为 752亿美元,同比增长 92%;按旧分部口径,数据中心计算收入 604亿美元,网络收入 148亿美元。
同一季度,英伟达宣称 Dynamo 1.0 可把 Blackwell GPU 上部分生成式和智能体推理性能提高最多 7 倍。若效率提升会自动减少硬件需求,这类软件优化应当压低数据中心收入。实际情况是效率和收入一起上升。
原因在于,系统优化降低了每项任务成本,客户随后把更多任务搬上平台。更高吞吐也缩短产品响应时间,让实时语音、编程智能体和企业搜索达到可用门槛。新场景上线后,总调用量又推动客户采购更多 GPU、网络和存储。
英伟达的网络收入增长更快,也说明瓶颈已经超出单张芯片。训练和长上下文推理需要 GPU 之间高速交换数据,机架规模扩大后,交换机、网卡、光模块和网络软件成为集群效率的组成部分。单位 GPU 性能提高,会增加高性能网络的价值密度。
这里仍要保留两个风险。数据中心收入增长包含新架构升级和供给扩张,不能全部归因于杰文斯效应。公司披露的“最多 7 倍”也属于特定配置下的上限,客户实际收益取决于模型、延迟目标、批量和系统利用率。

9. 算力短缺正在迁移,不会只停留在 H100
当新一代 GPU 大量交付,单卡稀缺可能缓解,系统瓶颈会依次迁移。HBM 决定模型参数和 KV Cache 能否高效留在高带宽存储器中;网络决定大规模并行是否被通信拖慢;存储决定训练数据、检查点和智能体日志能否快速读写。
更下游的限制来自电力、并网、冷却和土地。国际能源署预计,全球数据中心用电量到 2030 年可能升至约 945TWh,较报告时点翻倍以上,AI 是主要增量来源。预测存在不确定性,但它给出了一个清晰方向:算力扩张最终要落在物理能源系统上。
推理占比提高还会改变基础设施形态。训练需要高密度大集群,持续时间相对集中;推理更重视低延迟、稳定在线和地域覆盖。企业应用上线后,容量需要长期驻留,网络、CPU、存储与服务等级协议的重要性上升。
因此,H100 小时价格稳定只代表某一层供需。若 Blackwell 供应增加,H100 的绝对价格可能下降;同一时期,全行业电力合同、机架密度、液冷设备、光互连和 HBM 需求仍可能上升。短缺从“有没有 GPU”转向“能否按时交付一套可用集群”。

10. CoreWeave 与 Nebius:高弹性也伴随高资本约束
CoreWeave 2026 财年第二季度业绩会提供了新型 AI 云的直接侧写。管理层披露季度收入 26亿美元,同比增长 112%;积压订单达到 1040亿美元,活跃电力容量达到 1.5GW,单季度增加近 500MW。
托管推理平台上线数月后,年化收入运行率从 100万美元升至超过 1亿美元。公司预计 2026 年末至少达到 2.5亿美元。管理层还表示,7 月对全部 SKU 平均调价约 25%,近期容量接近售罄,A100 等上一代 GPU 仍能签订延续至 2029 年的合同。
这些陈述与流传图表的方向一致:单位推理成本下降没有让 GPU 租赁市场快速失去定价。客户从训练转向推理后,集群使用更连续,老一代设备也可以承接成本敏感型任务。
管理层陈述需要接受财务验证。积压订单只有在数据中心、电力和 GPU 按期交付后才会转为收入。活跃电力不等于满载利用率,价格上涨也可能只是传导组件和融资成本。调整后 EBITDA 较高时,自由现金流仍可能被前置资本开支和利息吞噬。
Nebius 的逻辑相似,弹性来自快速扩容、企业客户和现货定价,风险来自规模较小、建设执行与融资。新型 AI 云把 GPU、园区和电力组合成长期合同,收入可见度较高;资产负债表也更容易受到客户集中、租赁承诺和设备折旧影响。

剩余30%章节可以加入知识星球查看,完整原文以及参考报告原文已经发知识星球,欢迎加入
本内容基于公开资料和研报数据整理,不构成任何投资建议,不代表任何个人观点,仅供学习参考,请理性阅读



夜雨聆风