ARTICLE · 1138154
a16z最新AI百强榜:大模型越来越强,应用凭什么收钱?

流量榜之外,29家厂商跻身支出前50:消费者账单揭开应用层的生意底牌
麦克风前的问题很直接:大模型越来越强,应用凭什么收钱?
这是 a16z 播客《The a16z Show》的录制现场。参与对谈的是长期主笔 AI 百强报告的消费投资合伙人 Olivia Moore,以及亲历过 Twitter、Robinhood 早期构建的合伙人 Josh Elman;主持人是 Elena Burger。
节目讨论触及过去一年所有软件公司最敏感的神经,问题可以概括为:
底座模型越来越强、推理单价持续下降,为什么这批应用还能让用户源源不断地付款?钱到底付给了什么?
Olivia 拿出的不是理论,而是联合 YipitData 观察美国消费者样本实际支出的底牌:
• Midjourney 没进网页流量前 50,也没进移动端前 50,却高居全美消费者真实支出榜第 11 位; • 编程平台 Replit 网页流量仅列第 48,但在支出榜冲到了第 6; • 软硬一体录音产品 Plaud 在两张公网流量榜上彻底隐形,支出排名仍达第 16。
同一批 AI 产品,换一把尺子,看到的生意完全不同。支出前 50 强的厂商中,有 29 家未进入本期网页或移动流量榜前 50。真实的资金,不只流向令人惊艳的通用对话,也涌向了流量榜看不到、却能死磕交付的具体工具。
综合 Olivia 的观点,贯穿整期报告最核心的商业主线可以概括为:
消费级 AI 先找到了最像企业客户的一批消费者。他们愿意重金购买生产工具,却还不能代表大众市场。应用要继续扩大,既要证明自己值得付钱,也要找到不要求人人订阅的服务方式。
01 903美元的狂热信徒:最有价值的客户,也是最危险的算力吞噬者
理解这批客户,首先要穿透大众直觉制造的数据烟雾。
皮尤(Pew)调研显示,近半数(49%)美国成年人声称用过聊天机器人,24% 每天使用;但 YipitData 监测表明,2026 年 8 月,其美国电子收据面板的合资格消费者中,为三大助手(ChatGPT、Gemini、Claude)至少持有一项有效个人付费订阅的比例,仅约 4.5%。两项调查样本不同,不能直接当作使用到付费的转化率。
大众对 AI 的高频尝鲜,并未转化为普遍的付费意愿。而在 AI 付费群体内部,资金分布呈现出极度的幂律倒挂:头部 1% 用户跨产品月均自费达 903 美元,而全体付费者的月支出中位数其实只有 25 美元。 这批头部 1% 的超级用户贡献了近两成(19.5%)的流水,超过了后半数(50%)普通付费者合计贡献的 16.6%;排名前 10% 的高支出群体,直接包揽了观测总额的约一半。

进一步穿透头部 1% 用户的采购偏好(Overindex 指标:头部 1% 支出者购买某产品的比例,相对于全体 AI 购买者的比例;2026年6—8月窗口),资金流向展现出极强的任务导向:
这些采购偏好更接近独立全栈开发者、跨境卖家与“一人公司”(Solopreneurs)用个人信用卡采购生产工具的需求,以此替代原本需要外包或雇佣初级人力承担的开销。对他们而言,Token 不是信息消费,而是可折算的生产工具支出。
但商业反转恰恰在此发生:最有价值的客户,也可能是边际成本最高昂、毛利最脆弱的客户。
大模型推理成本(Inference COGS)具有物理属性,成本受 Token 用量、模型选择、缓存、推理步数和工具调用共同影响。在平价包月、用量限制不足或带有补贴性质的定价体系中,超级用户使用得越深入,平台边际毛利就越可能承压;而如果平台严格按量加价,具备极强工程能力的极客又可能转向廉价 API 或开源本地部署。
高支出不等于高净利。这批高客单极客既是初创公司早期的现金奶牛,也是随时可能击穿算力成本线的“算力雇佣兵”。
02 赋能与吞噬的生死线:大模型步步紧逼,应用层凭什么活下来?
设想一段软件开发日常:
在网页对话框里让模型写一段 50 行的 Python 脚本只要 2 秒钟。但若把这段代码直接拷进公司数十万行的核心项目库,它可能不知道既有的鉴权规则、调用了废弃老接口,甚至直接触发持续集成(CI)报错。剩下的 10% 接口与规范冲突,依然需要工程师排查半小时。
换一个更大的基础大模型,并不能自动消除这些摩擦。既有项目的依赖库、代码审查规范、版本分支冲突,全部依赖模型之外的应用软件来承载。Josh Elman 指出:模型能力的进步在放大软件的效用,商业价值绝不会只留存在模型层。
应用层的真实分化由此显现:
• 单次输出型工具(Prompt Wrapper):仅提供单次文本或代码生成,极易被基础大模型入口后续上线的新特性直接抹平; • 承载复杂工序的软件(Workflow Software):如 Cursor,其壁垒不仅是调用模型,更在于代码库索引、工程规则库对齐、调试工具链与 Agent 执行沙盒的深度集成。
逃向组织:对抗吞噬的防线
应用层抵御吞噬的一条有效生路,是将单点工具转化为组织级工作流。Olivia Moore 在《The Great Expansion》中阐明了一条演进路径:
| 个人使用 | 脆弱 | ||
| 团队协同 | 稳固 | ||
| 企业采购 | 极高 |
当工具由个人自费转向组织统一采购时,购买决策者与预算性质随之改变,产品所需补齐的往往是合规、权限与资产治理能力。向组织协同渗透,让 Cursor、Canva 这批软件成功构筑起防线,稳稳吃到了企业预算。
但这也意味着它们进入了传统 B2B SaaS 的预算与采购体系,吃的是公司 IT 预算。那些试图留在广阔个人消费世界里的团队,必须面对更难的暗礁。
03 记忆的虚与实:少修改几句话的价值,凭什么留住用户?
对于单人使用的专业软件,“个人专属上下文”被寄予厚望。
在 a16z 领投 5500 万美元的个人助手 Town 身上,这场围绕上下文的防守战展现出真实的工程质感。前 Plaid CTO Jean-Denis Greze 与前 Google AI 高管 Tony Vincent 让软件直接寄生在邮件和即时通讯中,分配专有邮箱助手(Townie)。
以穿梭在工地的澳大利亚水管工为例,设想这样的应用场景(并非 Town 披露的真实案例):
水管工每天在泥泞中面对抢修、账单与报价邮件,根本没空打开电脑写提示词。如果助手能在授权范围内分流紧急任务,并根据师傅过往处理纠纷的语气起草回信,省下的就是一次次停工操作的时间。
Olivia Moore 用个人回信体验描述了这种行为上下文带来的修改负担差别:
• 85% 像本人时,修改负担仍可能很重:她形容,邮件虽然接近自己的表达,仍可能需要 10 分钟以上修改; • 99.9% 像本人时,修改负担显著减轻:助手积累用户上下文与表达偏好,使草稿更像本人;她形容这种情况下,修改只需约 10 秒。
然而,这个机制还面临公开传播与私密上下文之间的冲突。
社交网络靠公开连接裂变;个人智能体为了达到 99.9% 的默契,必须极深地侵入私人信件、日历与账单。软件对个体越了解,其数据资产就越具排他性。用户往往不愿把一个摸透自己底细的智能体连同私人数据公开分享出去。 私密上下文筑起了抗迁移防线,但跨用户协作还要解决共享范围与授权问题。
04 免费个人助手与交易收费:无头跑腿与零分润困局
从“问答”走向“代办事务”,是近期最受瞩目的变量。新兴助手 Instinct 创始人披露其早期测试中约 40% 的用户在三周内绑定了个人信用卡,发生购买行为的用户平均月交易额为 1300 美元。
但进入大众消费市场时,智能体遭遇了物理阻碍。数据显示,智能体应用 Muse 在美加两国上线后的前 22 天累计下载估计约为 538 万次;而社交应用 Threads 在其上线后的前 22 天下载估计达 1571 万次:

社交应用新增用户的服务器边际成本通常较低;而智能体在后台做环境巡检、多工具调用与推理,每一个活跃用户每天都在消耗真实的 GPU 算力。在单次操作推理成本降至临界点之前,缺少用量限制与成本控制的平台就难以放开做无门槛的免费裂变,过快的大众涌入可能击穿初创公司的资金链。
更残酷的现实发生在交易现场。回答错常识只会引人一笑,但代订机票搞错了日期,直接牵涉到扣款损失与售后责任。
在真实的商业交易中,最致命的不是明确的“失败”,而是“接口超时与状态未知”:当智能体向第三方网关发起扣款遭遇超时,系统便陷入死局——在缺少幂等保护时,盲目判定为失败重试,可能导致用户被重复划扣数千元;直接判定为成功,用户到了酒店可能根本没有订单。大模型在语言上无论显得多有把握,物理世界的交易网关只认流水对账。一次异常引发的人工客服介入,成本可能抹平多次任务的贡献。
更为尴尬的是商业利益的悬空:部分智能体号称代办了数亿美元流水(GMV),执行时仍依赖无头浏览器在航司酒店官网代刷代买。GMV 并不等于平台营收;如果尚未签订官方分润协议,平台承担推理算力和客诉风险,却未必能从交易中抽成。已有平台签署官方集成,接口开放与分润也不是同一件事。尚未跑通抽佣通道的智能体,本质上是在靠风投补贴算力、替别人打白工的超级跑腿。
05 商业模式大分流:订阅制的局限、广告的回归与双雄决裂
在 a16z 统计的 Web 榜单中,44 款 AI 原生产品的变现方式高度倾斜:个人订阅采用率为 84.1%,按量计费为 63.6%,广告为 13.6%,交易或平台收费仅为 2.3%。同一产品可以采用多种模式,这些数字不是收入占比。
Olivia 指出,大量依赖订阅制,实质上是消费互联网历史的一场非自然倒置(Unnatural Inversion)。成熟互联网极少向普通人收软件月租,绝大多数靠广告和交易佣金活着。早期 AI 创业者大量采用包月,是因为推理算力太贵,不得不把 20 美元预付费当做安全气囊。
为什么交易抽佣(2.3%)目前是一门苦生意?
2.3% 是产品采用率;交易抽佣要跑通,仍需面对严苛的单位经济学约束:
假设单笔净手续费 14 元,系统算力 0.8 元,单次人工处理成本 30 元:
• 转化率 20%、人工介入率 4% 时,单项任务贡献为 +0.8 元; • 转化率跌至 10%,该任务贡献立刻转为 -0.6 元; • 转化率维持 20% 时,人工介入率一旦上升至约 6.7%,任务贡献归零。
在尚未建立官方直连通道的阶段,单次人工客诉的成本,需要数十次顺利履约才能补平。
任务分类如何切分出巨头的战略分水岭?
研究者 David Pawlan 对 3101 条可见消息中的 401 条任务相关讨论(Assistant Benchmark,2026年8月31日—9月28日)的分类统计,揭示了两大巨头背后的需求分界。分类可重叠,讨论也包含提问与设想,不等于已执行任务量:

• 编程与技术自动化(103次,居首):这是重型计算与逻辑构建,通常缺乏旅行购物那样的即时消费撮合意图,更适合专业订阅、按量计费与组织采购; • 旅行(66次)与购物(58次):沉淀了极高浓度的即时商业意图(Commercial Intent),天然具备从检索直通商品转化的广告与推荐潜力。
围绕这两种完全不同的任务属性,Anthropic 与 OpenAI 展开了极具火药味的变现对决:
| 商业意识形态 | ||
| 流量与用户基数 | ||
| 付费分层转化 | ||
| 核心商业成果 |
Anthropic 将模型作为精密工具,靠 7.3% 消费者付费者选择的高客单超级套餐在专业圈层变现,其在美个人付费订阅用户量曾于 2026 年 3 月超过 Google Gemini;截至 8 月,两者接近,美国电子收据样本中的个人付费订阅比例为 Claude 1.07%、Gemini 1.09%。
拥有 12 亿周活跃用户的 OpenAI 则顺应大众规律,其广告业务年化收入运行率在 8 月底推过 10 亿美元 大关。Josh Elman 分享的底特律机械钥匙扣案例展示,当用户在多轮对话中细化工艺诉求时,顺势引荐匹配的工坊有望构成极高价值的商业撮合;该对话未展示广告,也未披露成交。而在医疗领域,专业平台 OpenEvidence 覆盖了全美 50% 至 60% 的执业医生,并已部分采用广告变现;医生覆盖率不能当作广告转化率。
平价单一订阅的幻想破灭后,两家巨头各自走出了分流之路。
06 消费级的终极盲区:当所有 AI 都在帮人“省时间”,谁来让人“消磨时间”?
在探讨消费级 AI 的长远空间时,访谈触及了整个赛道最根本的商业盲区。Olivia Moore 转述了 Replika 创始人 Eugenia Kuyda 的一个判断,大意是:
很多人不只想节省时间,也在寻找消磨时间的方式。
依靠“帮人省时间”活着的产品,若缺少持续使用场景,就可能背负用完即走的留存诅咒。而真正统治消费互联网的超级帝国,从来都在顺应人类消磨时间的天性。
当前在支出榜上逆势崛起的多模态创意工具,印证了跨越这条鸿沟的潜力:
• 音频工具 Suno(支出榜 #7)与 ElevenLabs(#10):访谈认为,唱片工业版权诉讼风险为创业公司留出窗口。音乐创作不仅是配乐工具,更成为大众自发制作梗曲、宣泄情绪的娱乐玩具——用户花数小时微调一首歌,是因为创造本身带来了消磨时间的乐趣; • 视觉工具 Midjourney(支出榜 #11):尽管通用对话框内置了免费生图,但专业创作者依然愿意为其独特的艺术审美偏好(Taste)持续买单; • 视频与多模态厂商快手可灵(#26)、MiniMax(#42)与 Runway(#25):凭借各自模型与创作体验,切入全球创作者的高客单采购清单; • 代码做图的跨界演进:大量用户借助 Claude 的前端代码能力(Artifacts/SVG),直接在浏览器沙盒中编译出动效图表,结构化代码在精确排版与可编辑性上展现出独特优势。
字节跳动、Meta、Netflix 与腾讯从未依靠“帮用户提高工作效率”成为大型消费互联网公司。只要 AI 工具继续只围绕职场效率竞争,消费级 AI 就难以打开更广阔的生活场景与付费空间。
07 终局审判:大模型抹平了技术差距,却拉大了产品差距
两年前,科技界曾陷入对大模型的盲目崇拜,认为底座模型将吞噬一切,应用层不过是一层脆弱的“垫片(Shim)”。
但第七期榜单的真实账本给出了截然相反的判决:大模型正在迅速建材化,而软件层的价值正在强力复苏。
用一个比喻概括 Josh 对软件价值的判断:底座模型越来越像发电厂,但发电厂不会直接替你盖房子。真正的护城河,仍在终端用户每天看得见、摸得着、离不开的软件体验里。
大厂的“创新者窘境”正为创业公司留出清晰的时间窗口:Google 若要把 Gmail 和 Docs 彻底重构成 AI 界面,就必须顾及庞大的传统 UI 惯性与既有收入结构;OpenAI 与 Anthropic 的通用对话入口,也未必能覆盖每一种细碎的垂直交互沙盒。
大模型抹平了“实现某项功能”的技术门槛,却进一步拉大了“交付卓越体验”的产品鸿沟。
大模型没有杀死软件,它只是杀死了投机。 那些企图把开源模型套个界面就宣称自己是 AI 公司的套利者正在出清;而那些把模型当成普通算力元件、深入真实业务泥潭、用严密工作流替用户承担连带责任的厚重系统,正在迎来商业常识的回归。
08 第七期完整APP与厂商清单及演进档案
本期网页榜与移动榜各列 50 款产品(两榜存在重合),新增支出榜按母公司厂商列示 50 个席位,全表共计 150 个观测条目。
数据口径
1. 统计实体:网页榜(Similarweb 月度独立访问量)与移动榜(Sensor Tower 月度活跃用户数)反映使用规模;支出榜(YipitData 美国消费者银行卡样本,2026年8月)反映个人实付规模,非全球利润总榜。 2. 特殊归属与排除:Google 未单列入支出榜,不能据此判断 Gemini 无人付费;Superhuman 包含 Grammarly 全局支出;本期排除了主要用途为 NSFW 的产品。 3. 29 家隐形黑马:支出榜中有 29 家未进入本期流量前 50。未登榜可能与桌面客户端、硬件设备、后端 API 或特定工作流交付有关,并不代表其没有公网访问。
全球消费级 AI 三榜 150 强全景对照表



(注:标 ★ 者为 29 家未进入本期公网流量双榜前 50 的纯支出榜上榜厂商)