ARTICLE · 1023241
AI 产品经理进化论(20):AI 时代的模型成本计算——一文看懂 Token 与账单
在系列第十九篇,我们反复强调一句话:AI PM 必须学会算单位经济账,ARPU > COGS 是盈利的底线。 而 COGS 的大头,就是模型调用成本。
很多产品经理和开发者第一次接入大模型 API 后,都有一模一样的困惑:"我就让 AI 回答了几个问题,为什么账单这么贵?"
本文用最短的篇幅,讲清三件事:Token 是什么、模型成本怎么算、以及怎么把钱花在刀刃上。
一、Token:AI 世界的计价单位
Token 是什么
大模型不认识字,只认识 Token(词元)——文本被切分后的最小处理单元。
"你好,世界!" → 你好 │ , │ 世界 │ ! (4 个 Token)"Hello world" → Hello │ ▁world (2 个 Token)
换算规律(近似):
关键结论:中文比英文"贵"。 同样意思,中文的 Token 消耗通常比英文多 50%~100%。
为什么按 Token 计费
一次调用 = 一次推理 = 一次算力消耗。Token 是算力消耗的天然刻度:
- 输入 Token(Prompt Token)
你发给模型的全部内容(系统提示词 + 历史对话 + 用户问题); - 输出 Token(Completion Token)
模型生成的内容。
两者都收费,而且输出通常比输入贵(生成比阅读消耗更多算力,行业普遍是 3~4 倍价差)。
二、Token 经济:按用量付费的新货币
Token 经济的本质是:AI 服务"用多少、付多少",成本与用量严格绑定。 这与传统软件"买断一个功能"的逻辑完全不同,也是 AI 产品 COGS 永远为正的根本原因。
三个常识
- 上下文越长,单次越贵
每次调用,历史对话都要重新发给模型——10 轮对话的会话,单次成本可能是首轮的 5~10 倍; - 输出越长,单次越贵
生成 2000 字的文章 vs 生成 100 字摘要,成本差 20 倍; - 不同模型,价格差百倍
旗舰模型与轻量模型的 Token 单价可以相差 50~100 倍。
一条规律
省 Token = 省钱。 模型成本优化,本质上就是 Token 消耗优化。
三、模型成本的三种消耗方式
| API 按 Token | ||||
| 订阅制 | ||||
| 私有化 / GPU 租用 |
绝大多数产品走的是第一种——直接调用模型厂商接口。接下来重点算它。
四、API 成本计算:一个公式看懂
核心公式
一次调用费用 = 输入Token数 × 输入单价 + 输出Token数 × 输出单价价格基准(示意)
不同厂商、不同模型价格差异极大,以下为示意量级,实际以各厂商官方最新定价为准。
案例一:一次客服对话要多少钱
假设用中端模型,输入 $1 / 百万 Token,输出 $3 / 百万 Token:
一次问答 = 系统提示词 800 Token + 历史对话 1200 Token + 用户问题 100 Token+ 模型回答 300 Token= 输入 2100 Token + 输出 300 Token费用 = 2100 / 1,000,000 × $1 + 300 / 1,000,000 × $3= $0.0021 + $0.0009= $0.003(约 ¥0.02)
单看一次不贵。但客户一天 1 万次问答,就是每天 $30、每月约 $900。 这就是为什么 AI 客服产品的 COGS 必须精细管理。
案例二:一次长文生成要多少钱
生成一篇 2000 字的公众号文章(约 3000 Token 输出),输入 1000 Token:
费用 = 1000 / 1M × $1 + 3000 / 1M × $3= $0.001 + $0.009= $0.01(约 ¥0.07)
写一篇文章不到一毛钱——这就是为什么"AI 写作"能成为最便宜的 AI 应用之一。
案例三:一个 Agent 任务要多少钱(隐藏放大器)
Agent 干活不是一次调用,而是多步循环:
Agent 任务(3 步) = 调用① + 调用② + 调用③每步都要把"之前的对话"全部重发 → Token 指数级膨胀单步 2000 Token × 3 步 ×(输出另计)≈ 单任务的真实成本是单次问答的 3~5 倍
Agent 是 Token 消耗的放大器——步骤越多、上下文越长,账单涨得越快。做 Agent 类产品时,这是成本测算里最容易被忽略的一项。
五、影响成本的四个隐藏变量
| 上下文长度 | ||
| 输出长度 | ||
| 重试与多步 | ||
| 模型档位 |
降本三板斧(实战中最有效)
- 缓存(Cache)
高频相同输入(系统提示、常见问题)命中缓存,费用直降 90%; - 模型路由(Routing)
简单问题走轻量模型,只有复杂问题才上旗舰模型,综合成本可降 70%; - 上下文瘦身(Context Pruning)
对话超过 N 轮就自动摘要压缩历史,防止 Token 失控。
这三个手段,正是系列第十七篇讲的"成本结构支柱"在工程层的具体落地。模型路由不是工程细节,而是产品逻辑——什么场景用哪个模型,应该被写进产品需求里。
六、一张表看懂:从"账单失控"到"成本可控"
七、一句话总结
模型成本 = 输入 Token × 输入单价 + 输出 Token × 输出单价;省 Token 就是省钱,而 Token 的三大放大器是——长上下文、长输出、Agent 多步调用。
对 AI PM 来说,这张账单就是单位经济的起点:先看懂每个用户每天在烧多少钱,才能谈 ARPU 与 COGS,才能谈商业模式能不能成立。 会算这笔账,是 AI 产品从"能跑"走向"能盈利"的第一步。
下篇预告
下一篇我们将进入 AI 产品经理无法回避的另一座大山:AI 产品的合规、安全与伦理设计。我们将讨论:全球主要市场的 AI 监管政策异同、如何建立 AI 产品的安全防线、"可解释性"如何从技术概念转化为产品功能、AI 的偏见与公平性问题如何被产品设计所缓解。敬请期待。
关于本系列:「AI 产品经理进化论」系列旨在为想做/正在做 AI 产品经理的读者提供一套完整的认知框架和实操方法论。所有方法论均来自行业实践总结,所有案例与数据均来自公开可查的行业报告与真实产品,无一编造。