夜雨聆风学习资料网

ARTICLE · 1023241

AI 产品经理进化论(20):AI 时代的模型成本计算——一文看懂 Token 与账单

AI 产品经理进化论(20):AI 时代的模型成本计算——一文看懂 Token 与账单

在系列第十九篇,我们反复强调一句话:AI PM 必须学会算单位经济账,ARPU > COGS 是盈利的底线。 而 COGS 的大头,就是模型调用成本。

很多产品经理和开发者第一次接入大模型 API 后,都有一模一样的困惑:"我就让 AI 回答了几个问题,为什么账单这么贵?"

本文用最短的篇幅,讲清三件事:Token 是什么、模型成本怎么算、以及怎么把钱花在刀刃上。

一、Token:AI 世界的计价单位

Token 是什么

大模型不认识字,只认识 Token(词元)——文本被切分后的最小处理单元。

"你好,世界!"  →  你好 │ , │ 世界 │ !     (4 个 Token"Hello world"   →  Hello │ ▁world              (2 个 Token

换算规律(近似):

内容
约等于
1 个中文字
1 ~ 2 个 Token
1 个英文单词
约 1.3 个 Token
1 个数字 / 标点
约 1 个 Token
1 页中文文档(约 500 字)
约 800 ~ 1000 Token

关键结论:中文比英文"贵"。 同样意思,中文的 Token 消耗通常比英文多 50%~100%。

为什么按 Token 计费

一次调用 = 一次推理 = 一次算力消耗。Token 是算力消耗的天然刻度:

  • 输入 Token(Prompt Token)
    你发给模型的全部内容(系统提示词 + 历史对话 + 用户问题);
  • 输出 Token(Completion Token)
    模型生成的内容。

两者都收费,而且输出通常比输入贵(生成比阅读消耗更多算力,行业普遍是 3~4 倍价差)。

二、Token 经济:按用量付费的新货币

Token 经济的本质是:AI 服务"用多少、付多少",成本与用量严格绑定。 这与传统软件"买断一个功能"的逻辑完全不同,也是 AI 产品 COGS 永远为正的根本原因。

三个常识

  1. 上下文越长,单次越贵
    每次调用,历史对话都要重新发给模型——10 轮对话的会话,单次成本可能是首轮的 5~10 倍;
  2. 输出越长,单次越贵
    生成 2000 字的文章 vs 生成 100 字摘要,成本差 20 倍;
  3. 不同模型,价格差百倍
    旗舰模型与轻量模型的 Token 单价可以相差 50~100 倍。

一条规律

省 Token = 省钱。 模型成本优化,本质上就是 Token 消耗优化。

三、模型成本的三种消耗方式

方式
计费逻辑
适合场景
优点
缺点
API 按 Token
按实际用量付费
应用内嵌、To B 服务
精准、起步便宜
用量不可预期
订阅制
按月付固定费,用量设上限
高频小调用的个人工具
成本可控、省心
额度用不满即浪费
私有化 / GPU 租用
按算力资源租用(卡时)
数据不出域、高合规要求
数据安全、成本稳定
前期投入大、运维重

绝大多数产品走的是第一种——直接调用模型厂商接口。接下来重点算它。

四、API 成本计算:一个公式看懂

核心公式

一次调用费用 = 输入Token数 × 输入单价 + 输出Token数 × 输出单价

价格基准(示意)

不同厂商、不同模型价格差异极大,以下为示意量级,实际以各厂商官方最新定价为准。

模型档位
输入单价
输出单价
示例
旗舰模型
$2.5~5 / 百万 Token
$10~15 / 百万 Token
顶级通用大模型
中端模型
$0.15~3 / 百万 Token
$0.6~15 / 百万 Token
主力日常模型
轻量模型
$0.01~0.2 / 百万 Token
$0.03~0.6 / 百万 Token
小任务、量大场景

案例一:一次客服对话要多少钱

假设用中端模型,输入 $1 / 百万 Token,输出 $3 / 百万 Token:

一次问答 = 系统提示词 800 Token + 历史对话 1200 Token + 用户问题 100 Token         + 模型回答 300 Token         = 输入 2100 Token + 输出 300 Token费用 = 2100 / 1,000,000 × $1  +  300 / 1,000,000 × $3     = $0.0021 + $0.0009     = $0.003(约 ¥0.02

单看一次不贵。但客户一天 1 万次问答,就是每天 $30、每月约 $900。 这就是为什么 AI 客服产品的 COGS 必须精细管理。

案例二:一次长文生成要多少钱

生成一篇 2000 字的公众号文章(约 3000 Token 输出),输入 1000 Token:

费用 = 1000 / 1M × $1 + 3000 / 1M × $3     = $0.001 + $0.009     = $0.01(约 ¥0.07

写一篇文章不到一毛钱——这就是为什么"AI 写作"能成为最便宜的 AI 应用之一。

案例三:一个 Agent 任务要多少钱(隐藏放大器)

Agent 干活不是一次调用,而是多步循环

Agent 任务(3 步) = 调用① + 调用② + 调用③每步都要把"之前的对话"全部重发 → Token 指数级膨胀单步 2000 Token × 3 步 ×(输出另计)≈ 单任务的真实成本是单次问答的 3~5 倍

Agent 是 Token 消耗的放大器——步骤越多、上下文越长,账单涨得越快。做 Agent 类产品时,这是成本测算里最容易被忽略的一项。

五、影响成本的四个隐藏变量

变量
影响
控制方法
上下文长度
每次调用都全量重发,会话越长越贵
精简系统提示词、裁剪历史、滑动窗口
输出长度
输出单价是输入的 3~4 倍
设置 max_tokens 上限、让模型"言简意赅"
重试与多步
失败重试、Agent 多步调用让成本翻倍
提高提示质量、加缓存、控制最大重试次数
模型档位
旗舰模型单价可贵百倍
模型路由:简单任务用小模型

降本三板斧(实战中最有效)

  1. 缓存(Cache)
    高频相同输入(系统提示、常见问题)命中缓存,费用直降 90%;
  2. 模型路由(Routing)
    简单问题走轻量模型,只有复杂问题才上旗舰模型,综合成本可降 70%;
  3. 上下文瘦身(Context Pruning)
    对话超过 N 轮就自动摘要压缩历史,防止 Token 失控。

这三个手段,正是系列第十七篇讲的"成本结构支柱"在工程层的具体落地。模型路由不是工程细节,而是产品逻辑——什么场景用哪个模型,应该被写进产品需求里。

六、一张表看懂:从"账单失控"到"成本可控"

动作
省什么
效果
精简系统提示词
每单输入
减 20%~40% Token
设置输出上限
每单输出
防止一次性费用爆表
高频结果加缓存
重复调用
命中部分成本趋近于零
小任务用小模型
单价
综合降 50%~70%
长会话自动压缩
多轮成本
防止"对话越长越贵"失控
用量看板 + 预警
全局
成本异常当天发现,而不是月底吓一跳

七、一句话总结

模型成本 = 输入 Token × 输入单价 + 输出 Token × 输出单价;省 Token 就是省钱,而 Token 的三大放大器是——长上下文、长输出、Agent 多步调用。

对 AI PM 来说,这张账单就是单位经济的起点:先看懂每个用户每天在烧多少钱,才能谈 ARPU 与 COGS,才能谈商业模式能不能成立。 会算这笔账,是 AI 产品从"能跑"走向"能盈利"的第一步。

下篇预告

下一篇我们将进入 AI 产品经理无法回避的另一座大山:AI 产品的合规、安全与伦理设计。我们将讨论:全球主要市场的 AI 监管政策异同、如何建立 AI 产品的安全防线、"可解释性"如何从技术概念转化为产品功能、AI 的偏见与公平性问题如何被产品设计所缓解。敬请期待。

关于本系列:「AI 产品经理进化论」系列旨在为想做/正在做 AI 产品经理的读者提供一套完整的认知框架和实操方法论。所有方法论均来自行业实践总结,所有案例与数据均来自公开可查的行业报告与真实产品,无一编造。

相关学习资料

返回首页浏览学习资料