乐于分享
好东西不私藏

AI工具的使用成本

AI工具的使用成本

最近各个公司都开始收紧大家的AI token额度,因为投入产出比不对,大家都在消耗大量的token去做一些无关痛痒的事情。

有没有一个简单的评估方式?让使用者大致了解投入产出比?

由于所有模型都是按token作为单位进行计费的,我们就来简单拆解下:

01

Token消耗拆解

我们拆解一个简单的例子:

第二轮模型输入70+76字为第一轮对话的内容,模型需要对本轮对话的所有内容做分析(上下文),才能给出正确答案。

02

Token成本拆解

一个汉字/单词,我们按2个Token来做估算。

输入和输出的价格不同,越专业的模型,输出的价格越高。

注:下方表格中T表示Token

分类
模型名称
输入(元/千T)
输出(元/千T)
场景
轻量化经济型
Qwen-Turbo、DeepSeek V4 Flash、Moonshot-v1-8k
0.012 ~ 0.02
0.012 ~ 0.05
低成本批量处理摘要、翻译、简单问答
中端通用主力
Qwen-Plus、ERNIE 4.0、GLM-4-Air
0.08 ~ 0.12
0.20 ~ 0.24
日常办公写方案、公文、客户对话与基础代码
高端旗舰专业
Qwen-Max、GPT-4o、Claude 3.5 Sonnet
0.07 ~ 1.00
0.35 ~ 3.00
复杂推演、合同审核、专业深度报告等高价值工作

我们按轻量化模型运行,价格取该区间的中间值,那么刚才2轮对话的费用为:

轮次
类型
字数
Token 
单价(元/千T)
费用 (元)
合计 (元)
第一轮
模型输入
70
140
0.016
0.00224
0.016748
模型输出
76
152
0.031
0.004712
第二轮
模型输入
186
372
0.016
0.005952
模型输出
62
124
0.031
0.003844

03

Token成本举例

场景分类
计费逻辑
Token 计算
纯文字对话
输入提问 + 输出回答,分开计价
中文 1 字≈2Token,输入、输出分别统计
图片理解(看图问答)
图片转视觉 Token 计入输入,
提问文字算输入,
AI 回答算输出
448×448 低清图固定 256Token
1024×1024 高清图约 930Token
文生图(AI 画图)
提示词算输入 Token,生成图片的视觉 Token 算输出,输出单价上浮
生成图片按像素算输出视觉 Token
视频理解(视频解读)
视频每帧转视觉 Token 计入输入,提问文字算输入,AI 解读算输出
单帧 448×448 图 = 256Token
总视觉 Token = 帧数 × 单帧 Token
文生视频(AI 生成视频)
文案提示词算输入 Token,生成视频的帧序列 Token 算输出,输出单价大幅上浮
视频总 Token = 时长 × 帧率 × 单帧 Token
AI 音乐生成
作曲提示词算输入 Token,
生成音频的波形 Token 算输出
10 秒音乐≈1000 音频 Token
AI 制作 PPT
多轮文本交互,
需求文案算输入,
大纲 / 每页内容算输出
所有文本按中文 1 字≈2Token 换算
AI 电脑自动化(小龙虾操作电脑)
每一步操作都是一轮对话,
桌面截图算输入视觉 Token,
操作记录算输入,
动作指令算输出
单步截图 448×448=256Token,
历史操作 / 动作指令按 1 字≈2Token

从这个表格中看到,图片是按像素计算token,

视频是按帧拆成图片计算token,

电脑自动化是按桌面截的图片计算token。

04

如果在使用前计算投入产出比?

现在,我们就可以按计算投入产出比。

我的主要AI对话内容是文字和图片。

假设每一轮对话都包含刚才的保温杯类似内容,再加一张高清图片。

每个月100块的预算,可以实现3630次。