COST · AI教程实战
OpenAI 新模型别乱点:一个任务选错,账单能翻几倍
GPT-5.5、GPT-5.4、GPT-5.4 mini 摆在一起,看起来只是能力差别,真正要命的是成本差别。选错模型,账单会悄悄变胖。
···
我以前选模型很粗暴。
重要任务就上最贵的,普通任务就上便宜的。
听起来没问题,但真跑几天账单就会告诉你:这办法太糙了。
OpenAI 现在的价格梯度已经拉得很开。
以我本轮核对到的公开价格页为例,GPT-5.5 常见标价是:
输入:$5 / 1M tokens 缓存输入:$0.5 / 1M tokens 输出:$30 / 1M tokens
GPT-5.4 常见标价是:
输入:$2.5 / 1M tokens 缓存输入:$0.25 / 1M tokens 输出:$15 / 1M tokens
GPT-5.4 mini 常见标价是:
输入:$0.75 / 1M tokens 缓存输入:$0.075 / 1M tokens 输出:$4.5 / 1M tokens
这不是“贵一点”和“便宜一点”的区别。
这是同一个任务,选错模型,成本可能直接差好几倍。
不过价格这件事要特别小心:模型名、上下文长度、缓存输入、Batch、代理平台,都会让最终账单不一样。
所以这篇文章不是让你背价格表,而是教你一个思路:先按任务风险分层,再按输出长度控成本。

···
01. 先别问哪个能力更强,先问任务值多少钱
很多人一看新模型,就想问:哪个能力更强?
这个问题没错,但不够实际。
更实际的问题是:
这个任务失败一次的代价是多少?
如果是上线前修一个支付 Bug,失败代价很高,用强模型合理。
如果只是把 300 条客服消息分分类,用旗舰模型就有点浪费。
模型选择应该看风险,不只看能力。
我现在会把任务分成三档。
···
02. 第一档:低风险任务,用 mini
适合 GPT-5.4 mini 这类模型的任务:
文本分类 简单摘要 标题备选 关键词提取 格式转换 FAQ 初筛 短文本润色
这些任务的特点是:
错了能改,影响小,判断标准明确。
比如把一批用户反馈分成“Bug / 建议 / 咨询 / 投诉”。
这类任务用旗舰模型,通常是浪费。
mini 便宜,速度也更适合高频调用。
💡 低风险任务,省钱就是能力的一部分。
···
03. 第二档:中风险任务,用主力模型
GPT-5.4 这类模型适合当主力。
它比 mini 贵,但没有 GPT-5.5 那么贵。
适合这些场景:
中等复杂代码生成 技术文档改写 产品方案梳理 长文章初稿 多轮问答 需求拆解 普通数据分析
这类任务有一定复杂度,但不一定需要最贵模型。
比如写一个后台管理页的接口说明,或者把会议记录整理成产品需求。
用 mini 可能会漏细节。
用 GPT-5.5 又可能过度。
GPT-5.4 这种中间档,反而是日常使用里最稳的选择。
···
04. 第三档:高风险任务,再上 GPT-5.5
GPT-5.5 适合什么?
不是所有“我觉得重要”的任务。
而是失败成本真的高的任务。
比如:
复杂代码重构 多文件工程修改 上线前风险复查 长上下文研究分析 关键合同条款梳理 复杂方案二次审查 需要更强推理的任务
这类任务贵一点可以接受。
因为它省的是人的复查时间,降低的是出错成本。
但如果你拿 GPT-5.5 去写 20 个小红书标题,那不是高级,是烧钱。
···
05. 输出 tokens 才是账单刺客
很多人只看输入价格。
但真正吓人的,经常是输出价格。
GPT-5.5 输出 $30 / 1M tokens。
GPT-5.4 输出 $15 / 1M tokens。
GPT-5.4 mini 输出 $4.5 / 1M tokens。
如果你让模型写长文、写代码、写报告,输出 tokens 会涨得很快。
我以前踩过一个坑:
让模型“详细分析这份文档,尽量完整”。
结果它真的很完整,写了一大堆。
看着很爽,账单也很爽。
后来我改成:
text
先输出 10 条以内的结论,每条不超过 80 字。需要展开时我再追问。成本立刻降下来。
💡 省钱不是少用 AI,而是别让它一口气写废话。
···
06. 缓存输入是被很多人忽略的省钱点
价格页里有一个很关键的数字:缓存输入。
GPT-5.5:
普通输入 $5 缓存输入 $0.5
GPT-5.4:
普通输入 $2.5 缓存输入 $0.25
差 10 倍。
这对什么场景有用?
系统提示词很长、项目规范很长、固定背景资料很长的时候。
比如你每次都把同一份项目规范、同一套写作规则、同一段背景资料放在 prompt 前面。
如果结构设计得好,缓存就能发挥作用。
简单说:
稳定不变的内容放前面,经常变化的问题放后面。
这样更容易命中缓存。
我以前喜欢每次把 prompt 写得乱七八糟,顺序也不固定。
后来才意识到,这不只是“不优雅”,还是在浪费钱。
···
07. Batch API 适合“慢一点没关系”的活
Batch API 这类异步处理方式,通常会给不需要实时返回的任务更低价格。
它适合什么?
适合不需要实时返回的任务。
比如:
夜里集中整理文档 离线清洗数据 集中做摘要 生成候选标题 统一格式化旧文章
但如果是聊天机器人、在线客服、实时编程助手,就不适合。
因为 Batch 的价值是便宜,不是快。
这点要分清楚。
···
08. 我的模型路由规则
我现在会这样分配。
用 mini 的情况
text
任务明确 + 错了能改 + 输出短比如分类、提取、短摘要。
用 GPT-5.4 的情况
text
需要理解上下文 + 有一定推理 + 但失败成本可控比如写方案、写文档、普通代码辅助。
用 GPT-5.5 的情况
text
任务复杂 + 上下文长 + 失败成本高 + 需要复查能力比如关键代码、重要文档、复杂研究。
这个规则不性感,但真的省钱。
···
09. 我会先做一个任务分流表
真正落地时,我不会每次都重新纠结模型。
我会先把常见任务写成一张表:
这张表的价值不是“永远正确”。
它的价值是:团队里每个人都知道默认怎么选,不会一上来就把所有任务丢给最贵模型。
如果某类任务连续三次翻车,就升级默认模型。
如果某类任务连续一个月都很稳,就尝试降一档。
这比凭感觉省钱靠谱多了。
···
10. 一个真实账单算法
假设一个任务:
输入 100K tokens 输出 20K tokens
用 GPT-5.5:
输入:0.1 × $5 = $0.5 输出:0.02 × $30 = $0.6 总计:$1.1
用 GPT-5.4:
输入:0.1 × $2.5 = $0.25 输出:0.02 × $15 = $0.3 总计:$0.55
用 GPT-5.4 mini:
输入:0.1 × $0.75 = $0.075 输出:0.02 × $4.5 = $0.09 总计:$0.165
看起来每次都不贵。
但如果一天跑 200 次:
GPT-5.5:$220 GPT-5.4:$110 GPT-5.4 mini:$33
一个月按 30 天算,差距就很明显了。
所以别小看单次几毛钱。
AI 账单最可怕的地方,是它悄悄重复。
···
11. 别把“深度思考”用在所有任务上
强模型会更认真。
但不是所有任务都需要认真到那个程度。
比如让它把“张三,男,28岁,北京”转成 JSON。
你不需要旗舰模型思考半天。
这类任务最重要的是稳定格式,不是深度推理。
我现在会给任务加一句限制:
text
不要展开解释,只输出 JSON。或者:
text
先给结论,最多 5 条。不要写背景介绍。这类小限制,能明显减少输出成本。
···
12. 新模型真正该怎么用
我的建议很简单:
先用 mini 跑一遍,看看任务能不能完成 不稳,再升到 GPT-5.4 还不稳,或任务很关键,再用 GPT-5.5 长提示词固定结构,尽量吃缓存 不急的任务走 Batch 限制输出长度,避免模型自由发挥
这套策略比“全程用旗舰模型”更现实。
强模型当然好。
但好模型也要用在值得的地方。
···
13. 最后说两句
OpenAI 新模型真正改变的,不只是能力。
还有使用方式。
以前你可以粗暴一点:一个模型打天下。
现在不行了。
模型越来越多,价格差距越来越大,选错就是烧钱。
所以别再问“哪个模型更强”。
更好的问题是:
这个任务,应该用多少钱的模型完成?
能回答这个问题,你才算真的开始会用 AI。
···
本文框架由 AI 辅助整理,价格信息按 2026-06-29 本轮可访问公开资料复核;不同入口、地区和上下文长度可能存在差异,发布前请再核对官方价格页。成本计算和模型选择策略按个人工具使用经验重写;相关工具仅用于个人学习与手动实操记录。
🤖 AI辅助制作说明
AI辅助制作说明:本文由 AI 辅助整理价格维度和表格结构;成本计算、任务分层和使用边界由我按个人工具使用经验重写。价格变化很快,发布前需再次核对官方价格页。
本文写于 2026.06。AI 工具、模型价格和节点版本变化很快,发布前建议再次核对官方文档和本机实测。
📌 爆款话题
如果这篇帮你少踩一个坑,点个「在看」就够啦。
夜雨聆风