ARTICLE · 1130717
我给AI编码工具算了账,钱花在重读上.
我算了一笔账,算完之后我把订阅费那张表重新看了一遍。
不是因为它贵。是因为我发现自己付的钱里,大部分买的是「重复」。
现象:我让它干 88 步活,它读了 17 万字的同一段话
我先拿出本机一个真实会话的账本 —— 这是我平时干活留下的记录,不是我编的:
| 5510912 | |
「5510912 / (5510912 + 242777) = 95.8%」。
这个会话里,95.8% 的输入 token 是「缓存读」。
我一开始的想法跟你可能一样:那挺好,说明缓存生效了,省钱。
然后我把这个数换算了一下:88 步 × 每步约 1955 tokens 的固定负载 ≈ 17.2 万 tokens。
这 17.2 万 tokens 是什么?是工具表定义 + 系统提示词 + 历史消息,每一步原样重发一遍。用户真正新说的话、工具真正返回的新内容,占比不到 5%。
我拿另一个更长的会话复核了一遍:70 步、只轮 1 次,未缓存 69189 / 缓存读 2351104 —— 缓存读占 97.1%。会话越短、来回越少,这个比例反而越高,因为那套固定负载(工具表 + 系统提示词)是被摊薄的次数少了,但每一步都得带,一次不落。
我付钱让它干活,它 95% 的时间在读一本它已经读过的书。
我的判断:缓存不是打折,是把贵的东西换了个价签
很多人的算法是这样的:「缓存读只按输入价的 10% 计费,所以成本基本可以忽略。」
我按这个逻辑核算了一遍 —— 用的是本机 10 个真实会话的合计数据(未缓存 449554 / 缓存读 9202688):
| 67.2% | ||
| 83.7% |
即使缓存只按 10% 计价,你账上那笔输入成本里,仍然有 67% 是「重复」贡献的。
换成 25% 就更明显:83.7%。
这就是我要说的:缓存不是让这笔开销消失了,是把贵的东西换成了便宜的价签。量还在。 单位价格降了 10 倍,但次数没变 —— 你还是在为同一段文字付 230 次钱,只是每次便宜了。
还有一个更难算的账:延迟不跟着打折。
| 1.346s |
上下文从 464 涨到 3692(8 倍),延迟从 0.684s 涨到 1.346s(1.97 倍)。
缓存命中了又怎样。算力的账可以打折,延迟的账一分不打。 而延迟是你自己坐在屏幕前等的时间 —— 这部分从来不进账单,只进你的耐心。
我顺便试了另一件事:把同一个请求原封不动连发 5 次,看命中缓存能省多少时间。结果 「cached_tokens」 恒定 256,耗时 0.744 → 0.676s,只降了 9%。
9%。这就是「完全命中」能给你的全部红利。换句话说,缓存的价值几乎全在钱上,一点不在时间上。 如果你用 AI 编码工具时最大的痛点是「等」,那缓存帮不了你 —— 能帮你的只有把上下文缩短。
一个可执行动作
下次你看 AI 编码工具的参数表,别只看「模型多强」「上下文多长」。
去看它每一步的 「prompt_tokens」 里,重复的有多少。
具体怎么查:如果你的客户端能看 usage(大多数 CLI 都打日志),抓一次任务中间某一步的 「prompt_tokens」,再对比你实际新输入的字数。两者的比值,就是你的「重复税税率」。
我本机那个 88 步的会话,这个税率是 95%。
再补一个反直觉的点:这个税率会随着任务变长而变高,不会变低。 因为那套固定负载每步都带,任务越长,累积的重复就越多;而真正的新内容是被「摊」在固定负载上的。所以长任务不是线性变贵,是重复项在复利。
结论一句话:AI 编码工具真正的开销不在模型有多聪明,在它每一次思考都要把同一本书重读一遍。你为「聪明」付的钱,大头是重复。
参考来源
1. 本机实测 — 10 个真实 dsh 会话 token 账本(「~/.dsh/storages/session_projcache/sessions/*.json」),2026-10-06
2. 本机实测 — 上下文长度 vs 首 token 延迟对照(464 / 731 / 1536 / 3692 tokens),2026-10-06
3. 本机实测 — 22 个工具 schema 的 prompt_tokens 增量(2359,裸问 12),2026-10-06
4. OpenAI API 定价页 — 「cached_tokens」 计费口径(缓存读通常为输入价的 10%–25% 区间)
5. SGLang 文档 — 前缀缓存(RadixAttention)机制
6. 本机实测归档 — 「AI 变现\实测_Agent隐式提示词账本_20261006.md」
数据说明:token 数与耗时均为本机单机实测,受硬件与后端负载影响会有波动,重复测量取中位数。缓存计价比例(10%/25%)为公开定价区间的示例取值,非本机账单实测值;换算结果用于说明量级关系,不代表任何具体厂商的实际账单。第三方定价与机制说明来自公开文档,非官方对本机环境的承诺。
声明:本文为原创实测核算,数据来源于本机实跑记录。文中涉及的第三方产品归各自权利人所有。
🔔 深耕 AI 干货 | 点名片订阅,上新早知道
💡 仍有疑问?一键呼叫在线答疑
✅ 全时段AI查询
✅ 专属个性化方案建议
⬇️ 长按识别二维码直达咨询
私信AI回复 | 24小时在线答疑

长按识别二维码,进入公众号发消息咨询
📊 硬件实测库 · 小程序
四十多个模型跑不跑得动你的机器,先在这里算一遍再下单。
🧮 适配器 · 45 模型 × 33 机型 | 🔍 核验器 · 商用判定🚀 部署单 · 14 类场景 | 📈 对照台 · 9 台真机实测
扫码进入「硬件实测库」小程序
