ARTICLE · 1094531
贴长文档,账单为什么贵
贴长文档,账单为什么贵
贴长文档,账单为什么贵
你只是把一篇长文档丢进对话框,没多问模型什么,月底账单却贵了一截。这钱不是模型临时涨价涨出来的,是你喂进去的每一个字都在按 token 计费。
长文档最坑的地方:它把每次提问的“输入量”都撑大了。更狠的是来回多轮对话,要是没开提示词缓存,每一轮都要把整篇长文档重新读一遍、重新计费。一篇文档聊十轮,就被收了十遍。
开了缓存就不一样。以 Anthropic 的 Opus 5.5 为例,官方列价:输入 4 美元、缓存读 0.20 美元,每百万 token。缓存读价大约是输入的二十分之一。长文档只要开了缓存,第一轮读完,后面轮次就走这条便宜二十倍的低档,反复计费的压力才压得住。反过来没开缓存,输出又是输入的 5 倍价,长文档的输出也跟着贵。
所以长文档这笔账,差在“档位”不在“字数”:同一个字,落在输入档和缓存读档,能差出 20 倍。你以为是文档太长才贵,其实是每轮重算加上没走缓存低档,两件事叠在一起。
真要算自己花多少,任务跑完敲 /usage,看会话那栏三行(缓存读、新输入、输出)就行。
长文档不是免费扩容。先开缓存,再看上下文窗口,别让同一篇文档被反复计费。
下一张讲另一件事:图片和音频为什么不按字算钱。Anthropic 官方文档里“prompt caching(提示词缓存)”这几个词能直接搜到。
收录于token计费词典
作者提示: 个人观点,仅供参考
上海,1小时前,