夜雨聆风学习资料网

ARTICLE · 1108489

我用 AI 半天烧掉 540 万 token:不想白花钱,先看懂这 3 笔账

我用 AI 半天烧掉 540 万 token:不想白花钱,先看懂这 3 笔账

9 月 25 日,Anthropic 说 Claude 独立算出了一个前沿物理难题;换成普通用户来做,大约要花一两千美元。

这个消息,让我回头看这次 AI 的账。

我让 AI 连续干了半天活。

任务是找数据源、导出,抓文章,做 GitHub 调研。最后留下的数字是:约 540 万输入 token,额度提前用完。

如果你也遇到过“我没干什么,额度怎么又没了”,这篇就帮你把账拆开。

先说结论:540 万看着吓人,但它不等于 540 万都按原价付费。其中约 92% 命中了缓存,计费便宜得多。

真正值得盯的,是另外三笔账:模型选贵了、每次背的东西太多、失败后又从头再来。

先别被 540 万吓住

token 可以先理解成 AI 处理文字和信息的计量单位。

它有点像快递计重。你收到的回答只是包裹,AI 在回答前读过的聊天记录、规则、文件和工具说明,也都要上秤。

所以,回答只有一行,不代表这次调用很轻。

我的项目里做过一次小测:只要求 Codex 回复一句“OK”,仍然用了 23,430 token。

不是“OK”很贵,而是它开口前,先读了一大摞系统说明、工具列表和项目规则。

同一天的 540 万输入 token 也是这样。其中大约九成命中缓存,不能拿这个总数直接当账单金额。

按更适合比较的口径,只算未缓存输入和输出,当天公众号项目约 69 万 token;其中失败和重复约 27 万,接近四成。

这才是该砍的地方。

AI 最容易浪费的,不是最后那句回答,而是回答之前反复搬进去的东西,以及失败后重走的路。

第一笔:小活也默认叫最贵的人

那天所有任务都默认用了最高档模型。难题这么做有理由,改个文件名、抓取一批页面、检查格式也这么做,就不划算了。

好比公司里复印、校对、定战略,全交给收费最高的顾问。活当然能干,账单也会一起抬高。

普通人用豆包、DeepSeek、ChatGPT 时,前台未必显示同一种 token 账单,但选择逻辑一样:先看任务难度,再选模型或模式。

比如,把一段会议录音整理成要点,用常规模型先跑;要比较三份合同里的责任差异,或者处理会影响决策的复杂材料,再换更强的模型,并由人复核。

我后来把项目改成:每次派任务,都必须明确填写模型和思考强度。配置缺失,流程直接报错,不再偷偷回到最贵的默认项。

你也可以在点发送前问一句:

•这是整理、改写、提取,还是分析、判断、规划?
•用普通模式先做,失败的代价大不大?
•真要换强模型,具体难点是什么?

别把“最强”当默认。最强模型应该解决最难的部分,不该承包所有杂活。

第二笔:每次对话都背着整间仓库

那次运行同时加载了 11 个插件、3 个 MCP、上百个技能说明,还有浏览器的大块页面快照。

这些东西并非全都没用。问题是,很多任务一次只需要其中很小一部分,却每次都把整套背景重新带上。

比如你让 ChatGPT 改一封请假邮件,却沿用一个聊了几个月的长对话。

让 DeepSeek 提取表格,又顺手上传整份项目资料;让豆包写商品介绍,还塞进与这款商品无关的品牌历史。

AI 要先读完,才知道哪些不用。

砍这笔账,不是把背景全删掉,而是只带本次任务会用到的部分:

•新任务另开对话。
•长文件先标出页码或章节。
•工具只开需要的。
•固定规则保留,参考资料按任务加载。

一个简单判断是:删掉这段背景,AI 还能正确完成吗?如果能,它大概率不该跟着这次任务走。

上下文不是越长越专业。真正有用的上下文,应该让 AI 少猜;无关上下文只会让它多读。

第三笔:报错以后,又从第一步开始

540 万 token 里,最可惜的不是缓存,而是失败和重复。

项目记录里,同一轮工作遇到沙箱问题后重跑,GitHub 调研重复做了三遍;同一个任务也出现过重复派单。

按未缓存输入加输出的同一口径,失败和重复约占当天用量的四成。

这类浪费很隐蔽。你只看到“再试一次”,AI 却可能重新读取材料、重新规划、重新生成已经完成的部分。

比如让 AI 做一份 30 页 PPT,第 25 页导出失败。最贵的做法是把原提示词再发一遍,让它从第 1 页重做。

更省的做法是:

•先保存大纲、文案和已完成页面。
•明确告诉它:“前 24 页已验收,只处理第 25 页导出失败;完成后继续剩余页面。”

我后来把长任务改成可续跑流程,并记录失败点。派单脚本还把模型和强度设为必填。

随后,流水线用 mock 方式完整走过选题、写作、配图、排版、审核、推送、通知七个阶段。

这里要说清边界:mock 证明流程能接起来,不代表每个外部服务都完成了真实调用。但它至少让失败停在哪、下一次从哪继续,变得可检查。

送你一张“AI 省 token 三查表”

下次准备把任务发给 AI,先花半分钟过一遍:

【模型档位】 这次是整理执行,还是复杂判断? 普通模型能不能先完成 80%? 如果必须用强模型,难点具体在哪?  【上下文负重】 这次真正要用的文件、聊天记录、工具有哪些? 删掉哪段背景,结果仍不会变? 能否新开对话,只放必要材料?  【失败重跑】 任务分成了哪些可验收的小段? 中途失败后,完成品和失败点保存在哪里? 重试时能否只做失败部分,不从头生成? 

这张表不是让你一味省 token。

重要合同、复杂分析、关键代码,该用强模型就用;一段背景如果决定结果,也必须保留。省钱的目标,是删掉无关消耗,不是拿结果冒险。

Claude 完成九圈六粒子(六边形)散射振幅计算的案例,给了一个很好的参照。

研究者只给了一句题目,之后基本只说“继续”。它运行了很长时间,其中一段计算相当于 96 个 CPU 跑了一周;普通用户来做,大约要花一两千美元。

研究者用另一种方法做了交叉验证,另有学者独立算出了大部分结果。

但它沿用的是物理学家已经发展出来的方法,不是凭空提出了新物理。这个边界很重要。

一两千美元当然不便宜。和一项经过核对的前沿计算结果放在一起,它的投入才有意义。

所以,判断 AI 贵不贵,别只看总 token,也别只看会员月费。要看这笔消耗换回了什么,又有多少花在了与结果无关的地方。

会用 AI 的人,不是每次都选最便宜,而是知道每一笔额度为什么花。

最后想问你:你最近哪一次 AI 任务最容易从头重做——写长文、做 PPT,还是分析文件?在留言区说一个具体任务。


参考(查证日期 2026-09-30):

1.DeepTech 深科技《Claude 独立攻克理论物理前沿难题,全程无人指导,花费不到两千美元》,2026-09-26,http://mp.weixin.qq.com/s?__biz=MzA3NTIyODUzNA==&mid=2649806145&idx=1&sn=77660f95569ed835f5ba9a2f07a6e393&chksm=8607b8ae879881efac42687b2daadf791c48d5f11e30c043dc62935b30a57af3107f4809727e&scene=126&sessionid=0#rd
2.Anthropic《Yes, Claude can do nine loops》,2026-09-25,https://www.anthropic.com/research/yes-claude-can-do-nine-loops
3.《来源核对-Anthropic 原文》,2026-09-30 核对,内部记录:运行/a/20260929-2031/来源核对-Anthropic 原文.md
4.公众号运营项目《踩坑记录》,2026-09-29,内部记录:规范/踩坑记录.md
5.公众号运营项目《Codex-06 回执》,2026-09-29,内部记录:任务单/Codex-06-调度与夹具-回执.md

本文由 AI 创作:选题、写作、配图均由 AI 完成,内容基于真实运行记录,事实已核对来源。

相关学习资料