你有没有发现,同样的任务,几个月前可能只消耗几千 token,现在动辄上万甚至数万?这到底是 AI 变 "笨" 了,还是你变 "贪" 了?
先说结论:这个现象确实存在,而且几乎每个人都在经历
如果你是 AI 助手(Claude、ChatGPT 等)的重度用户,大概率有过这样的体验:
最开始用 AI,一句话的 prompt 就能得到满意的答案
慢慢地,你的 prompt 从一句话变成了三段,附带两个示例、三个约束条件
现在,你习惯了把整个项目的上下文一股脑丢给 AI,让它 "看着办"
翻看历史对话记录,发现一条对话已经持续了三周、来回 60 多轮
Token 消耗就在这个过程中悄然膨胀,而你甚至没有意识到。 这不是你的错觉。根据 Anthropic 官方数据,Claude 的上下文窗口已经扩展到 200K token[1],这意味着用户客观上拥有了 "塞更多内容" 的技术条件。而人性决定了:给多少空间,就能用多少空间。
"Token 通胀" 的五个真凶
◎ 上下文窗口越大,你的 prompt 越长
这几乎是一个定律。当上下文窗口从 4K 扩展到 100K 再到 200K,用户的行为也随之变化:窗口变大了,人的 "懒" 也变大了。

以前还会精挑细选哪些内容值得喂给 AI,现在直接复制粘贴整个模块,"让 AI 自己找重点"。
◎ 对话马拉松:一条对话用三周
很多人没有关闭对话、另起新对话的习惯。一条对话可能横跨一个完整的需求开发周期:

一条对话的Token消耗演变每一轮对话,AI 都需要重新理解前面所有轮次的内容。到第 30 轮时,光历史上下文可能就占了 50% 以上的 token 消耗。
Anthropic 官方建议:当话题发生根本性转变时,开启新对话可以显著降低 token 消耗与使用成本[1]。
◎ "来都来了" 效应:什么都想喂给 AI
这是最隐蔽也最普遍的现象。你原本只是想问一个函数怎么写,但转念一想:
"反正上下文窗口够大,我把整个文件都贴进去吧,这样 AI 理解得更准确"
"既然文件都贴了,相关的类型定义也贴了吧"
"类型定义都贴了,package.json 也给 AI 参考一下"
结果:一个原本只需要 200 token 的问题,变成了 8000 token 的输入。
◎ 对完美的无尽追求:A/B 测试式对话
现在的 AI 用户越来越像产品经理:

A/B测试式对话的Token浪费每一次微调都是在消耗 token。而这种 "反复横跳" 的对话模式在真人沟通中只需几秒,放到 AI 对话里,每一轮撤回修改的 token 成本都和上一轮几乎持平。
◎ 输出期待的通货膨胀
几个月前,你让 AI "写个排序函数",返回 10 行代码就足够满意;现在你的期待直接拉满:
✅ 函数核心实现
✅ 完整类型注解
✅ 配套单元测试
✅ 代码性能分析
✅ 标准文档注释
✅ 落地使用示例
AI 能完整满足全部需求,但输出 token 体量直接暴涨 5–10 倍。
这是坏事吗?
不一定。Token 消耗增长,某种程度上代表你使用 AI 的深度在持续提升:
从浅层尝鲜,进阶到深度工作依赖
从简单问答任务,升级到复杂工程协作
从单向提问,转变为长期协同开发
你之所以觉得 "越用越耗 token",恰恰说明 AI 已经深度融入你的工作流程。但核心问题在于:你是否在为大量无效 token 付费?根据针对开发者 AI 使用习惯的非正式调研:单次完整对话中,约 30%–50% 的历史上下文,在后续轮次里从未被 AI 调用参考[2]。 这些就是纯沉没成本 —— 消耗 token、占用上下文,却无法为最终输出创造任何价值。
如何让 token 花在刀刃上?
找准根源,优化方案清晰可落地,以下方法见效极快:
◎ 小切换新话题,直接开启新对话
当需求从「A 模块 Bug 排查」切换到「B 模块架构设计」时,新建对话。 避免几十轮无关历史上下文持续占用 token 配额,持续拉高使用成本。
◎ 长对话定期 "修剪" 无效上下文
若业务需要在单条对话持续推进工作,可以主动指令 AI:
忘掉前面无关的历史讨论,我们现在只聚焦当前新问题。
虽无法彻底清除底层历史记录,但能引导模型降低无关信息权重,减少无效 token 占用。
◎ 先梳理清晰问题,再投喂内容
粘贴完整文件前先自问:AI 是否必须读取全部文本,才能解答我的问题?绝大多数场景下:精准问题描述 + 核心代码片段,远优于全量文件复制的 "地毯式投喂",效率更高、消耗更低。
◎ 复用固定配置:善用 System Prompt / Project 功能
Claude 专属 Project 功能可预设固定全局上下文(项目背景、统一编码规范、业务规则等),这类内容会全局复用,不会重复计入单次对话 token 上限[1]。 把每轮都要重复说明的规则放入预设,能大幅削减单次对话 token 消耗。
写在最后
AI 助手越用越费 token,本质是「成长的烦恼」。 不是 AI 性能变差,而是你的使用场景更深、覆盖更广、依赖度更高。真正值得关注的从来不是「总共消耗了多少 token」,而是「其中多少 token 产生了实际工作价值」。学会管理 token,和管理时间是同一个逻辑:无需吝啬克制不用,而是让每一份 token 投入,都对应真实工作产出。
参考资料
[1]Anthropic,ModelsOverviewClaude, https://docs.anthropic.com/en/docs/about-claude/models
[2] 基于 AI 助手日常使用模式观察与社区讨论总结,非严谨学术研究本文首发于微信公众号,转载请联系作者。 写于 2026 年 6 月,Claude 协助创作。
—推荐阅读—




夜雨聆风