乐于分享
好东西不私藏

AI 编程工具烧掉多少 Token?10 个立竿见影的降本技巧

AI 编程工具烧掉多少 Token?10 个立竿见影的降本技巧
最近跟几个准备春招的同学聊,发现一个普遍现象:AI 编程工具(Cursor、Claude Code、GitHub Copilot、通义灵码、Trae……)确实让效率起飞,但账单也跟着起飞。
有人一个月 API 费用三四百,甚至过千。但仔细一拆,里面至少有一半是「浪费」——不是模型太贵,而是你用错了姿势
这篇文章不聊虚的,直接给你 10 个能马上落地的降本技巧,最后附一张速查表。
一、Token 到底花在哪了?
先搞清楚钱烧在哪,才能对症下药。AI 编程工具的成本,主要来自四个「隐形吞噬者」:
  1. 上下文膨胀:每一轮对话,模型都要把你之前的所有对话历史 + 引用的文件重新读一遍。聊得越久,单次请求越贵。
  2. Agent 多轮调用:Agent 模式会自己读文件、跑命令、再读输出,一个任务可能偷偷调了几十次模型。
  3. 整段粘贴大文件:把几千行的文件全贴进 prompt,或者让工具每次都扫描整个仓库。
  4. 重复解释需求:每次新开会话都重新说一遍「我们项目用 React + TypeScript、禁止 any……」。
二、10 个立竿见影的降本技巧
1. 大小模型分工,别什么都上旗舰
强模型(Claude Opus、GPT-5 级)干重活:架构设计、复杂重构、难 bug 定位
杂活(代码补全、格式转换、单测生成、变量重命名)用便宜的小模型甚至本地模型就够了。
Cursor / Claude Code 都支持在设置里给不同场景指定不同模型,Copilot 也有「基础模型 + 旗舰模型」切换。
2. 收紧上下文,别让工具扫描整个仓库
  • 用 @文件名精确引用单个文件,而不是让 agent 自己去翻整个 repo。
  • 把超长文件拆小,一个函数一个文件胜过 2000 行巨石。
  • 用规则文件固化规范(见第 3 条),减少「重复解释」带来的 token。
3. 用规则文件替代「每次重复说一遍」
把项目约定写进规则文件,新会话自动加载,一次写好,永久省 token
.cursorrules(Cursor)示例:
# 项目约定
- 技术栈:React 18 + TypeScript + Vite
- 禁止使用 any,优先用 unknown + 类型守卫
- 组件用函数式 + hooks,不写 class 组件
- 提交前必须跑 pnpm lint && pnpm test
Claude Code 对应 CLAUDE.md,Copilot 对应 .github/copilot-instructions.md,通义灵码/Trae 也有类似机制。
4. 开启 Prompt Caching,长提示成本直降 90%
很多平台(Claude、OpenAI)支持把不变的 system prompt / 项目说明做缓存,命中后这部分 token 按 1/10 计价。
OpenAI 示例(在请求里加 cache_control):
from openai import OpenAIclient = OpenAI()resp = client.chat.completions.create(    model="gpt-4o",    messages=[        {"role""system""content"open("project_rules.txt").read()},        {"role""user""content""给这个模块加单元测试"},    ],    # 全局请求缓存配置,作用于整轮对话上下文    prompt_cache_options={        "enabled"True,        "ttl""1h"  # 缓存存活时长    })
关键:把「稳定不变的大段内容」放前面并标记缓存,变化的用户问题放最后。
5. 日常补全交给本地小模型
不是所有代码补全都需要云端旗舰模型。Ollama 跑本地 coder 模型做日常补全,0 云端成本:
# 安装并启动本地模型
ollama pull qwen2.5-coder:7b
ollama run qwen2.5-coder:7b
Cursor / 通义灵码 / Cline 都能把「补全模型」指向本地 Ollama,只在需要复杂推理时才调云端。
6. 设预算、设上限,别等到月底才傻眼
  • 给每次请求设 max_tokens,防止模型喋喋不休输出几千字。
  • 在平台后台开用量告警(到 50 元 / 100 元自动邮件提醒)。
  • Cursor、Claude 都有「用量面板」,每周看一眼,找出「吞 token 大户」。
7. 短对话、一次说清,别养出超长会话
对话越长,上下文越臃肿。建议:
  • 一个任务开一个新会话,别把一个会话聊成「长篇连续剧」。
  • 指令一次给全:「用 Python 写一个读取 CSV 并按金额排序的脚本,要处理空值,输出到 result.csv」——比来回追问省得多。
  • Claude Code 里用 /clear 清掉无关上下文再开新任务。
8. Agent 模式节制使用
Agent 模式强大,但。普通补全、单文件修改用普通模式;只有需要「跨多个文件、自己探索代码库」时才开 Agent。很多人把 Agent 当默认模式,等于天天开空调还开着窗。
9. 批量处理,一次顶十次
需要给一批相似文件做同一类改动(比如统一加日志、统一改 API 调用方式),一次性让模型批量处理,而不是反复单文件调用。一次带清楚上下文,复用同一段 system prompt,token 效率最高。
10. 定期复盘用量
每月导出一次账单,按「模型 / 会话 / 工具」维度看分布。你会发现:80% 的浪费往往来自 20% 的使用习惯。改掉这几条,成本立刻腰斩。
三、主流工具省 Token 配置速查
工具
规则文件
省 token 要点
Cursor
.cursorrules + Notepads
@ 精确引用;补全用小模型;Agent 节制
Claude Code
CLAUDE.md
/clear 清上下文;--model 切小模型;开 caching
GitHub Copilot
.github/copilot-instructions.md
指令文件固化规范;用基础模型做补全
通义灵码 / Trae
工程规则配置
本地模型兜底;精确引用文件
四、一句话总结
AI 编程工具的成本,不是模型决定的,是使用方式决定的。 大小模型分工、收紧上下文、善用缓存和本地模型、设预算——这四件事做到位,成本至少砍一半,效率还不降。
如果你正在准备 AI Agent 方向的就业,想系统性地做出能写进简历的实战项目,欢迎关注我的公众号。