摘要
你丢一份 100 页的 PDF 给 Claude,让它帮你找几个关键条款。
它吭哧吭哧把整份 PDF 的 token 全塞进上下文,给出答案。挺好用。
但你打开账单一看,一次对话,烧掉 8 万 token。按 Sonnet 5 的定价,$0.24 没了。
你一天要处理 10 份这样的 PDF,每份问 3 个问题。
月底账单:$216。一年 $2,592。
更糟的是——你的合同、财报、病历,全都上传到了 Anthropic 的服务器。
有没有办法让 Claude 只吃该吃的那点 token,剩下的靠本地检索补?文件还不上传?
有,本周刚上线的一个开源工具,把这事做到了极致。
一句话定位
Token Saver 是 Marktechpost AI 团队 7 月 30 日发布的一个 Claude Desktop 扩展。
它干的事很简单:你在本地指定一个放 PDF 的文件夹,问 Claude 问题时,它先在本地把相关段落检索出来,只把那几段喂给模型——不是整份 PDF。
省多少?仓库公开的 eval 数据是 92-98%——但有条件。条件是什么,后面说。
GitHub 地址:https://github.com/Marktechpost/Token-Saver ,截至发文 41 star。
🗣️ 说人话:以前你问 Claude 关于 PDF 的问题,模型必须接收整份 PDF 的全部 token 才能回答;现在它只需要接收检索出的相关段落。极端高频大文件场景下,账单可能从 $216 量级降至 $8 量级。
它是怎么做到的
原理不复杂,但值得讲清楚——因为这决定了它什么时候好用、什么时候没用。
Token Saver 用了"混合检索"(hybrid RAG):
整个过程跑在你本地。PDF 原文不整体上传——索引和检索都在本地完成,只有检索出的相关段落会通过 MCP 发送给 Claude 的云端模型。Embedding 模型第一次用会下载一次(2-5 分钟),之后就离线运行。
🗣️ 说人话:它先把 PDF 切成小块,给每块建索引。你问问题时,它先查索引找到最相关的几块,只把这几块给 Claude。模型看到的少了,账单就少了。
安装:5 步,真的不用 Python
我们最讨厌"安装只需 3 步"结果要装 7 个依赖的工具。Token Saver 这点比较诚实——真的不用 Python、不用终端、不用改配置文件。
token-saver-ccr.mcpb(一个文件)首次提问时 Claude 会问你"要不要用这个工具",选 Always allow。首次运行会下载 RAG 引擎(2-5 分钟),之后就很快。
两个使用习惯(README 里强调的):
仓库公开数据:92-99% 是真的,但有条件
我们看官方 eval 数据(2026-07-25 测量,30 个作者编写的问题,两份真实 PDF:213 页的 Dobbs v. Jackson 判决书 + 152 页的伯克希尔 2023 年报。注:样本量较小,不足以推断真实世界准确率):
Token 节省官方数据(按文档规模,tiktoken 测的):
看到关键了吗?
92-99% 对应的是 80-300 页的大文档 + 每轮重复粘贴的场景。
20 页的小文档,一次性粘贴只省 14%。15 页以下,切片可能比整份文件更贵——这时候别用。
🗣️ 说人话:大文档、反复问问题 → 省 90%+ 是真的。小文档、问一次就走 → 不值得折腾。
月度账单能省多少?
我们算一笔账——先声明,这是理论上限,不是真实用户收益。
假设你是重度用户:每天处理 10 份 100 页 PDF,每份问 3 个问题。并且假设你禁用一切缓存、每轮都全量重复粘贴整份 PDF(最差情况)。
这是最差情况下的上限。 实际上 Claude Desktop 有 file context 缓存,你大概率不会每轮都重新粘贴整份 PDF。实际节省通常低于这个数。
更现实的估算:如果你每月在 Claude 上处理 PDF 花 $50+,Token Saver 大概率能砍到 $5-10 的量级——具体取决于你的文档规模分布和使用频率。
🗣️ 说人话:账单越贵的人省得越多。每月花 $10 以下的用户,这工具对你意义不大。
它不适合什么场景
诚实讲几个限制(作者自己也披露了,这点值得赞赏):
适用场景:
✅ 推荐使用: 1. 法律合同(50+ 页)、财报(100+ 页)、教科书、长文档查询 2. 对隐私敏感的人(PDF 不上传) 3. 账单焦虑的 Claude 订阅者
❌ 不推荐使用: 1. 会议纪要(5-10 页)、研究论文(10-30 页,边界)、需要全文通读的创意写作 2. 需要图表解读的 PDF、多文档交叉引用
为什么本地 RAG 可能是一个重要方向
最后聊一个更大的趋势。
Token Saver 不是第一个做本地 RAG 的工具,但在目前公开可查的 Claude Desktop 扩展中,它是较早提供图形化一键安装方案(.mcpb 单文件)的本地 RAG 工具之一。
这背后的逻辑是:
我们上个月写过 Marker 2(PDF → Markdown 转换),那是在"格式转换"这一层做文章。Token Saver 是在"检索 + 计费"这一层做文章。两层加起来,PDF + AI 的工作流才算完整。
🗣️ 说人话:以前 AI 是"你把文件传上来,我帮你处理"。现在趋势是"索引和检索在你电脑上,只有必要的片段传给云端"。这是从"全量上传"到"本地驻在 + 最小传输"的转变。
数据来源:MarkTechPost 原文,https://github.com/Marktechpost/Token-Saver
关注「AI 效能派」,我们专注把 AI 工具讲成你能用的东西,不讲黑话、不画大饼。
夜雨聆风