读长 PDF 把 token 烧光,这个开源 MCP 把消耗砍掉 9 成
如果你经常拿 AI 读几十上百页的 PDF——合同、论文、财报、技术标准——多半碰到过这个问题:一份长文件扔进去,没问几句额度(额度,就是 AI 按用量收费的"字数")就见底了。Marktechpost AI 团队最近开源了一个叫 Token Saver 的工具,专治这个痛点:它让 AI 只读真正相关的那几段,把读 PDF 的额度消耗砍掉九成,而且全程在你自己电脑上跑,文件不上传。
1. 长 PDF 为什么这么烧额度
读长 PDF 时,AI 之所以费额度,是因为它默认要把整份文档"读"一遍才能回答你;而在对话里,这些内容每追问一次就重新算一遍钱。文件越长、问得越多,烧得越快。
Token Saver 做的事很简单:你问一个问题,它先在本地把文档里能回答这个问题的段落找出来,只把这些段落连同页码交给 AI。一篇 200 页的报告,它可能只挑出两三段给模型——既省额度,还常常更准,因为 AI 盯着一堆无关内容反而容易看走眼。
官方用两份真实文档(213 页的法庭判决书、152 页的伯克希尔年报)测过:文档越大、对话越多,省得越多。大约 300 页的文件在多轮对话里,额度消耗能省到接近 99%;但 20 页以下的小文件不值得用,因为找出来的片段可能比整份文件还长。
2. 它是什么:一个 Claude 桌面端扩展
Token Saver 是一个给 Claude Desktop 用的扩展(扩展,可以理解成"插件",装上后给 AI 增加一个新能力)。它基于 MCP(MCP,全称"模型上下文协议",是 Anthropic 推出的一套标准,让 AI 能调用外部工具和数据——这里你只要知道:它让 Claude 能"翻"你电脑里的 PDF)。

它用的核心技术叫"本地混合 RAG"(RAG,简单说就是"先检索后回答"——先找到相关内容,再让 AI 基于这些内容生成答案;"混合"指它同时用了关键词匹配和语义理解两种找法,互相补漏)。这套检索全程在你自己电脑上完成,文档不离开本机。
安装门槛出乎意料地低:不用装 Python、不用开命令行、不用改配置文件。去 GitHub 下载一个 `token-saver-ccr.mcpb` 文件,在 Claude Desktop 设置里一键安装,再选一个放 PDF 的文件夹就行。第一次用时会自动下载检索引擎(约 2–5 分钟),之后就很快。
3. 隐私和准确度
隐私是它的一个明确卖点:你的 PDF 全程留在本机,检索在本地跑完,只有最后那几段命中内容才发给模型。它还支持文件夹白名单,只允许读取你指定的文件夹。

准确度方面,官方在 30 道测试题上测得检索命中率约 90%,没有错误拒答该答的问题。每次回答还会附上"本次省了多少额度"的统计,并标注引用页码——你可以直接翻到原文核对。
4. 几个要注意的限制
任何工具都有适用边界,这个也不例外:
/// 适合谁,值不值得现在试
适合:经常用 Claude Desktop 读长 PDF 的人——做法律、研究、金融、技术文档的,尤其是动辄几十上百页、还要反复追问的场景。
不适合:不用 Claude Desktop 的人;只读几页短文档的人;希望开箱即用、零学习成本的纯新手(虽然安装简单,但首次配置和摸索用法仍需要一点耐心)。
判断:如果你正好是 Claude Desktop 的用户,又经常跟长 PDF 打交道,现在就值得试——开源免费、本地运行、安装确实简单,省额度效果在大文件上是实打实的。如果你用的是别的 AI 工具,可以先关注,等同类方案扩散到更多平台再说。
一句话:它没有宣传里"砍掉九成"那么普适,但把场景限定在"用 Claude 读大 PDF"时,确实是个省心省钱的好帮手。
—— Kail的AI工具箱
夜雨聆风