↑↑↑ 点击关注,了解AI干货!!!
把一份两百页的PDF拖进Claude聊天框,你以为是一次性收费,其实每问一句后续问题,那份PDF都要跟着对话历史重新算一遍token。这笔隐藏账单,做长文档分析的人多少都踩过。
Marktechpost团队做了个叫Token Saver的开源MCP扩展想解决这事,号称能把token消耗砍掉92%到99%,PDF全程留在本机不上传。这种数字看着漂亮的通稿我见得不少,这次没有停在读通稿,把仓库克隆下来自己装了一遍。
仓库地址是github.com/Marktechpost/Token-Saver,13颗星,MIT协议,最新一个release是v1.1,标签version1,跟通稿里说的完全对得上。作者是罗切斯特理工学院的在读学生Arnav Rai,在Marktechpost实习期间做的,README里挂着他和两位带教人的领英主页,不是匿名马甲项目。核心检索逻辑我翻了源码,index_store.py里写死的权重是kw_weight=0.4, sem_weight=0.6,跟通稿说的"关键词0.4、语义0.6"分毫不差,这个数字不是编的。
真实装一遍,作者自带的124个测试我也跑了
克隆仓库后建了个虚拟环境,按requirements.txt装真实依赖(sentence-transformers、pypdf、tiktoken这些),没有卡在依赖冲突上。装完直接跑作者自带的两组测试,index_selftest.py结果是18 passed, 0 failed,mcp_selftest.py结果是106 passed, 0 failed,跟README里承诺的数字一模一样,这套代码不是挂着测试文件当门面。

拿一篇真实论文测检索效果
光看测试通过还不够,我又找了篇真实论文practice,经典的Attention Is All You Need,15页,用仓库自带的retrieve.py直接问它「多头注意力是怎么计算的」。真实输出的覆盖报告里,语义检索命中了页4、页5这些讲模型结构的地方,跟人工去翻这篇论文找到的位置一致。用tiktoken按官方同款方法一算,整篇论文编码后是10172个token,这次检索只返回了2648个,省了74%。
这个数字比通稿里92%到99%低不少,但这恰恰是真实测出来的东西,官方自己的评测表里也写了同样的规律,文档越长省得越多,233页的法院判决书能省到99.4%,我这篇15页的论文天然占不到那么大便宜,短文档的读者对这个数字得有心理预期。
我还真复现了作者自己标注的一个已知缺陷
仓库里有个专门记录已知问题的文档,说这套检索的"弃权门槛"在某些情况下会失灵,一个完全无关的问题只要碰巧沾上文档里的一个常见词,就可能被当成命中,返回一段风马牛不相及的内容,而不是老老实实说"这篇文档里没有"。我拿这篇AI论文试了一句「NFL橄榄球训练营的赛程安排」,六个词里有四个在论文里完全查无此词,但因为"训练"这个词跟论文里的"training"沾了边,真被判定为命中,翻出论文中间几页内容硬凑成答案,而不是弃权。这个坑作者自己写进文档里了,我这次是拿真实数据把它复现了一遍,不是转述。

值不值得装
这次测试用的是仓库里的底层Python引擎,不是在Claude Desktop的图形界面里把插件装上跑一次真实对话,这一步我这台机器没条件演示,如实说清楚。但检索算法本身、测试套件、token计算这几件事都是我真跑出来的,不是复述通稿。
想用的话记得两件事,README里写着推荐用Claude 3.5 Sonnet当默认模型,处理法律判决这种多方观点混杂的文档时Opus表现更细致;另外每次答案都带精确页码,别嫌麻烦,真去翻一眼引用的那一页,这次实测证明了它偶尔真会把不相关的内容当成答案端出来。
你平时处理长PDF是靠直接拖进对话框硬啃,还是有自己的一套省token办法,评论区聊聊。
本号每周实测 Claude Code 和新出的 AI 工具,关注我,别错过下一次这样把源码跑一遍的实测。
⭐ 点赞、转发、在看三连,星标不错过⭐
15 年 Top 外企 IT,专做 AI 落地,边踩坑边记录。同路人,欢迎来。
夜雨聆风