ARTICLE · 1159700
PageIndex 别再切文档了,RAG 该动脑了

你有没有这种经历:把几百页的财报丢进 RAG,问「去年毛利率多少」,它却回你一段八竿子打不着的相似段落?向量检索靠的是语义相似,可相似不等于相关。「每日开源」今天聊的这个项目,干脆不建向量库,让大模型像人翻书一样去读文档。
项目简介
PageIndex 是 VectifyAI 开源的一个「无向量、推理式」RAG 引擎。它的出发点很朴实:人读一份长报告,不会先把整本拆成碎块再比相似度,而是翻目录、定位章节、最后细读。PageIndex 把这套动作变成了「树状索引 + 大模型推理」。建索引时给文档生成一棵结构树,检索时让 LLM 顺着树推理着往下找。灵感来自 AlphaGo——用推理代替暴力匹配。结果能追溯到具体出处,你一眼就知道答案从哪来。
传统方案里,检索质量卡在「相似度」这一关:关键词没对上、说法换了个表述,相关内容就漏掉了,不相关的内容反倒被挑出来。PageIndex 把判断交给会推理的模型,流程变成两步——先建树,再在树里找。检索从「比距离」变成了「走流程」,对长文档格外友好。
核心功能
树状索引,替代向量库
文档被理解成层级结构,检索不再依赖 embedding 之间的距离,也就没有 chunk 切分的烦恼。
推理式检索
LLM 像专家一样在树里「翻找」,能处理需要多步推理和领域知识的专业文档。
本地即用,也能上云
pip 装好就能在本地跑,用自己的模型 key;同一套客户端也能接 PageIndex Cloud。另有 PageIndex Flash 针对文本型 PDF 快速建树,已成默认方式;文件级文件系统还能扩展到百万级文档的语料库推理。
使用场景
• 金融与合规:季报、监管文件、法律合同里找某个条款或数字,答案带明确出处,审计友好。
• 技术手册与学术文献:长手册、教科书、医学文献的精确问答,不再被「相似但不相关」误导。
• 企业内部知识库:制度、规格书、历史纪要散落各处,用它做跨文档推理,新人不至于翻到头晕。
这类场景的刚需其实是「可解释」。PageIndex 的答案会带着它走过的章节路径,哪一段支撑了结论清清楚楚,拿去汇报或审计都站得住脚,而不是甩给你一句没头没尾的摘要。
上手建议
装好就能试(需自备 LLM key)。index 和 chat 都支持换成你自己的模型;本地模式下数据不出本机,敏感文档也放心。先跑通一个 PDF,再决定要不要上云。
pip install -U pageindex
import os from pageindex import PageIndexClient os.environ["OPENAI_API_KEY"] = "your-openai-key" client = PageIndexClient( index="gpt-5.6.luna", # 建树用的模型 chat="gpt-5.6.sol", # 检索用的模型 ) doc_id = client.submit_document("report.pdf")["doc_id"] answer = client.chat("What was the 2023 operating margin?", doc_id=doc_id) print(answer)
结尾
如果长文档检索一直是你的痛点,去 GitHub 给 PageIndex 点个 Star 吧,3.8 万星的项目值得一试。
① 觉得有用点个「在看」,分享给需要的同事;
② 关注本号,每天一个值得收藏的开源项目;
③ 你最想看哪类项目?前端 / 后端 / AI / DevOps?评论区告诉我,下期安排。
关注公众号,AI时代不迷路,创建价值活下去