夜雨聆风学习资料网

ARTICLE · 1159700

PageIndex 别再切文档了,RAG 该动脑了

PageIndex 别再切文档了,RAG 该动脑了

你有没有这种经历:把几百页的财报丢进 RAG,问「去年毛利率多少」,它却回你一段八竿子打不着的相似段落?向量检索靠的是语义相似,可相似不等于相关。「每日开源」今天聊的这个项目,干脆不建向量库,让大模型像人翻书一样去读文档。

项目简介

PageIndex 是 VectifyAI 开源的一个「无向量、推理式」RAG 引擎。它的出发点很朴实:人读一份长报告,不会先把整本拆成碎块再比相似度,而是翻目录、定位章节、最后细读。PageIndex 把这套动作变成了「树状索引 + 大模型推理」。建索引时给文档生成一棵结构树,检索时让 LLM 顺着树推理着往下找。灵感来自 AlphaGo——用推理代替暴力匹配。结果能追溯到具体出处,你一眼就知道答案从哪来。

传统方案里,检索质量卡在「相似度」这一关:关键词没对上、说法换了个表述,相关内容就漏掉了,不相关的内容反倒被挑出来。PageIndex 把判断交给会推理的模型,流程变成两步——先建树,再在树里找。检索从「比距离」变成了「走流程」,对长文档格外友好。

核心功能

树状索引,替代向量库

文档被理解成层级结构,检索不再依赖 embedding 之间的距离,也就没有 chunk 切分的烦恼。

推理式检索

LLM 像专家一样在树里「翻找」,能处理需要多步推理和领域知识的专业文档。

本地即用,也能上云

pip 装好就能在本地跑,用自己的模型 key;同一套客户端也能接 PageIndex Cloud。另有 PageIndex Flash 针对文本型 PDF 快速建树,已成默认方式;文件级文件系统还能扩展到百万级文档的语料库推理。

使用场景

• 金融与合规:季报、监管文件、法律合同里找某个条款或数字,答案带明确出处,审计友好。

• 技术手册与学术文献:长手册、教科书、医学文献的精确问答,不再被「相似但不相关」误导。

• 企业内部知识库:制度、规格书、历史纪要散落各处,用它做跨文档推理,新人不至于翻到头晕。

这类场景的刚需其实是「可解释」。PageIndex 的答案会带着它走过的章节路径,哪一段支撑了结论清清楚楚,拿去汇报或审计都站得住脚,而不是甩给你一句没头没尾的摘要。

上手建议

装好就能试(需自备 LLM key)。index 和 chat 都支持换成你自己的模型;本地模式下数据不出本机,敏感文档也放心。先跑通一个 PDF,再决定要不要上云。

pip install -U pageindex

import os from pageindex import PageIndexClient  os.environ["OPENAI_API_KEY"] = "your-openai-key"  client = PageIndexClient(     index="gpt-5.6.luna",   # 建树用的模型     chat="gpt-5.6.sol",     # 检索用的模型 ) doc_id = client.submit_document("report.pdf")["doc_id"] answer = client.chat("What was the 2023 operating margin?", doc_id=doc_id) print(answer)

结尾

如果长文档检索一直是你的痛点,去 GitHub 给 PageIndex 点个 Star 吧,3.8 万星的项目值得一试。

① 觉得有用点个「在看」,分享给需要的同事;

② 关注本号,每天一个值得收藏的开源项目;

③ 你最想看哪类项目?前端 / 后端 / AI / DevOps?评论区告诉我,下期安排。

#github#开源

关注公众号,AI时代不迷路,创建价值活下去

相关学习资料