
本地跑 PDF 解析,不传云端、不要 GPU、不花 API 钱,还能输出带坐标的结构化数据——LiteParse 让你把文档解析这件事彻底攥在自己手里。做 RAG、搞合同审查、批量处理论文的,看完这篇能省下不少冤枉钱。
① 一句话定位:本地优先的轻量 PDF 解析器
LiteParse 是 LlamaIndex 团队开源的独立解析工具,核心就一个字:快。它用 PDFium 做空间文本提取,不依赖任何云端 LLM,全部逻辑在本地跑完。
解决的是两类痛点:一是数据敏感不能上传云端的场景,二是批量解析时云服务按页收费太贵。它把 PDF、DOCX、XLSX、PPTX、图片统一转成带边界框的 JSON、Markdown 或纯文本,喂给下游 LLM 或 RAG 管线直接能用。
② 核心亮点:不花哨,但每个都实用
PDFium 底层解析,速度是卖点
直接调 Chromium 同款 PDF 引擎,纯文本提取毫秒级完成,不需要 GPU,2GB 内存的机器就能跑。
OCR 三档可选:内置、HTTP、自定义
内置 Tesseract 零配置开箱即用;想换 EasyOCR、PaddleOCR 就起个 HTTP 服务接进来;接口规范公开,自己写也行。按需对扫描页做 OCR,不浪费算力。
复杂度检测:先看难度再决定怎么解析
解析前先花极小代价判断文档是否需要 OCR 或深度处理,能直接拒绝、路由或预估成本。批量处理时这功能省下的时间很可观。
输出带边界框 + 截图
每个文本块都有精确坐标,还能生成 PNG 页面截图——给 LLM 代理当视觉输入用,或者做文档版面分析的数据集。
四语言绑定 + 三平台
Rust、Node.js、Python、浏览器 WASM 全支持,Linux/macOS/Windows 都能跑。装个 npm 包或 pip 包就能用,不用编译源码。
③ 上手:一条命令装好,代码三行跑通
安装走包管理器,不需要编译环境:
pip install liteparse
npm install @llamaindex/liteparse
cargo add liteparse
Python 里解析一个 PDF:
from liteparse import parse_pdf
result = parse_pdf("doc.pdf", output_format="markdown")
print(result.text)
CLI 也能直接用:liteparse parse doc.pdf --format json。没有特殊硬件要求,普通笔记本就能跑,OCR 模型首次加载会多花几秒,之后解析单页 PDF 在百毫秒级。
④ 谁该用:三类人直接受益
做 RAG 的开发者——文档预处理是 RAG 管线里最脏最累的活,LiteParse 输出的 Markdown 带标题层级和表格结构,直接切块喂 embedding 模型,不用自己写解析逻辑。
处理敏感数据的企业内部工具——法律合同、医疗记录、财务报告这些不能上传云端的文档,本地解析是唯一合规路径。LiteParse 跑在内网服务器上,数据不出门。
批量处理 PDF 的学术/研究场景——论文库、专利文档、历史档案扫描件,用复杂度检测先筛一遍,简单的直接文本提取,复杂的才走 OCR,整体成本比全量 OCR 低一个量级。
⑤ 项目价值:省成本、能变现、有生态位
直接省成本:云解析服务按页收费,LiteParse 本地跑电费忽略不计。按每天解析 1 万页算,云服务年费轻松过万,本地部署一次投入永久免费。
变现路径清晰:拿它做底层,封装企业级本地文档解析服务,按 API 调用收费;或者集成到 RAG 工具链里做增值模块。LlamaIndex 官方已经做了 LlamaParse 云服务(复杂文档效果更好),LiteParse 是它的本地开源版,生态位互补。
技术参考价值:代码里 OCR 合并策略、网格投影做版面重建的实现,对想做文档解析或版面分析的人是一份很好的开源参考。Rust 核心 + 多语言绑定的架构也值得借鉴。
🔗 工具链接
https://github.com/run-llama/liteparse
👇 长按二维码,关注这个号
AI 帮你筛能挣钱 / 省时间的工具,每天一个挣钱路
夜雨聆风