乐于分享
好东西不私藏

让AI智能体告别“等文档”时代!LlamaIndex开源LiteParse:纯本地、极速、布局感知

让AI智能体告别“等文档”时代!LlamaIndex开源LiteParse:纯本地、极速、布局感知

当你的AI智能体还在为一个PDF等待10秒,它已经失去了“思考”的连贯性。
每一个AI智能体,都需要读文档。
无论是分析合同、总结论文,还是从PDF中提取关键信息,文档解析都是智能体工作流中绕不开的一环。
但问题来了:现有的工具,要么快但不准(比如pypdf),要么准但慢——依赖云端GPU、调用VLM(视觉大模型),几秒甚至十几秒才能返回结果。智能体只好在那里干等,甚至超时,而它真正需要的,只是一个“差不多”的输出,来引导推理、继续迭代。
现在,LlamaIndex团队给出了一个答案:LiteParse。
01
LiteParse是什么?
LiteParse是一个纯本地运行、零Python依赖、专为AI智能体设计的文档解析工具。
它通过CLI或TypeScript库的形式,快速从PDF、Office文档(Word/Excel/PPT)和图片中提取 布局感知的文本 ,输出简洁的纯文本,保留空间结构(比如表格用ASCII形式呈现),让大模型“一眼看懂”。
一句话总结: 让智能体用最快的速度,读懂文档的“骨架”。
LiteParse 与 LlamaParse:怎么选?
LiteParse 和 LlamaParse 是同一团队打造的两个工具,定位不同:
LiteParse
  • ⚡ 本地运行,毫秒级响应
  • 📄 输出布局文本 + 截图
  • 🔌 适合智能体实时阅读、快速理解
LlamaParse
  • 🧠 云端高精度解析
  • 📊 输出 Markdown、JSON、表格
  • 🏭 适合文档智能产品、复杂格式处理
一句话:如果你的智能体只需要“扫一眼”文档,用 LiteParse;如果要做专业的文档分析,用 LlamaParse。
02
为什么LiteParse是为智能体“量身定制”的?
团队观察了智能体处理文档的两种常见模式:
  • 写代码模式 :智能体自己写Python代码,调用pypdf或pdfplumber来解析。问题是——每次都要写新代码,不同文档不通用,而且代码容易出错。
  • 截图模式 :智能体先快速提取文本,发现不够时再截图给VLM分析。思路对,但流程复杂,没法复用。
LiteParse正是为了完美适配这两种模式而设计的:
  • 文本提取 :一条命令 `lit parse report.pdf` 就能输出布局文本,智能体直接grep关键词。
  • 截图辅助 : `lit screenshot report.pdf -o ./images –pages “1-3″` 快速生成指定页的截图,当智能体需要视觉推理时,可以无缝切换。
而且,LlamaIndex已经把这个能力打包成了 智能体技能 ,可以直接安装到你的Agent框架中:智能体从此拥有“快速阅读+视觉补刀”的双重能力。
03
核心技术:只保留布局,不花哨
大多数解析器都在努力“理解”文档结构——识别表格、转成Markdown、抽取标题层级……但这对智能体来说,常常是 过度加工
LiteParse的哲学是: 保留布局,让大模型自己去“看” 。
它把文本投影到一个空间网格上,保留列对齐、缩进、换行。比如一个表格:LLM天然理解这种ASCII风格的表格(因为它们训练数据里全是这种),何必再花功夫转成复杂的Markdown?直接用,更快、更准、更省事。
Name        Age    City
John        25     NYC
Jane        30     LA
实测对比,同样的表格,pypdf输出可能把三列揉成一团乱麻,而LiteParse完美保持对齐。
04
支持的格式:不止PDF
LiteParse能处理:
  • PDF :原生文本提取,自动对扫描页触发OCR(内置Tesseract.js)
  • Office文档 (DOCX/XLSX/PPTX):后台调用LibreOffice转成PDF,再走同一套解析流程
  • 图片 (PNG/JPG/TIFF):通过ImageMagick转PDF后OCR
所有格式统一用一套处理逻辑,未来也容易扩展。
05
灵活的OCR:内置+外接
对于扫描件,LiteParse内置了Tesseract.js,自动并行利用CPU多核处理大文档。同时支持对接外部OCR服务(如PaddleOCR、EasyOCR),适合对准确率有更高要求的场景:你可以自己部署任何OCR模型,只要它返回带边界框的文本,就能无缝接入。
lit parse scanned.pdf --ocr-server http://localhost:8000/ocr
06
性能实测:又快又准
LlamaIndex团队自己做了一套评测,因为现有OCR数据集都不适配LiteParse的输出特点(它们期望Markdown结构,但LiteParse只给文本布局)。
他们用大模型根据截图生成问答对,人工审核后作为测试集,对比了pypdf、PyMuPDF、Markitdown等轻量级解析器。
结果: LiteParse在页面级问答任务上准确率领先,且解析大文档的延迟位于第一梯队
用团队的话说:这就是给智能体设计的——既要快,又要准,还不能依赖云端。
07
如何上手?
  1. 安装CLI

    npm i -g @llamaindex/liteparse
    lit parse anything.pdf
  2. 在TypeScript/JS中使用

    import { LiteParse } from'@llamaindex/liteparse';
    constparser=newLiteParse({ ocrEnabledtrue });
    constresult=awaitparser.parse('document.pdf');
    console.log(result.text);
  3. 在Python中使用(通过CLI封装)

    # pip install liteparse
    fromliteparseimportLiteParse
    parser=LiteParse()
    result=parser.parse("document.pdf")
    print(result.text)
  4. 技能一键安装
npx skills add run-llama/llamaparse-agent-skills --skill liteparse
08
为什么开源LiteParse?
LlamaIndex团队在打造LlamaParse的过程中,积累了海量关于“快速、轻量级解析”的经验。他们发现,大多数AI智能体其实不需要最顶级的准确率,它们只需要在几秒内得到“足够好”的文本,就能继续推理。
开源LiteParse,就是要把这种能力交给每一个智能体开发者。
“我们在LlamaParse上投入了数年,今天把它的核心能力开源。希望每一个智能体都能更快地读懂文档。”——LlamaIndex团队
09
总结:智能体读文档,从此不再“卡壳”
LiteParse不是要取代LlamaParse,而是为AI智能体开辟了一条新的路径:
  •  :本地运行,无网络延迟
  •  :布局保留,LLM友好
  •  :零Python依赖,一条命令搞定
  •  :配合截图,视觉推理无缝衔接
如果你的智能体经常因为解析文档而“等待”,不妨试试LiteParse。开源、免费、即装即用。
文档解析,本该如此简单。
  • 项目地址 : https://github.com/run-llama/liteparse
本站文章均为手工撰写未经允许谢绝转载:夜雨聆风 » 让AI智能体告别“等文档”时代!LlamaIndex开源LiteParse:纯本地、极速、布局感知

猜你喜欢

  • 暂无文章