导语:做 RAG 项目时最头疼的环节之一,就是文档入库:几百份扫描 PDF,扫描件、表格、公式什么都有,扔给大模型直接懵圈。试了一圈商业 OCR 都不满意,最后回到 PaddleOCR——它刚更新的 3.6.0 版本,专门为 AI 场景做了优化。这篇分享实测体验。
起因是最近在搞 RAG 项目,文档里有几百份 PDF:扫描件、表格、公式、印章,什么都有。
把这些直接扔给大模型?它直接懵圈。
试了好几个商业 OCR 都不满意,后来想起了 PaddleOCR——好家伙,居然又更新了 3.6.0 版本,专门针对 LLM 场景做了优化。

为啥又拎出来说它
先看一组数据:
GitHub Stars:80,486 Forks:10,630 支持语言:100+ 种 被引用项目:6k+
放在 GitHub Trending 榜上,能直接冲进前十。而且它不是一夜爆红的项目,是 2020 年 5 月就上线的"老兵",能在 2026 年继续往榜单上窜,说明一直在跟时代。
最关键的一点是:它的定位变了。
以前的 PaddleOCR 是纯粹的 OCR 工具——给一张图,还你文字。3.x 之后,它开始针对 LLM 场景优化,主打"把任何 PDF/图片转成结构化数据喂给 AI"。
简单说,它从「字符识别工具」升级成了「文档智能引擎」,输出的不是一堆纯文本,而是带结构的 Markdown 或 JSON,可以直接进 RAG 流程。
Dify、RAGFlow、Cherry Studio 这些热门 AI 项目都在用它。能被这一票头部项目集成进去,本身就是质量背书。
它能做什么(不带水分版)
1. PDF / 图片 → Markdown / JSON
这是当下最实用的能力。给一份扫描的 PDF(合同、论文、财报都行),输出是结构化的 Markdown:
标题层级保留 表格转成标准 Markdown 表格 公式识别成 LaTeX 印章、图表都能解析
我拿一份带表格的财报 PDF 测试,效果确实惊到——表格的合并单元格、跨页表格自动拼接都搞定了。放以前,这得专门写规则代码处理。
2. 多语言场景文字识别
支持 100+ 语种,一个模型搞定中英日韩混排。官方数据是 PP-OCRv5 相比上一代准确率提升 13%。
3. 印章、街景、票据这类"非标"场景
普通商用 OCR 一遇到圆形印章就拉胯。新版本专门优化了印章识别、古籍生僻字、图表理解这些硬骨头。我拿一张盖了红色印章的合同试了下,印章里的公司名和编码能完整提取出来——这个我用过的几个商用产品都做不到。
4. 直接当 RAG 的预处理管道
PP-StructureV3 流水线,从「PDF → 版面分析 → 元素抽取 → 输出 Markdown」一键打通,配合后面的向量化、Embedding,整个 RAG 的"数据入库"环节就齐活了。
3.6.0 版本到底牛在哪
重点是 PaddleOCR-VL-1.6 这个新模型:
参数量只有 0.9B——市面上同等任务的 VLM 动不动 7B 起步 OmniDocBench 基准上文本/公式/表格识别全部 SOTA 输出 Markdown / JSON 支持 109 种语言
0.9B 参数意味着什么?一张消费级显卡就能跑,甚至 CPU 推理延迟也能接受。 对中小团队、个人开发者来说,这是"能用"和"用不起"的差别。
架构是 NaViT 动态分辨率视觉编码器 + ERNIE-4.5-0.3B 语言模型,既轻又准。
上手感受:从安装到出结果
第一步:安装。 官方推荐 pip 直接装,依赖比想象中轻——3.2.0 之后核心依赖和可选依赖拆开了,基础识别只需要核心包。
第二步:选模型。
只识别文字 → PP-OCRv5解析文档结构 → PP-StructureV3想要最强效果且能跑 GPU → PaddleOCR-VL-1.6
我的建议:先用 PP-StructureV3 起步,95% 的需求都能覆盖,要做 RAG 进阶再上 VL 系列。
第三步:先在线试效果。 官方有 Web 体验站(paddleocr.com),上传图片直接出结果,决策成本很低——先在网页确认效果,再决定要不要本地部署。
第四步:部署。 硬件支持非常全:NVIDIA GPU、Intel CPU、昆仑芯 XPU、各种 NPU。还有 C++、C#、Java 的服务化方案。3.5.0 之后还出了 PaddleOCR.js——浏览器里直接跑 PP-OCRv5,前端同学也能做本地 OCR 小应用。
踩坑提醒:
Windows 装 PaddlePaddle,50 系显卡要装 3.1.1 版本以上才支持 第一次跑 VL 模型会下载几百 MB 权重,国内建议配镜像 想最快推理,记得开高性能推理(OpenVINO/TensorRT 加速)
和其他方案比
简单说下我用过的几个方案的感受:
Tesseract:老牌轻量,但中文效果差、复杂版面跪 商业云 OCR:接入快,但按量付费长期不划算,数据要出本地 PaddleOCR:开源免费、中文 SOTA、生态完整、印章/古籍/表格强,代价是模型偏大、需要部署成本
结论:如果你的场景是中文、要处理 PDF/扫描件、想自部署、要做 RAG——PaddleOCR 基本闭眼选。 如果只是偶尔识别英文截图,Tesseract 就够用。
什么人适合用
强烈推荐: 做 RAG/Agent 项目的开发者、需要处理大量 PDF 入库的团队、中文文档处理场景(合同、财报、论文、票据)、对数据合规有要求的企业。
可以试试: 想给 App 集成 OCR 的独立开发者、做笔记类工具的产品、需要论文公式/表格抽取的学术党。
不太合适: 只识别几张英文图片的临时需求、完全没有 Python 环境不想折腾部署的小白(直接用官方在线版)。
我的判断
在 AI 应用爆发的当下,"喂数据给模型"的能力,有时候比模型本身更值钱。
一个稳定、准确、能本地化部署的 OCR 引擎,就是 AI 项目的"水电煤"。PaddleOCR 把这件事做到了开源天花板——80k 星不是吹的,中文场景下我目前没找到能稳定打过它的开源方案。
如果你正在做 RAG、做 Agent、做文档智能,值得 clone 下来试试。
工具地址:
GitHub 仓库:https://github.com/PaddlePaddle/PaddleOCR[1] 官方体验站:https://www.paddleocr.com[2] 完整文档:https://www.paddleocr.ai[3]
引用链接
[1]https://github.com/PaddlePaddle/PaddleOCR
[2]https://www.paddleocr.com
[3]https://www.paddleocr.ai
点击下方[AI池匠]关注我
觉得有用的话,点个♡,让更多需要的朋友看到。
夜雨聆风