夜雨聆风学习资料网

ARTICLE · 1050137

OCRFlux:复杂排版 PDF 也能拆成 Markdown

OCRFlux:复杂排版 PDF 也能拆成 Markdown

最近翻到一个新开源的 OCR 工具,叫 OCRFlux,试完有点上头。

它干的事说起来不复杂:把 PDF 和图片里的文字扒下来,整理成干净的 Markdown。但真正想聊的是——它在复杂排版这件事上,确实能处。

平时拿到的 PDF 哪有那么规整?双栏论文、夹个表格、跨了好几页的大表、页脚页眉一堆乱七八糟的……传统 OCR 一碰就崩,输出要么顺序乱,要么表格只剩个壳。

OCRFlux 的解法是直接基于多模态大模型来理解页面,所以它能做到:

• 按自然阅读顺序识别文字,多栏、带插图、带侧边栏都不乱

• 解析复杂表格和公式,做学术的、对财报的尤其友好

• 自动丢掉页眉页脚,输出清爽

• 跨页表格和跨页段落自动合并,不用手动拼

官方在自家 benchmark OCRFlux-bench-single 上跑过分,跟 olmOCR-7B-0225-preview、Nanonets-OCR-s、MonkeyOCR 这些对比,EDS(编辑距离相似度)从 0.78~0.87 拉到 0.967,提升幅度肉眼可见。连一些潦草的手写体也能比较完整地提出来,这点源站测试时反复强调,确实有点东西。

仓库是 chatdoc-com/OCRFlux,目前 2.5k star、154 fork,Apache-2.0 协议,可以放心用。代码是 Python 的,主分支 main。还提供了在线 demo 和 Discord 频道,卡住了可以直接去问。

怎么上手?

仓库里给了模型权重和详细用法,基本流程:

1. 装环境,拉模型

2. 喂 PDF 或图片进去

3. 吐 Markdown 出来

支持整文件解析模式(推荐直接丢整本 PDF),也支持按页处理。临时想体验的,去官方 demo 点两下最快。

适合谁

• 经常啃论文 PDF 的学生、研究者

• 处理财报、合同、扫描件的运营/法务

• 想做 RAG / 知识库,但被 PDF 解析折磨过的开发者

• 想把一堆扫描文档批量转成 Markdown 的人

一句话:被 PDF OCR 折磨过的,OCRFlux 值得给它半小时。

对了,他们还配套放了一个 benchmark 数据集在 Hugging Face 上,叫 ChatDOC/OCRFlux-bench-single,想做对比实验的直接拿去用,省事。

开源项目:chatdoc-com/OCRFlux

免责声明:本文内容仅供学习与交流参考,不构成任何专业建议。文中观点及资料仅代表原作者;如涉及版权或内容问题,请联系处理。完整原文请点击文末「阅读原文」。

相关学习资料