ARTICLE · 1050137
OCRFlux:复杂排版 PDF 也能拆成 Markdown
最近翻到一个新开源的 OCR 工具,叫 OCRFlux,试完有点上头。
它干的事说起来不复杂:把 PDF 和图片里的文字扒下来,整理成干净的 Markdown。但真正想聊的是——它在复杂排版这件事上,确实能处。
平时拿到的 PDF 哪有那么规整?双栏论文、夹个表格、跨了好几页的大表、页脚页眉一堆乱七八糟的……传统 OCR 一碰就崩,输出要么顺序乱,要么表格只剩个壳。
OCRFlux 的解法是直接基于多模态大模型来理解页面,所以它能做到:
• 按自然阅读顺序识别文字,多栏、带插图、带侧边栏都不乱
• 解析复杂表格和公式,做学术的、对财报的尤其友好
• 自动丢掉页眉页脚,输出清爽
• 跨页表格和跨页段落自动合并,不用手动拼
官方在自家 benchmark OCRFlux-bench-single 上跑过分,跟 olmOCR-7B-0225-preview、Nanonets-OCR-s、MonkeyOCR 这些对比,EDS(编辑距离相似度)从 0.78~0.87 拉到 0.967,提升幅度肉眼可见。连一些潦草的手写体也能比较完整地提出来,这点源站测试时反复强调,确实有点东西。
仓库是 chatdoc-com/OCRFlux,目前 2.5k star、154 fork,Apache-2.0 协议,可以放心用。代码是 Python 的,主分支 main。还提供了在线 demo 和 Discord 频道,卡住了可以直接去问。
怎么上手?
仓库里给了模型权重和详细用法,基本流程:
1. 装环境,拉模型
2. 喂 PDF 或图片进去
3. 吐 Markdown 出来
支持整文件解析模式(推荐直接丢整本 PDF),也支持按页处理。临时想体验的,去官方 demo 点两下最快。
适合谁
• 经常啃论文 PDF 的学生、研究者
• 处理财报、合同、扫描件的运营/法务
• 想做 RAG / 知识库,但被 PDF 解析折磨过的开发者
• 想把一堆扫描文档批量转成 Markdown 的人
一句话:被 PDF OCR 折磨过的,OCRFlux 值得给它半小时。
对了,他们还配套放了一个 benchmark 数据集在 Hugging Face 上,叫 ChatDOC/OCRFlux-bench-single,想做对比实验的直接拿去用,省事。
开源项目:chatdoc-com/OCRFlux
免责声明:本文内容仅供学习与交流参考,不构成任何专业建议。文中观点及资料仅代表原作者;如涉及版权或内容问题,请联系处理。完整原文请点击文末「阅读原文」。