
自动剥掉页眉、页脚、页码;
多栏、插图 inset 也能排对阅读顺序;
公式、表格、手写体都能认,表格会转成 Markdown 表格。
pip install olmocr
olmocr ./localworkspace --server http://你的推理服务:8000/v1 \
--model allenai/olmOCR-2-7B-1025-FP8 --markdown --pdfs *.pdfpip install olmocr[gpu] --extra-index-url https://download.pytorch.org/whl/cu128
olmocr ./localworkspace --markdown --pdfs olmocr-sample.pdfdocker pull alleninstituteforai/olmocr:latest-with-model本地跑要 GPU。 它基于 7B 视觉模型,官方建议至少 12GB 显存、30GB 磁盘。纯 CPU 基本不现实,没卡的人得走远程推理或外部服务,而那类方案按 token 收费(约 $0.07–0.20 / 百万 token)。
不是万能解析器。 它再聪明也是 VLM 估计,极度混乱的排版、质量很差的扫描件仍可能出错。真要高质量,先传几页 Demo 验一下,别默认它就是标准答案。
批量有工程坑。 文件很多时容易撞 too many open files,得先 ulimit -n 65536;走外部推理服务还有并发上限,得把 --pages_per_group 调小。
Docker 镜像偏大(带模型约 30GB),磁盘紧张先算好空间。
代码近期以稳定为主。 仓库最近一次实质提交在 2026 年 3 月,之后多是小修。它是个已经发布、相对成熟稳定的工具包,不是那种每天大改的项目——对想长期用的反而算好事。
和 MinerU 比:MinerU 更偏"单文档解析、给人/RAG 读",olmOCR 更偏"海量 PDF 线性化、给训练做语料",且是研究机构出品、侧重可复现的数据管线。两者选型看你是"读几篇"还是"洗几百万页"。




夜雨聆风