乐于分享
好东西不私藏

基于 7B 视觉模型的文档线性化:olmOCR 怎么把 PDF 喂给 LLM

基于 7B 视觉模型的文档线性化:olmOCR 怎么把 PDF 喂给 LLM
做 RAG、做预训练、做知识库的人都懂一个别扭:公司几百页 PDF、扫描版的论文、带表格的报表,模型根本"读不进去"。PDF 本质是排版指令,不是文字流——页眉页脚混进正文、表格碎成乱码、公式变方框,多栏排版的阅读顺序更是东拼西凑。
之前聊过的 MinerU 是把这类文档转成 Markdown 给模型读;olmOCR 走的是同一个大方向,但定位更偏数据集构建。它是 AllenAI 出的工具包,核心动词是"线性化(linearize)"——把一页版式复杂的 PDF,摊平成一段模型能直接吃的自然语言文本。仓库 2024 年 9 月开源,现在约 1.9 万 Star。
它到底怎么干活
普通 OCR 只管"把图里的字认出来"。olmOCR 多了一层"理解":它背后跑的是一个 7B 参数的视觉语言模型(默认 olmOCR-2-7B-1025-FP8),看图的同时理解结构。
打个比方:传统 OCR 像把一页纸拍照后逐字朗读,遇到分栏、插图就乱了顺序;olmOCR 像请了个先看懂版面的人,按"人怎么读这页"的顺序,把内容整理成 Markdown 再交出去。所以它能做到几件普通工具吃力的事:
  • 自动剥掉页眉、页脚、页码;
  • 多栏、插图 inset 也能排对阅读顺序;
  • 公式、表格、手写体都能认,表格会转成 Markdown 表格。
为什么是给 LLM 用的
关键点在于"线性化"这个词。模型训练要的是一长串 token,不是一堆带坐标的方块。olmOCR 的输出就是为这个设计的——干净文本,可以直接进数据集。
它也真的为"量大"做过工程:支持 AWS S3 协调多节点、Beaker 集群批量跑。官方给过一个参考成本,转换百万页低于 200 美元。对要清洗几百万页语料的人,这个量级和单价是有意义的。
上手门槛
最轻的方式是不碰模型,走远程推理:
pip install olmocr
olmocr ./localworkspace --server http://你的推理服务:8000/v1 \
--model allenai/olmOCR-2-7B-1025-FP8 --markdown --pdfs *.pdf
想在自己机器上跑,需要 GPU:
pip install olmocr[gpu] --extra-index-url https://download.pytorch.org/whl/cu128
olmocr ./localworkspace --markdown --pdfs olmocr-sample.pdf
嫌装环境麻烦,有 Docker 镜像(含模型那个约 30GB):
docker pull alleninstituteforai/olmocr:latest-with-model
在线 Demo 也开着(olmocr.allenai.org),先传一个 PDF 看看效果最省事。Apache-2.0 许可,商用没障碍。
要如实说的几点
  • 本地跑要 GPU。 它基于 7B 视觉模型,官方建议至少 12GB 显存、30GB 磁盘。纯 CPU 基本不现实,没卡的人得走远程推理或外部服务,而那类方案按 token 收费(约 $0.07–0.20 / 百万 token)。
  • 不是万能解析器。 它再聪明也是 VLM 估计,极度混乱的排版、质量很差的扫描件仍可能出错。真要高质量,先传几页 Demo 验一下,别默认它就是标准答案。
  • 批量有工程坑。 文件很多时容易撞 too many open files,得先 ulimit -n 65536;走外部推理服务还有并发上限,得把 --pages_per_group 调小。
  • Docker 镜像偏大(带模型约 30GB),磁盘紧张先算好空间。
  • 代码近期以稳定为主。 仓库最近一次实质提交在 2026 年 3 月,之后多是小修。它是个已经发布、相对成熟稳定的工具包,不是那种每天大改的项目——对想长期用的反而算好事。
  • 和 MinerU 比:MinerU 更偏"单文档解析、给人/RAG 读",olmOCR 更偏"海量 PDF 线性化、给训练做语料",且是研究机构出品、侧重可复现的数据管线。两者选型看你是"读几篇"还是"洗几百万页"。
最后
如果你手上有大量 PDF 想变成模型能用的文本——不论是做知识库、做预训练数据,还是单纯想把扫描版资料结构化——olmOCR 值得先去 Demo 传一个试试。它把"公式表格手写都能认、还能批量到百万页"这件事,做成了 Apache-2.0 下能直接装的开源工具。
觉得有用就收藏,转给也在做语料清洗、RAG 数据准备的同事。你现在处理 PDF 用的是自己写脚本、MinerU,还是别的工具?评论区聊聊。
关注我,带你了解更多有用的AI工具。

把微信文章、YouTube 一键变成 NotebookLM 播客,这个技能能办

3.4 万 Star 的 AI agent 项目合集,到底能当什么用

终端也能接 AI?这个 macOS 工具把助手嵌进了命令行

自己生成的 AI 图带水印?这个工具一键清掉标和元数据