乐于分享
好东西不私藏

一张PDF直接变Markdown:阿里这个0.8B小模型,把OCR流水线卷明白了

一张PDF直接变Markdown:阿里这个0.8B小模型,把OCR流水线卷明白了

AI TOOL · DOCUMENT PARSING

PDF 只能看,不能用?

一张 PDF 直接变 Markdown

0.8B 小模型卷明白了 OCR

OvisOCR2 · 一页输出结构化内容

把锁在 PDF 和图片里的信息,变成下一步能用的内容。

“OCR 真正难的不是认出字,而是把一整页的结构、顺序和格式一起带出来。”

你手里那堆扫描版 PDF、论文截图、会议纪要,最麻烦的往往不是看不懂,而是拿不出来。复制一段文字,表格散了;公式一多,格式就乱;双栏文档还常常前后串行。

阿里开源的 OvisOCR2 想解决的就是这件事:给它一页文档图片,它直接输出按人类阅读顺序排好的 Markdown。它在 OmniDocBench v1.6 拿到 96.58 分,首次让端到端路线超过传统流水线方案。

PART 01 · HOW IT WORKS

以前 OCR 像接力赛,现在想一棒跑完

传统文档解析通常要走好几步:先找版面,再识别文字、表格和公式,最后把碎片拼回去。任何一环看错了,后面很难补救。表格边界裁偏了,或双栏阅读顺序错了,识字再准也救不回来。

OvisOCR2 更像整页阅读。它不把页面拆成一堆小任务,而是看完整页后,一次生成最终 Markdown。标题该接哪段、表格该放在哪、公式前后是什么文字,都能放在同一份上下文里判断

PART 02 · WHY 0.8B

0.8B 为什么能跑到前面

它的底座来自 Qwen3.5-0.8B。团队没有只靠堆参数,而是花力气做训练数据:真实文档负责覆盖扫描质量、字体和版式;合成页面专门补复杂表格、公式混排、多栏和长输出。

训练时,项目还先在更大的 4B 分支上做强化学习,再把能力蒸馏回 0.8B 模型。在 PureDocBench,它的 Avg3 达到 75.06。对使用者来说,最有感的是拿到的不是一段散文字,而是能继续编辑、喂给知识库或交给 AI 的 Markdown。

PART 03 · USE CASES

它适合谁用?先从这三类文件试起

论文和报告:公式、图表、双栏排版最考验解析。转成 Markdown 后,做笔记、翻译和问答都会顺手很多。

扫描资料:老合同、纸质讲义、会议材料,可以先解析,再人工核对关键字段,把图片档案变成可检索内容。

批量整理:实测视频演示了图片和 PDF 的处理:PDF 按页解析后会合成 Markdown,图片则直接生成对应文件。整理课程资料和技术手册时,能少掉不少逐页复制。

PART 04 · CHECK FIRST

开源不等于可以闭眼用

OvisOCR2 采用 Apache 2.0 许可证,模型页提供了基于 vLLM 的推理示例。不过它是文档页面解析模型,不是万能文件助手。复杂表格、手写字、低清扫描件和关键信息仍应抽查;官方也提示,输出可能出错或不完整。

别先拿它处理最重要的合同。先找一份你熟悉的论文或扫描讲义,对照原件和 Markdown,重点看 双栏顺序、表格、公式和页眉页脚。结果过关,再放进正式工作流。

LAST · 东哥说AI

这次有意思的不是又多了一个 OCR 工具,而是小模型证明了:文档解析不一定非得靠一串复杂组件才能做好。

如果你正搭知识库、整理论文,或者每周都要跟 PDF 打交道,OvisOCR2 值得留一个测试位。觉得这篇有用,欢迎点赞、在看、转发,我们下篇见。