一页证券报告摆在左边,右边不到半分钟就吐出了 Markdown。
标题、页码和正文保持着原来的阅读顺序,两组财务数据不再是一团复制不出来的图片,而是变成了两个完整的 HTML 表格。年份、收入、利润、ROE 和估值指标,各自回到了对应的行列里。

这次转换由 OvisOCR2 完成。
它只有 0.8B 参数,模型文件约 1.7GB,任务也很专一:接收一页文档图片,按照正常阅读顺序输出 Markdown。普通文字直接转写,公式保留为 LaTeX,表格转成 HTML,页面里的插图则用坐标标记出来。
PDF 复制后满是断行、双栏论文顺序错乱、扫描表格只能重新录入,这些麻烦正好落在它的射程里。
一张图进去,结构跟着出来
普通 OCR 主要回答“图里写了什么”。文档解析还要多回答几件事:哪段是标题,哪几列属于同一张表,公式在哪里结束,双栏内容应该先读左边还是右边。
传统方案通常把这项工作拆开。一个模型找版面,一个模型识别文字,表格和公式再交给各自的模块,最后把所有结果拼回一页。
这种流水线成熟,也容易在中间丢东西。第一步没有框准表格,后面的识别器再强也拿不到完整内容;阅读顺序排错,输出的段落就会前后颠倒。
OvisOCR2 走的是另一条路。整页图片只经过一个模型,一次生成最终 Markdown。模型看见的不只是某个裁剪框里的文字,还能参考这一页的整体排版。
研发团队以 Qwen3.5-0.8B 为底座,先用真实文档教它认识自然排版,再通过 HTML 生成带有精确答案的合成页面。训练时另有一条 4B 参数分支负责强化学习,最后把调整后的行为蒸馏回 0.8B 模型。
说得直白些:大模型负责把难题练明白,小模型把这套做法带回部署端。

表格没有被压成一串数字
官方在线 Demo 里先放入了一页中文证券报告。
原图上有两张表。第一张包含 2022A 至 2026E 的主营业务收入、归母净利润、每股收益和 ROE;第二张则是 P/B、P/E 和 P/S。
OvisOCR2 用 25.6 秒生成了 1162 个字符。两张表都被完整找出,行列没有混到一起,页眉、数据来源、免责声明和页码也顺着页面位置进入结果。
输出并不是看起来像表格的一堆空格,而是真正的结构:
<table> <tr> <td>(百万元)</td> <td>2022A</td> <td>2023A</td> <td>2024A</td> </tr> <tr> <td>主营业务收入</td> <td>53,798</td> <td>60,850</td> <td>70,020</td> </tr></table>这一步很实用。研究报告和财务 PDF 里的数字可以继续交给脚本、表格软件或大模型处理,不必先人工抄一遍。
不过,HTML 表格不等于已经完成数据清洗。合并单元格、脚注归属、负号和小数点仍要复核,涉及财务、合同或医疗材料时更不能直接把 OCR 结果当成原始数据。
长公式也能留下 LaTeX
第二页换成了一篇英文数学论文。
页面里既有普通段落,也有 Fokker-Planck 方程和多行推导。OvisOCR2 用 49.6 秒输出 3817 个字符,正文、Lemma、Proof 和公式保持了连续顺序,多行推导被放进 align* 环境。

这里能看出“文档转 Markdown”和普通截图识字的差别。
识别出 alpha、积分号和上下标只是第一步。真正决定结果能不能继续使用的,是它有没有把整段公式重新组织成可渲染的 LaTeX,有没有把正文和公式放回正确位置。
本次样例完成了这两件事。标题层级只是按模型判断写成五级标题,和论文原排版并不完全等价,但内容已经可以进入笔记、知识库或后续排版流程。
手写内容能读,版式别抱太高期待
第三页是一篇中文手写日记。
模型在 31.6 秒内输出了 545 个字符,日期、正文和页码都被识别出来。大段中文基本保持可读,原稿的换行和局部层次则被收成了一段连续文字。

这项表现适合“先把内容抢救出来”,不适合要求笔记版式原样复刻的场景。手写字形、拍摄角度、污渍和压缩都会继续放大误差,专有名词与相近汉字也需要人工校对。
技术报告里的结果同样留出了这条边界。
在 PureDocBench 的清晰页面和数字退化页面上,OvisOCR2 都排在首位;到了手机翻拍、复印件、屏摄和重度压缩图片组成的 Real 赛道,它得到 66.56 分,低于 Gemini 3.1 Pro 和 Qwen3.5-122B-A10B。
小模型在干净文档上已经很能打,现实世界里的糟糕照片仍然难啃。

96.58 分是怎么来的
OvisOCR2 在 OmniDocBench v1.6 上取得 96.58 分。这个基准包含 1651 页 PDF,覆盖十类文档、五种版式和五种语言,同时检查文字误差、公式识别、表格结构与阅读顺序。
它超过了 PaddleOCR-VL-1.6、MinerU2.5-Pro 和 GLM-OCR,也让端到端模型第一次站到这张榜单的首位。
另一个 PureDocBench 使用 1475 个原始页面生成清晰、数字退化和真实重拍三组材料,共 4425 张图。OvisOCR2 的三组平均分是 75.06。
这些成绩来自论文团队与公开榜单,不能替代特定业务里的抽样测试。发票、档案、竖排书籍、盖章表格和低清聊天截图的难点完全不同。正式接入前,最省事的办法仍然是拿出几十页真实材料,看关键字段到底会错在哪里。
在线先试,本地部署并不算一键
官方 Hugging Face Space 可以直接上传 PNG、JPEG、WebP 或 PDF,单个文件上限 50MB,不安装环境也能试。
本地运行则需要 Transformers、vLLM 或 SGLang。模型采用 Apache-2.0 许可证,官方给出的 vLLM 启动方式很短:
pip install "vllm==0.22.1" pillowvllm serve "ATH-MaaS/OvisOCR2"模型虽小,官方当前提供的路径仍偏向 GPU 推理,没有给出适合普通 Mac 用户的一键 MLX 版本。只有偶尔几页文档需要处理,在线 Demo 更省事;需要批量处理内部资料,或文档不能离开本地环境,再考虑部署模型。
OvisOCR2 适合三类任务:
• 扫描 PDF、研究报告和说明书转成可搜索 Markdown; • 论文公式与表格进入知识库前的结构化处理; • 老档案、手写笔记和截图内容的第一轮抢救。
它不适合直接替代财务录入、合同审阅和医疗数据校验。识别结果可以省掉大量机械劳动,最终责任仍然落在复核环节。
不到 1B 参数带来的真正变化,不是让 OCR 多认出几个字。
一页原本只能观看的文档,开始能够直接交回文字、表格和公式。后面的搜索、整理、计算与归档,终于有了可以继续处理的结构。

夜雨聆风