实际跑了一下,总体上感觉效果还是不错的,基本不太有错漏。即使拿我的手写内容去OCR,也只有个位数错误,可能比我之前用豆包跑略微差一丢丢,但是作为0.8B模型,我觉得效果已经真的很强了。具体实例验证效果在附录。接下来的报告内容则主要由AI生成。
OvisOCR2 本地实测:19 份样例与 22 项问题
本次测试覆盖 8 组、19 个页面和图像,包括论文正文、复杂表格、公式、复合图和中文手写材料。
结论
- 印刷体正文表现较好
:长段文字、双栏阅读顺序和章节结构基本可靠。 - 表格主体可用,但细节会错
:脚注、双语表头、粗体与下划线等语义格式需要抽检。 - 中文手写关键字段风险较高
:年份、编号、坐标和专名必须人工复核。 16 个印刷页面的加权近似字符相似度为 98.93%,但仍发现结构和识别错误。 14 个留有完整记录的输入,纯推理平均约 3.08 秒/页;初始化约 23 秒。
下面列出 4 类代表性问题。红框均为原图与 OvisOCR2 实际输出的对照。
1. 双语次级表头遗漏
原表第二行含“模型”“总分”。输出把 Model、Overall 设为跨两行单元格,导致中文表头消失。

2. PDF 链接框被识别为公式
普通的 Figure 1 被输出成 Figure $\boxed{1}$。模型把 PDF 的可点击引用框当成了数学方框。

3. 复合图被拆成 17 个图片块
RCTW-17 原页中的两组复合图被拆散,父图、子图和整体布局关系没有保留。

4. 手写关键字段与专名出错
2026→ 2016110.9855°E→ 110.4855°E30.8288°N→ 308288°N“谌老师” → “谋老师” “星期六” → “星期3” “郭沫若” → “郭庆若” 原图无日期,输出额外生成 2023年1月1日

问题汇总
本次共确认 22 项问题:
高风险 5 项:年份、编号、经纬度及无依据补写; 中风险 9 项:表头、图号、复合图结构及专名错误; 低风险 8 项:脚注、链接、强调格式、伪文本和次要字符问题。
使用建议
论文、技术报告:自动解析 + 表格/公式抽检。 手写材料:正文自动转写 + 日期、编号、坐标、金额等字段强制复核。 实际入库时保留原图、OCR 原文和人工校正值,并对坐标、日期等字段增加格式与范围校验。
总体判断:印刷体文档可以进入生产试用;手写材料适合辅助录入,不适合直接作为最终数据。
完整评测附录
以下附录覆盖全部 8 组、19 个页面或图像。每张图左侧为原 PDF/原图,右侧为对应的 OvisOCR2 完整输出。
附录 A:全部样例逐页对比
A01|OvisOCR2 技术报告第 1 页
近似字符相似度 97.21%。标题、摘要、图表和阅读顺序正确;Alibaba/Ovis 图形 Logo 被简化为纯文本。

A02|OmniDocBench 第 6 页
近似字符相似度 99.56%。多表格及双栏顺序正确;Mathpix 脚注的 LaTeX 输出渲染正确,不计为错误。实际问题是页脚链接粘连和粗体/下划线丢失。
A03|Attention Is All You Need 第 3 页
近似字符相似度 99.56%。架构图、正文和公式完整;Figure 1 被写成 Figure $\boxed{1}$。

A04|SciTSR 复杂表格第 6 页
近似字符相似度 99.69%。两张宽表的结构和数值正确;最优值粗体丢失,Adobe 脚注 URL 被断开。

A05|DeepSeek 双语表格第 17 页
近似字符相似度 98.51%。19 个模型行和主要数值保留;中文“模型”“总分”遗漏,重点行及总分列粗体丢失。

A06|RCTW-17 第 1 页
近似字符相似度 98.95%。标题、摘要、章节和示例图完整;图号链接框被写成 \boxed{1}。

A07|RCTW-17 第 2 页
近似字符相似度 97.25%。Task 1、Task 2 正文和图表保留;Figure 2 被写成 Figure $\boxed{2}$。

A08|RCTW-17 第 3 页
近似字符相似度 99.49%。组织说明、提交方法和排名正文完整,未登记新的确定错误。

A09|RCTW-17 第 4 页
近似字符相似度 99.62%。两张结果表的团队、排名和指标可继续解析,未登记新的确定错误。

A10|RCTW-17 第 5 页
近似字符相似度 98.80%。正文可读;两组复合图被拆成 17 个图片块,多个 Figure 4/5 引用被写成 \boxed{}。

A11|RCTW-17 第 6 页
近似字符相似度 99.80%。结论、致谢和参考文献完整,未登记新的确定错误。

A12|中文 ChatGPT 论文第 1 页
近似字符相似度 98.60%。中英文标题、摘要、关键词和简介完整,未登记确定错误。

A13|中文 ChatGPT 论文第 2 页
近似字符相似度 98.40%。“对学术诚信的挑战”章节完整,未登记确定错误。

A14|中文 ChatGPT 论文第 3 页
近似字符相似度 98.40%。“学术界能做什么”及子章节层级完整,未登记确定错误。

A15|中文 ChatGPT 论文第 4 页
近似字符相似度 98.41%。结论及正文顺序完整,未登记确定错误。

A16|中文 ChatGPT 论文第 5 页
近似字符相似度 98.56%。参考文献连续保留,未登记确定错误。

A17|中文手写样例 01
正文主要语义可读;“谌老师”被写成“谋老师”,原图末尾没有独立数字 1,输出却多出一行 1。

A18|中文手写样例 02
正文主要语义可读;星期六 被写成 星期3,点号 D07180102 被写成 707180102。右上角页码在原图中本就没有完整显示,不计为遗漏。

A19|中文手写样例 03
正文可辅助录入;年份、经纬度和多个专名出错,并额外生成原图中不存在的 2023年1月1日。

附录 B:完整错误清单
本清单只收录能够从原 PDF/图片与输出直接核对的错误。同一类型在同一页面多次出现时合并登记。能够正常渲染的 LaTeX 输出不计为错误;原图本就显示不完整的信息也不登记为遗漏。
E01|低|OvisOCR2 报告第 1 页完整 Alibaba/Ovis 图形 Logo →
Alibaba | Ovis纯文本。品牌图形丢失。E02|低|OmniDocBench 第 6 页页脚上标脚注
⁵与 URL →5https://github.com/tesseract-ocr/tesseract。脚注号与链接粘连。E03|低|OmniDocBench 第 6 页,表 2 至表 5原表用于标示最优、次优结果的粗体和下划线被删除,排名语义格式丢失。
E04|中|Attention 第 3 页
Figure 1→Figure $\boxed{1}$。PDF 链接框被误判为数学公式。E05|低|SciTSR 第 6 页,表 3、表 4原表最优值粗体 → 普通文本。表结构和数值正确,但重点标记丢失。
E06|低|SciTSR 第 6 页页脚连续 Adobe URL → URL 主体与
sdk/eula.html被拆成两个段落,自动链接失效。E07|中|DeepSeek 第 17 页第二表头行“模型”“总分” → 遗漏;
Model、Overall被错误设为rowspan="2"。E08|低|DeepSeek 第 17 页总分列及重点模型行粗体 → 普通文本,排名与重点模型提示丢失。
E09|中|RCTW-17 第 1、2、5 页普通的 Figure 1、2、4、5 引用 →
Figure $\boxed{...}$。PDF 图号链接框被误判为公式。E10|中|RCTW-17 第 5 页两组完整复合图 → 17 个独立
<img>图块。父图、子图和整体阅读关系丢失。E11|低|中文手写样例 01原图末尾无独立数字 → 输出额外出现一行
1。E12|中|中文手写样例 01
谌老师→谋老师,人物指代发生改变。E13|低|中文手写样例 02
星期六→星期3。E14|高|中文手写样例 02点号
D07180102→707180102,记录编号无法可靠关联。E15|高|中文手写样例 03年份
2026→2016。E16|高|中文手写样例 03经度
110.9855°E→110.4855°E。E17|高|中文手写样例 03纬度
30.8288°N→308288°N,小数点丢失且数值超出合法纬度范围。E18|中|中文手写样例 03
郭沫若→郭庆若。E19|中|中文手写样例 03
江渎庙→江陵庙。E20|中|中文手写样例 03
秭归皮影戏→种归皮影戏。E21|中|中文手写样例 03
三闾刺绣→三间刺绣。E22|高|中文手写样例 03原图末尾无日期 → 输出额外生成
2023年1月1日。
错误分级汇总:高风险 5 项,中风险 9 项,低风险 8 项,合计 22 项。
夜雨聆风