乐于分享
好东西不私藏

阿里0.8B文档识别模型OvisOCR2本地实测

阿里0.8B文档识别模型OvisOCR2本地实测

      实际跑了一下,总体上感觉效果还是不错的,基本不太有错漏。即使拿我的手写内容去OCR,也只有个位数错误,可能比我之前用豆包跑略微差一丢丢,但是作为0.8B模型,我觉得效果已经真的很强了。具体实例验证效果在附录。接下来的报告内容则主要由AI生成。

OvisOCR2 本地实测:19 份样例与 22 项问题

本次测试覆盖 8 组、19 个页面和图像,包括论文正文、复杂表格、公式、复合图和中文手写材料。

结论

  • 印刷体正文表现较好
    :长段文字、双栏阅读顺序和章节结构基本可靠。
  • 表格主体可用,但细节会错
    :脚注、双语表头、粗体与下划线等语义格式需要抽检。
  • 中文手写关键字段风险较高
    :年份、编号、坐标和专名必须人工复核。
  • 16 个印刷页面的加权近似字符相似度为 98.93%,但仍发现结构和识别错误。
  • 14 个留有完整记录的输入,纯推理平均约 3.08 秒/页;初始化约 23 秒。

下面列出 4 类代表性问题。红框均为原图与 OvisOCR2 实际输出的对照。

1. 双语次级表头遗漏

原表第二行含“模型”“总分”。输出把 ModelOverall 设为跨两行单元格,导致中文表头消失。

2. PDF 链接框被识别为公式

普通的 Figure 1 被输出成 Figure $\boxed{1}$。模型把 PDF 的可点击引用框当成了数学方框。

3. 复合图被拆成 17 个图片块

RCTW-17 原页中的两组复合图被拆散,父图、子图和整体布局关系没有保留。

4. 手写关键字段与专名出错

  • 2026
     → 2016
  • 110.9855°E
     → 110.4855°E
  • 30.8288°N
     → 308288°N
  • “谌老师” → “谋老师”
  • “星期六” → “星期3”
  • “郭沫若” → “郭庆若”
  • 原图无日期,输出额外生成 2023年1月1日

问题汇总

本次共确认 22 项问题

  • 高风险 5 项:年份、编号、经纬度及无依据补写;
  • 中风险 9 项:表头、图号、复合图结构及专名错误;
  • 低风险 8 项:脚注、链接、强调格式、伪文本和次要字符问题。

使用建议

  • 论文、技术报告:自动解析 + 表格/公式抽检
  • 手写材料:正文自动转写 + 日期、编号、坐标、金额等字段强制复核
  • 实际入库时保留原图、OCR 原文和人工校正值,并对坐标、日期等字段增加格式与范围校验。

总体判断:印刷体文档可以进入生产试用;手写材料适合辅助录入,不适合直接作为最终数据。

完整评测附录

以下附录覆盖全部 8 组、19 个页面或图像。每张图左侧为原 PDF/原图,右侧为对应的 OvisOCR2 完整输出。

附录 A:全部样例逐页对比

A01|OvisOCR2 技术报告第 1 页

近似字符相似度 97.21%。标题、摘要、图表和阅读顺序正确;Alibaba/Ovis 图形 Logo 被简化为纯文本。

A02|OmniDocBench 第 6 页

近似字符相似度 99.56%。多表格及双栏顺序正确;Mathpix 脚注的 LaTeX 输出渲染正确,不计为错误。实际问题是页脚链接粘连和粗体/下划线丢失。

A03|Attention Is All You Need 第 3 页

近似字符相似度 99.56%。架构图、正文和公式完整;Figure 1 被写成 Figure $\boxed{1}$

A04|SciTSR 复杂表格第 6 页

近似字符相似度 99.69%。两张宽表的结构和数值正确;最优值粗体丢失,Adobe 脚注 URL 被断开。

A05|DeepSeek 双语表格第 17 页

近似字符相似度 98.51%。19 个模型行和主要数值保留;中文“模型”“总分”遗漏,重点行及总分列粗体丢失。

A06|RCTW-17 第 1 页

近似字符相似度 98.95%。标题、摘要、章节和示例图完整;图号链接框被写成 \boxed{1}

A07|RCTW-17 第 2 页

近似字符相似度 97.25%。Task 1、Task 2 正文和图表保留;Figure 2 被写成 Figure $\boxed{2}$

A08|RCTW-17 第 3 页

近似字符相似度 99.49%。组织说明、提交方法和排名正文完整,未登记新的确定错误。

A09|RCTW-17 第 4 页

近似字符相似度 99.62%。两张结果表的团队、排名和指标可继续解析,未登记新的确定错误。

A10|RCTW-17 第 5 页

近似字符相似度 98.80%。正文可读;两组复合图被拆成 17 个图片块,多个 Figure 4/5 引用被写成 \boxed{}

A11|RCTW-17 第 6 页

近似字符相似度 99.80%。结论、致谢和参考文献完整,未登记新的确定错误。

A12|中文 ChatGPT 论文第 1 页

近似字符相似度 98.60%。中英文标题、摘要、关键词和简介完整,未登记确定错误。

A13|中文 ChatGPT 论文第 2 页

近似字符相似度 98.40%。“对学术诚信的挑战”章节完整,未登记确定错误。

A14|中文 ChatGPT 论文第 3 页

近似字符相似度 98.40%。“学术界能做什么”及子章节层级完整,未登记确定错误。

A15|中文 ChatGPT 论文第 4 页

近似字符相似度 98.41%。结论及正文顺序完整,未登记确定错误。

A16|中文 ChatGPT 论文第 5 页

近似字符相似度 98.56%。参考文献连续保留,未登记确定错误。

A17|中文手写样例 01

正文主要语义可读;“谌老师”被写成“谋老师”,原图末尾没有独立数字 1,输出却多出一行 1

A18|中文手写样例 02

正文主要语义可读;星期六 被写成 星期3,点号 D07180102 被写成 707180102。右上角页码在原图中本就没有完整显示,不计为遗漏。

A19|中文手写样例 03

正文可辅助录入;年份、经纬度和多个专名出错,并额外生成原图中不存在的 2023年1月1日

附录 B:完整错误清单

本清单只收录能够从原 PDF/图片与输出直接核对的错误。同一类型在同一页面多次出现时合并登记。能够正常渲染的 LaTeX 输出不计为错误;原图本就显示不完整的信息也不登记为遗漏。

  1. E01|低|OvisOCR2 报告第 1 页完整 Alibaba/Ovis 图形 Logo → Alibaba | Ovis 纯文本。品牌图形丢失。

  2. E02|低|OmniDocBench 第 6 页页脚上标脚注  与 URL → 5https://github.com/tesseract-ocr/tesseract。脚注号与链接粘连。

  3. E03|低|OmniDocBench 第 6 页,表 2 至表 5原表用于标示最优、次优结果的粗体和下划线被删除,排名语义格式丢失。

  4. E04|中|Attention 第 3 页Figure 1 → Figure $\boxed{1}$。PDF 链接框被误判为数学公式。

  5. E05|低|SciTSR 第 6 页,表 3、表 4原表最优值粗体 → 普通文本。表结构和数值正确,但重点标记丢失。

  6. E06|低|SciTSR 第 6 页页脚连续 Adobe URL → URL 主体与 sdk/eula.html 被拆成两个段落,自动链接失效。

  7. E07|中|DeepSeek 第 17 页第二表头行“模型”“总分” → 遗漏;ModelOverall 被错误设为 rowspan="2"

  8. E08|低|DeepSeek 第 17 页总分列及重点模型行粗体 → 普通文本,排名与重点模型提示丢失。

  9. E09|中|RCTW-17 第 1、2、5 页普通的 Figure 1、2、4、5 引用 → Figure $\boxed{...}$。PDF 图号链接框被误判为公式。

  10. E10|中|RCTW-17 第 5 页两组完整复合图 → 17 个独立 <img> 图块。父图、子图和整体阅读关系丢失。

  11. E11|低|中文手写样例 01原图末尾无独立数字 → 输出额外出现一行 1

  12. E12|中|中文手写样例 01谌老师 → 谋老师,人物指代发生改变。

  13. E13|低|中文手写样例 02星期六 → 星期3

  14. E14|高|中文手写样例 02点号 D07180102 → 707180102,记录编号无法可靠关联。

  15. E15|高|中文手写样例 03年份 2026 → 2016

  16. E16|高|中文手写样例 03经度 110.9855°E → 110.4855°E

  17. E17|高|中文手写样例 03纬度 30.8288°N → 308288°N,小数点丢失且数值超出合法纬度范围。

  18. E18|中|中文手写样例 03郭沫若 → 郭庆若

  19. E19|中|中文手写样例 03江渎庙 → 江陵庙

  20. E20|中|中文手写样例 03秭归皮影戏 → 种归皮影戏

  21. E21|中|中文手写样例 03三闾刺绣 → 三间刺绣

  22. E22|高|中文手写样例 03原图末尾无日期 → 输出额外生成 2023年1月1日

错误分级汇总:高风险 5 项,中风险 9 项,低风险 8 项,合计 22 项。

如果另外发现了错误,也欢迎在评论区指出。