乐于分享
好东西不私藏

阿里开源AI文档解析模型OvisOCR2:0.8B参数,PDF/表格/公式一键转结构化Markdown!

阿里开源AI文档解析模型OvisOCR2:0.8B参数,PDF/表格/公式一键转结构化Markdown!

715日,阿里巴巴ATH-Maas团队正式发布并开源OvisOCR2,一款面向文档解析任务的端到端视觉语言模型。

该模型仅包含0.8B参数,能够将 PDF、扫描件、图片文档等视觉输入,直接转换为结构化Markdown输出,覆盖文本、表格、数学公式以及视觉区域等多类文档元素。

OmniDocBench v1.6测试中,OvisOCR2获得96.58综合得分,超过此前多个基于多模型流水线方案的文档解析系统。

OvisOCR2OmniDocBench v1.6排行榜上的表现与其他领先的管道和端到端方法的比较

核心功能

文档图片直接转换为Markdown

OvisOCR2并不是简单输出 OCR 文字,而是尝试恢复完整文档结构。

其中包含文档层级、表格关系、公式表达、阅读顺序。

这些结构信息可以直接用于后续AI检索、知识库构建等任务。

支持复杂表格解析

表格一直是文档解析中的难点。传统OCR往往

可以识别文字,但难以准确恢复行列关系合并单元格表格边界

OvisOCR2在内部测试中,对复杂表格文档进行了评估。

结果显示:

表格漏检率达到7.96%

相比部分传统流水线方法的13%-17%漏检率有所降低。

OvisOCR2与流水线方法在复杂表格文档上的对比

支持手写文档解析

除了标准电子文档,OvisOCR2也测试了手写内容场景。包括手写记录历史档案非标准格式文档。

OvisOCR2在手写文档上的表现与现有方法的对比

在内部手写文档测试中,模型取得72.28总分

长文档结构支持

对于包含多个章节的长文档,模型需要保持:标题层级上下文关联内容顺序。

OvisOCR2通过长篇多节文档测试,展示了较好的结构一致性。

OvisOCR2在长篇多节文档中保持结构一致性的示例

应用场景

企业知识库构建:解析企业 PDF、扫描文件,生成结构化内容,辅助 RAG 知识库搭建。

财务与业务文档分析:识别财报、报告中的表格和数据,辅助信息提取与分析。

学术论文与技术资料处理:解析论文结构、公式和图表,帮助科研资料整理与阅读。

合同、档案等文档数字化:处理扫描合同、手写档案,实现历史资料电子化管理。

AI Agent的文档输入层:作为 Agent 文档解析模块,让 AI 理解复杂文件内容。

项目地址:

GitHubhttps://github.com/ATH-MaaS/Ovis技术报告:https://www.alphaxiv.org/zh/overview/2607.13639

欢迎扫码加入社群

一起交流AI前沿技术!

小编免费共享AI开源项目知识库,

实现大家的AI资讯自由!

直接扫码或点击链接即可查看!

AI开源项目知识库:https://qyxznlkmwx.feishu.cn/wiki/BwWIwsCOuiMWGmkUzNHcKLvPnPh

点击下方名片「关注我们」第一时间收到推送