阿里开源AI文档解析模型OvisOCR2:0.8B参数,PDF/表格/公式一键转结构化Markdown!

7月15日,阿里巴巴ATH-Maas团队正式发布并开源OvisOCR2,一款面向文档解析任务的端到端视觉语言模型。
该模型仅包含0.8B参数,能够将 PDF、扫描件、图片文档等视觉输入,直接转换为结构化Markdown输出,覆盖文本、表格、数学公式以及视觉区域等多类文档元素。
在OmniDocBench v1.6测试中,OvisOCR2获得96.58综合得分,超过此前多个基于多模型流水线方案的文档解析系统。
OvisOCR2在OmniDocBench v1.6排行榜上的表现与其他领先的管道和端到端方法的比较
核心功能
文档图片直接转换为Markdown
OvisOCR2并不是简单输出 OCR 文字,而是尝试恢复完整文档结构。
其中包含文档层级、表格关系、公式表达、阅读顺序。
这些结构信息可以直接用于后续AI检索、知识库构建等任务。
支持复杂表格解析
表格一直是文档解析中的难点。传统OCR往往
可以识别文字,但难以准确恢复行列关系、合并单元格、表格边界。
OvisOCR2在内部测试中,对复杂表格文档进行了评估。
结果显示:
表格漏检率达到7.96%;


OvisOCR2与流水线方法在复杂表格文档上的对比
除了标准电子文档,OvisOCR2也测试了手写内容场景。包括手写记录、历史档案、非标准格式文档。


OvisOCR2在手写文档上的表现与现有方法的对比
在内部手写文档测试中,模型取得72.28总分。

长文档结构支持
对于包含多个章节的长文档,模型需要保持:标题层级、上下文关联、内容顺序。
OvisOCR2在长篇多节文档中保持结构一致性的示例
应用场景
企业知识库构建:解析企业 PDF、扫描文件,生成结构化内容,辅助 RAG 知识库搭建。
财务与业务文档分析:识别财报、报告中的表格和数据,辅助信息提取与分析。
学术论文与技术资料处理:解析论文结构、公式和图表,帮助科研资料整理与阅读。
合同、档案等文档数字化:处理扫描合同、手写档案,实现历史资料电子化管理。
AI Agent的文档输入层:作为 Agent 文档解析模块,让 AI 理解复杂文件内容。
项目地址:
GitHub:https://github.com/ATH-MaaS/Ovis技术报告:https://www.alphaxiv.org/zh/overview/2607.13639
欢迎扫码加入社群
一起交流AI前沿技术!

小编免费共享AI开源项目知识库,
实现大家的AI资讯自由!
直接扫码或点击链接即可查看!

AI开源项目知识库:https://qyxznlkmwx.feishu.cn/wiki/BwWIwsCOuiMWGmkUzNHcKLvPnPh
夜雨聆风