当前时间: 2026-08-17 18:10:16
分类:办公文件
评论(0)
文档解析进入新时代:一文盘点国产最强OCR模型文档解析是大模型落地的关键基础设施,企业知识库、RAG 检索、智能问答等场景,都需要先将 PDF、扫描件、图片等非结构化文档转换为结构化数据。过去几年,行业讨论更多的是 OCR(Optical Character Recognition),但随着多模态大模型的发展,行业竞争已经从识别文字升级到了文档解析(Document Parsing)。一个优秀的Document Parsing模型,不仅需要识别文本,还需要理解版面布局、恢复阅读顺序、解析公式、提取表格、识别图片,并最终输出适合大模型直接使用的 Markdown 或 JSON。这也是为什么越来越多厂商开始推出专门的 Document Parsing 模型,而不再满足于传统 OCR。本文结合OmniDocBench v1.6最新榜单,盘点目前国产最具代表性的六款文档解析模型。一、阿里云 OvisOCR2
阿里云于2026年7月正式开源OvisOCR2。模型基于Qwen3.5-0.8B后训练得到,仅有 0.8B 参数,却在 OmniDocBench v1.6 上取得96.58的综合成绩,成为榜单第一,同时也是首个超过传统 Pipeline 方法的端到端文档解析模型。过去几年,文档解析一直采用流水线(Pipeline)方案:首先进行版面分析,然后调用 OCR、公式识别、表格识别等多个模型,最后恢复阅读顺序并拼接输出 Markdown。虽然方案成熟,但维护复杂、推理成本高,而且任何一个环节出现误差,都会影响最终结果。输入一张文档图片,模型即可一次性生成符合自然阅读顺序的 Markdown,同时完成文本、公式、表格以及视觉区域解析,实现真正意义上的 End-to-End Document Parsing。这意味着,过去需要多个模型共同完成的任务,现在只需要一个模型即可完成。OvisOCR2 的发布,也意味着文档解析开始进入端到端时代。二、百度 PaddleOCR-VL-1.6
如果说 OvisOCR2 代表着端到端路线的新突破,那么百度 PaddleOCR-VL 则代表着国产 OCR 多年工程积累后的全面升级。PaddleOCR 已经成为全球最受欢迎的 OCR 开源项目之一,GitHub Star 超过 8 万,支持 100 多种语言,并广泛应用于金融、政务、教育、企业办公等行业。近年来,PaddleOCR 逐渐从传统 OCR 演进为完整的文档解析框架,而最新发布的PaddleOCR-VL-1.6更进一步引入 Vision Language Model 架构,在文档解析能力上实现全面升级。在 OmniDocBench v1.6 榜单中,PaddleOCR-VL-1.6 取得96.33分,仅次于 OvisOCR2,位列第二。相比上一代版本,它重点优化了区域级数据增强、渐进式后训练以及强化学习训练流程,在文本、公式、表格以及复杂版面解析等多个任务上刷新了公开纪录。值得一提的是,PaddleOCR-VL-1.6 与上一代保持架构兼容,企业几乎可以零成本升级,这也是它在产业落地中的重要优势。PaddleOCR是工业化能力最成熟,也是目前企业部署最广泛的国产 Document Parsing 模型。三、MinerU2.5 Pro
如果你经常搭建企业知识库或者 RAG 系统,那么一定听过 MinerU。MinerU 由OpenDataLab(上海人工智能实验室)团队推出,是近年来国内最受欢迎的开源文档解析项目之一,也是很多开发者构建知识库时的首选工具。在最新的 OmniDocBench v1.6 榜单中,MinerU2.5 Pro取得95.8分,位列第三,仅次于 OvisOCR2 与 PaddleOCR-VL-1.6。与很多模型追求更大的参数规模不同,MinerU 更强调复杂 PDF 的解析能力,尤其擅长科研论文、教材、财报等版面复杂的文档。模型能够较好恢复标题层级、公式、图片、表格以及阅读顺序,并直接输出高质量 Markdown,因此深受 RAG、知识库以及 AI 搜索开发者欢迎。相比单纯追求榜单成绩,MinerU 更注重工程生态建设。它不仅提供完善的 Python API,也支持多种输出格式,方便接入 LangChain、LlamaIndex 等主流框架,因此在开发者社区拥有极高的人气。四、智谱 GLM-OCR
作为 GLM 系列多模态能力的重要组成部分,智谱 AI 于今年正式开源GLM-OCR。模型采用0.9B 参数的轻量化架构,在保证部署成本较低的同时,实现了较强的文档解析能力。GLM-OCR 基于 GLM-V 编码器—解码器架构构建,引入了Multi-Token Prediction(MTP)训练目标,并结合稳定的强化学习训练策略,提高了复杂文档场景下的识别精度。视觉部分采用 CogViT 编码器,通过跨模态连接器完成视觉 Token 压缩,再由 GLM 语言模型生成最终结果。与 OvisOCR2 完全端到端不同,GLM-OCR 目前仍采用"版面分析 + 并行识别"的工程路线,版面分析依赖 PP-DocLayout-V3,再结合 OCR-VLM 完成文本、公式、表格等内容解析。这种设计虽然保留了 Pipeline 的部分特点,但在工程稳定性和推理效率之间取得了较好的平衡。在 OmniDocBench 上,GLM-OCR 已跻身第一梯队,并且官方同时提供 SDK、vLLM、SGLang、Ollama 等部署方式,对开发者十分友好。五、腾讯 HunyuanOCR-1.5
腾讯于 2026 年 7 月发布HunyuanOCR-1.5,这是混元系列最新一代 OCR Vision Language Model,也是榜单中最受关注的新模型之一。相比上一代版本,HunyuanOCR-1.5 并没有重新设计模型架构,而是在训练策略和推理效率上下了更多功夫。其中最大的亮点,是引入DFlash推理优化技术,在长文档、表格以及公式等长结构输出场景中,大幅降低了解码延迟。官方数据显示,Transformer 解码速度提升6.37 倍,在 vLLM 环境下整体推理速度提升2.14 倍,成为目前速度最快的轻量级 OCR-VLM 之一。除此之外,腾讯还提出Agentic Data Flow数据构建体系,通过 Agent 自动发现模型短板、搜索数据、验证质量并生成训练样本,进一步提升古籍 OCR、多语言文档解析、复杂图表以及幻觉控制等长尾能力。对于企业而言,HunyuanOCR-1.5 最大优势并不仅仅是榜单成绩,而是推理速度和工程部署能力,在企业知识库、办公自动化以及 Agent 场景中具有很大的落地潜力。六、DeepSeek-OCR2
虽然在 OmniDocBench v1.6 排行榜中,DeepSeek-OCR2 并未进入前十,但它依然是今年开源社区关注度最高的文档解析模型之一。DeepSeek-OCR2 延续了 DeepSeek 一贯的技术风格,没有继续沿用传统 Vision Encoder,而是提出Visual Causal Flow(视觉因果流),重新思考视觉 Token 的组织方式。传统 VLM 通常按照固定的栅格顺序读取图像,而 DeepSeek-OCR2 则尝试让视觉 Token 根据文档语义动态排序,更接近人类阅读文档时的浏览方式。论文中提出的DeepEncoder V2是这一工作的核心创新。它使用轻量级 LLM 替代传统 CLIP 编码器,引入 Causal Flow Tokens,对视觉信息进行重排序,在保持较低视觉 Token 数量的同时,提高复杂文档、图表和长页面的理解能力。相比榜单成绩,DeepSeek-OCR2 更大的价值在于探索新的视觉编码路线。如果这一方向能够持续演进,未来不仅适用于 OCR,还可能推广到更广泛的视觉理解任务。