乐于分享
好东西不私藏

2026年近期pdf文档解析主流开源方案对比

2026年近期pdf文档解析主流开源方案对比

引言

本篇写得初衷是,今年的afac 2026结束,赛道二复杂金融文档还原挑战最后进入了前30,成绩并不理想,相比于去年ccks,不过花在这题的时间不多,主要时间都在赛道三和四,可惜一个违规(二修PS:自我感觉,所以B榜没咋玩,赛后与前排大佬聊了下,发现有点老实了),一个明面上差距1分,emmm。但个人参赛影响不大,我主要谈谈今年afac给我的感受,跟梁圣闭门会的一个核心词一致,即克制,赛题一的实时指标,赛题二的统一线上OCR模型,赛题三的无过多人为干预的长程agent自主化,赛题四的30%token惩罚,都是算法制定不可忽视的问题,这也是我认为本届有意思的地方,无关金融。

从赛题二展开,赛方规定,只能调用线上Finix模型,但克制过头,前期我记得只给共用一个api key,导致前中期所有人都巨卡无比,然后就是投诉->加资源->再投诉,emmm。直到初赛最后几天,说加了MTP,我才算正式开始,在finix创建策略到结束。本篇后续会进行的实验就是接着这个比赛数据集,将最近的一些开源OCR都跑跑,以及在这之前想对今年开源的OCR做一个系统性的介绍,但个人水平有限,如有错误欢迎指正。

一、2026年的OCR发生了什么

PS:这里可以插播一下2025年的OCR,mineru不论是效率还是质量,都是独一档存在,具体能看之前写得一篇:

https://mp.weixin.qq.com/s/hTETWRjqHylgv9e0X5w0Aw

如果只看OmniDocBench排行榜,2026年的OCR似乎只是从90分提高到96分;但从系统结构看,这一年的变化远不止几个百分点。文档OCR正在从“识别图片里的字”转变为“把视觉文档编译成可执行结构”。模型不仅要回答文字是什么,还要确定文字属于哪个区域、各区域按什么顺序阅读、公式如何写成LaTeX、表格如何恢复为HTML、图形是否可以转成SVG,以及数千个输出token如何在可接受的延迟和显存内生成。

本文基于12篇公开技术论文,对OCRVerse、DeepSeek-OCR-2、Dolphin-v2、GLM-OCR、dots.mocr、PaddleOCR-VL-1.6、MinerU2.5-Pro、Unlimited-OCR、HunyuanOCR-1.5、MonkeyOCRv2、OvisOCR2与HPD-Parsing进行系统梳理,首先聚焦下面的问题:

论文汇总重点模型需要回答的问题
视觉表示
DeepSeek-OCR-2、MonkeyOCRv2、dots.mocr
图像进入语言模型之前,如何保留小字、笔画和二维结构?
训练与奖励
OCRVerse、PaddleOCR-VL-1.6、OvisOCR2、HunyuanOCR-1.5
SFT、GRPO、可验证奖励和蒸馏分别解决什么问题?
文档分解
Dolphin-v2、GLM-OCR、MinerU2.5-Pro、HPD-Parsing
整页生成、粗到细流水线与层次并行如何取舍?
推理效率
Unlimited-OCR、HunyuanOCR-1.5、HPD-Parsing、GLM-OCR
如何减少KV Cache、解码步数和页面区域的串行等待?
论文到业务
FinixDoc-VL、MinerU2.5-Pro、OvisOCR2、HPD-Parsing、PaddleOCR-VL-1.6、GLM-OCR
在金融超长表上,实际体验与论文是否有出入?

unsetunset这里给出部分回答:unsetunset

  1. 小模型不等于低精度。 OvisOCR2以0.8B参数在OmniDocBench v1.6达到96.58,表明大教师强化学习、在线蒸馏和数据质量能够显著改变参数效率。
  2. 视觉编码器重新成为研究重点。 DeepSeek-OCR-2尝试在视觉侧建立因果信息流;MonkeyOCRv2用图像重建约束编码器保留笔画;dots.mocr从零训练文档高分辨率视觉主干。
  3. 纯端到端与传统流水线正在融合。 Dolphin-v2和GLM-OCR仍依赖区域分解;HPD-Parsing则把布局—内容分工放进统一模型的解码图中。
  4. 强化学习的关键不只是算法,而是奖励是否可验证、样本是否值得学习。 PaddleOCR-VL-1.6的消融显示主要增益来自CPT和SFT,RL是最后的精修;OvisOCR2发现0.8B直接RL不稳定,因而转向4B教师。
  5. 速度指标必须结合条件阅读。 4752 TPS、1002 TPS和5580 TPS可能分别来自不同批量、运行时和并发,数字本身不能直接排名。
  6. v1.5与v1.6不能混算。 测试集、元素匹配和统计协议不同,跨版本分数变化不等于模型能力升降。
  7. 页面分解可以改变六十分以上。 Huge-Long同页同GT实验中,共享切片相对整图带来+53.36+82.36的Overall提升;这不是模型权重变化,而是输入任务从超长整页变为模型可稳定处理的局部片段。
  8. 高论文分仍需正确调用协议兑现。 Paddle、MinerU、Ovis与HPD在共享切片下达到88分以上,说明旧实验中的30—50分主要混入了整图过载、弱提示词、错误输出转换和不匹配组装器等系统问题。

详细内容,将慢慢展开。

二、文档大模型OCR的统一问题定义

本节参考综述《Document Parsing Unveiled: Techniques, Challenges, and Prospects for Structured Information Extraction》,该文最初发表于2024年,v5于2026年4月修订,其检索覆盖约1995—2026年的研究,从约860条记录中经过去重、摘要筛选和全文审查,最终纳入230篇论文。选择它并非因为时间最新,而是因为它同时覆盖版面分析、文字识别、表格、公式、图表等文档元素,且把传统模块化系统、VLM统一解析、数据集和评价指标放进同一套分类框架。

在系统分类上,该综述以架构组织方式为主,区分两类范式:一类是把版面检测、OCR、表格与公式识别等环节显式拆开的模块化流水线;另一类是共享视觉—语言表示并直接生成结构化结果的统一VLM。它还指出,统一VLM内部又存在整页端到端生成和保留多阶段推理的技术路线。本节后续关于视觉编码、结构规划、内容生成和层次解码的讨论,都以这套分类为起点。

图中从“页面”到“结构化表示”再到下游任务的路径,正对应下文的数学抽象:输入仍是一张图像,但输出不再是单一字符串,而是带有位置、类别、载荷和顺序的文档元素序列。后续模型的差异,都可以放回“如何编码页面、如何恢复结构、如何生成内容”这三步中理解。

unsetunset2.1 从字符识别到结构化文档生成unsetunset

传统OCR主要回答“图中写了什么”,输出通常是字符、词或文本行;文档解析还需要回答“这些内容位于哪里、属于什么元素、彼此如何组织”:文字相同但行列关系不同的两张表,对下游计算具有完全不同的语义;多栏页面即使逐字识别正确,阅读顺序错误也会改变段落含义。因此,文字、二维布局、元素类别和输出顺序必须进入同一个问题定义。综述用映射  表达从文档图像空间到结构化表示空间的转换;下面进一步展开为元素序列,给定文档图像

现在的OCR模型需要生成有序文档元素序列

其中:

  •  为第  个元素的位置或边界框;
  •  为元素类别,如正文、标题、表格、公式、代码块或图形;
  •  为元素载荷,可为纯文本、Markdown、HTML、LaTeX、JSON或SVG;
  • 元素顺序同时承担阅读顺序和部分层次关系的表达。

端到端生成模型通常将视觉编码结果记为

并由自回归解码器生成目标序列:

其中  为任务提示, 为结构化输出。

标准监督学习目标为:

上述概率分解与交叉熵目标是条件自回归生成的标准写法,这里仅将其用于统一表达“视觉条件下生成结构化序列”这一共同部分。它不能推出各模型具有相同的视觉编码器、数据组织、提示格式或辅助损失。后续的OCRVerse在论文中明确给出同类SFT目标;Dolphin-v2、GLM-OCR与dots.mocr等论文虽使用自回归训练,但未都给出新的独立闭式损失。

unsetunset2.2 系统架构:模块化、统一生成与层次解码unsetunset

综述把模块化pipeline与统一VLM视为两类范式,而不是“旧方法”和“新方法”的简单替代关系。pipeline用显式中间结构换取可解释性、局部优化和故障定位,但布局错误会向后传播,多个模块也难以联合优化;统一模型通过参数共享和端到端训练增强全局一致性,却要在一条生成轨迹中同时处理几何、文字和关系,复杂页面上的可扩展性与可解释性仍有限。所以综述进一步把专用VLM分为整页端到端与多阶段解析两条路线。结合HPD-Parsing等2026年模型,本文将其细化为以下三种工程形态,其中第三种是我看了DeepSeek-OCR-2和HPD的论文后,对统一模型内部执行方式的补充分类,目前边界不是很清晰,但看未来还有没有什么发展空间。

2.2.1 整页端到端生成

整页图像经过一次视觉编码后,模型直接生成完整Markdown或其他结构化结果。代表模型包括OCRVerse、DeepSeek-OCR-2、Unlimited-OCR、HunyuanOCR-1.5与OvisOCR2。

其优点是全局上下文完整、系统结构统一;缺点是输出序列长,局部错误可能造成后续重复、遗漏或格式崩溃。

2.2.2 版面检测与区域识别流水线

首先预测元素类型、位置和阅读顺序,再按区域并行识别,最后合并输出。Dolphin-v2、GLM-OCR、PaddleOCR-VL-1.6与MonkeyOCRv2-Parsing均具有此类特征。

其核心近似为:

该范式便于并行和类型专用优化,但会引入检测误差传播与裁剪误差。

2.2.3 层次化统一生成

HPD-Parsing不使用完全独立的外部检测器,而由主布局分支动态创建内容子分支。其位置介于整页直接生成与传统pipeline之间:模型仍是统一VLM,但推理轨迹已显式分层并行。本文单列这一形态,是为了避免把“端到端”误解为“只能用一条串行序列完成整页生成”;它是对统一模型执行方式的分析性细分,而不是第三种获得综述共识的基础范式。

三、评价指标及其公式

unsetunset3.1 Levenshtein编辑距离与归一化编辑距离unsetunset

对预测字符串  和真值 ,Levenshtein距离递推为:

归一化编辑距离通常写为:

OmniDocBench中的TextEdit与ROEdit均为“越低越好”。对应的文本相似度常写为:

需要注意,TextEdit的输入通常是在元素匹配、文本规范化和空白处理之后得到的文本;ROEdit的输入则是匹配后的阅读顺序序列。因此两者不是简单地对整段原始Markdown直接计算编辑距离。

unsetunset3.2 OmniDocBench Overallunsetunset

OmniDocBench v1.5总体分数为:

其中:

  • TextEdit先被转换为百分制文本得分;
  • FormulaCDM和TableTEDS直接进入平均;
  • TEDS-S与ROEdit通常是诊断指标,不直接进入Overall。

unsetunset3.3 AFAC赛题评价体系unsetunset

本赛题要求输入复杂金融文档图片,输出与原文严格对应的高保真Markdown。赛题资料与公开FinixDocBench兼容评测器对应三个核心量化指标:

赛题指标
方向
实际关注点
text_block_Edit_dist
越低越好
匹配文本块后的归一化编辑距离,惩罚漏字、错字、数字错误与幻觉
reading_order_Edit_dist
越低越好
匹配内容块序列的阅读顺序编辑距离,惩罚多栏错序、跨块错序与错误拼接
table_TEDS
越高越好
HTML表格树编辑相似度,同时比较DOM结构、rowspan/colspan与单元格内容

对应的百分制总分为:

这里三个方向等权,各占三分之一。若文本和阅读顺序不变,Table TEDS提高9分,理论Overall只提高3分;反之,只优化表格而损伤文字或顺序,也可能使总分下降。这正是比赛中“本地表格看起来更完整,线上却降分”的主要原因之一。

3.3.1 相对OmniDocBench Overall的任务化改造

两套Overall形式非常接近,但第三项不同。理解这一差异前,需要先看清基准如何从真实文档构造出可评分对象:文档采样决定场景覆盖,元素级标注决定能否区分文字、公式和表格,抽取与匹配流程最终决定每个指标在惩罚什么。

这张图先回答“评测数据从哪里来”,而下图回答了“页面被标注成什么”和“这些标注如何进入指标计算”,两张图共通解释为什么同一个Markdown结果不能只用整页字符相似度评价:

两套Overall形式的第三项差异如下:

OmniDocBench把FormulaCDM纳入Overall,ROEdit通常只作诊断;赛题不单独评价公式CDM,而把Read Order提升为主分。金融合同、保险条款、目录、多栏说明和超长表格更在意“先读什么、后读什么”,公式通常不是主要内容。

3.3.2 本地cv构建proxy

考虑本地机器性能以及能建立有效评测,验证cv,所以我采用的评价指标是:

它沿用了赛题“三项等权”的思想,但把最昂贵的完整Table TEDS替换为有序表格形状代理。二者区别如下:

对比项
赛题线上评测
线下本地cv
文本
匹配文本块后的编辑距离
沿用统一文本编辑距离口径
阅读顺序
匹配块序列的顺序编辑距离
沿用统一阅读顺序编辑距离口径
表格
完整TEDS:树结构 + cell文字
快速形状代理:表数、顺序和结构形状
计算成本
超长表可能非常慢
可固定80页快速全量运行
适用目的
正式评分或高可信离线校准
候选筛选、失败诊断、快速消融

赛题指标的优势是表格项同时检查内容与结构,更接近真实交付;proxy的优势是不会因超长表树编辑计算而大面积超时。proxy高只能说明“值得进一步评测”,有一定参考性。

3.3.3 Overall的局限性

三项等权比单一字符准确率完整得多,但仍有四个局限:

  1. 平台只返回总分时,文本、表格和阅读顺序的涨跌无法在线拆分,容易造成错误归因;
  2. Overall允许不同维度互相补偿,某一项严重退化可能被另外两项部分掩盖;
  3. TEDS在超大DOM上计算昂贵,若静默丢弃超时页会产生选择偏差;
  4. 标题层级、列表、脚注绑定、图片内容与运行成功率没有独立等权分项。

因此,严谨实验不应只报告Overall,还应同时报告三个子项、成功率、短输出数、重复率、标签闭合率和评测超时率。

unsetunset3.4 CDM与ExpRateunsetunset

CDM即Character Detection Matching。其核心不是比较LaTeX字符串,而是将公式渲染为图像,再进行字符检测、字符匹配与空间位置对齐,从视觉层面评价符号是否正确。其优势是能减少等价LaTeX写法差异造成的误罚,例如不同空格、宏命令或括号写法渲染后可能完全一致。

CDM协议包含渲染、检测、匹配和归一化等多步过程,相关论文通常调用官方实现而不重新给出单一闭式公式。本文这里不构造一个并不存在于原协议中的“简化CDM公式”。

ExpRate用于公式完全匹配:

ExpRate比CDM更严格:一个局部符号错误即可使整条公式记为0。

unsetunset3.5 TEDS与TEDS-Sunsetunset

将HTML表格解析为树结构,预测树和真值树分别记为 。TEDS可统一写为:

其中  为树编辑距离。实际报告通常乘以100。

TEDS同时考虑表格拓扑与单元格内容;TEDS-S主要评价结构,弱化或忽略单元格文本。因此:

  • TEDS高而TEDS-S更高:结构较好,部分单元格内容仍有错误;
  • TEDS-S低:行列关系、合并单元格或标签结构存在根本错误;
  • 只报告TEDS而不报告TEDS-S,难以区分结构错误与文字错误。

这也解释了MinerU输出中常见的<table><tr><td>...</td></tr></table>与标准Markdown管线表格之间的关系:HTML外观不是额外加分项,标准竖线表格也不是天然扣分项。正式评测关注的是能否被解析为正确的表格树,以及行列、合并单元格和cell文字是否与GT一致。把HTML标签补齐只能改善可解析性;如果标签内部的数字、rowspan/colspan或阅读顺序错误,TEDS仍会下降。比较MinerU与其他模型时,应保存原始输出、统一解析/规范化规则,并单独记录格式修复前后的变化,不能用字符串长度或“看起来像HTML”替代结构指标。

unsetunset3.6 F1及结构化抽取指标unsetunset

关键字段抽取常采用:

GLM-OCR在KIE强化学习中使用字段级F1,并叠加JSON可解析、字段缺失与重复惩罚。PaddleOCR-VL-1.6的文本检测识别奖励则使用“编辑相似度加权F1”,使位置匹配和文字正确性同时进入得分。

unsetunset3.7 TPS、PPS、延迟与接受长度unsetunset

HunyuanOCR-1.5给出的速度统计为:

其中  为样本耗时, 为生成token数。

推测解码还应报告有效接受长度:

稿

不同模型分词器不同,生成相同文本所需token数也不同。因此TPS不应脱离分词器、硬件、精度、批量大小、输入长度和输出长度直接比较。PPS更接近文档服务吞吐,但仍受页面复杂度影响。

unsetunset3.8 ISVGEN、渲染相似度与Elounsetunset

dots.mocr与OCRVerse包含图形代码生成任务。此类任务通常先执行或渲染预测代码,再比较渲染图像和输入图像。ISVGEN属于渲染后相似度指标,适合SVG等可执行表示,但不能等价为字符识别准确率。

Elo成对比较的期望胜率可写为:

dots.mocr的OCR Arena使用同一裁判模型对输出进行成对评价并聚合Elo。该指标能容忍部分表面格式差异,但会继承裁判模型偏差,也不应与TextEdit、TEDS等严格匹配指标混合解释。

四、OCR模型说明

unsetunset4.1 OCRVerse:跨域统一OCR与分域强化学习unsetunset

4.1.1 研究目标

OCRVerse试图统一两类传统上分离的任务:

  • 文本中心OCR:正文、公式、表格和整页文档解析;
  • 视觉中心OCR:图表、网页、SVG、科学绘图与化学结构到代码的转换。

模型基于Qwen3-VL-4B。其创新重点不在重新设计视觉主干,而在于八类数据的统一训练与分域奖励,OCRVerse是一个两阶段流水线:第一阶段把文本中心和视觉中心数据放进同一SFT空间,第二阶段再按输出类型选择可验证奖励。

图中的分叉不是简单的数据分类,而是奖励可验证性的分叉:文字、公式和表格可以直接比较编辑距离、CDM或TEDS,网页、图表和SVG则更适合把代码重新渲染后比较视觉结果。下文的SFT目标和分域GRPO奖励,分别对应图中的Stage 1与Stage 2。

4.1.2 SFT训练

论文给出的监督目标为:

训练时冻结视觉编码器与视觉—语言适配器,仅更新语言模型参数。该策略保留原有视觉表示,主要让语言模型学习不同领域的输出语法与结构约束。

SFT阶段直接混合八个领域。其优点是建立共享输出空间;缺点是各领域奖励目标不同,例如文本任务强调字符忠实,SVG任务强调渲染相似,简单混合交叉熵容易产生梯度冲突。

4.1.3 文本中心奖励

内容类型集合记为 ,真值中实际存在的类型集合记为 。论文原式为:

其中:

  • 普通文本:
  • 公式:规范化LaTeX后的BLEU;
  • 表格:TEDS-S;
  • 只平均真值中存在的内容类型,避免无公式页面被公式奖励稀释。

4.1.4 视觉中心奖励

模型执行预测代码并渲染图像,使用DINOv2特征比较全局与局部视觉相似度:

其中全局项比较缩略图语义,局部项比较图像分块细节;此外还加入代码语言和格式对齐奖励。该设计的重要意义在于:对SVG、网页或图表代码,仅比较字符串会严重误判,渲染后比较才与最终视觉结果一致。

4.1.5 GRPO

对同一输入采样  个回答,组内优势为:

概率比为:

论文目标为PPO式裁剪形式:

GRPO无需额外价值网络,适合可通过编辑距离、渲染、TEDS等程序化方式评分的OCR任务。

unsetunset4.2 DeepSeek-OCR-2:视觉因果流与查询token重排unsetunset

4.2.1 核心问题

普通视觉Transformer通常按从左到右、从上到下的光栅顺序展平图像块。该顺序并不一定等于文档阅读顺序,尤其不适合多栏、表格、公式和非线性版面。DeepSeek-OCR-2提出DeepEncoder V2,使视觉编码阶段本身产生因果化的视觉信息序列。

上述图是完整的模型推理链路:图像压缩器解决高分辨率输入的token预算,语言模型式视觉编码器负责全局信息交换,因果查询再把二维视觉内容隐式组织为适合自回归解码的一维表示。该设计继承了DETR与BLIP-2的可学习查询思想,但关键变化不是“多加一组查询”,而是用定制注意力掩码把查询间关系从并行双向交互改为因果依赖。因而,视觉压缩率、语义重组能力和最终识别精度是三个相关但不能互相替代的概念。

4.2.2 视觉token压缩

视觉Tokenizer由约80M参数的SAM-base与两层卷积组成,实现16倍视觉token压缩。全局视图为1024×1024,对应256个查询token;每个768×768局部视图对应144个查询token,局部视图数,故最终视觉token数为:

4.2.3 块因果注意力

设原始视觉token数为 ,可学习因果查询数为 ,论文取。注意力可见性矩阵为:

其含义为:

  • 视觉token之间双向可见;
  • 视觉token不能读取后缀查询;
  • 每个查询可以读取全部视觉token;
  • 个查询只能读取自己及其之前的查询。

令视觉Tokenizer为,LLM式视觉编码器为,查询抽取算子为,解码器为,则论文给出的整体前向过程为:

只有查询部分的输出进入语言解码器。因果查询并非显式地对图像块执行可审计的排列,而是将“已观察全部视觉信息后,按因果顺序逐步提炼”的表示传给解码器。因此“重排”更准确地说是隐式语义重组。

4.2.4 三阶段训练

第一阶段为DeepEncoder V2预训练。视觉Tokenizer与Qwen2-0.5B初始化的视觉编码器连接轻量级解码器,使用下一个token预测进行联合训练。分辨率为768和1024;AdamW学习率由余弦下降至;160张A100、批量640、训练40K步,论文称约处理100M图文对。

第二阶段为查询增强。冻结SAM—卷积视觉Tokenizer,联合优化LLM式视觉编码器和DeepSeek语言解码器;使用多裁剪统一输入,学习率从降至,训练15K步。

第三阶段冻结全部DeepEncoder V2参数,仅继续训练语言解码器;学习率由降至,训练20K步。该阶段在相同计算量下可显著提高数据吞吐。

OCR数据占训练混合的80%,OCR 1.0数据中的文本、公式、表格按3:1:1采样。解码器为3B MoE,实际激活参数约0.5B。

unsetunset4.3 Unlimited-OCR:参考滑动窗口注意力与多页长序列unsetunset

4.3.1 R-SWA

Unlimited-OCR从DeepSeek-OCR继续训练,将语言解码器的全注意力替换为Reference Sliding Window Attention。

R-SWA的关键不是删除视觉上下文,而是始终保留视觉前缀,同时限制已生成文本的可见历史。由此,视觉引用成本由前缀长度决定,文本历史成本由窗口宽度封顶。

设前缀长度为 ,其中包含视觉token与提示;生成到第  个token时,前缀集合为:

宽度为  的解码滑动窗口为:

当前token的可见集合为:

注意力权重和输出为:

模型始终看到全部视觉—提示前缀,但只看到最近  个已生成token。论文设置 

4.3.2 KV Cache复杂度

标准全注意力的KV Cache为:

R-SWA为:

缓存比率为:

当  时:

因此解码侧缓存由随输出长度线性增长,变为上界固定。但视觉前缀  仍随页数增长,所以“Unlimited”指的是解码侧长期稳定,不代表有限上下文下数学意义的无限输入。

4.3.3 训练

论文构造约2M文档OCR样本,单页与多页比例9:1;约200K多页样本由2至50页拼接,使用<page>分隔,统一打包到32K上下文。训练从DeepSeek-OCR检查点开始,冻结DeepEncoder,仅训练LLM;4000步、全局批量256、学习率 、32K序列。

unsetunset4.4 GLM-OCR:轻量核心、任务统一与多token预测unsetunset

4.4.1 系统结构

GLM-OCR由约0.4B的CogViT视觉编码器和约0.5B的GLM语言解码器构成,总参数0.9B。在文档解析任务中,PP-DocLayout-V3先将页面拆分为段落、表格、公式等区域,GLM-OCR Core并行生成区域内容,最后恢复阅读顺序。在KIE任务中,整页图像与字段提示直接输入核心模型,输出JSON。两类任务被统一为视觉条件结构化生成:

4.4.2 MTP

主预测头之外,模型增加  个共享参数的辅助头,预测多个未来位置。论文没有给出完整的加权闭式损失,便于比较可统一写为:

其中  为标准下一个token预测。此式为统一形式化,不是论文声称的新公式。

论文训练时预测未来10个token,推理时平均接受长度约5.2,并报告约50%的吞吐提升。MTP除加速外,还迫使模型提前建模HTML闭合标签、Markdown标记和局部表格结构,减少破损标签。

4.4.3 四阶段训练

第一阶段训练视觉编码器,数据规模达到数百亿图文对,联合使用掩码图像建模、CLIP式对齐和大视觉教师蒸馏。

第二阶段分为:

  • 2.1:连接GLM-0.5B,使用图文、文档解析、Grounding和VQA数据联合预训练;
  • 2.2:加入MTP目标,使解码器适应多token结构化生成。

第三阶段使用文本、公式、表格与KIE高质量数据SFT,并保持MTP开启。

第四阶段使用GRPO。任务奖励包括:

任务
准确性奖励
结构约束
文本
归一化编辑相似度
重复惩罚
公式
CDM
LaTeX结构有效性
表格
TEDS
标签闭合与结构可解析
KIE
字段级F1
JSON可解析、缺失/重复字段惩罚

unsetunset4.5 PaddleOCR-VL-1.6:欠优化区域驱动的数据与后训练unsetunset

4.5.1 研究出发点

PaddleOCR-VL-1.6保持0.9B模型规模,从PaddleOCR-VL-1.5继续训练。论文认为高性能模型的剩余错误不再是“数据总量不足”,而是集中在三类欠优化区域:

  1. 边界脆弱区域:晚期检查点或语义保持扰动下,预测不稳定;
  2. 覆盖稀疏区域:特征空间邻域样本不足;
  3. 不可靠监督区域:模型高置信地重复错误标签。

边界脆弱性通过训练最后8%阶段的8个检查点,以及16种语义保持扰动共同检测。覆盖稀疏性通过文档特征空间的小型、弱连接离群簇检测。不可靠监督则由Qianfan-OCR、GLM-OCR与MinerU2.5-Pro等外部专家进行一致性校验。

以下为PaddleOCR-VL-1.6总体图,其数据引擎图说明欠优化区域如何被发现和修正。

4.5.2 多专家标注与渲染校验

若至少两个专家输出一致,则采用共识标签;否则由ERNIE 5.0进行Judge-and-Refine。对公式和表格,候选LaTeX或HTML先渲染为图像,再与输入图像进行同模态比较。该机制解决了强VLM直接比较“图像—代码”时难以定位表格行列和合并单元格错误的问题。

4.5.3 CPT—SFT—RL

  • CPT:16.8M样本,全参数解冻,1轮,批量1024,最大学习率 
  • SFT:7.3M难例与修正样本,全参数解冻,1轮,批量1024,最大学习率 
  • RL:49K高潜样本,全参数解冻,2轮,批量1024,最大学习率 

4.5.4 高潜RL样本评分

对每个输入生成  个rollout。第  条输出的长度归一化置信度为:

样本不确定性为:

奖励方差为:

最终高潜评分为:

论文设置 。评分的第一项要求模型“偶尔能做对”,即样本具有可达改进空间;指数项提高不确定且组内奖励有区分度样本的权重。始终做错、始终做对或组内奖励完全相同的样本会被过滤。

4.5.5 统一可验证奖励

论文原式为:

其中:

  • :格式、截断、退化、LaTeX或表格可解析性的硬门控;
  • :结构可修复程度的软惩罚;
  • :NED、CDM、TEDS、RMS-F1等任务相似度。

乘法结构意味着无效输出直接得0,防止模型通过“内容大致相似但格式不可用”获得高奖励。

4.5.6 结果与消融

OmniDocBench v1.6:

阶段
Overall
TextEdit
FormulaCDM
TableTEDS
TEDS-S
PaddleOCR-VL-1.5
94.93
0.038
96.89
91.67
94.37
+ CPT
95.62
0.035
97.32
93.03
95.82
+ SFT
96.25
0.034
97.37
94.74
97.09
+ RL
96.33
0.033
97.49
94.76
97.11

主要增益来自CPT和SFT,RL仅将Overall从96.25提高到96.33。该结果说明,当模型已接近性能上限时,高质量数据定位与监督修正比单纯扩大RL规模更关键。

unsetunset4.6 MonkeyOCRv2:文档原生视觉基础模型unsetunset

4.6.1 研究重点

MonkeyOCRv2不是首先提出一个新的整页语言解码器,而是训练可替换通用CLIP、DINO或ImageNet主干的文档视觉编码器。MonkeyDoc v2包含113M图像、17种语言,约8M整页和105M局部裁剪,覆盖印刷、扫描、手写、报纸、杂志和财务文档。

图中上半部分的文本生成让编码器保留可读语义,下半部分的像素重建迫使视觉表示保留笔画、局部纹理和版面细节。两种目标共同回答本节的核心问题:文档视觉编码器不能只依赖语言先验猜字,还必须保存足够的原始视觉证据。后文的重建损失正对应图中的像素分支。

4.6.2 双目标预训练

给定输入图像:

默认像素重建目标为:

为保留笔画边缘,论文进一步研究结构感知重建。灰度图的Sobel梯度为:

软边缘图为:

截断距离图初始化为:

迭代更新:

最终 。结构损失为:

结构感知重建为:

文本解码器使用标准自回归交叉熵 ,总预训练目标为:

论文设置 。但主要结果默认使用MSE-only,即 ;结构损失只在文档理解实验中额外评估。

4.6.3 模型与下游解析

编码器有:

  • MonkeyOCRv2-S:28M;
  • MonkeyOCRv2-B:113M;
  • MonkeyOCRv2-AS:21M,多尺度ViTAEv2结构。

下游MonkeyOCRv2-Parsing冻结视觉编码器,连接MLP与Qwen3-0.6B。第一步预测元素坐标、类别和自然阅读顺序;第二步裁剪区域并使用类型提示并行识别。训练先只优化MLP,再联合优化MLP和LLM,视觉编码器始终冻结。

unsetunset4.7 OvisOCR2:大模型RL教师与小模型在线蒸馏unsetunset

4.7.1 双分支训练

OvisOCR2最终模型为Qwen3.5-0.8B。训练同时维护:

  • 4B教师分支:SFT后执行GRPO;
  • 0.8B学生分支:SFT后执行在线策略蒸馏;
  • 最后对多个候选0.8B模型加权参数平均。

0.8B全参数SFT训练2轮,4B仅训练0.2轮以控制成本;最大序列长度16K,动态视觉分辨率。

OvisOCR2的核心不是把4B教师永久部署到推理端,而是让大模型承担探索和强化学习,再把行为迁移给0.8B学生。下图把这一训练拓扑画成两条并行分支,能够直接解释后文为什么要同时讨论GRPO教师、在线策略蒸馏和参数融合。

因此,OvisOCR2中的“大模型能力”是一种训练期资源,而不是最终模型参数量的组成部分。紧接着的数据引擎图回答另一个问题:教师与学生究竟在什么样的真实和合成页面上学习。

上述第一张图即双分支图描述“知识如何从4B流向0.8B”,后面的数据引擎图描述“监督信号如何保持图像与Markdown同源”。前者解决小模型容量问题,后者降低复杂表格、长公式和阅读顺序标签中的伪标误差。

4.7.2 同源合成数据

合成样本从同一HTML源同时得到Markdown真值和Playwright渲染图像,并记录几何信息。与“先生成图像再由OCR模型伪标”相比,同源生成能保证图像和结构标签严格对应。模板根据真实失败案例迭代,重点增加复杂表格、长公式、长Markdown和阅读顺序难例。

4.7.3 多组件RL奖励

令  表示真值是否包含该类可评价元素,论文原式为:

其中:

  • 文本为 
  • 公式为归一化CDM;
  • 表格为归一化TEDS;
  • 截断、缺失或不可解析结构通过门控将相应组件置0。

4B模型能更稳定地吸收长结构输出的RL信号。论文观察到0.8B直接RL产生更大KL漂移,并在后期出现TableTEDS下降,因此改用教师蒸馏。

4.7.4 在线策略蒸馏

学生先按自身策略生成完整回答:

第  个状态为 。由学生分布选取top-k集合:

在该集合内重新归一化:

论文使用学生到教师的反向KL:

该方向具有mode-seeking性质:若学生将概率放在教师认为很差的候选上,会受到强惩罚;它不会要求学生覆盖教师分布的全部低概率模式。

top-k使分布张量复杂度由:

其中  为词表大小,。蒸馏状态来自学生自身轨迹,避免教师生成与学生生成长度不一致的对齐问题。

4.7.5 模型融合与结果

多个学生候选模型通过加权参数平均:

该式是加权参数融合的统一表示;论文未公开所有具体权重。

OvisOCR2在OmniDocBench v1.6达到Overall 96.58、TextEdit 0.025、FormulaCDM 97.53、TableTEDS 94.76、TEDS-S 97.16、ROEdit 0.111;PureDocBench的Clean、Digital、Real分别为81.55、77.09、66.56,Avg3为75.06。

其方法论价值在于:小模型不一定要直接承受高方差RL更新,可由容量更大的模型完成奖励对齐,再沿学生自身状态分布执行蒸馏。

unsetunset4.8 HPD-Parsing:层次并行解码与P-MTPunsetunset

4.8.1 模型结构

HPD-Parsing基于InternVL3.5-1B,视觉端约0.3B InternViT,语言端约0.8B、28层Qwen3-0.6B式解码器。图像动态切分为最多24个448×448块。

主布局分支按阅读顺序生成:

每当主分支生成<FORK>,调度器创建内容子分支,将该标记替换为<CHILD>,复用视觉前缀和当前结构前缀的KV Cache,并在局部区域上生成内容。主分支继续识别后续元素,多个内容分支并行执行。

下图把传统整页自回归与HPD的层次解码并排展示,P-MTP只在分支内部继续减少生成步数,并不取代主分支的全局协调。

若页面有  个内容块、每块输出长度 ,传统整页自回归关键路径近似为:

层次并行关键路径则近似为:

该式是本文用于解释并行收益的统一形式化,实际调度仍受分支创建时刻、GPU批处理和KV容量影响。

4.8.2 P-MTP损失

在位置  和前瞻深度 ,残差MLP结合前一层隐藏表示与已预测token嵌入,使用共享LM Head得到 。论文原式可整理为:

其中:

  •  为标准下一个token预测,
  •  为多步未来预测;
  •  为分支内目标有效掩码;
  •  综合距离衰减、预测路径一致性与目标一致性;
  • 内容分支只对<CHILD>之后的局部内容计算损失。

推理时每个活动分支并行起草多个token,目标头验证后接受连续正确前缀。平均每步接受6.6个token。具体更详细的P-MTP内容可以看百度专门发的论文,非常有参考价值,但这里碍于篇幅就不再介绍。

4.8.3 三阶段训练

第一阶段使用2.8M整页样本进行普通整页序列训练,同时训练主干和P-MTP,使模型先学会完整文档解析。

第二阶段使用100K精细样本,将每页重新组织为布局分支样本和局部内容分支样本,使模型适应<FORK>/<CHILD>机制并强化难例。

第三阶段使用600个代表性难例进行轻量强化学习,奖励针对公式、表格、布局和元素计数一致性。

训练全参数解冻。阶段1学习率 ,阶段2为 ,阶段3为 ;前两阶段各1轮,最大序列16K。

4.8.4 结果与效率

OmniDocBench v1.6达到Overall 94.91、TextEdit 0.039、FormulaCDM 97.28、TableTEDS 91.35、TEDS-S 94.11、ROEdit 0.124。

批量512时:

模型
平均输入token
TPS
PPS
同架构自回归基线
4809.3
1554.8
1.02
HPD-Parsing
4809.3
4752.1
2.68

TPS提高3.06倍,PPS提高2.62倍。最长输出区间中,论文报告解码步数最多减少18.04倍、请求吞吐最高提高3.67倍、单请求延迟最高降低5.80倍。

其主要代价是调度器和分支KV管理复杂度增加;此外,局部内容分支隔离了其他区域的详细文本历史,若某一区域必须依赖远处正文语义,过强隔离可能损害跨区域一致性。

unsetunset4.9 HunyuanOCR-1.5:DFlash、Agentic Data Flow与IcePopunsetunset

4.9.1 模型结构

HunyuanOCR-1.5为约1B端到端模型,由Hunyuan-ViT原生分辨率编码器、自适应MLP连接器和Hunyuan-0.5B语言模型组成。最高图像分辨率由2K提高到4K,上下文扩展到128K,支持Markdown、HTML、LaTeX、图表描述、信息抽取与多图问答。

下面的总架构图先给出主模型的数据路径:图像经过原生分辨率视觉编码和自适应连接器进入语言模型,不同OCR任务共享同一生成主干。

该图解释了“1B统一OCR模型”的边界:能力共享发生在视觉编码、连接和语言生成三层,而不是为每项任务单独训练一个识别器。接下来讨论的DFlash、Agentic Data Flow和IcePop,分别作用于推理效率、数据扩展和行为对齐,不应与主干结构混为一谈。

4.9.2 DFlash块扩散草稿

普通推测解码仍可能按自回归方式生成草稿。DFlash使用约90.7M、5层Transformer草稿模型,一次并行预测长度  的token块,目标模型并行验证并接受最长正确前缀。

训练时冻结目标模型。每条序列随机采样  个锚点(anchor),每个anchor形成独立块预测任务;FlexAttention块对角掩码使每个块可读取anchor前的目标模型隐藏状态和本块掩码token,不同块互相隔离。这里使用论文记号  表示anchor数,避免与Unlimited-OCR中表示滑动窗口宽度的  混淆。

每个草稿块都能读取目标模型在anchor之前的隐藏状态,却不能偷看其他草稿块;因此一次前向可以并行构造多个训练样本,同时保持各块的条件独立性。

论文给出的距离衰减权重为:

加权损失为:

其中  是第  个anchor, 是目标模型在anchor前缓存的隐藏状态, 是该草稿块的掩码查询, 是真实后续token。论文设置 ;anchor token和无效位置不计损失,距离anchor越远的未来token权重越小。

4.9.3 Agentic Data Flow

数据代理根据模型弱点自动搜索语料、字体、PDF和背景,调用OCR/VLM进行清理,编写合成或QA脚本,并由工程师迭代反馈。论文将其用于:

  • 331种语言的低资源OCR;
  • 7类汉字历史字形;
  • 多页PDF问答;
  • 表格、多栏、长尾版式等难例。

训练分为预训练、SFT和RL。预训练重做原模型第三阶段,混入新增能力数据,并将输入扩展到4K和128K;SFT统一任务接口和高质量结构输出;RL使用规则奖励、LLM裁判奖励和退化抑制奖励。

4.9.4 IcePop

IcePop用于缓解推理引擎与训练引擎概率不一致。训练策略与旧策略概率比为:

训练—推理校准比为:

只保留:

其PPO式token目标为:

完整的token均值目标为:

其中  是有效token掩码, 是训练—推理概率校准掩码, 是组内相对优势, 是token级KL项。原论文仍用  表示KL系数;本文写成 ,只是为了避免与DFlash距离衰减系数  混淆,并未改变公式含义。归一化在整个小批次通过双重掩码的有效token上完成,而不是先按每条响应长度分别平均;若 ,则跳过该次更新。

4.9.5 文档解析奖励

论文原式为:

表格元素奖励为:

其中结构项使用可定位错误的一维探针奖励,内容项采用带锚点去样式处理的TEDS式奖励。图表先转为CSV,再用对行列交换更稳健的SCRM计算平均精度。超过任务长度限制或检测到结尾重复片段的rollout直接得0。

unsetunset4.10 FinixDoc-VL:参照实验模型unsetunset

https://www.chooseai.net/news/4733/

6月30日消息,蚂蚁集团旗下 InclusionAI 实验室发布 FinixDoc,一套面向真实金融文档场景的端到端解析系统。该系统的核心模型 FinixDoc-VL 仅有 4B 参数,基于 Qwen3-VL 架构微调,在自建基准 FinixDocBench 上取得 81.43 的综合得分,超过 Kimi-K2.5 和多个参数量远大于自身的通用模型。蚂蚁同步开源了 FinixDocBench 的部分子集,供外部团队评估自身文档解析能力。

没错,到今天为止,网上能找到的开源是在huggingface上的FinixDocBench数据集与上图,其余都没有开源,后面我想重新复现时,可能没有进决赛群,原共用的userid没有权限了,我也是在最后被关闭的前一刻跑完了一组实验,其余在比赛中跑出来的数据没有纳入参考组,除了记录有些乱外,无法保证一些过拟合的后处理对于其它模型的不同格式有效。

当前唯一可纳入新正式横向表的结果来自Huge-Table 34页共享二维切片:Text Edit为0.453625、Reading Order Edit为0.425641、Table TEDS为38.055634、Overall为50.043019,34/34完整落盘。它与Paddle的52.085527和Ovis的51.701291接近,说明Finix在超宽表局部块上的文字与结构恢复仍有竞争力,但不支持“Finix显著领先所有开源模型”的旧结论,数据会在下章做展示。

五、公开基准与业务实测结果汇总

本章主要先整理了omnidocbench在1.5到1.6间,各模型对齐的口径,然后针对本次比赛的huge-table,后续会称其为A组,以及huge-long,后续称为B组,两组都有两次对照实验,一个是跑整图的分数,一个是共享切片,但A组别整图的时候,因为有些解析pipeline没对齐,最后我在整理成文的时候,也不是很想回头跑了,emmm,还是算力有限,一台4090如果跑完一次实验,加上评测,跑过类似任务的应该知道,一个是GPU算力需求,评测是CPU算力需求了,后续我租了两台,4090上跑结果,然后在32核纯CPU上跑评分,那么以下即是数据对比。

本章节本地跑的模型为OvisOCR2、HPD-Parsing、PaddleOCR-VL-1.6、GLM-OCR和mineru,然后没有Unlimited-OCR和monkeyocrv2,前者是我在另外项目中使用过,它的生成质量非常不稳定,后者因为它是一个编码器,选用llm和到底哪一款编码器那排列组合就太多,所以干脆就没跑,其中我最想跑的还有hunyuanocr,这个是因为当前所租的服务器不支持cuda 13.0以上的,所以当时gpt给我的方案是在基于12.9上编译,我准备好了脚本以及数据,但重新编译发现太久,就搁置了,后续看转autodl补跑,emmm。

unsetunset5.1 v1.5结果unsetunset

模型
范式
Overall↑
TextEdit↓
FormulaCDM↑
TableTEDS↑
TEDS-S↑
ROEdit↓
OCRVerse
整页端到端
89.23
0.052
87.13
85.77
90.35
0.068
DeepSeek-OCR-2
整页端到端
91.09
0.048
90.31
87.75
92.06
0.057
Dolphin-v2
类型路由流水线
89.78
0.054
87.63
87.02
90.48
0.054
GLM-OCR
版面流水线
94.62
0.040
93.90
93.96
96.39
0.044
Unlimited-OCR
整页端到端
93.23
0.038
92.61
90.93
94.07
0.045

说明:Dolphin-v2论文正文与表格总分存在89.45/89.78不一致;表中采用详细指标表的89.78。dots.mocr只在附录报告TextEdit 0.031和ROEdit 0.029,缺少同表完整分项,未列入总分表。

unsetunset5.2 v1.6结果unsetunset

模型
参数规模
系统范式
Overall↑
TextEdit↓
FormulaCDM↑
TableTEDS↑
TEDS-S↑
ROEdit↓
OCRVerse
4B
整页端到端
88.60
0.063
89.61
82.44
86.27
0.163
Dolphin-v2
3B
类型路由流水线
89.50
0.069
91.01
84.40
87.44
0.150
DeepSeek-OCR-2
3B/0.5B激活
整页端到端
90.25
0.050
91.84
83.89
87.75
0.144
dots.ocr基线
3B
整页端到端
90.77
0.048
89.95
87.18
90.58
0.138
MonkeyOCRv2-B-Parsing
约0.7B
区域流水线
91.57
0.053
91.83
88.24
91.38
0.131
Unlimited-OCR
3B/0.5B激活
整页端到端
93.92
0.042
95.79
90.16
93.32
0.129
HunyuanOCR-1.5
1B
整页端到端
94.74
0.039
94.50
93.67
94.71
0.129
HPD-Parsing
1B
层次并行统一模型
94.91
0.039
97.28
91.35
94.11
0.124
GLM-OCR
0.9B
版面流水线
95.22
0.044
97.18
92.83
95.39
0.133
MinerU2.5-Pro
1.2B
粗到细解耦模型
95.69
0.036
97.29
93.42
95.92
0.120
PaddleOCR-VL-1.6
0.9B
版面流水线
96.33
0.033
97.49
94.76
97.11
0.127
OvisOCR2
0.8B
整页端到端
96.58
0.025
97.53
94.76
97.16
0.111

这些数字表明:

  1. 参数量与结果不呈单调关系,0.8B OvisOCR2高于多种3B—4B模型;
  2. 流水线模型在表格结构上仍有优势,但OvisOCR2证明端到端模型可以达到同级TableTEDS;
  3. HPD-Parsing的主要目标是吞吐,不是绝对最高Overall,其FormulaCDM很高但TableTEDS低于顶级流水线;
  4. MonkeyOCRv2冻结视觉编码器且无专用后训练,其分数主要用于验证视觉基础模型的迁移性;
  5. v1.5和v1.6同名指标的绝对值不可直接相减。

unsetunset5.3 A组:Huge-Table 34页整图历史诊断unsetunset

比赛后第一轮系统复核曾让六套系统直接处理Huge-Table原始整页,并保存逐页输出;所有模型都使用34页固定分母:历史整图缺失页保留为空预测,不用切片结果回填。需要特别说明,这轮历史记录的表格项是ordered_shape_score,只比较按出现顺序对齐后的表格形状,不比较完整cell树,因此下表的Proxy不是正式Table TEDS Overall。它可用于确认整图路径确实运行过、比较截断与结构退化方向:

模型
固定分母
Text Edit↓
Reading Order Edit↓
Ordered Shape↑
Proxy↑
FinixDoc-VL
34/34
0.437290
0.362255
0.66481562.175672
OvisOCR2
34/34
0.527210
0.433333
0.460272
49.990968
HPD-Parsing
34/34
0.604045
0.297059
0.316327
47.174096
PaddleOCR-VL-1.6
34/34
0.756706
0.481373
0.335424
36.578177
MinerU
34/34
0.790682
0.544118
0.310393
32.519796
GLM-OCR
34/34
0.757456
0.544608
0.094603
26.417978

上面这张表还是有意义的,虽然当时有些事情没对齐,在超大表格中,FinixDoc-VL对于相同34页上的文本距离和表格形状代理均领先,说明商业API内部的页面压缩、区域处理或长输出控制比当时几套开源调用更适应超宽金融表,以及服务器更强,HPD的读序距离最低,但文本与表格形状较弱;Paddle、MinerU和GLM的历史整图调用则出现明显内容压缩、区域碎片化或输出协议失配。

后续的A组切片,对齐了官方推荐参数配置,以及开启了mtp,数据将更有说服力。

unsetunset5.4 A组:Huge-Table 34页共享切片正式横向对照unsetunset

A组用于回答一个问题:面对横向、纵向同时超出模型稳定输入范围的超宽金融表格,在完全相同的二维切片条件下,不同OCR系统恢复整页内容和表格结构的能力有何差异?

实验固定34页Huge-Table及其GT,按照冻结manifest生成2,752张带坐标的JPEG切片。与B组只沿纵轴切分不同,A组同时切分横轴和纵轴,以保证超宽页面中的小字号、密集列和表格线在每个局部图块中保持可辨。六套系统读取完全相同的切片字节、页面ID和坐标;随后按坐标顺序恢复为34份页面Markdown,再使用同一正式评分器计算Text Edit、Reading Order Edit与Table TEDS。

切片缺失不能由整图或其他模型输出补齐。各系统允许使用自己的官方提示词、服务端和输出转换器,因为这些属于模型合法输出协议;公共页面组装阶段只负责依据冻结坐标恢复页面,不调用其他OCR补字,也不读取GT进行选择。

5.4.1 运行配置

系统
本轮采用的正式路径
关键控制
FinixDoc-VL
比赛期间完整落盘的Finix切片输出与冻结坐标组装器
2,752张切片全部存在,不使用整图或后续版本补页
PaddleOCR-VL-1.6
官方PaddleOCRVL版面分析、区域识别与结果合并pipeline
使用官方vLLM服务和布局路径,所有切片按同一manifest组装
OvisOCR2
原生OvisOCR2 vLLM服务
max_tokens=8192
;超时tile独立重试,最终2,752/2,752完成
HPD-Parsing
官方HPD服务与官方hpd_to_markdown.py转换
max_tokens=8000
;先移除<BLOCK>/<CHILD>协议标记,再进行页面组装
GLM-OCR
官方vLLM推理路径
max_tokens=8192
、MTP=3、enforce_eager=False;不混入早期eager/no-MTP结果
MinerU2.5-Pro
MinerU2.5-Pro-2605-1.2B
正式服务
checkpoint原生max_model_len=8192、客户端max_tokens=4096;使用修正后的完整任务提示和专用组装路径

5.4.2 正式结果

模型
状态
Text Edit↓
Reading Order Edit↓
Table TEDS↑
Overall↑
PaddleOCR-VL-1.6
34/34
0.438303
0.448718
44.95869952.085527
OvisOCR2
34/34
0.467515
0.417949
43.650235
51.701291
FinixDoc-VL
34/34
0.453625
0.425641
38.055634
50.043019
HPD-Parsing(官方转换)
34/34
0.934631
0.178205
8.780641
32.499007
GLM-OCR(未加layoutv3)
34/34
1.000000
1.000000
37.965839
12.655280
MinerU2.5-Pro-2605-1.2B
33/34(部分)
0.544263
0.232000
7.494762
43.289501*
  • MinerU四项指标只聚合成功评分的33页,分母与其余五个系统不同,不能据此确定其34页全量名次。最后一页GT约72KB、含一个90行超大表,预测约69KB并含19个HTML表格;评测器预处理未在限定窗口完成。该页未写0,也未从其他版本补齐,因此43.289501只能作为透明披露的33页部分结果。

在34/34完整系统中,Paddle、Ovis和Finix的Overall分别为52.09、51.70和50.04,差距不足2.1分;HPD为32.50,GLM为12.66。MinerU的33页部分分为43.29,但因分母不同不进入全量排序。

5.4.3 为什么二维切片仍然困难

二维切片解决了局部可读性,却引入了比B组纵切更强的全局重建问题:

  • 列关系被切断:同一行的表头、字段和值可能分布在不同横向图块中;
  • 表格边界被重复观察:横纵重叠会让同一单元格、边框和表头在多个切片中出现;
  • 局部表格缺少全局宽度信息:模型可正确识别局部行列,却无法知道它属于整表的第几列以及应与哪个相邻表合并;
  • 合并单元格跨块rowspan/colspan一旦越过切片边界,单个图块无法独立恢复完整跨度;
  • 页面组装由识别问题转为结构匹配问题:2,752个局部结果需要重新形成34棵全局表格树,任何错误合并或漏合并都会同时影响Text、Order与TEDS。

因此,A组约50分不能解释为模型没有识别出局部文字。它更直接地表明:在超宽密集表中,局部OCR正确并不足以保证全局表格正确,跨块结构恢复成为主要瓶颈

5.4.4 逐模型结果分析

PaddleOCR-VL-1.6以52.085527排名第一。Text Edit为0.438303、Table TEDS为44.958699,均为34页完整系统最佳,说明其版面分析和区域识别pipeline在局部块内保持了较好的内容与表格恢复。但Reading Order Edit为0.448718,且总分远低于B组纵切的94.40,说明横向分块后的跨列顺序和整表合并仍是主要损失来源。

OvisOCR2达到51.701291,与Paddle仅差0.384236。其Reading Order Edit为0.417949,优于Paddle;Table TEDS为43.650235。该结果说明Ovis端到端模型在局部二维块上具有较强识别能力,但统一组装器仍难以把多个局部HTML表格恢复成完整超宽表。

FinixDoc-VL达到50.043019,与前两名处于同一水平。Text Edit为0.453625、Reading Order Edit为0.425641,Table TEDS为38.055634。它证明Finix在比赛验证过的二维切片路径上具有稳定的局部恢复能力,但其表格结构分低于Paddle和Ovis,说明切片后的全局拓扑重建同样没有被完全解决。

HPD-Parsing的Reading Order Edit为0.178205,是完整系统中最低值,但Overall只有32.499007。GT共1,413,100个可见字符和89个表格,HPD输出2,151,204字符和1,222个表格。官方转换已经生效,低分主要来自层次分支在二维切片上产生大量局部碎片与重复表格;顺序较好不能抵消Text Edit 0.934631和Table TEDS 8.780641。

GLM-OCR的Table TEDS为37.965839,但Text Edit和Reading Order Edit均为1,Overall仅12.655280。正式配置已启用MTP=3并保持enforce_eager=False,因此低分不是误用性能参数造成的,而是我忘记加layoutv3做版面分析了,后来换了一台4090部署,也就是说这里是纯glm模型推理。该结果表明,局部表格骨架能够进入评分器,但页面组装后的文本块与顺序无法和GT建立有效匹配。

MinerU2.5-Pro在33页有效子集上得到43.289501,其中Reading Order Edit为0.232000,但Table TEDS仅7.494762。该结果说明已完成页面仍存在明显表格碎片化;同时缺失的最后一页恰好是90行超大表,不能假设补齐后分数保持不变。因此本文只分析其部分结果,不将其插入34页排名。

unsetunset5.5 B组:Huge-Long 30页整图与共享切片unsetunset

B组用于回答一个明确问题:面对纵向极长、横向结构连续的金融文档,外部纵向切片是否能稳定提升不同OCR系统的内容、阅读顺序与表格恢复质量?

实验固定同一批30页Huge-Long原图及其GT,并为每个模型建立两条相互隔离的推理分支:

  1. 整图分支:直接输入30张原始长页;
  2. 共享切片分支:按整宽6000px、相邻重叠600px沿纵轴切分,共生成425张JPEG,再按固定坐标顺序组装回30页。

两条分支使用相同模型权重、官方或原生推荐推理路径、关键解码配置、输出转换器、页面ID、GT和评分器;预测目录完全隔离,不跨分支补页。共享切片保持页面完整宽度,因此不会主动切断同一行中的列关系,只缩短单次视觉上下文和输出长度。Finix接口因授权失效未产生有效B组预测,故不填0,也不参与本组比较。

运行配置与A组同理。

5.5.1 正式结果

模型
覆盖
整图Text Edit↓
整图Reading Order Edit↓
整图Table TEDS↑
整图Overall↑
PaddleOCR-VL-1.6
30/30
0.566743
0.512330
5.885886
32.659522
MinerU2.5-Pro
30/30
0.642358
0.562408
25.858934
35.127443
OvisOCR2
30/30
0.966691
0.792300
0.000000
8.033644
HPD-Parsing(官方转换)
30/30
0.930150
0.851728
0.302347
7.371510
GLM-OCR
30/30
0.942167
0.816362
0.000000
8.049015
模型
覆盖
切片Text Edit↓
切片Reading Order Edit↓
切片Table TEDS↑
切片Overall↑
相对整图提升
PaddleOCR-VL-1.6
30/30
0.0361680.03245790.04991094.395818
+61.736296
MinerU2.5-Pro
30/30
0.076326
0.056643
89.233817
91.978987
+56.851544
OvisOCR2
30/30
0.081224
0.058851
85.195824
90.396132
+82.362488
HPD-Parsing(官方转换)
30/30
0.098416
0.086533
83.464431
88.323157
+80.951647
GLM-OCR
30/30
0.487964
0.374862
70.494733
61.404023
+53.355008

两张表中的指标直接取自success=true且覆盖30/30页的正式评分JSON。Overall由评分器使用未舍入的内部统计量计算,因此按表中六位小数反算时,末位可能出现不超过0.000024的舍入差异。

结果具有三个明显特征:

  1. 五个系统切片后均提升超过53分,说明收益不是单一模型偶然现象;
  2. Paddle、MinerU、Ovis和HPD同时改善Text、Reading Order与Table TEDS,并非只靠某一指标补偿;
  3. Paddle、MinerU、Ovis与HPD达到88—94分,而GLM为61.40,表明纵向切片解决了主要尺度问题,但不能自动修复所有输出协议与页面组装问题。

5.5.2 逐模型结果分析

PaddleOCR-VL-1.6取得最高分94.395818。其共享切片Text Edit为0.036168、Reading Order Edit为0.032457,均为五个系统最佳,Table TEDS也达到90.049910。说明官方版面分析—区域识别—结果合并pipeline在局部尺度下能够同时保持文字、顺序和表格结构,优势并非来自单项指标。

MinerU2.5-Pro由35.127443升至91.978987。整图输出已有289,657个可见字符,约为GT的104.5%,但被拆成860个HTML表格,低分根因是布局与表格区域过度碎片化,而不是字符总量不足。共享切片后输出为267,933字符、约为GT的96.6%,只产生21个闭合表格,表格页数量与GT一致,三项指标随之同时恢复。

OvisOCR2由8.033644升至90.396132,提升82.362488,为五个系统最大。整图仅输出GT约13.9%的字符且没有可计分表格,说明超长输入下发生了严重视觉压缩或生成截断;切片后Text、Order和TEDS分别恢复至0.081224、0.058851和85.195824,证明其局部端到端识别能力本身较强。

HPD-Parsing由7.371510升至88.323157。正式结果已经经过官方hpd_to_markdown.py转换,因此提升不能归因于修复评分器兼容性。整图输出膨胀到GT约2750.2%,存在分支循环和结构失稳;共享切片后长度降至GT的176.2%,但仍有局部重复、2页表格未闭合,因此低于前三名。

GLM-OCR由8.049015升至61.404023,说明纵切同样有效,但恢复不完整。正式结果使用MTP=3和enforce_eager=False,低分不能归因于关闭官方加速路径。共享切片Table TEDS达到70.494733,但Text Edit和Reading Order Edit仍为0.487964与0.374862,剩余问题主要位于文本块序列化、阅读顺序恢复和页面组装,而不是表格完全无法识别。

unsetunset5.6 A/B证据分层诊断unsetunset

为了避免把相关性直接写成因果,下面把结论分为两层:直接证据来自同页A/B分数、输出结构统计和逐页抽查;机制判断则是结合模型架构与输出形态作出的解释,需要额外消融才能完全证明。

模型
直接证据
当前高分或低分的主要解释
优先改进方向
PaddleOCR-VL-1.6
B组共享切片Text Edit与Reading Order Edit最低、Table TEDS最高,Overall 94.40;A组52.09
在B组整宽纵切下,官方版面—识别管线能稳定恢复文字、顺序和表格;A组低分与更复杂的超宽表及二维分块同时相关,现有实验不能拆分两者贡献
对超宽表优先测试结构感知的列边界检测;组装时显式约束跨块表头与rowspan/colspan,并通过同页消融验证收益
MinerU2.5-Pro
B组整图字符量为GT的104.5%,却产生860个表格、Overall 35.13;共享切片缩至21个表格、Overall 91.98
低分不是文字总量不足,而是整图布局与表格区域过度碎片化;共享切片把粗到细识别限制在稳定局部范围
合并高度相邻、列结构一致的小表;为极端长图设置外部分段阈值;保留全局表头和跨片几何坐标
OvisOCR2
B组整图仅GT字符量的13.9%、无可计分表格,Overall 8.03;共享切片90.40;A组51.70
B组同页消融表明整图主要受视觉压缩和单次生成预算限制,局部识别能力本身较强;A组低分只能说明当前“超宽表数据+二维切片+组装”组合仍困难
在输出预算前主动切片;使用终止原因和长度门控检测截断;对超宽表比较重叠列锚点与均匀网格的同页效果
HPD-Parsing
官方转换后,B整图膨胀至GT的2750.2%、Overall 7.37;共享切片仍为176.2%,但升至88.32;A组产生1,222个表格
整图分支生成出现循环和聚合膨胀;二维切片又放大表格碎片。低分不能归因于<BLOCK>漏转换,因为正式结果已走官方转换器
分支级重复检测与提前终止;按重叠坐标去重;限制异常fork数量;合并相邻同列结构表格
GLM-OCR
正式配置为MTP=3、enforce_eager=False;B组切片由8.05升至61.40,但Text Edit与Reading Order Edit仍为0.488/0.375;A组两项均为1
切片缓解整图过载,但由于未启用官方推荐的 PP-DocLayout-V3 版面检测组件,当前核心链路的输出协议、文本块序列化和页面组装仍未复现论文完整两阶段流水线。
接入官方版面检测和区域提示;逐块核对prompt与输出schema;先修文本与顺序匹配,再优化Table TEDS;不以eager/no-MTP结果替代正式配置

六、共性分析

unsetunset6.1 输出统一为可执行结构序列unsetunset

这些模型几乎都不再输出无结构纯文本,而是输出Markdown、HTML、LaTeX、JSON或SVG。统一训练目标仍以条件自回归为主,但评价函数已从单一字符准确率扩展到:

这意味着OCR已成为“视觉到程序或结构语言”的生成问题。

业务实测进一步说明,“可执行”至少有三层含义:语法可解析、结构与图像一致、内容与图像一致。B组MinerU整图虽然输出字符量达到GT的104.5%,却碎片化为860个HTML表格,Overall只有35.13;共享切片后字符量略降,结构恢复,Overall反而达到91.98。因而结构语言生成不能只用字符量、编译成功或标签闭合作为终点。

unsetunset6.2 数据工程由“扩量”转向“定向补弱”unsetunset

PaddleOCR-VL-1.6挖掘欠优化区域,HunyuanOCR-1.5让代理围绕能力缺口构造数据,OvisOCR2根据失败案例改进HTML模板,HPD-Parsing进行难度分层与多模型标注,Dolphin-v2针对拍照、代码和目录单独合成。

这类数据闭环的业务含义不是“再加一些金融图片”这么简单。本文数据集中同时存在超长输出、数字密集、宽表、合并单元格、序列化模板和极端页面尺寸;如果训练数据只匹配视觉风格而不匹配输出长度与HTML复杂度,模型仍会在生成阶段坍缩。应把失败样本按“视觉看不清、布局分错、输出截断、结构未闭合、重复循环、拼接错序”分层,而不是统一归为OCR错误。

其共同流程可抽象为:

因此2026年的数据工程是闭环系统,而非一次性static datasets。

unsetunset6.3 SFT负责格式学习,RL负责可验证偏好unsetunset

多数模型先通过SFT学习任务格式,再用可验证奖励提高结构正确性。OCR天然适合RLVR,因为文本、表格、公式和JSON均可程序化评价:

OCRVerse强调分域奖励;GLM-OCR强调任务奖励;PaddleOCR-VL-1.6强调Valid—Struct—Sim;HunyuanOCR-1.5强调结构、裁判与退化抑制;OvisOCR2则先让4B模型承受RL,再蒸馏给0.8B学生。

unsetunset6.4 推理瓶颈由视觉前向转向长序列解码unsetunset

结构化OCR输出常有数千词元。2026年主要加速路线包括:

  • GLM-OCR:MTP;
  • HunyuanOCR-1.5:DFlash并行草稿;
  • HPD-Parsing:跨区域分支并行与分支内P-MTP;
  • Unlimited-OCR:限制解码历史窗口,使每步缓存与注意力成本稳定;
  • Dolphin-v2:数字文档区域并行。

这些方法分别压缩:

金融长表实验说明,压缩关键路径之后还会出现新的“可靠性关键路径”:任务是否被切到可生成规模、分支是否爆炸、局部HTML是否闭合、跨片是否重复、失败是否被及时发现。推理优化因此不能只最小化生成步数,还要最小化错误结果进入最终文档的概率。

七、关键差异

unsetunset7.1 视觉表示差异unsetunset

模型
视觉侧主要创新
主要作用
DeepSeek-OCR-2
双向视觉词元+因果查询
语义重组与视觉阅读逻辑
MonkeyOCRv2
文本生成+像素/结构重建
保留字符笔画,降低语言先验依赖
dots.mocr
1.2B文档原生高分辨率编码器
同时感知文字与图形基元
HunyuanOCR-1.5
4K原生分辨率Hunyuan-ViT
稠密文档、超大表格与图表
HPD-Parsing
最多24个动态视觉块
以较高视觉词元预算换取细节

DeepSeek-OCR-2主要重构“视觉词元如何组织”;MonkeyOCRv2主要重构“视觉编码器学什么”;dots.mocr主要重构“视觉对象包含什么”。

unsetunset7.2 结构分解差异unsetunset

  • Dolphin-v2先判断文档类型,再决定整页或区域解析;
  • GLM-OCR和PaddleOCR-VL-1.6依赖外部版面模块;
  • MonkeyOCRv2-Parsing由同一模型预测版面并再次识别裁剪区域;
  • HPD-Parsing在解码过程中动态分叉,不需要完全独立的外部区域识别系统;
  • OvisOCR2、OCRVerse和DeepSeek-OCR-2直接整页生成。

流水线的上界通常受限制为:

端到端模型没有显式乘法误差链,但可能产生长序列累积错误。A/B实验把这组差异具体化了:Ovis端到端整图只有8.03,切片后达到90.40;HPD整图分支聚合严重重复,切片后达到88.32;MinerU整图粗到细过度碎片化,切片后达到91.98;Paddle在同切片下达到94.40;GLM核心调用虽提升到61.40,仍未复现论文完整版面流水线。不存在“端到端一定优于流水线”或相反的统一答案,关键是页面分解是否与训练范式一致,以及合并是否恢复全局结构。

unsetunset7.3 RL使用方式差异unsetunset

模型
RL对象
奖励核心
稳定机制
OCRVerse
4B模型
分域文本/渲染奖励
GRPO组内标准化
GLM-OCR
0.9B系统核心
NED/CDM/TEDS/F1
格式与重复约束
PaddleOCR-VL-1.6
0.9B模型
Valid×Struct×Sim
高潜样本筛选、DAPO式动态组
HunyuanOCR-1.5
1B模型
文档结构、LLM裁判、退化抑制
IcePop训练—推理概率校准
OvisOCR2
4B教师
文本/CDM/TEDS
0.8B不直接RL,改用OPD
HPD-Parsing
1B分支模型
公式、表格、布局、计数
仅600难例轻量RL

OvisOCR2的差异最明显:它将“学习奖励”与“部署小模型”分离。PaddleOCR-VL-1.6则证明,在高性能区间,RL增益小于高质量CPT/SFT数据。

A/B业务实验只有各模型的最终checkpoint,没有CPT、SFT、RL或蒸馏阶段的中间checkpoint,因此不能从最终输出反推各训练阶段的因果贡献。业务结果只能检验最终系统是否表现出论文宣称的能力:Ovis在共享切片下达到90.40,说明小模型的局部识别能力能够兑现;Paddle达到94.40,说明其完整管线在该输入尺度上兼顾了文字、顺序与表格;GLM核心调用仍为61.40,则说明缺少完整系统组件时,论文奖励设计本身不足以保证业务结果。

unsetunset7.4 加速机制差异unsetunset

方法
减少对象
是否改变目标模型分布
主要风险
GLM MTP
目标模型串行解码步数
验证式推理原则上保持目标分布
草稿接受率低时收益有限
DFlash
目标模型调用次数
验证后保持目标分布
草稿模型额外成本
HPD+P-MTP
区域串行关键路径与分支内步数
改变生成组织方式
调度复杂、跨区依赖减弱
R-SWA
解码历史长度与KV增长
改变注意力可见范围
远程文本依赖丢失
区域并行
页面区域串行数
依赖裁剪和合并
检测误差传播

DFlash属于验证式推测解码,理论上保持目标模型输出分布;R-SWA直接改变模型注意力结构,需要继续训练适应;HPD改变的是整个输出执行图。

unsetunset7.5 研究目标差异unsetunset

  • OCRVerse追求跨域统一;
  • DeepSeek-OCR-2追求视觉因果流;
  • Dolphin-v2追求数字文档与拍照文档统一;
  • GLM-OCR追求轻量部署和KIE统一;
  • dots.mocr追求文本与图形代码统一;
  • PaddleOCR-VL-1.6追求数据效率和榜单上限;
  • Unlimited-OCR追求多页长序列稳定;
  • HunyuanOCR-1.5追求能力边界、速度和多任务;
  • MonkeyOCRv2追求文档视觉基础编码器;
  • OvisOCR2追求小参数端到端高精度;
  • HPD-Parsing追求高吞吐层次并行。

因此不能仅用一个Overall概括所有论文价值。

八、结论

2026年大模型OCR研究的核心变化不是将传统OCR简单接入LLM,而是重新设计视觉表示、文档结构、训练奖励和解码执行图。各论文形成了相互补充的技术谱系:

  • DeepSeek-OCR-2与MonkeyOCRv2提升视觉编码质量;
  • Dolphin-v2、GLM-OCR与PaddleOCR-VL-1.6强化版面分解和数据闭环;
  • OCRVerse与dots.mocr扩大输出空间;
  • Unlimited-OCR、HunyuanOCR-1.5与HPD-Parsing解决长序列效率;
  • OvisOCR2展示大教师RL与小学生在线蒸馏的高效路径。

A/B金融长表实验让这些论文结论获得了更具体的边界:

  • Huge-Long同页同GT中,Paddle、MinerU、Ovis与HPD由整图的7—35分恢复到共享切片的88—94分,证明旧低分首先是输入与系统协议失配,而不是模型完全缺少金融表能力;
  • OvisOCR2以0.8B在共享切片上达到90.40,支持“小模型可以很准”,同时82.36分的整图—切片差也说明参数效率不能代替任务分解;
  • MinerU整图字符量已接近GT却碎成860个表格,共享切片后以更短输出达到91.98,证明结构完整性比生成长度更重要;
  • HPD经官方转换和共享切片达到88.32,但重复膨胀与二维切片碎片化仍是主要代价;
  • GLM共享切片由8.05升至61.40,却仍未达到其他系统水平,强调论文中的版面流水线不能缩写成核心权重调用;
  • Huge-Table二维切片最佳仅52.09,且输出审计显示跨块表格恢复仍是主要难点;由于该组与Huge-Long并非同一数据集,不能用两组分差定量归因于切片方向。Finix在A组为50.04,与Paddle、Ovis接近而非显著领先;
  • Hunyuan因推理栈不兼容未计分;MinerU A组报告33/34部分分43.289501,但不参加34页全量排名;Finix B组因授权失效标记blocked。状态边界本身属于正式结果。

因此,模型参数量不再是性能的唯一决定因素,论文Overall也不是业务完成度的代理。业务差距往往来自五个连续环节:视觉细节是否保留、页面是否正确分解、每个生成任务是否落在输出预算内、局部结果是否可靠拼接、失败是否能被门控并回退。任何一环失效,前面的模型精度都可能无法兑现。

指标层面同样需要收紧:输出/GT字符比不是内容覆盖率;在超长表上静默丢弃TEDS超时页会制造选择偏差;合法HTML不等于正确HTML;不同系统的分数必须带完整配置名称。本文主结论只使用带GT的正式Text Edit、Reading Order Edit与Table TEDS;旧80页proxy仅作为失败审计,不与比赛线上分、OmniDocBench或新A/B分数互相映射。

综合判断,下一阶段高水平OCR系统将具有五项共同特征:文档原生视觉编码、全局—局部层次生成、可验证多任务奖励、面向长结构输出的专用推理机制,以及显式失败检测与可回滚工程。其最终形态将不再只是“识别文字”,而是把复杂视觉文档编译为真正有效的结构化内容。

最后

很久没写过这么长的文了,当然还有很多想聊的但没有转述出来,不过希望读者都有所收获。