引言
本篇写得初衷是,今年的afac 2026结束,赛道二复杂金融文档还原挑战最后进入了前30,成绩并不理想,相比于去年ccks,不过花在这题的时间不多,主要时间都在赛道三和四,可惜一个违规(二修PS:自我感觉,所以B榜没咋玩,赛后与前排大佬聊了下,发现有点老实了),一个明面上差距1分,emmm。但个人参赛影响不大,我主要谈谈今年afac给我的感受,跟梁圣闭门会的一个核心词一致,即克制,赛题一的实时指标,赛题二的统一线上OCR模型,赛题三的无过多人为干预的长程agent自主化,赛题四的30%token惩罚,都是算法制定不可忽视的问题,这也是我认为本届有意思的地方,无关金融。
从赛题二展开,赛方规定,只能调用线上Finix模型,但克制过头,前期我记得只给共用一个api key,导致前中期所有人都巨卡无比,然后就是投诉->加资源->再投诉,emmm。直到初赛最后几天,说加了MTP,我才算正式开始,在finix创建策略到结束。本篇后续会进行的实验就是接着这个比赛数据集,将最近的一些开源OCR都跑跑,以及在这之前想对今年开源的OCR做一个系统性的介绍,但个人水平有限,如有错误欢迎指正。
一、2026年的OCR发生了什么
PS:这里可以插播一下2025年的OCR,mineru不论是效率还是质量,都是独一档存在,具体能看之前写得一篇:
如果只看OmniDocBench排行榜,2026年的OCR似乎只是从90分提高到96分;但从系统结构看,这一年的变化远不止几个百分点。文档OCR正在从“识别图片里的字”转变为“把视觉文档编译成可执行结构”。模型不仅要回答文字是什么,还要确定文字属于哪个区域、各区域按什么顺序阅读、公式如何写成LaTeX、表格如何恢复为HTML、图形是否可以转成SVG,以及数千个输出token如何在可接受的延迟和显存内生成。
本文基于12篇公开技术论文,对OCRVerse、DeepSeek-OCR-2、Dolphin-v2、GLM-OCR、dots.mocr、PaddleOCR-VL-1.6、MinerU2.5-Pro、Unlimited-OCR、HunyuanOCR-1.5、MonkeyOCRv2、OvisOCR2与HPD-Parsing进行系统梳理,首先聚焦下面的问题:
| 论文汇总 | 重点模型 | 需要回答的问题 |
|---|---|---|
unsetunset这里给出部分回答:unsetunset
小模型不等于低精度。 OvisOCR2以0.8B参数在OmniDocBench v1.6达到96.58,表明大教师强化学习、在线蒸馏和数据质量能够显著改变参数效率。 视觉编码器重新成为研究重点。 DeepSeek-OCR-2尝试在视觉侧建立因果信息流;MonkeyOCRv2用图像重建约束编码器保留笔画;dots.mocr从零训练文档高分辨率视觉主干。 纯端到端与传统流水线正在融合。 Dolphin-v2和GLM-OCR仍依赖区域分解;HPD-Parsing则把布局—内容分工放进统一模型的解码图中。 强化学习的关键不只是算法,而是奖励是否可验证、样本是否值得学习。 PaddleOCR-VL-1.6的消融显示主要增益来自CPT和SFT,RL是最后的精修;OvisOCR2发现0.8B直接RL不稳定,因而转向4B教师。 速度指标必须结合条件阅读。 4752 TPS、1002 TPS和5580 TPS可能分别来自不同批量、运行时和并发,数字本身不能直接排名。 v1.5与v1.6不能混算。 测试集、元素匹配和统计协议不同,跨版本分数变化不等于模型能力升降。 页面分解可以改变六十分以上。 Huge-Long同页同GT实验中,共享切片相对整图带来 +53.36到+82.36的Overall提升;这不是模型权重变化,而是输入任务从超长整页变为模型可稳定处理的局部片段。高论文分仍需正确调用协议兑现。 Paddle、MinerU、Ovis与HPD在共享切片下达到88分以上,说明旧实验中的30—50分主要混入了整图过载、弱提示词、错误输出转换和不匹配组装器等系统问题。
详细内容,将慢慢展开。
二、文档大模型OCR的统一问题定义
本节参考综述《Document Parsing Unveiled: Techniques, Challenges, and Prospects for Structured Information Extraction》,该文最初发表于2024年,v5于2026年4月修订,其检索覆盖约1995—2026年的研究,从约860条记录中经过去重、摘要筛选和全文审查,最终纳入230篇论文。选择它并非因为时间最新,而是因为它同时覆盖版面分析、文字识别、表格、公式、图表等文档元素,且把传统模块化系统、VLM统一解析、数据集和评价指标放进同一套分类框架。
在系统分类上,该综述以架构组织方式为主,区分两类范式:一类是把版面检测、OCR、表格与公式识别等环节显式拆开的模块化流水线;另一类是共享视觉—语言表示并直接生成结构化结果的统一VLM。它还指出,统一VLM内部又存在整页端到端生成和保留多阶段推理的技术路线。本节后续关于视觉编码、结构规划、内容生成和层次解码的讨论,都以这套分类为起点。

图中从“页面”到“结构化表示”再到下游任务的路径,正对应下文的数学抽象:输入仍是一张图像,但输出不再是单一字符串,而是带有位置、类别、载荷和顺序的文档元素序列。后续模型的差异,都可以放回“如何编码页面、如何恢复结构、如何生成内容”这三步中理解。
unsetunset2.1 从字符识别到结构化文档生成unsetunset
传统OCR主要回答“图中写了什么”,输出通常是字符、词或文本行;文档解析还需要回答“这些内容位于哪里、属于什么元素、彼此如何组织”:文字相同但行列关系不同的两张表,对下游计算具有完全不同的语义;多栏页面即使逐字识别正确,阅读顺序错误也会改变段落含义。因此,文字、二维布局、元素类别和输出顺序必须进入同一个问题定义。综述用映射 表达从文档图像空间到结构化表示空间的转换;下面进一步展开为元素序列,给定文档图像
现在的OCR模型需要生成有序文档元素序列
其中:
为第 个元素的位置或边界框; 为元素类别,如正文、标题、表格、公式、代码块或图形; 为元素载荷,可为纯文本、Markdown、HTML、LaTeX、JSON或SVG; 元素顺序同时承担阅读顺序和部分层次关系的表达。
端到端生成模型通常将视觉编码结果记为
并由自回归解码器生成目标序列:
其中 为任务提示, 为结构化输出。
标准监督学习目标为:
上述概率分解与交叉熵目标是条件自回归生成的标准写法,这里仅将其用于统一表达“视觉条件下生成结构化序列”这一共同部分。它不能推出各模型具有相同的视觉编码器、数据组织、提示格式或辅助损失。后续的OCRVerse在论文中明确给出同类SFT目标;Dolphin-v2、GLM-OCR与dots.mocr等论文虽使用自回归训练,但未都给出新的独立闭式损失。
unsetunset2.2 系统架构:模块化、统一生成与层次解码unsetunset
综述把模块化pipeline与统一VLM视为两类范式,而不是“旧方法”和“新方法”的简单替代关系。pipeline用显式中间结构换取可解释性、局部优化和故障定位,但布局错误会向后传播,多个模块也难以联合优化;统一模型通过参数共享和端到端训练增强全局一致性,却要在一条生成轨迹中同时处理几何、文字和关系,复杂页面上的可扩展性与可解释性仍有限。所以综述进一步把专用VLM分为整页端到端与多阶段解析两条路线。结合HPD-Parsing等2026年模型,本文将其细化为以下三种工程形态,其中第三种是我看了DeepSeek-OCR-2和HPD的论文后,对统一模型内部执行方式的补充分类,目前边界不是很清晰,但看未来还有没有什么发展空间。
2.2.1 整页端到端生成
整页图像经过一次视觉编码后,模型直接生成完整Markdown或其他结构化结果。代表模型包括OCRVerse、DeepSeek-OCR-2、Unlimited-OCR、HunyuanOCR-1.5与OvisOCR2。
其优点是全局上下文完整、系统结构统一;缺点是输出序列长,局部错误可能造成后续重复、遗漏或格式崩溃。
2.2.2 版面检测与区域识别流水线
首先预测元素类型、位置和阅读顺序,再按区域并行识别,最后合并输出。Dolphin-v2、GLM-OCR、PaddleOCR-VL-1.6与MonkeyOCRv2-Parsing均具有此类特征。
其核心近似为:
该范式便于并行和类型专用优化,但会引入检测误差传播与裁剪误差。
2.2.3 层次化统一生成
HPD-Parsing不使用完全独立的外部检测器,而由主布局分支动态创建内容子分支。其位置介于整页直接生成与传统pipeline之间:模型仍是统一VLM,但推理轨迹已显式分层并行。本文单列这一形态,是为了避免把“端到端”误解为“只能用一条串行序列完成整页生成”;它是对统一模型执行方式的分析性细分,而不是第三种获得综述共识的基础范式。
三、评价指标及其公式
unsetunset3.1 Levenshtein编辑距离与归一化编辑距离unsetunset
对预测字符串 和真值 ,Levenshtein距离递推为:
归一化编辑距离通常写为:
OmniDocBench中的TextEdit与ROEdit均为“越低越好”。对应的文本相似度常写为:
需要注意,TextEdit的输入通常是在元素匹配、文本规范化和空白处理之后得到的文本;ROEdit的输入则是匹配后的阅读顺序序列。因此两者不是简单地对整段原始Markdown直接计算编辑距离。
unsetunset3.2 OmniDocBench Overallunsetunset
OmniDocBench v1.5总体分数为:
其中:
TextEdit先被转换为百分制文本得分; FormulaCDM和TableTEDS直接进入平均; TEDS-S与ROEdit通常是诊断指标,不直接进入Overall。
unsetunset3.3 AFAC赛题评价体系unsetunset
本赛题要求输入复杂金融文档图片,输出与原文严格对应的高保真Markdown。赛题资料与公开FinixDocBench兼容评测器对应三个核心量化指标:
text_block_Edit_dist | ||
reading_order_Edit_dist | ||
table_TEDS | rowspan/colspan与单元格内容 |
对应的百分制总分为:
这里三个方向等权,各占三分之一。若文本和阅读顺序不变,Table TEDS提高9分,理论Overall只提高3分;反之,只优化表格而损伤文字或顺序,也可能使总分下降。这正是比赛中“本地表格看起来更完整,线上却降分”的主要原因之一。
3.3.1 相对OmniDocBench Overall的任务化改造
两套Overall形式非常接近,但第三项不同。理解这一差异前,需要先看清基准如何从真实文档构造出可评分对象:文档采样决定场景覆盖,元素级标注决定能否区分文字、公式和表格,抽取与匹配流程最终决定每个指标在惩罚什么。

这张图先回答“评测数据从哪里来”,而下图回答了“页面被标注成什么”和“这些标注如何进入指标计算”,两张图共通解释为什么同一个Markdown结果不能只用整页字符相似度评价:

两套Overall形式的第三项差异如下:
OmniDocBench把FormulaCDM纳入Overall,ROEdit通常只作诊断;赛题不单独评价公式CDM,而把Read Order提升为主分。金融合同、保险条款、目录、多栏说明和超长表格更在意“先读什么、后读什么”,公式通常不是主要内容。
3.3.2 本地cv构建proxy
考虑本地机器性能以及能建立有效评测,验证cv,所以我采用的评价指标是:
它沿用了赛题“三项等权”的思想,但把最昂贵的完整Table TEDS替换为有序表格形状代理。二者区别如下:
赛题指标的优势是表格项同时检查内容与结构,更接近真实交付;proxy的优势是不会因超长表树编辑计算而大面积超时。proxy高只能说明“值得进一步评测”,有一定参考性。
3.3.3 Overall的局限性
三项等权比单一字符准确率完整得多,但仍有四个局限:
平台只返回总分时,文本、表格和阅读顺序的涨跌无法在线拆分,容易造成错误归因; Overall允许不同维度互相补偿,某一项严重退化可能被另外两项部分掩盖; TEDS在超大DOM上计算昂贵,若静默丢弃超时页会产生选择偏差; 标题层级、列表、脚注绑定、图片内容与运行成功率没有独立等权分项。
因此,严谨实验不应只报告Overall,还应同时报告三个子项、成功率、短输出数、重复率、标签闭合率和评测超时率。
unsetunset3.4 CDM与ExpRateunsetunset
CDM即Character Detection Matching。其核心不是比较LaTeX字符串,而是将公式渲染为图像,再进行字符检测、字符匹配与空间位置对齐,从视觉层面评价符号是否正确。其优势是能减少等价LaTeX写法差异造成的误罚,例如不同空格、宏命令或括号写法渲染后可能完全一致。
CDM协议包含渲染、检测、匹配和归一化等多步过程,相关论文通常调用官方实现而不重新给出单一闭式公式。本文这里不构造一个并不存在于原协议中的“简化CDM公式”。
ExpRate用于公式完全匹配:
ExpRate比CDM更严格:一个局部符号错误即可使整条公式记为0。
unsetunset3.5 TEDS与TEDS-Sunsetunset
将HTML表格解析为树结构,预测树和真值树分别记为 。TEDS可统一写为:
其中 为树编辑距离。实际报告通常乘以100。
TEDS同时考虑表格拓扑与单元格内容;TEDS-S主要评价结构,弱化或忽略单元格文本。因此:
TEDS高而TEDS-S更高:结构较好,部分单元格内容仍有错误; TEDS-S低:行列关系、合并单元格或标签结构存在根本错误; 只报告TEDS而不报告TEDS-S,难以区分结构错误与文字错误。
这也解释了MinerU输出中常见的<table><tr><td>...</td></tr></table>与标准Markdown管线表格之间的关系:HTML外观不是额外加分项,标准竖线表格也不是天然扣分项。正式评测关注的是能否被解析为正确的表格树,以及行列、合并单元格和cell文字是否与GT一致。把HTML标签补齐只能改善可解析性;如果标签内部的数字、rowspan/colspan或阅读顺序错误,TEDS仍会下降。比较MinerU与其他模型时,应保存原始输出、统一解析/规范化规则,并单独记录格式修复前后的变化,不能用字符串长度或“看起来像HTML”替代结构指标。
unsetunset3.6 F1及结构化抽取指标unsetunset
关键字段抽取常采用:
GLM-OCR在KIE强化学习中使用字段级F1,并叠加JSON可解析、字段缺失与重复惩罚。PaddleOCR-VL-1.6的文本检测识别奖励则使用“编辑相似度加权F1”,使位置匹配和文字正确性同时进入得分。
unsetunset3.7 TPS、PPS、延迟与接受长度unsetunset
HunyuanOCR-1.5给出的速度统计为:
其中 为样本耗时, 为生成token数。
推测解码还应报告有效接受长度:
不同模型分词器不同,生成相同文本所需token数也不同。因此TPS不应脱离分词器、硬件、精度、批量大小、输入长度和输出长度直接比较。PPS更接近文档服务吞吐,但仍受页面复杂度影响。
unsetunset3.8 ISVGEN、渲染相似度与Elounsetunset
dots.mocr与OCRVerse包含图形代码生成任务。此类任务通常先执行或渲染预测代码,再比较渲染图像和输入图像。ISVGEN属于渲染后相似度指标,适合SVG等可执行表示,但不能等价为字符识别准确率。
Elo成对比较的期望胜率可写为:
dots.mocr的OCR Arena使用同一裁判模型对输出进行成对评价并聚合Elo。该指标能容忍部分表面格式差异,但会继承裁判模型偏差,也不应与TextEdit、TEDS等严格匹配指标混合解释。
四、OCR模型说明
unsetunset4.1 OCRVerse:跨域统一OCR与分域强化学习unsetunset
4.1.1 研究目标
OCRVerse试图统一两类传统上分离的任务:
文本中心OCR:正文、公式、表格和整页文档解析; 视觉中心OCR:图表、网页、SVG、科学绘图与化学结构到代码的转换。
模型基于Qwen3-VL-4B。其创新重点不在重新设计视觉主干,而在于八类数据的统一训练与分域奖励,OCRVerse是一个两阶段流水线:第一阶段把文本中心和视觉中心数据放进同一SFT空间,第二阶段再按输出类型选择可验证奖励。

图中的分叉不是简单的数据分类,而是奖励可验证性的分叉:文字、公式和表格可以直接比较编辑距离、CDM或TEDS,网页、图表和SVG则更适合把代码重新渲染后比较视觉结果。下文的SFT目标和分域GRPO奖励,分别对应图中的Stage 1与Stage 2。
4.1.2 SFT训练
论文给出的监督目标为:
训练时冻结视觉编码器与视觉—语言适配器,仅更新语言模型参数。该策略保留原有视觉表示,主要让语言模型学习不同领域的输出语法与结构约束。
SFT阶段直接混合八个领域。其优点是建立共享输出空间;缺点是各领域奖励目标不同,例如文本任务强调字符忠实,SVG任务强调渲染相似,简单混合交叉熵容易产生梯度冲突。
4.1.3 文本中心奖励
内容类型集合记为 ,真值中实际存在的类型集合记为 。论文原式为:
其中:
普通文本:; 公式:规范化LaTeX后的BLEU; 表格:TEDS-S; 只平均真值中存在的内容类型,避免无公式页面被公式奖励稀释。
4.1.4 视觉中心奖励
模型执行预测代码并渲染图像,使用DINOv2特征比较全局与局部视觉相似度:
其中全局项比较缩略图语义,局部项比较图像分块细节;此外还加入代码语言和格式对齐奖励。该设计的重要意义在于:对SVG、网页或图表代码,仅比较字符串会严重误判,渲染后比较才与最终视觉结果一致。
4.1.5 GRPO
对同一输入采样 个回答,组内优势为:
概率比为:
论文目标为PPO式裁剪形式:
GRPO无需额外价值网络,适合可通过编辑距离、渲染、TEDS等程序化方式评分的OCR任务。
unsetunset4.2 DeepSeek-OCR-2:视觉因果流与查询token重排unsetunset
4.2.1 核心问题
普通视觉Transformer通常按从左到右、从上到下的光栅顺序展平图像块。该顺序并不一定等于文档阅读顺序,尤其不适合多栏、表格、公式和非线性版面。DeepSeek-OCR-2提出DeepEncoder V2,使视觉编码阶段本身产生因果化的视觉信息序列。

上述图是完整的模型推理链路:图像压缩器解决高分辨率输入的token预算,语言模型式视觉编码器负责全局信息交换,因果查询再把二维视觉内容隐式组织为适合自回归解码的一维表示。该设计继承了DETR与BLIP-2的可学习查询思想,但关键变化不是“多加一组查询”,而是用定制注意力掩码把查询间关系从并行双向交互改为因果依赖。因而,视觉压缩率、语义重组能力和最终识别精度是三个相关但不能互相替代的概念。
4.2.2 视觉token压缩
视觉Tokenizer由约80M参数的SAM-base与两层卷积组成,实现16倍视觉token压缩。全局视图为1024×1024,对应256个查询token;每个768×768局部视图对应144个查询token,局部视图数,故最终视觉token数为:
4.2.3 块因果注意力
设原始视觉token数为 ,可学习因果查询数为 ,论文取。注意力可见性矩阵为:
其含义为:
视觉token之间双向可见; 视觉token不能读取后缀查询; 每个查询可以读取全部视觉token; 第个查询只能读取自己及其之前的查询。
令视觉Tokenizer为,LLM式视觉编码器为,查询抽取算子为,解码器为,则论文给出的整体前向过程为:
只有查询部分的输出进入语言解码器。因果查询并非显式地对图像块执行可审计的排列,而是将“已观察全部视觉信息后,按因果顺序逐步提炼”的表示传给解码器。因此“重排”更准确地说是隐式语义重组。
4.2.4 三阶段训练
第一阶段为DeepEncoder V2预训练。视觉Tokenizer与Qwen2-0.5B初始化的视觉编码器连接轻量级解码器,使用下一个token预测进行联合训练。分辨率为768和1024;AdamW学习率由余弦下降至;160张A100、批量640、训练40K步,论文称约处理100M图文对。
第二阶段为查询增强。冻结SAM—卷积视觉Tokenizer,联合优化LLM式视觉编码器和DeepSeek语言解码器;使用多裁剪统一输入,学习率从降至,训练15K步。
第三阶段冻结全部DeepEncoder V2参数,仅继续训练语言解码器;学习率由降至,训练20K步。该阶段在相同计算量下可显著提高数据吞吐。
OCR数据占训练混合的80%,OCR 1.0数据中的文本、公式、表格按3:1:1采样。解码器为3B MoE,实际激活参数约0.5B。
unsetunset4.3 Unlimited-OCR:参考滑动窗口注意力与多页长序列unsetunset
4.3.1 R-SWA
Unlimited-OCR从DeepSeek-OCR继续训练,将语言解码器的全注意力替换为Reference Sliding Window Attention。

R-SWA的关键不是删除视觉上下文,而是始终保留视觉前缀,同时限制已生成文本的可见历史。由此,视觉引用成本由前缀长度决定,文本历史成本由窗口宽度封顶。
设前缀长度为 ,其中包含视觉token与提示;生成到第 个token时,前缀集合为:
宽度为 的解码滑动窗口为:
当前token的可见集合为:
注意力权重和输出为:
模型始终看到全部视觉—提示前缀,但只看到最近 个已生成token。论文设置 。
4.3.2 KV Cache复杂度
标准全注意力的KV Cache为:
R-SWA为:
缓存比率为:
当 时:
因此解码侧缓存由随输出长度线性增长,变为上界固定。但视觉前缀 仍随页数增长,所以“Unlimited”指的是解码侧长期稳定,不代表有限上下文下数学意义的无限输入。
4.3.3 训练
论文构造约2M文档OCR样本,单页与多页比例9:1;约200K多页样本由2至50页拼接,使用<page>分隔,统一打包到32K上下文。训练从DeepSeek-OCR检查点开始,冻结DeepEncoder,仅训练LLM;4000步、全局批量256、学习率 、32K序列。
unsetunset4.4 GLM-OCR:轻量核心、任务统一与多token预测unsetunset
4.4.1 系统结构
GLM-OCR由约0.4B的CogViT视觉编码器和约0.5B的GLM语言解码器构成,总参数0.9B。在文档解析任务中,PP-DocLayout-V3先将页面拆分为段落、表格、公式等区域,GLM-OCR Core并行生成区域内容,最后恢复阅读顺序。在KIE任务中,整页图像与字段提示直接输入核心模型,输出JSON。两类任务被统一为视觉条件结构化生成:
4.4.2 MTP
主预测头之外,模型增加 个共享参数的辅助头,预测多个未来位置。论文没有给出完整的加权闭式损失,便于比较可统一写为:
其中 为标准下一个token预测。此式为统一形式化,不是论文声称的新公式。
论文训练时预测未来10个token,推理时平均接受长度约5.2,并报告约50%的吞吐提升。MTP除加速外,还迫使模型提前建模HTML闭合标签、Markdown标记和局部表格结构,减少破损标签。
4.4.3 四阶段训练
第一阶段训练视觉编码器,数据规模达到数百亿图文对,联合使用掩码图像建模、CLIP式对齐和大视觉教师蒸馏。
第二阶段分为:
2.1:连接GLM-0.5B,使用图文、文档解析、Grounding和VQA数据联合预训练; 2.2:加入MTP目标,使解码器适应多token结构化生成。
第三阶段使用文本、公式、表格与KIE高质量数据SFT,并保持MTP开启。
第四阶段使用GRPO。任务奖励包括:
unsetunset4.5 PaddleOCR-VL-1.6:欠优化区域驱动的数据与后训练unsetunset
4.5.1 研究出发点
PaddleOCR-VL-1.6保持0.9B模型规模,从PaddleOCR-VL-1.5继续训练。论文认为高性能模型的剩余错误不再是“数据总量不足”,而是集中在三类欠优化区域:
边界脆弱区域:晚期检查点或语义保持扰动下,预测不稳定; 覆盖稀疏区域:特征空间邻域样本不足; 不可靠监督区域:模型高置信地重复错误标签。
边界脆弱性通过训练最后8%阶段的8个检查点,以及16种语义保持扰动共同检测。覆盖稀疏性通过文档特征空间的小型、弱连接离群簇检测。不可靠监督则由Qianfan-OCR、GLM-OCR与MinerU2.5-Pro等外部专家进行一致性校验。
以下为PaddleOCR-VL-1.6总体图,其数据引擎图说明欠优化区域如何被发现和修正。

4.5.2 多专家标注与渲染校验
若至少两个专家输出一致,则采用共识标签;否则由ERNIE 5.0进行Judge-and-Refine。对公式和表格,候选LaTeX或HTML先渲染为图像,再与输入图像进行同模态比较。该机制解决了强VLM直接比较“图像—代码”时难以定位表格行列和合并单元格错误的问题。
4.5.3 CPT—SFT—RL
CPT:16.8M样本,全参数解冻,1轮,批量1024,最大学习率 ; SFT:7.3M难例与修正样本,全参数解冻,1轮,批量1024,最大学习率 ; RL:49K高潜样本,全参数解冻,2轮,批量1024,最大学习率 。
4.5.4 高潜RL样本评分
对每个输入生成 个rollout。第 条输出的长度归一化置信度为:
样本不确定性为:
奖励方差为:
最终高潜评分为:
论文设置 。评分的第一项要求模型“偶尔能做对”,即样本具有可达改进空间;指数项提高不确定且组内奖励有区分度样本的权重。始终做错、始终做对或组内奖励完全相同的样本会被过滤。
4.5.5 统一可验证奖励
论文原式为:
其中:
:格式、截断、退化、LaTeX或表格可解析性的硬门控; :结构可修复程度的软惩罚; :NED、CDM、TEDS、RMS-F1等任务相似度。
乘法结构意味着无效输出直接得0,防止模型通过“内容大致相似但格式不可用”获得高奖励。
4.5.6 结果与消融
OmniDocBench v1.6:
主要增益来自CPT和SFT,RL仅将Overall从96.25提高到96.33。该结果说明,当模型已接近性能上限时,高质量数据定位与监督修正比单纯扩大RL规模更关键。
unsetunset4.6 MonkeyOCRv2:文档原生视觉基础模型unsetunset
4.6.1 研究重点
MonkeyOCRv2不是首先提出一个新的整页语言解码器,而是训练可替换通用CLIP、DINO或ImageNet主干的文档视觉编码器。MonkeyDoc v2包含113M图像、17种语言,约8M整页和105M局部裁剪,覆盖印刷、扫描、手写、报纸、杂志和财务文档。

图中上半部分的文本生成让编码器保留可读语义,下半部分的像素重建迫使视觉表示保留笔画、局部纹理和版面细节。两种目标共同回答本节的核心问题:文档视觉编码器不能只依赖语言先验猜字,还必须保存足够的原始视觉证据。后文的重建损失正对应图中的像素分支。
4.6.2 双目标预训练
给定输入图像:
默认像素重建目标为:
为保留笔画边缘,论文进一步研究结构感知重建。灰度图的Sobel梯度为:
软边缘图为:
截断距离图初始化为:
迭代更新:
最终 。结构损失为:
结构感知重建为:
文本解码器使用标准自回归交叉熵 ,总预训练目标为:
论文设置 。但主要结果默认使用MSE-only,即 ;结构损失只在文档理解实验中额外评估。
4.6.3 模型与下游解析
编码器有:
MonkeyOCRv2-S:28M; MonkeyOCRv2-B:113M; MonkeyOCRv2-AS:21M,多尺度ViTAEv2结构。
下游MonkeyOCRv2-Parsing冻结视觉编码器,连接MLP与Qwen3-0.6B。第一步预测元素坐标、类别和自然阅读顺序;第二步裁剪区域并使用类型提示并行识别。训练先只优化MLP,再联合优化MLP和LLM,视觉编码器始终冻结。
unsetunset4.7 OvisOCR2:大模型RL教师与小模型在线蒸馏unsetunset
4.7.1 双分支训练
OvisOCR2最终模型为Qwen3.5-0.8B。训练同时维护:
4B教师分支:SFT后执行GRPO; 0.8B学生分支:SFT后执行在线策略蒸馏; 最后对多个候选0.8B模型加权参数平均。
0.8B全参数SFT训练2轮,4B仅训练0.2轮以控制成本;最大序列长度16K,动态视觉分辨率。
OvisOCR2的核心不是把4B教师永久部署到推理端,而是让大模型承担探索和强化学习,再把行为迁移给0.8B学生。下图把这一训练拓扑画成两条并行分支,能够直接解释后文为什么要同时讨论GRPO教师、在线策略蒸馏和参数融合。

因此,OvisOCR2中的“大模型能力”是一种训练期资源,而不是最终模型参数量的组成部分。紧接着的数据引擎图回答另一个问题:教师与学生究竟在什么样的真实和合成页面上学习。

上述第一张图即双分支图描述“知识如何从4B流向0.8B”,后面的数据引擎图描述“监督信号如何保持图像与Markdown同源”。前者解决小模型容量问题,后者降低复杂表格、长公式和阅读顺序标签中的伪标误差。
4.7.2 同源合成数据
合成样本从同一HTML源同时得到Markdown真值和Playwright渲染图像,并记录几何信息。与“先生成图像再由OCR模型伪标”相比,同源生成能保证图像和结构标签严格对应。模板根据真实失败案例迭代,重点增加复杂表格、长公式、长Markdown和阅读顺序难例。
4.7.3 多组件RL奖励
令 , 表示真值是否包含该类可评价元素,论文原式为:
其中:
文本为 ; 公式为归一化CDM; 表格为归一化TEDS; 截断、缺失或不可解析结构通过门控将相应组件置0。
4B模型能更稳定地吸收长结构输出的RL信号。论文观察到0.8B直接RL产生更大KL漂移,并在后期出现TableTEDS下降,因此改用教师蒸馏。
4.7.4 在线策略蒸馏
学生先按自身策略生成完整回答:
第 个状态为 。由学生分布选取top-k集合:
在该集合内重新归一化:
论文使用学生到教师的反向KL:
该方向具有mode-seeking性质:若学生将概率放在教师认为很差的候选上,会受到强惩罚;它不会要求学生覆盖教师分布的全部低概率模式。
top-k使分布张量复杂度由:
其中 为词表大小,。蒸馏状态来自学生自身轨迹,避免教师生成与学生生成长度不一致的对齐问题。
4.7.5 模型融合与结果
多个学生候选模型通过加权参数平均:
该式是加权参数融合的统一表示;论文未公开所有具体权重。
OvisOCR2在OmniDocBench v1.6达到Overall 96.58、TextEdit 0.025、FormulaCDM 97.53、TableTEDS 94.76、TEDS-S 97.16、ROEdit 0.111;PureDocBench的Clean、Digital、Real分别为81.55、77.09、66.56,Avg3为75.06。
其方法论价值在于:小模型不一定要直接承受高方差RL更新,可由容量更大的模型完成奖励对齐,再沿学生自身状态分布执行蒸馏。
unsetunset4.8 HPD-Parsing:层次并行解码与P-MTPunsetunset
4.8.1 模型结构
HPD-Parsing基于InternVL3.5-1B,视觉端约0.3B InternViT,语言端约0.8B、28层Qwen3-0.6B式解码器。图像动态切分为最多24个448×448块。
主布局分支按阅读顺序生成:
每当主分支生成<FORK>,调度器创建内容子分支,将该标记替换为<CHILD>,复用视觉前缀和当前结构前缀的KV Cache,并在局部区域上生成内容。主分支继续识别后续元素,多个内容分支并行执行。
下图把传统整页自回归与HPD的层次解码并排展示,P-MTP只在分支内部继续减少生成步数,并不取代主分支的全局协调。

若页面有 个内容块、每块输出长度 ,传统整页自回归关键路径近似为:
层次并行关键路径则近似为:
该式是本文用于解释并行收益的统一形式化,实际调度仍受分支创建时刻、GPU批处理和KV容量影响。
4.8.2 P-MTP损失
在位置 和前瞻深度 ,残差MLP结合前一层隐藏表示与已预测token嵌入,使用共享LM Head得到 。论文原式可整理为:
其中:
为标准下一个token预测,; 为多步未来预测; 为分支内目标有效掩码; 综合距离衰减、预测路径一致性与目标一致性; 内容分支只对 <CHILD>之后的局部内容计算损失。
推理时每个活动分支并行起草多个token,目标头验证后接受连续正确前缀。平均每步接受6.6个token。具体更详细的P-MTP内容可以看百度专门发的论文,非常有参考价值,但这里碍于篇幅就不再介绍。
4.8.3 三阶段训练
第一阶段使用2.8M整页样本进行普通整页序列训练,同时训练主干和P-MTP,使模型先学会完整文档解析。
第二阶段使用100K精细样本,将每页重新组织为布局分支样本和局部内容分支样本,使模型适应<FORK>/<CHILD>机制并强化难例。
第三阶段使用600个代表性难例进行轻量强化学习,奖励针对公式、表格、布局和元素计数一致性。
训练全参数解冻。阶段1学习率 ,阶段2为 ,阶段3为 ;前两阶段各1轮,最大序列16K。
4.8.4 结果与效率
OmniDocBench v1.6达到Overall 94.91、TextEdit 0.039、FormulaCDM 97.28、TableTEDS 91.35、TEDS-S 94.11、ROEdit 0.124。
批量512时:
TPS提高3.06倍,PPS提高2.62倍。最长输出区间中,论文报告解码步数最多减少18.04倍、请求吞吐最高提高3.67倍、单请求延迟最高降低5.80倍。
其主要代价是调度器和分支KV管理复杂度增加;此外,局部内容分支隔离了其他区域的详细文本历史,若某一区域必须依赖远处正文语义,过强隔离可能损害跨区域一致性。
unsetunset4.9 HunyuanOCR-1.5:DFlash、Agentic Data Flow与IcePopunsetunset
4.9.1 模型结构
HunyuanOCR-1.5为约1B端到端模型,由Hunyuan-ViT原生分辨率编码器、自适应MLP连接器和Hunyuan-0.5B语言模型组成。最高图像分辨率由2K提高到4K,上下文扩展到128K,支持Markdown、HTML、LaTeX、图表描述、信息抽取与多图问答。
下面的总架构图先给出主模型的数据路径:图像经过原生分辨率视觉编码和自适应连接器进入语言模型,不同OCR任务共享同一生成主干。

该图解释了“1B统一OCR模型”的边界:能力共享发生在视觉编码、连接和语言生成三层,而不是为每项任务单独训练一个识别器。接下来讨论的DFlash、Agentic Data Flow和IcePop,分别作用于推理效率、数据扩展和行为对齐,不应与主干结构混为一谈。
4.9.2 DFlash块扩散草稿
普通推测解码仍可能按自回归方式生成草稿。DFlash使用约90.7M、5层Transformer草稿模型,一次并行预测长度 的token块,目标模型并行验证并接受最长正确前缀。
训练时冻结目标模型。每条序列随机采样 个锚点(anchor),每个anchor形成独立块预测任务;FlexAttention块对角掩码使每个块可读取anchor前的目标模型隐藏状态和本块掩码token,不同块互相隔离。这里使用论文记号 表示anchor数,避免与Unlimited-OCR中表示滑动窗口宽度的 混淆。

每个草稿块都能读取目标模型在anchor之前的隐藏状态,却不能偷看其他草稿块;因此一次前向可以并行构造多个训练样本,同时保持各块的条件独立性。
论文给出的距离衰减权重为:
加权损失为:
其中 是第 个anchor, 是目标模型在anchor前缓存的隐藏状态, 是该草稿块的掩码查询, 是真实后续token。论文设置 、、;anchor token和无效位置不计损失,距离anchor越远的未来token权重越小。
4.9.3 Agentic Data Flow
数据代理根据模型弱点自动搜索语料、字体、PDF和背景,调用OCR/VLM进行清理,编写合成或QA脚本,并由工程师迭代反馈。论文将其用于:
331种语言的低资源OCR; 7类汉字历史字形; 多页PDF问答; 表格、多栏、长尾版式等难例。
训练分为预训练、SFT和RL。预训练重做原模型第三阶段,混入新增能力数据,并将输入扩展到4K和128K;SFT统一任务接口和高质量结构输出;RL使用规则奖励、LLM裁判奖励和退化抑制奖励。
4.9.4 IcePop
IcePop用于缓解推理引擎与训练引擎概率不一致。训练策略与旧策略概率比为:
训练—推理校准比为:
只保留:
其PPO式token目标为:
完整的token均值目标为:
其中 是有效token掩码, 是训练—推理概率校准掩码, 是组内相对优势, 是token级KL项。原论文仍用 表示KL系数;本文写成 ,只是为了避免与DFlash距离衰减系数 混淆,并未改变公式含义。归一化在整个小批次通过双重掩码的有效token上完成,而不是先按每条响应长度分别平均;若 ,则跳过该次更新。
4.9.5 文档解析奖励
论文原式为:
表格元素奖励为:
其中结构项使用可定位错误的一维探针奖励,内容项采用带锚点去样式处理的TEDS式奖励。图表先转为CSV,再用对行列交换更稳健的SCRM计算平均精度。超过任务长度限制或检测到结尾重复片段的rollout直接得0。
unsetunset4.10 FinixDoc-VL:参照实验模型unsetunset
https://www.chooseai.net/news/4733/
6月30日消息,蚂蚁集团旗下 InclusionAI 实验室发布 FinixDoc,一套面向真实金融文档场景的端到端解析系统。该系统的核心模型 FinixDoc-VL 仅有 4B 参数,基于 Qwen3-VL 架构微调,在自建基准 FinixDocBench 上取得 81.43 的综合得分,超过 Kimi-K2.5 和多个参数量远大于自身的通用模型。蚂蚁同步开源了 FinixDocBench 的部分子集,供外部团队评估自身文档解析能力。

没错,到今天为止,网上能找到的开源是在huggingface上的FinixDocBench数据集与上图,其余都没有开源,后面我想重新复现时,可能没有进决赛群,原共用的userid没有权限了,我也是在最后被关闭的前一刻跑完了一组实验,其余在比赛中跑出来的数据没有纳入参考组,除了记录有些乱外,无法保证一些过拟合的后处理对于其它模型的不同格式有效。
当前唯一可纳入新正式横向表的结果来自Huge-Table 34页共享二维切片:Text Edit为0.453625、Reading Order Edit为0.425641、Table TEDS为38.055634、Overall为50.043019,34/34完整落盘。它与Paddle的52.085527和Ovis的51.701291接近,说明Finix在超宽表局部块上的文字与结构恢复仍有竞争力,但不支持“Finix显著领先所有开源模型”的旧结论,数据会在下章做展示。
五、公开基准与业务实测结果汇总
本章主要先整理了omnidocbench在1.5到1.6间,各模型对齐的口径,然后针对本次比赛的huge-table,后续会称其为A组,以及huge-long,后续称为B组,两组都有两次对照实验,一个是跑整图的分数,一个是共享切片,但A组别整图的时候,因为有些解析pipeline没对齐,最后我在整理成文的时候,也不是很想回头跑了,emmm,还是算力有限,一台4090如果跑完一次实验,加上评测,跑过类似任务的应该知道,一个是GPU算力需求,评测是CPU算力需求了,后续我租了两台,4090上跑结果,然后在32核纯CPU上跑评分,那么以下即是数据对比。
本章节本地跑的模型为OvisOCR2、HPD-Parsing、PaddleOCR-VL-1.6、GLM-OCR和mineru,然后没有Unlimited-OCR和monkeyocrv2,前者是我在另外项目中使用过,它的生成质量非常不稳定,后者因为它是一个编码器,选用llm和到底哪一款编码器那排列组合就太多,所以干脆就没跑,其中我最想跑的还有hunyuanocr,这个是因为当前所租的服务器不支持cuda 13.0以上的,所以当时gpt给我的方案是在基于12.9上编译,我准备好了脚本以及数据,但重新编译发现太久,就搁置了,后续看转autodl补跑,emmm。
unsetunset5.1 v1.5结果unsetunset
说明:Dolphin-v2论文正文与表格总分存在89.45/89.78不一致;表中采用详细指标表的89.78。dots.mocr只在附录报告TextEdit 0.031和ROEdit 0.029,缺少同表完整分项,未列入总分表。
unsetunset5.2 v1.6结果unsetunset
这些数字表明:
参数量与结果不呈单调关系,0.8B OvisOCR2高于多种3B—4B模型; 流水线模型在表格结构上仍有优势,但OvisOCR2证明端到端模型可以达到同级TableTEDS; HPD-Parsing的主要目标是吞吐,不是绝对最高Overall,其FormulaCDM很高但TableTEDS低于顶级流水线; MonkeyOCRv2冻结视觉编码器且无专用后训练,其分数主要用于验证视觉基础模型的迁移性; v1.5和v1.6同名指标的绝对值不可直接相减。
unsetunset5.3 A组:Huge-Table 34页整图历史诊断unsetunset
比赛后第一轮系统复核曾让六套系统直接处理Huge-Table原始整页,并保存逐页输出;所有模型都使用34页固定分母:历史整图缺失页保留为空预测,不用切片结果回填。需要特别说明,这轮历史记录的表格项是ordered_shape_score,只比较按出现顺序对齐后的表格形状,不比较完整cell树,因此下表的Proxy不是正式Table TEDS Overall。它可用于确认整图路径确实运行过、比较截断与结构退化方向:
| 0.437290 | 0.664815 | 62.175672 | |||
| 0.297059 | |||||
上面这张表还是有意义的,虽然当时有些事情没对齐,在超大表格中,FinixDoc-VL对于相同34页上的文本距离和表格形状代理均领先,说明商业API内部的页面压缩、区域处理或长输出控制比当时几套开源调用更适应超宽金融表,以及服务器更强,HPD的读序距离最低,但文本与表格形状较弱;Paddle、MinerU和GLM的历史整图调用则出现明显内容压缩、区域碎片化或输出协议失配。
后续的A组切片,对齐了官方推荐参数配置,以及开启了mtp,数据将更有说服力。
unsetunset5.4 A组:Huge-Table 34页共享切片正式横向对照unsetunset
A组用于回答一个问题:面对横向、纵向同时超出模型稳定输入范围的超宽金融表格,在完全相同的二维切片条件下,不同OCR系统恢复整页内容和表格结构的能力有何差异?
实验固定34页Huge-Table及其GT,按照冻结manifest生成2,752张带坐标的JPEG切片。与B组只沿纵轴切分不同,A组同时切分横轴和纵轴,以保证超宽页面中的小字号、密集列和表格线在每个局部图块中保持可辨。六套系统读取完全相同的切片字节、页面ID和坐标;随后按坐标顺序恢复为34份页面Markdown,再使用同一正式评分器计算Text Edit、Reading Order Edit与Table TEDS。
切片缺失不能由整图或其他模型输出补齐。各系统允许使用自己的官方提示词、服务端和输出转换器,因为这些属于模型合法输出协议;公共页面组装阶段只负责依据冻结坐标恢复页面,不调用其他OCR补字,也不读取GT进行选择。
5.4.1 运行配置
PaddleOCRVL版面分析、区域识别与结果合并pipeline | ||
max_tokens=8192 | ||
hpd_to_markdown.py转换 | max_tokens=8000<BLOCK>/<CHILD>协议标记,再进行页面组装 | |
max_tokens=8192enforce_eager=False;不混入早期eager/no-MTP结果 | ||
MinerU2.5-Pro-2605-1.2B | max_model_len=8192、客户端max_tokens=4096;使用修正后的完整任务提示和专用组装路径 |
5.4.2 正式结果
| 0.438303 | 44.958699 | 52.085527 | |||
| 0.178205 | |||||
MinerU四项指标只聚合成功评分的33页,分母与其余五个系统不同,不能据此确定其34页全量名次。最后一页GT约72KB、含一个90行超大表,预测约69KB并含19个HTML表格;评测器预处理未在限定窗口完成。该页未写0,也未从其他版本补齐,因此43.289501只能作为透明披露的33页部分结果。
在34/34完整系统中,Paddle、Ovis和Finix的Overall分别为52.09、51.70和50.04,差距不足2.1分;HPD为32.50,GLM为12.66。MinerU的33页部分分为43.29,但因分母不同不进入全量排序。
5.4.3 为什么二维切片仍然困难
二维切片解决了局部可读性,却引入了比B组纵切更强的全局重建问题:
列关系被切断:同一行的表头、字段和值可能分布在不同横向图块中; 表格边界被重复观察:横纵重叠会让同一单元格、边框和表头在多个切片中出现; 局部表格缺少全局宽度信息:模型可正确识别局部行列,却无法知道它属于整表的第几列以及应与哪个相邻表合并; 合并单元格跨块: rowspan/colspan一旦越过切片边界,单个图块无法独立恢复完整跨度;页面组装由识别问题转为结构匹配问题:2,752个局部结果需要重新形成34棵全局表格树,任何错误合并或漏合并都会同时影响Text、Order与TEDS。
因此,A组约50分不能解释为模型没有识别出局部文字。它更直接地表明:在超宽密集表中,局部OCR正确并不足以保证全局表格正确,跨块结构恢复成为主要瓶颈。
5.4.4 逐模型结果分析
PaddleOCR-VL-1.6以52.085527排名第一。Text Edit为0.438303、Table TEDS为44.958699,均为34页完整系统最佳,说明其版面分析和区域识别pipeline在局部块内保持了较好的内容与表格恢复。但Reading Order Edit为0.448718,且总分远低于B组纵切的94.40,说明横向分块后的跨列顺序和整表合并仍是主要损失来源。
OvisOCR2达到51.701291,与Paddle仅差0.384236。其Reading Order Edit为0.417949,优于Paddle;Table TEDS为43.650235。该结果说明Ovis端到端模型在局部二维块上具有较强识别能力,但统一组装器仍难以把多个局部HTML表格恢复成完整超宽表。
FinixDoc-VL达到50.043019,与前两名处于同一水平。Text Edit为0.453625、Reading Order Edit为0.425641,Table TEDS为38.055634。它证明Finix在比赛验证过的二维切片路径上具有稳定的局部恢复能力,但其表格结构分低于Paddle和Ovis,说明切片后的全局拓扑重建同样没有被完全解决。
HPD-Parsing的Reading Order Edit为0.178205,是完整系统中最低值,但Overall只有32.499007。GT共1,413,100个可见字符和89个表格,HPD输出2,151,204字符和1,222个表格。官方转换已经生效,低分主要来自层次分支在二维切片上产生大量局部碎片与重复表格;顺序较好不能抵消Text Edit 0.934631和Table TEDS 8.780641。
GLM-OCR的Table TEDS为37.965839,但Text Edit和Reading Order Edit均为1,Overall仅12.655280。正式配置已启用MTP=3并保持enforce_eager=False,因此低分不是误用性能参数造成的,而是我忘记加layoutv3做版面分析了,后来换了一台4090部署,也就是说这里是纯glm模型推理。该结果表明,局部表格骨架能够进入评分器,但页面组装后的文本块与顺序无法和GT建立有效匹配。
MinerU2.5-Pro在33页有效子集上得到43.289501,其中Reading Order Edit为0.232000,但Table TEDS仅7.494762。该结果说明已完成页面仍存在明显表格碎片化;同时缺失的最后一页恰好是90行超大表,不能假设补齐后分数保持不变。因此本文只分析其部分结果,不将其插入34页排名。
unsetunset5.5 B组:Huge-Long 30页整图与共享切片unsetunset
B组用于回答一个明确问题:面对纵向极长、横向结构连续的金融文档,外部纵向切片是否能稳定提升不同OCR系统的内容、阅读顺序与表格恢复质量?
实验固定同一批30页Huge-Long原图及其GT,并为每个模型建立两条相互隔离的推理分支:
整图分支:直接输入30张原始长页; 共享切片分支:按整宽 6000px、相邻重叠600px沿纵轴切分,共生成425张JPEG,再按固定坐标顺序组装回30页。
两条分支使用相同模型权重、官方或原生推荐推理路径、关键解码配置、输出转换器、页面ID、GT和评分器;预测目录完全隔离,不跨分支补页。共享切片保持页面完整宽度,因此不会主动切断同一行中的列关系,只缩短单次视觉上下文和输出长度。Finix接口因授权失效未产生有效B组预测,故不填0,也不参与本组比较。
运行配置与A组同理。
5.5.1 正式结果
| 35.127443 | |||||
| 0.036168 | 0.032457 | 90.049910 | 94.395818 | |||
| +82.362488 | ||||||
两张表中的指标直接取自success=true且覆盖30/30页的正式评分JSON。Overall由评分器使用未舍入的内部统计量计算,因此按表中六位小数反算时,末位可能出现不超过0.000024的舍入差异。
结果具有三个明显特征:
五个系统切片后均提升超过53分,说明收益不是单一模型偶然现象; Paddle、MinerU、Ovis和HPD同时改善Text、Reading Order与Table TEDS,并非只靠某一指标补偿; Paddle、MinerU、Ovis与HPD达到88—94分,而GLM为61.40,表明纵向切片解决了主要尺度问题,但不能自动修复所有输出协议与页面组装问题。
5.5.2 逐模型结果分析
PaddleOCR-VL-1.6取得最高分94.395818。其共享切片Text Edit为0.036168、Reading Order Edit为0.032457,均为五个系统最佳,Table TEDS也达到90.049910。说明官方版面分析—区域识别—结果合并pipeline在局部尺度下能够同时保持文字、顺序和表格结构,优势并非来自单项指标。
MinerU2.5-Pro由35.127443升至91.978987。整图输出已有289,657个可见字符,约为GT的104.5%,但被拆成860个HTML表格,低分根因是布局与表格区域过度碎片化,而不是字符总量不足。共享切片后输出为267,933字符、约为GT的96.6%,只产生21个闭合表格,表格页数量与GT一致,三项指标随之同时恢复。
OvisOCR2由8.033644升至90.396132,提升82.362488,为五个系统最大。整图仅输出GT约13.9%的字符且没有可计分表格,说明超长输入下发生了严重视觉压缩或生成截断;切片后Text、Order和TEDS分别恢复至0.081224、0.058851和85.195824,证明其局部端到端识别能力本身较强。
HPD-Parsing由7.371510升至88.323157。正式结果已经经过官方hpd_to_markdown.py转换,因此提升不能归因于修复评分器兼容性。整图输出膨胀到GT约2750.2%,存在分支循环和结构失稳;共享切片后长度降至GT的176.2%,但仍有局部重复、2页表格未闭合,因此低于前三名。
GLM-OCR由8.049015升至61.404023,说明纵切同样有效,但恢复不完整。正式结果使用MTP=3和enforce_eager=False,低分不能归因于关闭官方加速路径。共享切片Table TEDS达到70.494733,但Text Edit和Reading Order Edit仍为0.487964与0.374862,剩余问题主要位于文本块序列化、阅读顺序恢复和页面组装,而不是表格完全无法识别。
unsetunset5.6 A/B证据分层诊断unsetunset
为了避免把相关性直接写成因果,下面把结论分为两层:直接证据来自同页A/B分数、输出结构统计和逐页抽查;机制判断则是结合模型架构与输出形态作出的解释,需要额外消融才能完全证明。
rowspan/colspan,并通过同页消融验证收益 | |||
<BLOCK>漏转换,因为正式结果已走官方转换器 | |||
enforce_eager=False;B组切片由8.05升至61.40,但Text Edit与Reading Order Edit仍为0.488/0.375;A组两项均为1 |
六、共性分析
unsetunset6.1 输出统一为可执行结构序列unsetunset
这些模型几乎都不再输出无结构纯文本,而是输出Markdown、HTML、LaTeX、JSON或SVG。统一训练目标仍以条件自回归为主,但评价函数已从单一字符准确率扩展到:
这意味着OCR已成为“视觉到程序或结构语言”的生成问题。
业务实测进一步说明,“可执行”至少有三层含义:语法可解析、结构与图像一致、内容与图像一致。B组MinerU整图虽然输出字符量达到GT的104.5%,却碎片化为860个HTML表格,Overall只有35.13;共享切片后字符量略降,结构恢复,Overall反而达到91.98。因而结构语言生成不能只用字符量、编译成功或标签闭合作为终点。
unsetunset6.2 数据工程由“扩量”转向“定向补弱”unsetunset
PaddleOCR-VL-1.6挖掘欠优化区域,HunyuanOCR-1.5让代理围绕能力缺口构造数据,OvisOCR2根据失败案例改进HTML模板,HPD-Parsing进行难度分层与多模型标注,Dolphin-v2针对拍照、代码和目录单独合成。
这类数据闭环的业务含义不是“再加一些金融图片”这么简单。本文数据集中同时存在超长输出、数字密集、宽表、合并单元格、序列化模板和极端页面尺寸;如果训练数据只匹配视觉风格而不匹配输出长度与HTML复杂度,模型仍会在生成阶段坍缩。应把失败样本按“视觉看不清、布局分错、输出截断、结构未闭合、重复循环、拼接错序”分层,而不是统一归为OCR错误。
其共同流程可抽象为:
因此2026年的数据工程是闭环系统,而非一次性static datasets。
unsetunset6.3 SFT负责格式学习,RL负责可验证偏好unsetunset
多数模型先通过SFT学习任务格式,再用可验证奖励提高结构正确性。OCR天然适合RLVR,因为文本、表格、公式和JSON均可程序化评价:
OCRVerse强调分域奖励;GLM-OCR强调任务奖励;PaddleOCR-VL-1.6强调Valid—Struct—Sim;HunyuanOCR-1.5强调结构、裁判与退化抑制;OvisOCR2则先让4B模型承受RL,再蒸馏给0.8B学生。
unsetunset6.4 推理瓶颈由视觉前向转向长序列解码unsetunset
结构化OCR输出常有数千词元。2026年主要加速路线包括:
GLM-OCR:MTP; HunyuanOCR-1.5:DFlash并行草稿; HPD-Parsing:跨区域分支并行与分支内P-MTP; Unlimited-OCR:限制解码历史窗口,使每步缓存与注意力成本稳定; Dolphin-v2:数字文档区域并行。
这些方法分别压缩:
金融长表实验说明,压缩关键路径之后还会出现新的“可靠性关键路径”:任务是否被切到可生成规模、分支是否爆炸、局部HTML是否闭合、跨片是否重复、失败是否被及时发现。推理优化因此不能只最小化生成步数,还要最小化错误结果进入最终文档的概率。
七、关键差异
unsetunset7.1 视觉表示差异unsetunset
DeepSeek-OCR-2主要重构“视觉词元如何组织”;MonkeyOCRv2主要重构“视觉编码器学什么”;dots.mocr主要重构“视觉对象包含什么”。
unsetunset7.2 结构分解差异unsetunset
Dolphin-v2先判断文档类型,再决定整页或区域解析; GLM-OCR和PaddleOCR-VL-1.6依赖外部版面模块; MonkeyOCRv2-Parsing由同一模型预测版面并再次识别裁剪区域; HPD-Parsing在解码过程中动态分叉,不需要完全独立的外部区域识别系统; OvisOCR2、OCRVerse和DeepSeek-OCR-2直接整页生成。
流水线的上界通常受限制为:
端到端模型没有显式乘法误差链,但可能产生长序列累积错误。A/B实验把这组差异具体化了:Ovis端到端整图只有8.03,切片后达到90.40;HPD整图分支聚合严重重复,切片后达到88.32;MinerU整图粗到细过度碎片化,切片后达到91.98;Paddle在同切片下达到94.40;GLM核心调用虽提升到61.40,仍未复现论文完整版面流水线。不存在“端到端一定优于流水线”或相反的统一答案,关键是页面分解是否与训练范式一致,以及合并是否恢复全局结构。
unsetunset7.3 RL使用方式差异unsetunset
OvisOCR2的差异最明显:它将“学习奖励”与“部署小模型”分离。PaddleOCR-VL-1.6则证明,在高性能区间,RL增益小于高质量CPT/SFT数据。
A/B业务实验只有各模型的最终checkpoint,没有CPT、SFT、RL或蒸馏阶段的中间checkpoint,因此不能从最终输出反推各训练阶段的因果贡献。业务结果只能检验最终系统是否表现出论文宣称的能力:Ovis在共享切片下达到90.40,说明小模型的局部识别能力能够兑现;Paddle达到94.40,说明其完整管线在该输入尺度上兼顾了文字、顺序与表格;GLM核心调用仍为61.40,则说明缺少完整系统组件时,论文奖励设计本身不足以保证业务结果。
unsetunset7.4 加速机制差异unsetunset
DFlash属于验证式推测解码,理论上保持目标模型输出分布;R-SWA直接改变模型注意力结构,需要继续训练适应;HPD改变的是整个输出执行图。
unsetunset7.5 研究目标差异unsetunset
OCRVerse追求跨域统一; DeepSeek-OCR-2追求视觉因果流; Dolphin-v2追求数字文档与拍照文档统一; GLM-OCR追求轻量部署和KIE统一; dots.mocr追求文本与图形代码统一; PaddleOCR-VL-1.6追求数据效率和榜单上限; Unlimited-OCR追求多页长序列稳定; HunyuanOCR-1.5追求能力边界、速度和多任务; MonkeyOCRv2追求文档视觉基础编码器; OvisOCR2追求小参数端到端高精度; HPD-Parsing追求高吞吐层次并行。
因此不能仅用一个Overall概括所有论文价值。
八、结论
2026年大模型OCR研究的核心变化不是将传统OCR简单接入LLM,而是重新设计视觉表示、文档结构、训练奖励和解码执行图。各论文形成了相互补充的技术谱系:
DeepSeek-OCR-2与MonkeyOCRv2提升视觉编码质量; Dolphin-v2、GLM-OCR与PaddleOCR-VL-1.6强化版面分解和数据闭环; OCRVerse与dots.mocr扩大输出空间; Unlimited-OCR、HunyuanOCR-1.5与HPD-Parsing解决长序列效率; OvisOCR2展示大教师RL与小学生在线蒸馏的高效路径。
A/B金融长表实验让这些论文结论获得了更具体的边界:
Huge-Long同页同GT中,Paddle、MinerU、Ovis与HPD由整图的7—35分恢复到共享切片的88—94分,证明旧低分首先是输入与系统协议失配,而不是模型完全缺少金融表能力; OvisOCR2以0.8B在共享切片上达到90.40,支持“小模型可以很准”,同时82.36分的整图—切片差也说明参数效率不能代替任务分解; MinerU整图字符量已接近GT却碎成860个表格,共享切片后以更短输出达到91.98,证明结构完整性比生成长度更重要; HPD经官方转换和共享切片达到88.32,但重复膨胀与二维切片碎片化仍是主要代价; GLM共享切片由8.05升至61.40,却仍未达到其他系统水平,强调论文中的版面流水线不能缩写成核心权重调用; Huge-Table二维切片最佳仅52.09,且输出审计显示跨块表格恢复仍是主要难点;由于该组与Huge-Long并非同一数据集,不能用两组分差定量归因于切片方向。Finix在A组为50.04,与Paddle、Ovis接近而非显著领先; Hunyuan因推理栈不兼容未计分;MinerU A组报告33/34部分分43.289501,但不参加34页全量排名;Finix B组因授权失效标记blocked。状态边界本身属于正式结果。
因此,模型参数量不再是性能的唯一决定因素,论文Overall也不是业务完成度的代理。业务差距往往来自五个连续环节:视觉细节是否保留、页面是否正确分解、每个生成任务是否落在输出预算内、局部结果是否可靠拼接、失败是否能被门控并回退。任何一环失效,前面的模型精度都可能无法兑现。
指标层面同样需要收紧:输出/GT字符比不是内容覆盖率;在超长表上静默丢弃TEDS超时页会制造选择偏差;合法HTML不等于正确HTML;不同系统的分数必须带完整配置名称。本文主结论只使用带GT的正式Text Edit、Reading Order Edit与Table TEDS;旧80页proxy仅作为失败审计,不与比赛线上分、OmniDocBench或新A/B分数互相映射。
综合判断,下一阶段高水平OCR系统将具有五项共同特征:文档原生视觉编码、全局—局部层次生成、可验证多任务奖励、面向长结构输出的专用推理机制,以及显式失败检测与可回滚工程。其最终形态将不再只是“识别文字”,而是把复杂视觉文档编译为真正有效的结构化内容。
最后
很久没写过这么长的文了,当然还有很多想聊的但没有转述出来,不过希望读者都有所收获。
夜雨聆风