
✨导读:文档解析里的 RL 常用 edit distance 做奖励,但当模型已经接近正确时,普通奖励很难区分“差一点”和“真正对”。DocPO 提出 Step-Aware Annealing,对文本、表格、公式三类元素使用定制 reference-based rewards,并随训练逐步锐化奖励曲线,在 OmniDocBench 上取得 95.38 overall,DocElemHard 上达到 93.76。
• 作者: Yunhao Wang, Binghong Wu, Zhenyu Huang, Jiacheng Shi, Shuo Huang, Tinghao Yu, Feng Zhang
• 单位: Tencent Hunyuan
• 论文标题: DocPO: Advancing Document Policy Optimization via Tailored Step-Aware Rewards
• 论文链接: https://arxiv.org/abs/2608.00536
• 发表信息: ACM MM 2026
🔍 行业背景:文档解析不是 OCR 之后简单拼文本
文档解析要同时处理文本、表格和公式,奖励设计比普通识别任务更难。 文本可以用 normalized edit distance,表格要关心树结构,公式则有语义等价和 LaTeX 表达多样性的问题。
如果统一用字符级奖励,表格结构可能被误判;如果奖励模型太复杂,又会引入额外人工监督和部署成本。DocPO 的路线是:保留简单 reference-based reward,但让它在训练过程中变得更有区分度。

图注:原文 Figure 1。该图从两个角度说明动机:左侧展示 Step-Aware Annealing 能改善高准确率阶段的优化;右侧展示普通 string-level edit distance 会误评分公式和复杂结构。
💥 三大核心亮点:奖励不换模型,先把学习信号调锋利
1.文本、表格、公式分别用不同 base reward。 文本使用 NED,表格使用加权 tree edit distance/TEDS,公式使用 syntax gate 加 Rubric+edit reward。
2.Step-Aware Annealing 动态锐化奖励。 训练早期保留平滑奖励,避免不稳定;模型进入高分区后逐步增大奖励曲率,放大近似正确样本之间的差距。
3.保持通用 Qwen2.5-VL backbone。 DocPO 使用标准 Qwen2.5-VL-3B,不依赖额外视觉 encoder 或复杂后处理,重点放在 RL reward 设计上。

图注:原文 Figure 2。该图展示 DocPO pipeline:不同文档元素先计算各自 normalized reward,再由 Step-Aware Annealing 进行 reward sharpening,最后进入 GRPO-style RL 更新。
🧠 方法拆解:SAA 的核心是让高分区更可分
对于一个归一化奖励 M ∈ [0, 1],SAA 会随训练步数增大指数 γ,使奖励变成 M^γ。早期 γ=1 时保持原始 reward;后期更高的 γ 会拉开高分候选之间的差异。
为了避免不同任务 reward 分布差异过大,DocPO 还设计 Dynamic Dispersion Controller,根据近期 reward 的均值和方差调整 annealing 速度。这样同一个 SAA 思路可以同时服务文本、表格和公式。
📊 硬核实测:3B 模型在文档元素级评测上达到强结果
实验使用 Qwen2.5-VL-3B 作为主 backbone,并在 Qwen2.5-VL-7B 上做 scaling study。RL 数据包含三类结构:206K table samples、196K formula samples,以及 text samples。评测使用 OmniDocBench 和作者构建的 DocElemHard,指标包括 NED、CDM、TEDS 和 overall。
在 OmniDocBench 上,DocPO(Qwen2.5-VL-3B) 达到 overall 95.38、text NED 0.0125、formula 94.70、table 93.01;在 DocElemHard 上达到 overall 93.76、text NED 0.022、formula 92.88、table 90.60。相比 Qwen2.5-VL-3B 原始模型的 88.05 overall,提升非常明显。

表注:原文 Table 3。该表比较通用 VLM、OCR/解析系统和 DocPO。DocPO 在不引入额外后处理的情况下,在 text、formula、table 三个元素上都取得强结果。
SAA 本身也带来稳定增益。表格任务中,固定 exponent 的方法最高约 92.3,而动态 SAA 达到 93.1;去掉 DDC 后从 93.10 降到 92.73。训练效率方面,论文报告在 32 张 H20 GPU、global batch size 128、最大序列长度 12K、8 rollouts 下,标准 GRPO 每步 60.3s,DocPO 每步 60.8s,额外开销约 0.8%。

图注:原文 Figure 7。该图展示 table recognition 中 TEDS 随训练变化:SAA 约在 step 587 达到 91.0 阈值,比非 annealed baseline 更快,论文称约 1.8 倍收敛加速。
🧐 深度解析:DocPO 的关键不是更复杂的模型,而是更贴合任务的 reward geometry
文档解析常常进入“高准确率但难继续提升”的区域。普通 edit distance 给出的 reward 太平,GRPO 很难从多个近似正确输出中区分谁更值得强化。SAA 的意义在于改变 reward geometry,让 near-correct 样本也能产生足够差异。
局限也在论文中很明确:RL training 更贵;DocPO 当前主要覆盖文本、表格和公式;页面级版式、跨页结构、图文混排等更复杂元素还需要扩展 reward 设计。
✅ 全文总结:DocPO 把文档解析 RL 的核心问题落在奖励曲线上
这篇论文说明,文档解析不一定要先换更大的模型,也可以先把 reward 设计做对。DocPO 用元素级 reward 加 Step-Aware Annealing,让文本、表格和公式都获得更清晰的优化信号。对 OCR、文档智能和 VLM 后训练来说,它是一篇很值得关注的 reward engineering 工作。
夜雨聆风