乐于分享
好东西不私藏

【ECCV 2026】P-MTP:让文档解析模型「一次读N个字」,推理提速5*

【ECCV 2026】P-MTP:让文档解析模型「一次读N个字」,推理提速5*

开篇语

近日,ECCV 2026正式录用了P-MTP(Progressive Multi-Token Prediction)。这项工作专注于解决VLM文档解析推理效率瓶颈——在保持精度的前提下,通过渐进式课程损失置信度门控动态草稿,将MTP的look-ahead深度大幅扩展,实现了最高5.24×的无损加速,是目前文档解析领域MTP深度扩展的首次成功验证。

为什么文档解析一直"跑不快"?

当前主流文档解析模型(VLM)采用逐token自回归解码:每次只生成一个字符,生成完再生成下一个,直到输出完整的Markdown/LaTeX/HTML结果。这意味着文档越长、内容越复杂,等待时间就越长——一张密密麻麻的页面可能需要等数十秒才能出结果。

Multi-Token Prediction(MTP) 是LLM/VLM领域已验证的提速思路:每次解码不只生成1个token,而是同时"猜"出接下来的K个,如果猜对了就一次性生成了K步,效率自然成倍提升。然而在通用领域MTP的look-ahead深度一直卡在K≤3——再深就会精度下降或者猜测错误率大幅下降,这是为什么?

根本原因有两个:

① 训练时"远端监督"有毒

传统MTP对预测深度1、2、3……K赋予固定权重,不管前面的预测是否靠谱,都强行用同样的权重来训练模型。这就好比:一个学生连第3步推导都写错了,你还逼他负责第4步甚至第9步的答案——这不是教学,是在引入噪声。当K越大时,长跨度预测噪声巨大,且忽略了不同上下文的生成难度差异,强行训练极易引发模型“失稳” 。

② 推理时"固定草稿长度"低效

即便训练好了,固定草稿长度K面对不同复杂度的内容时两头都不讨好:遇到简单的纯文字段落,其实可以一口气推测更远,但模型只猜K步就停了;遇到复杂的公式嵌套,猜K步大概率猜错,反而浪费了算力。

P-MTP怎么解决这两个问题?

关键洞察:

文档解析天然适合深度look-ahead

文档解析有一个独特性:模型的输出内容完全锚定于图像中的视觉特征表格里那个单元格写的是"87.3%",模型只要"看"准了,接下来几个token几乎没有歧义——不像开放式问答,下一句话可以有无数种说法。这意味着文档解析的预测分布本身就更"确定",理论上完全可以把look-ahead推到更深。P-MTP的目标就是:把这个理论潜力真正变成实际提速。

解法一:渐进式课程损失

——让模型"先学近再学远"

P-MTP的核心训练创新是引入动态监督权重不再对所有深度所有位置平等施加训练信号,而是根据当前预测的可靠和难易程度,赋予模型“及时止损”与“量力而行”的智能,自动决定远端目标值不值得学

具体来说,权重由两个维度共同决定:

  • "路径可不可靠"如果模型连第2、3步都预测得模棱两可,那第4步的监督权重就被大幅压缩。只有前面每一步都预测得很有把握,才会给深层目标赋予较高权重。

  • "目标自不自然"对于同一个目标token,如果从较近的位置也很难预测到它,说明这个token本身不确定性高,对应的深层监督权重也会被降低。

两个维度相乘,形成"双重把关":只有当前序路径可靠、较近跨度也已学会时,才把这个深度及位置的token权重提升, 这就避免了幻觉梯度的积累和无效的强行训练。

训练过程中损失比例会自动地从浅层逐步迁移到深层——模型先把K=1、2、3 学扎实了,才慢慢开始有效学习K=7、8、9。整个过程无需人工干预,是真正的"easy-to-hard课程学习"。

解法二:置信度门控动态草稿

——推理时"能走多远走多远"

训练完成后,推理阶段的策略同样关键。P-MTP不再固定草稿长度,而是实时监测预测的置信度

  • 每一步推测完,立刻检查当前"累积把握程度"是否超过阈值

  • 如果超过——继续往前猜,能走多远走多远

  • 如果跌破——立刻截停,不浪费计算

更进一步,这个阈值本身也是自适应的:模型训练收敛得越好,阈值越宽松,允许更激进的look-ahead;模型本来就不确定,阈值自动收紧,避免产生错误草稿。

上下滑动查看更多

结果:数字说话

深度扩展可行性验证

关键发现:传统等权重方案在K=9时精度已经明显下滑(-2.55),而P-MTP 在相同深度下精度几乎不变,同时实现更高加速。动态双重路径权重设计的消融实验证明联合使用获取最佳收益。

跨模型、跨任务验证

P-MTP在InternVL3.5-1B和Qwen3-VL-2B两种基座模型、公式/表格/文档三类任务上均验证有效:表格识别接受长度8.48~8.6(近满深度),TPS提升1.5~2.3×;公式识别TPS提升1.4~1.6×;文档解析内容更复杂多变,接受长度>3,TPS提升约1.4×

生产级部署(vLLM 框架)

vLLM框架下不同batch 生产部署,加速效果稳定维持1.5×以上。

一句话总结

P-MTP的逻辑很清晰:文档解析本身够确定,理应支持深度look-ahead;但传统MTP的训练方式太粗暴,给模型引入了大量无效的"远端噪声"。 P-MTP通过"只在该学的时候学"(渐进式课程损失)和"只在该猜的时候猜"(置信度门控动态草稿),优雅地把look-ahead深度从≤3推到9,实现最高5.24×提速而精度几乎不变——这正是文档解析推理加速的正确打开方式。

【使用入口】

  • 论文速览:

    https://arxiv.org/abs/2606.24447

  • GitHub:

    https://github.com/Hor1zonz/PMTP

关注【飞桨PaddlePaddle】公众号
获取更多技术内容~