
开篇语
近日,ECCV 2026正式录用了P-MTP(Progressive Multi-Token Prediction)。这项工作专注于解决VLM文档解析推理效率瓶颈——在保持精度的前提下,通过渐进式课程损失和置信度门控动态草稿,将MTP的look-ahead深度大幅扩展,实现了最高5.24×的无损加速,是目前文档解析领域MTP深度扩展的首次成功验证。
为什么文档解析一直"跑不快"?
当前主流文档解析模型(VLM)采用逐token自回归解码:每次只生成一个字符,生成完再生成下一个,直到输出完整的Markdown/LaTeX/HTML结果。这意味着文档越长、内容越复杂,等待时间就越长——一张密密麻麻的页面可能需要等数十秒才能出结果。
Multi-Token Prediction(MTP) 是LLM/VLM领域已验证的提速思路:每次解码不只生成1个token,而是同时"猜"出接下来的K个,如果猜对了就一次性生成了K步,效率自然成倍提升。然而在通用领域MTP的look-ahead深度一直卡在K≤3——再深就会精度下降或者猜测错误率大幅下降,这是为什么?
根本原因有两个:
① 训练时"远端监督"有毒
传统MTP对预测深度1、2、3……K赋予固定权重,不管前面的预测是否靠谱,都强行用同样的权重来训练模型。这就好比:一个学生连第3步推导都写错了,你还逼他负责第4步甚至第9步的答案——这不是教学,是在引入噪声。当K越大时,长跨度预测噪声巨大,且忽略了不同上下文的生成难度差异,强行训练极易引发模型“失稳” 。
② 推理时"固定草稿长度"低效
即便训练好了,固定草稿长度K面对不同复杂度的内容时两头都不讨好:遇到简单的纯文字段落,其实可以一口气推测更远,但模型只猜K步就停了;遇到复杂的公式嵌套,猜K步大概率猜错,反而浪费了算力。
P-MTP怎么解决这两个问题?
关键洞察:
文档解析天然适合深度look-ahead
文档解析有一个独特性:模型的输出内容完全锚定于图像中的视觉特征。表格里那个单元格写的是"87.3%",模型只要"看"准了,接下来几个token几乎没有歧义——不像开放式问答,下一句话可以有无数种说法。这意味着文档解析的预测分布本身就更"确定",理论上完全可以把look-ahead推到更深。P-MTP的目标就是:把这个理论潜力真正变成实际提速。
解法一:渐进式课程损失
——让模型"先学近再学远"
P-MTP的核心训练创新是引入动态监督权重:不再对所有深度所有位置平等施加训练信号,而是根据当前预测的可靠和难易程度,赋予模型“及时止损”与“量力而行”的智能,自动决定远端目标值不值得学。
具体来说,权重由两个维度共同决定:
"路径可不可靠":如果模型连第2、3步都预测得模棱两可,那第4步的监督权重就被大幅压缩。只有前面每一步都预测得很有把握,才会给深层目标赋予较高权重。
"目标自不自然":对于同一个目标token,如果从较近的位置也很难预测到它,说明这个token本身不确定性高,对应的深层监督权重也会被降低。
两个维度相乘,形成"双重把关":只有当前序路径可靠、较近跨度也已学会时,才把这个深度及位置的token权重提升, 这就避免了幻觉梯度的积累和无效的强行训练。

训练过程中损失比例会自动地从浅层逐步迁移到深层——模型先把K=1、2、3 学扎实了,才慢慢开始有效学习K=7、8、9。整个过程无需人工干预,是真正的"easy-to-hard课程学习"。

解法二:置信度门控动态草稿
——推理时"能走多远走多远"
训练完成后,推理阶段的策略同样关键。P-MTP不再固定草稿长度,而是实时监测预测的置信度:
每一步推测完,立刻检查当前"累积把握程度"是否超过阈值
如果超过——继续往前猜,能走多远走多远
如果跌破——立刻截停,不浪费计算
更进一步,这个阈值本身也是自适应的:模型训练收敛得越好,阈值越宽松,允许更激进的look-ahead;模型本来就不确定,阈值自动收紧,避免产生错误草稿。


结果:数字说话
深度扩展可行性验证
关键发现:传统等权重方案在K=9时精度已经明显下滑(-2.55),而P-MTP 在相同深度下精度几乎不变,同时实现更高加速。动态双重路径权重设计的消融实验证明联合使用获取最佳收益。


跨模型、跨任务验证
P-MTP在InternVL3.5-1B和Qwen3-VL-2B两种基座模型、公式/表格/文档三类任务上均验证有效:表格识别接受长度8.48~8.6(近满深度),TPS提升1.5~2.3×;公式识别TPS提升1.4~1.6×;文档解析内容更复杂多变,接受长度>3,TPS提升约1.4×

生产级部署(vLLM 框架)


vLLM框架下不同batch 生产部署,加速效果稳定维持在1.5×以上。
一句话总结
P-MTP的逻辑很清晰:文档解析本身够确定,理应支持深度look-ahead;但传统MTP的训练方式太粗暴,给模型引入了大量无效的"远端噪声"。 P-MTP通过"只在该学的时候学"(渐进式课程损失)和"只在该猜的时候猜"(置信度门控动态草稿),优雅地把look-ahead深度从≤3推到9,实现最高5.24×提速而精度几乎不变——这正是文档解析推理加速的正确打开方式。
【使用入口】
论文速览:
https://arxiv.org/abs/2606.24447
GitHub:
https://github.com/Hor1zonz/PMTP
夜雨聆风
