乐于分享
好东西不私藏

1000+页PDF解析速度暴涨3倍,MinerU模式不香了

1000+页PDF解析速度暴涨3倍,MinerU模式不香了
百度PaddleOCR又放出来一个叫HPD-Parsing,1B参数的小模型,文档解析速度直接干到每秒4752个token,是上一代最快模型的1.62倍,是它自己原来那套解码方式的3.06倍。

关键是,模型本身没换,骨干还是那个InternVL3.5-1B,参数一个没加。

那速度是哪来的,这个工作最有价值的地方在哪里?

文档解析这个事儿,简单讲就是把PDF、扫描件里的文字、公式、表格、阅读顺序,结构化地抠出来。你搞的每一个RAG系统、每一个知识库,背后第一道工序都是它。这两年主流路线是统一式的视觉语言模型,一张页面图扔进去,模型直接给你生成整页的结构化结果,MinerU、PaddleOCR-VL、DeepSeek-OCR都是这个路数。

大家都在卷什么。卷看得准不准,更大的模型,更多的数据,更高的分辨率。

视觉编码器看完整页文档,耗时基本恒定。而解码器写出结果的时间,跟着输出长度一路狂飙。长文档场景下,解码耗时接近编码耗时的496倍。

496倍。

说人话就是,模型的眼睛早就看完一整页了,但它被迫一个字一个字地往外抄。瓶颈根本不在看,在写。

官方实测,输出越长,解码耗时越离谱,最长档位解码接近编码的496倍

看到这张图的时候,我愣了一下,然后突然意识到一个更本质的问题。

一页文档,哪些部分需要全局理解。

标题层级、多栏布局、区域位置、阅读顺序,这些确实得看整页才能定。

但某个段落的具体文字、某个公式的LaTeX、某张表格的单元格,说实话,只依赖于那一小块图像。左下角的表格识别,需要等右上角的段落先写完吗。

完全不需要。

文档需要整体理解,但不需要整体串行生成。

这就是HPD-Parsing的全部出发点,Hierarchical Parallel Decoding,层级并行解码。

HPD-Parsing架构

它把原来"一条序列从头写到尾"的生成方式,拆成了一个全局协调加局部并行的结构。

传统方式是一条自回归序列写到底,HPD是布局主线协调、内容分支并行

具体怎么做的,两层并行,一层比一层妙。

第一层,布局主线加分叉

模型里有一条主布局分支,负责按阅读顺序识别页面里有哪些区域、各自是什么类型、在什么位置。

每确定好一个区域,它就吐出一个特殊的FORK标记,推理引擎看到这个标记,立刻动态创建一条内容分支,专门去写这个区域的内容。主线继续找下一个区域,内容分支们同时在写,互不等待。

而且分工不等于重复劳动。新分叉出来的内容分支,直接复用已经算好的视觉信息和布局前缀的KV Cache,不需要重新编码整张图,也不需要重复跑一遍Prefill。

更妙的是,每条内容分支只看共享的视觉上下文、自己的结构前缀和自己的生成历史,不用背着整页其他区域的文字往前走。传统方式下,每多生成一个token,注意力要扫的前文就更长一截,而这里,每条分支的注意力视野始终是局部的、恒定的。

第二层,每条分支内部还要再快一步。

分支内部的生成依然是逐token的,于是他们把自家ECCV 2026提出的P-MTP技术缝了进来,渐进式多token预测。

原理有点像老司机打字不看键盘,一次解码迭代同时预测并验证后面好几个token,验证通过的直接入账,没过的就退回去老实生成。

实测平均每个解码步能收下6.6个token,等于原来走一步,现在走六七步。

为啥文档解析特别适合这么干。

因为每个区域的内容都死死锚定在对应的图像证据上,生成的可预测性天然就高,瞎猜都猜得比别人准。

区域之间并行,区域内部多token并行。两层叠加,整页内容不再沿着一条长序列蠕动,而是全面铺开。

HPD-Parsing的整体架构,主线布局分叉加P-MTP多token预测

效果怎么样,直接上数据。

OmniDocBench v1.6评测集,512并发下,Token吞吐从基线的1554.8干到4752.1,页吞吐从1.02页每秒提到2.68。精度方面Overall得分94.91,在端到端统一式解析器里是新的SOTA,还把一票比它大的模型甩在身后。

速度和精度的散点图,右上角那颗红星就是它,效率一骑绝尘

更夸张的是这个优势会随文档变长而放大。

官方把测试集按输出长度分桶,越长的桶,HPD-Parsing相对传统解码的优势越大,最长档位解码步数压缩了18.04倍,批量吞吐提升3.67倍,单请求延迟下降5.8倍。

文档越长,传统方式越是便秘,它越是丝滑。

这不是一个固定比例的提速,是从机制上拆掉了"文档越长、等待越久"这个结构性瓶颈。

按输出长度分桶的对比,越长优势越大

推理速度对比表,4752的TPS一骑绝尘

说实话,光是把解码范式换掉还不足以保证精度不掉,这套训练方法我觉得同样值得抄作业。

训练方法

他们搞了一条自动化的数据流水线,先对海量文档做特征聚类和代表性采样,然后用PaddleOCR-VL-1.5和MinerU-2.5 Pro两个模型互相印证生成伪标签,再根据中间模型和伪标签的差异,把样本分成简单、中等、困难三档,困难样本再交给更强的模型多轮检查、生成、纠正,最后按难度和文档属性做分布平衡。

训练也是三阶段循序渐进。

先用280万条全页样本,按传统方式把通用解析能力学扎实。再用十万级分支样本,完成从整页生成到层级并行的范式迁移。最后挑六百条代表性难例,用强化学习针对公式、表格、布局做定点补强。

这套东西最让我喜欢的,还有它的兼容性。视觉token压缩、滑窗注意力这些已有的加速手段,跟它是正交的,理论上可以叠在一起用。

而且模型才1B,单卡A800就能跑,部署门槛相当亲民。

写在最后

如果你问我,这个工作里最值得偷走的是哪几样东西,我总结三条。

第一条,先掐表,再优化。他们没有急着改模型,而是先给推理过程做了一次profiling,找到了真正的瓶颈在解码而不是编码。多少优化项目死在一上来就拍脑袋,这个顺序值得刻进脑子里。

第二条,找结构里的天然并行性。不是所有任务都能拆,但文档解析天然就是"全局布局加局部内容"的结构,这种结构性质比任何trick都值钱。

第三条,范式切换不怕,分阶段迁移就行。直接让模型换一种生成方式,精度大概率崩,但先学能力、再迁范式、最后强化难例,三步走下来就稳了。这个套路放在很多模型改造场景里都成立。

谢谢你看我的文章,我们,下次再见。

  • https://arxiv.org/pdf/2607.18839
  • https://huggingface.co/PaddlePaddle/HPD-Parsing

推荐阅读

AI Agent 全栈实战:从原理到工业级系统

PDF文档解析技术分享

OCR多模态技术分享

RAG前沿技术分享

Agent前言技术分享