百度 PaddlePaddle 团队近日在 Hugging Face 开源了 HPD-Parsing(Hierarchical Parallel Document Parsing,层级并行文档解析),相关论文已同步发布于 arXiv(2607.18839)。这是一个仅有 10 亿参数的轻量级文档解析模型,却在权威评测集 OmniDocBench v1.6 上取得 94.91% 的综合得分,刷新了端到端统一解析模型的最好成绩,同时峰值吞吐达到 4,752 TPS(每秒生成 token 数),是现有最快文档解析模型的 2.62 倍,是其自身自回归基线版本的 3.06 倍。
核心问题:解析准确率与生成速度的矛盾
当前主流的统一 VLM(视觉语言模型)文档解析方案,通常将整页内容一并输入模型,再通过单一的自回归轨迹逐 token 生成结果。这种方式虽然保证了输出结构的整体一致性,却带来一个明显瓶颈:生成序列越长,解码步骤越多,速度也就越慢,序列长度与文档长度几乎成正比拖累效率。
HPD-Parsing 团队的洞察是:文档解析任务本身存在“全局”与“局部”的分工——页面结构(如版面、区域划分)需要全局协调,而具体内容(如某个文本块、表格单元格里的文字)的生成过程,其实是高度局部化的,彼此之间并不需要严格的顺序依赖。基于这一观察,团队提出了全新的解码范式。


技术方案:层级并行解码(HPD)+ 渐进式多 Token 预测(P-MTP)
HPD-Parsing 的核心架构由一个主布局分支(main layout branch)和多个内容分支(content branch)组成:
- 主布局分支
负责协调整页文档的全局结构,并在解码过程中动态地将任务“派生”(fork)给多个并发的内容分支; - 内容分支
各自负责一个局部区域的内容生成,彼此并行执行; 各分支内部还引入了 **P-MTP(Progressive Multi-Token Prediction,渐进式多 token 预测)**机制,通过一次迭代预测多个未来 token,进一步压缩每个分支自身的解码步数; 结合共享前缀的 KV 缓存复用机制,整个系统在“分支”和“token”两个维度上都大幅缩短了有效的顺序解码路径。
在骨干网络的选择上,HPD-Parsing 采用 InternVL3.5-1B 作为基座模型,并使用动态分块(dynamic tile-based cropping)策略,单张图像最多可切分为 24 个 448×448 的图块,以保留高分辨率细节。
为了让模型适应这种全新的并行解码范式,同时不损失原有的解析精度,团队还设计了一套分阶段自适应训练策略,配合自动化的难度感知数据构建流程——涵盖大规模数据采集、模型辅助标注、难度评估与均衡采样,在尽量减少人工标注成本的前提下,缓解了从自回归解码切换到并行解码过程中带来的精度下降问题。
性能表现
准确率方面,HPD-Parsing 以仅 10 亿参数的体量,在 OmniDocBench v1.6 上取得 94.91% 的综合得分,超过此前所有端到端统一文档解析模型。
效率方面,在英伟达 A800 80GB、batch size 512、基于 vLLM 的测试环境下,HPD-Parsing 将吞吐从 1.02 PPS(每秒解析页数)提升至 2.68 PPS,将 TPS 从 1,554.8 提升至 4,752.1,分别达到 2.62 倍和 3.06 倍的提升。值得一提的是,尽管 HPD-Parsing 每页处理的输入 token 数约为 4,800,是 DeepSeek-OCR-2 的四倍以上,它依然在 PPS 上领先 1.31 倍、在 TPS 上领先 1.62 倍。而且文档越长,这种加速优势越明显——在输出长度最长的分桶中,解码步数最多可减少 18.04 倍,请求吞吐提升 3.67 倍,单请求延迟降低 5.80 倍。
部署与使用
HPD-Parsing 需要运行在定制版 vLLM(基于 vLLM v0.17.1)之上,该定制版实现了层级并行解码所需的动态请求分叉(request forking)机制,并适配了 P-MTP 的推测解码。官方提供了两种部署方式:一是内置全部依赖与模型权重的 Docker 镜像(推荐,离线版约 24.5GB),二是面向 Python 3.10–3.13、CUDA 12.8+ 环境的预编译安装包。
此外,项目也提供了基于 transformers 库的参考实现:模型对外暴露 generate_hpd() 接口,复现了 vLLM 端的解码逻辑——主布局分支贪婪解码,遇到 <FORK> 标记时派生出内容子分支,子分支继承父分支的 KV 缓存,最终再拼接为完整序列。不过官方也说明,transformers 路径仅作为参考实现,生产环境的高吞吐仍需依赖 vLLM 的分页 KV 缓存机制来实现真正的零拷贝并发分支。
模型权重、评测脚本(eval/benchmark_tps.py 测吞吐、eval/hpd_to_markdown.py 转换输出格式)均已在 Hugging Face 仓库开源,并附有基于 OmniDocBench 官方评测流程的复现说明,采用 Apache 2.0 协议。
https://huggingface.co/PaddlePaddle/HPD-Parsing
夜雨聆风