乐于分享
好东西不私藏

HPD-Parsing分层并行文档解析

HPD-Parsing分层并行文档解析

重磅开源|打破文档解析串行瓶颈!百度飞桨推出HPD-Parsing分层并行文档解析模型

传统VLM文档解析全程单序列自回归生成,长文档推理速度拉胯、延迟极高。而 HPD-Parsing 创新性提出分层并行解码范式,精准拿捏文档核心特性:全局布局统一协调,局部区块并行解析

核心硬核优势

✅ 轻量高效:仅1B参数,低成本实现顶级解析能力

✅ 性能炸裂:峰值吞吐量达4752 TPS,是原生自回归基线的3.06倍、现有最快解析模型的2.62倍

✅ 精度能打:OmniDocBench v1.6 斩获94.91%高分,稳居端到端统一解析SOTA

✅ 长文本优化:长文档解码步骤最高减少18.04倍,单次请求延迟降低5.80倍

核心技术亮点

▫️ 主布局分支管控全局结构,动态拆分多区块并发解码

▫️ 搭载P-MTP渐进多令牌预测,大幅缩减解码步数

▫️ 定制vLLM v0.17.1推理框架,支持KV缓存共享、零拷贝加速

▫️ 难度感知数据流水线,兼顾并行提速与解析精度

适配复杂版式文档、大批量文档结构化解析场景,支持Docker一键部署+Python API快速推理,开箱即用!

论文:arxiv.org/abs/2607.18839

演示:hugging-apps/hpd-parsing

#HPDParsing #文档解析 #OCR #多模态大模型 #VLLM #PaddleOCR #AI技术开源