乐于分享
好东西不私藏

长文档OCR一步到位:几十页PDF直接出结构化结果

长文档OCR一步到位:几十页PDF直接出结构化结果

PDF、扫描件、合同、年报,以前OCR出来是一堆散字,还得再写脚本拼版面和阅读顺序。百度开源的 Unlimited-OCR 把这事砍成了一步:一个模型读完整份长文档,直接输出结构化内容。你省掉的是整条预处理管线。

① 不是又一个OCR,是“吞下整份文档”的解析器

Unlimited-OCR 是百度在 Deepseek-OCR 基础上往前推了一步的多模态模型,目标是一次性解析完整份长文档,而不是逐张图识别后再拼接。传统方案(Tesseract、PaddleOCR)处理不了跨页表格和复杂版面,Unlimited-OCR 直接理解版面结构并保留语义顺序。

关键参数:max_length 支持到 32768,意味着一次推理可以带住几十页的上下文。这类长文档任务的真正难点不是“认字”,而是“记住前文”,这也是它跟传统OCR拉开差距的地方。

② 四个值得盯的细节

gundam/base 双模式:gundam 用 640px 分辨率+crop 模式,速度快、适合手机截图和长图;base 用 1024px 分辨率,精度优先,适合扫描件。同一个权重,按场景切配置,不用重训。 
三个推理引擎,按预算选:官方给了 Transformers、vLLM、SGLang 三套部署方式。vLLM 有现成 Docker 镜像,一条 pull 命令起服务,兼容 OpenAI API;SGLang 支持流式输出。 
多页 PDF 原生支持:用 PyMuPDF 把 PDF 按 300dpi 转成图片再批量喂入,跨页表格的上下文不丢。多页模式下 n-gram 窗口从 128 放宽到 1024,抑制重复的同时保留长程信息。 
自定义 no-repeat n-gram:官方的 no_repeat_ngram_size=35 配合 ngram_window,能压制长文档生成时的重复段落。这个细节对合同、年报这类措辞高度模板化的文本很有用。 

集成方面,ms-swift 支持微调训练、ModelScope 和百度云可下载权重、HuggingFace Spaces 有在线 Demo,从训到部署链路是完整的。

③ 跑起来的真实门槛

硬性要求是 NVIDIA GPU,建议 ≥24GB 显存,官方测试环境是 Python 3.12.3 + CUDA 12.9。Transformers 推理最短只需要:

model_name = 'baidu/Unlimited-OCR'

AutoModel.from_pretrained(model_name, trust_remote_code=True)

单图调用 model.infer(),多页和 PDF 走 model.infer_multi(),传 prompt='document parsing.' 或 'Multi page parsing.' 即可,输出直接存目录。

vLLM 部署更省事,两张 Docker 镜像按 GPU 架构选:

docker pull vllm/vllm-openai:unlimited-ocr

# Hopper GPU 用 vllm/vllm-openai:unlimited-ocr-cu129

SGLang 则需先装官方 wheel 再 pip 固定 kernels==0.11.7,适合要低延迟、流式输出的生产场景。

环境配置比传统OCR繁,但换来的是不用再维护“检测+识别+版面分析+排序”四条流水线。

④ 谁该立刻试一版

做 RAG 管线的开发者。之前 PDF 解析要先过 OCR 出 block,再自己拼阅读顺序,拼错一点下游召回就崩。Unlimited-OCR 把顺序问题一并解决,输出直接进向量库。

律所和银行的技术团队。合同条款、财报附注动辄几十页,跨页表格是传统 OCR 的软肋,这个模型在长文档上下文上就是为这类场景设计的。

学术工具开发者。论文 PDF 转 Markdown 时,公式、表格、标题层级的保留靠的是版面理解能力,而不是字符识别率。crop_mode=True 处理双栏论文也够用。

如果只是偶尔识别几页图,用它不划算——有更轻的现成 API。但如果你每天处理上千份长文档,省掉人工重排版面的时间就很可观。

⑤ 更深的算盘:开源背后的占位逻辑

变现路径清晰:做云文档解析 SaaS,按页计费,vLLM 做 serving 成本压得下来;或者私有化部署卖给金融、法律机构,收年费 License。300dpi 的 PDF 解析质量已经达到商用交付标准。

技术路线信号更值得关注:百度同时打通了 vLLM、SGLang、ms-swift、ModelScope,等于把训练、推理、部署全链路开源。对比 GPT-4V 那种闭路 API,中小团队能用它搭自己的私有解析服务,不用把合同数据交给第三方。

从 Deepseek-OCR 到 Unlimited-OCR,路径已经明确:OCR 的竞争从单张图准确率,转向了多页长文档的理解深度。先在这条路上占位的开源模型,会吃掉下一波文档智能化的需求。

🔗 工具链接

https://github.com/baidu/Unlimited-OCR

👇 长按二维码,关注这个号

AI 帮你筛能挣钱 / 省时间的工具,每天一个挣钱路