Qianfan-OCR:统一端到端文档智能新范式
Qianfan-OCR:统一端到端文档智能新范式 📄✨
github地址: https://github.com/baidubce/Qianfan-VL
引言:OCR技术的三重困境与破局之道
在数字化浪潮席卷全球的今天,光学字符识别(OCR)技术已成为企业文档自动化、智能办公系统的核心基础设施。然而,当前主流OCR解决方案长期面临”成本-精度-能力”的三重困境:
- 传统多阶段管道系统
(如PaddleOCR-VL、MonkeyOCR)虽能提供精确的布局分析结果,但因模块间级联误差传播导致整体精度下降; - 端到端OCR模型
(如DeepSeek-OCR、olmOCR)虽避免了级联误差,却因缺乏显式布局分析能力,在复杂文档处理中表现乏力; - 通用多模态大模型
(如Qwen-VL、Gemini)虽具备强大推理能力,但因未针对文档结构优化,在表格解析、公式识别等任务中精度不足。
传统管道系统(左)与Qianfan-OCR端到端架构(右)的核心差异:前者通过独立模块处理布局检测、文本识别和语义理解,存在不可逆的视觉信息损失;后者则通过统一的视觉-语言架构实现”图像→Markdown”的直接转换,同时保留全量视觉上下文。

面对这一技术瓶颈,百度千帆团队(Baidu Qianfan Team)于2026年3月推出Qianfan-OCR——一个4B参数规模的统一端到端文档智能模型。该模型通过创新的”Layout-as-Thought”机制,在端到端架构中重新引入显式布局分析能力,同时在OmniDocBench v1.5等基准测试中达到93.12%的顶尖性能,首次在端到端模型中超越多数传统管道系统。
本文将深入剖析Qianfan-OCR的技术突破点,揭示其如何通过架构设计、数据工程与训练策略的协同优化,重新定义OCR技术的边界。
背景与动机:从”模块拼接”到”统一智能” 🔄
1.1 传统OCR管道的三大痛点
传统OCR系统通常采用两阶段架构:
- 第一阶段
:通过轻量级检测模型(如PaddleOCR-VL)输出文档元素的边界框、类型标签和阅读顺序; - 第二阶段
:将检测到的文本区域送入OCR引擎进行字符识别,最终通过规则引擎组装结构化结果。
然而,这种设计存在三个根本性缺陷:
- 级联误差传播
:检测阶段的微小误差(如漏检表格边框)会在识别阶段被放大,导致最终结果失真; - 视觉信息不可逆丢失
:文本区域被裁剪后,字符间的空间关系、表格结构等关键上下文信息永久丢失; - 功能割裂
:布局分析与文本理解由独立模块完成,无法实现跨任务的联合优化。
1.2 端到端模型的”能力断层”
为解决上述问题,学界提出了端到端OCR模型(如GOT-OCR 2.0、DeepSeek-OCR),直接通过视觉-语言模型完成”图像→结构化文本”的映射。这类模型的优势在于:
-
✅ 消除级联误差,保留全图上下文; -
✅ 支持多任务统一处理(文档解析、表格提取、图表理解等)。
但其局限性同样显著:
-
❌ 缺失显式布局分析能力:无法输出边界框、元素类型等结构化信息,导致在需要空间定位的场景(如合同关键信息抽取)中表现不佳; -
❌ 复杂文档处理能力不足:面对多栏排版、公式混合、非标准阅读顺序的文档时,模型难以准确解析元素间的逻辑关系。
1.3 通用VLM的”精度天花板”
以Qwen-VL、Gemini为代表的通用视觉-语言模型(VLM)虽具备强大的推理能力,但在OCR任务中存在两个关键短板:
-
📉 结构化精度不足:在表格TEDS(Table Extraction Document Structure)等指标上,通用VLM普遍低于专用OCR模型5-10个百分点; -
💰 推理成本高昂:7B以上参数的VLM单次推理成本是4B专用模型的3倍以上,难以满足企业级高并发需求。
专用管道系统在结构化任务中占据优势,但通用VLM在理解类任务中表现更佳,而端到端模型则处于性能”中间地带”。Qianfan-OCR的目标正是弥合这一鸿沟,实现”专用精度+通用理解”的统一。
核心方法详解:三重创新构建统一智能
2.1 模型架构
Qianfan-OCR 沿用了Qianfan-VL的多模态桥接架构,主要由三个核心模块构成:用于灵活视觉编码的视觉编码器、用于跨模态对齐的轻量级投影适配器,以及用于文本生成与推理的语言模型骨干。
视觉编码器:采用经过预训练的 Qianfan-ViT 作为视觉编码器,该模块内置 Any-Resolution 设计,能够将输入图像动态划分为 448×448 的图像块,最高支持 4K 可变分辨率输入。这一特性对 OCR 任务尤为重要,因为文档中常包含密集文本、小字号及复杂版式,需要高分辨率处理能力。编码器包含 24 个 Transformer 层,隐藏维度为 1024,配备 16 个注意力头,使用 14×14 的块大小,每个块输出 256 个视觉 token。编码器最多可处理 16 个图像块,单个文档图像最多可表示为 4096 个视觉 token,从而为细粒度字符识别提供充足的空间分辨率。
语言模型骨干:我们选用 Qwen3-4B(Bai 等,2025)作为语言模型骨干。该模型总参数量为 40 亿(其中非嵌入参数占 36 亿),共 36 层,隐藏维度为 2560,拥有 32K 的原始上下文窗口(可通过 YaRN 扩展至 131K)。该规模在推理能力与部署效率之间取得了良好平衡——既能处理复杂的文档理解与版面推理任务,又可在生产环境中通过单 GPU 进行高效部署。模型采用分组查询注意力机制(GQA,Ainslie 等,2023),设置 32 个查询头和 8 个 KV 头,在保持生成质量的同时,将 KV 缓存内存降至标准多头注意力的 1/4。此外,模型使用 RMSNorm(Zhang 和 Sennrich,2019)进行层归一化,有助于提升训练稳定性。
跨模态适配器:该适配器是一个轻量级的两层 MLP,使用 GELU 激活函数,用于连接视觉编码器与语言模型,将视觉特征从编码器的表示空间(1024 维)投影到语言模型的嵌入空间(2560 维)。该设计在保证跨模态对齐效果的同时,最大程度减少了适配器参数量。在训练的第一阶段,仅以较高学习率对适配器进行训练,以实现快速的视觉‑语言对齐;后续阶段则进行全参数训练。
2.2 数据生成
我们开发了六种专门的数据合成流程,分别面向文档解析、关键信息提取、复杂表格、图表理解、公式识别及多语言OCR场景,旨在构建大规模、高质量的训练数据。
1. 文档解析数据合成
我们构建了自动化流程,利用PaddleOCR-VL(Cui等,2025b)进行文档布局检测与内容识别,并将图像转换为结构化Markdown。在此过程中,边界框坐标被归一化至[0, 999]区间以保证分辨率不变性,表格通过OTSL中间格式转为HTML,公式则用$$块进行包裹。流程包含自动过滤以移除重复或长度异常的样本,并引入图像级增强(如压缩、翻转、模糊)以提升模型鲁棒性。
布局标签系统的关键选择:我们对比了PaddleOCR-VL和MinerU2.5在标签粒度与检测精度上的表现。核心差异在于正文标签:PaddleOCR-VL提供细粒度类别(如text、vertical_text、paragraph_title、doc_title、abstract、content、reference、reference_content、aside_text),而MinerU2.5使用较粗的标签(如text、title、list、aside_text)。更细的标签粒度直接有利于下游任务——例如,区分abstract与content可支持从论文中进行结构化提取,分离reference则能使参考文献解析更清晰。在多类型文档布局基准测试中,PaddleOCR-VL的检测精度持续领先。因此,我们最终采纳其标签系统作为标注引擎,将元素归纳为4个组别共25个类别:文本元素(12个标签)、页眉/页脚(4个)、图表/表格(6个)和公式(3个)。
布局即思维(Layout-as-Thought)数据构建:我们构建了包含结构化中间推理的训练数据,模型在生成最终答案前,会先输出以<layout>...</layout>标签包裹的布局分析,列出边界框坐标、元素标签及内容摘要。用户通过在查询中附加<layout>令牌即可激活此功能。该机制引导模型在生成前将注意力聚焦于相关文档区域,从而提升对复杂版面、多栏文本及交错图表等需要空间推理的任务性能。
2. 关键信息提取(KIE)数据构建
针对KIE任务,我们构建了两种场景的数据集:完整提取(所见即所得)与目标提取(用户指定字段)。为缓解教师模型幻觉问题,我们融合开源数据与小模型预标注,采用多模型协同标注策略。通过实现键的语义泛化,为同一字段构建多种同义描述,以增强模型泛化能力。流程还包括:对低分辨率输入进行方向校正与图像增强;应用业务逻辑规则进行硬过滤(如验证“单价×数量=总计”);对长序列、密集文本文档进行困难样本挖掘(例如包含5条以上明细的样本)。我们根据任务难度重新平衡样本分布,以提升模型在极端场景下的稳定性。
3. 复杂表格数据合成
我们结合程序化合成与真实文档提取来构建表格数据。程序化管道随机生成3-20行/列的表格,支持随机单元格合并,通过Faker库或大语言模型填充多样化数据类型内容,从50余种专业CSS主题中采样样式,并利用Jinja2与KaTeX引擎渲染,最后施加几何变换、颜色扰动及模糊等增强。对于真实文档表格,我们使用内部解析工具检测并提取表格区域,经PaddleOCR-VL和内部表格模型解析后,将两种输出转换为HTML并进行一致性验证,过滤存在显著结构或内容差异的样本,从而在保留真实文档版面与噪声特征的同时,确保标注的可靠性。
4. 图表理解数据构建
基于arXiv LaTeX源文件(2022年至今),我们构建了自动化合成管道。该管道通过规则解析系统性地提取图表代码块,使用TexLive引擎重新渲染以获得高保真矢量图像,并以图标题作为真实值,同时利用视觉语言模型生成详细的视觉描述,涵盖视觉编码、统计特征、空间布局与细粒度分布特性。我们对11种主流图表类型进行分类,并实施“元数据+视觉描述”驱动的合成策略。针对不同图表类型设计了定制化推理任务,如折线图的趋势分析、散点图的相关性与分布分析、箱线图的异常值检测等。该流程合成了超过30万个高精度、多样化的多模态指令调优样本。
5. 多语言OCR数据构建
为将语言支持扩展至192种,我们采用从HPLT多语言语料库出发的反向合成方法。流程首先利用fonttools进行字符集验证与文本-字体可渲染性过滤,随后对不同书写系统(拉丁、西里尔、阿拉伯、南亚、东南亚、汉字等)进行差异化处理并渲染文档图像。关键功能包括自动的从右至左文本方向检测、阿拉伯字符形变与单词级换行。通过随机化多种排版属性(字体大小、分栏布局、边距、间距、纹理背景等),以逼近真实文档的数据分布。
6. 文档图像增强
我们采用两套增强流程:一套用于OCR任务(允许轻微的几何扰动),另一套用于布局解析任务(需保持几何一致性)。两者均施加三个阶段噪声:(1)文本噪声(断笔、墨迹渗漏、字符错位);(2)背景噪声(纹理、颜色漂移、水印);(3)成像噪声(模糊、摩尔纹、阴影、曝光变化)。此外,旋转增强(90°、180°、270°及±15°)显著提升了关键信息提取和表格识别任务在非标准方向文档图像上的性能。
通过这些专业化、系统化的数据合成管道,我们构建了覆盖广泛OCR场景的大规模高质量训练数据,为千帆-OCR的多阶段渐进式训练提供了全面而坚实的数据基础。
2.3 训练策略
Qianfan-OCR 采用了 Qianfan-VL(Dong 等人,2025)中经过验证的多阶段渐进式训练方法,从基础的跨模态对齐到高级的推理任务,系统性地构建模型能力。针对 OCR 场景的核心适配在于数据混合的构成,我们在保持整体训练框架的同时,显著增强了针对 OCR 领域的专门设计。整个训练流程由四个紧密衔接的阶段组成,每个阶段都精心优化了数据配比,以契合文档智能的需求。
阶段1:跨模态对齐(500B token)
在此初始阶段,我们通过基础的图像-标题对和简单的OCR任务进行训练,并仅训练适配器参数,以建立初步的视觉-语言对齐,为后续阶段提供稳定可靠的初始化。
阶段2:基础OCR能力训练(2T token)
本阶段启动全参数训练,并采用密集的OCR数据混合,以开发全面的OCR基础能力。数据构成如下:文档OCR(45%)、场景文本识别(25%)、图像标题(15%),以及涵盖手写、公式、表格与多语言文本的专业OCR任务(15%)。
阶段3:领域特定增强(800B token)
本阶段针对关键的企业级OCR应用领域进行针对性强化。训练数据采用平衡混合,具体领域及比例如下:复杂表格(22%)、公式识别(20%)、图表理解(18%)、信息提取(18%)、多语言OCR(12%)和文档理解(10%)。为确保在增强专业能力的同时防止灾难性遗忘,我们保持数据混合中70%为领域特定数据,30%为通用数据。
阶段4:指令调优与推理增强
在此最终阶段,我们使用数百万指令样本对模型进行调优,使其能够熟练处理广泛的文档智能任务,包括但不限于:文档解析、版面分析、手写识别、场景文本识别、公式识别、表格识别、多页文档解析、图表问答、文档问答及复杂表格问答。指令数据通过三种互补策略构建:
- 公共数据整理
:收集公开的OCR相关数据集,并利用DeepSeek模型对指令进行重写与泛化,以丰富提示风格与任务形式。 - 反向合成
:对于适合反向生成的任务(如表格、试卷),我们基于结构化真实内容生成大规模问答对。 - 图表数据挖掘
:从海量学术论文的LaTeX源代码中提取图表及其描述,并基于原文生成高质量图表理解问答对,显著增强模型的图表理解能力。
所有指令数据均经过系统化的提示泛化与重写处理,以提升模型对多样化用户指令的鲁棒性。
与通用视觉语言模型(VLM)训练的关键区别在于,本方法所有阶段均贯彻以OCR为中心的数据构成,尤其强调文档解析、表格/图表理解和信息提取任务。各领域详细的数据合成流程见第3节。
训练基础设施与迭代策略
所有训练均在1,024块百度昆仑P800芯片上完成,采用三维并行(数据、张量和流水线并行)策略,并实现通信与计算重叠,总计处理超过2.85T token。在实际操作中,阶段1与阶段2仅训练一次,以建立稳定的基线检查点;而阶段3和阶段4则进行多次迭代,以探索不同的领域数据混合比例、采样策略及指令调优配置。由于阶段3与阶段4的token预算相对较小(800B token + 指令调优,对比阶段2的2T token),每次迭代完成速度较快。完整的四阶段训练流程可在一周内完成,其中阶段3/4的迭代频率约为每日一次,这支持我们对OCR专用训练方案进行系统的消融研究与优化。
3.1 Layout-as-Thought:可选的”结构化思维”机制 🧠
这是Qianfan-OCR最具革命性的设计——在端到端框架中动态注入显式布局分析能力。其核心思想是:当文档结构复杂时,模型主动”思考”布局;当结构简单时,直接输出结果。
3.1.1 机制触发与输出格式
- 触发条件
:用户在提示词中添加 <think>标记(如<think>请解析该合同中的关键信息</think>); - 输出格式
:模型先生成结构化布局分析(边界框、元素类型、内容摘要),再输出最终结果。
<label>paragraph_title</label> <brief>Subsectiontitle:BasicTraining</brief> <box>[[<COORD_129>,<COORD_180>,<COORD_488>,<COORD_217>]]</box> <label>text</label> <brief>Askstoidentifyshapesseenfrom the rightside...</brief> <box>[[<COORD_132>,<COORD_222>,<COORD_224>,<COORD_273>]]</box> <label>image</label> <brief>A 3Darrangementofwhitecubeswithlightblueedges...</brief>3.1.2 为什么有效?——结构先验的双重作用
- 功能补偿
:为端到端模型补充传统管道系统的布局分析输出能力,满足企业级应用对空间定位的需求; - 精度提升
:在复杂文档中,显式布局分析提供结构先验,帮助模型解决以下问题: * 多栏文本的阅读顺序混淆(如报纸、学术论文);
* 公式与正文的边界模糊(如数学试卷);
* 表格与图像的嵌套关系(如财务报告中的图表)。
3.1.3 坐标压缩技术:效率与精度的平衡
- 特殊token编码
:边界框坐标归一化为0-999范围,用 COORD_0~COORD_999单token表示(替代传统3token数字序列); - 效果
:使复杂文档的布局分析输出长度减少50%,推理延迟降低30%。
案例分析:图5展示了Layout-as-Thought在数学试卷上的应用。模型先生成60个元素的结构化列表(含文本、公式、3D几何图的边界框与类型),再据此生成Markdown。这种”先分析后生成”的模式,使其在多栏排版、公式混合的场景中准确率提升8.2%。
2.3 统一OCR与理解:提示驱动的多任务控制 🎯
Qianfan-OCR通过提示工程实现任务解耦:
- 文档解析
: <image>请将此PDF转换为Markdown; - 表格提取
: <image>提取表格数据并转换为CSV格式; - 图表理解
: <image>分析该折线图的趋势并总结关键发现; - 关键信息抽取
: <image>提取发票中的金额、日期、供应商信息。
这种设计使单模型覆盖从字符级识别(OCR)到语义级推理(文档QA)的全谱系任务,无需切换模型或部署额外模块。
实验结果分析:性能与效率的双重验证 📊
4.1 OCR专用基准测试:端到端模型的首次全面超越
Qianfan-OCR在OmniDocBench v1.5上的表现:
- 总体得分93.12%
,超越DeepSeek-OCR-v2(91.09%)、Gemini-3 Pro(90.33%)等顶级端到端模型; - 在表格TEDS指标上达到93.85%
,仅比最佳管道系统PaddleOCR-VL 1.5(95.79%)低1.94个百分点; - 公式CDM指标92.43%
,显著优于通用VLM(如Qwen3-VL-4B的86.55%)。
| 模型类型 | 模型名称 | 总体得分 | 表格TEDS | 公式CDM |
| :—- | :————— | :——– | :——– | :——– |
| 管道系统 | PaddleOCR-VL 1.5 | 94.50 | 95.79 | 94.21 |
| 端到端模型 | Qianfan-OCR | 93.12 | 93.85 | 92.43 |
| 端到端模型 | DeepSeek-OCR-v2 | 91.09 | 92.06 | 90.31 |
关键发现:Qianfan-OCR在公式识别(CDM指标)上表现尤为突出,这得益于其对数学符号的专门数据增强(见3.3节)。
4.2 Layout-as-Thought的差异化收益 📈
Layout-as-Thought的适用场景:
- 高熵文档(复杂布局)
:启用”思考”模式时,模型在OmniDocBench v1.5上的累积得分提升12.7%; - 低熵文档(简单布局)
:禁用”思考”模式可降低40%推理延迟,且精度无损。
实际应用建议:
-
✅ 启用”思考”:学术论文、财务报表、多栏排版文档; -
❌ 禁用”思考”:单栏文本、发票、简单表单。
4.3 通用OCR与文档理解任务:全能型选手
- OCRBench 880分
:超越Qwen3-VL-4B(850分)、Gemini-2.5 Pro(860分); - DocVQA 89.2%
:在文档视觉问答任务中达到业界顶尖水平; - ChartQA 86.5%
:显著优于传统OCR模型(<70%),证明其图表理解能力。
对比实验:当使用Qianfan-OCR的”思考”模式处理复杂表格时,TEDS指标从89.2%提升至93.1%,验证了结构先验的有效性。
深度讨论:为什么Qianfan-OCR能成功? 🔍
5.1 数据工程的”隐形冠军”
Qianfan-OCR的性能突破离不开其六大数据合成管道的精细化设计:
- 文档解析数据
:基于PaddleOCR-VL的25类细粒度标签(如 reference_content、aside_text),比MinerU 2.5的粗粒度标签提升结构化抽取精度; - 图表理解数据
:从arXiv LaTeX源码中提取30万+图表-描述对,覆盖11类图表类型; - 多语言OCR
:支持192种语言,通过RTL文本检测、阿拉伯字符重塑等技术处理复杂书写系统; - 表格合成
:结合程序化生成(随机合并单元格)与真实文档提取,确保结构多样性; - 公式识别
:利用KaTeX引擎渲染数学公式,增强对符号、上下标的识别能力; - KIE数据
:通过多模型协同标注+业务规则过滤,降低教师模型的幻觉风险。
数据启示:Qianfan-OCR的训练数据并非简单堆叠,而是针对文档智能的结构化语义进行定向增强。例如,在公式识别任务中,合成数据特意包含”上下标嵌套””积分符号”等复杂场景,使模型在真实试卷中表现优异。
5.2 多阶段训练的”渐进式优化”
Qianfan-OCR的四阶段训练策略(基础对齐→OCR预训练→领域增强→指令微调)是性能提升的关键:
- Stage 2(OCR预训练)
:加入45%文档OCR数据后,模型在OCRBench上提升12.3分; - Stage 3(领域增强)
:800B token的领域数据使复杂表格解析精度提升18.7%; - Stage 4(指令微调)
:通过逆向合成(如根据表格生成问题)增强任务泛化能力。
训练哲学:Qianfan-OCR的训练策略体现了”先通用后专业,先对齐后推理”的渐进式优化思想,避免了端到端模型常见的”灾难性遗忘”问题。
5.3 局限性与挑战 ⚠️
尽管Qianfan-OCR表现卓越,但仍存在以下局限:
- 长文档处理
:当前支持单页处理,多页文档需分页输入,可能丢失跨页逻辑关系; - 极低分辨率文档
:当图像分辨率<100dpi时,字符识别精度下降至72%(vs. 高分辨率95%); - 非拉丁文字母系统
:在泰米尔语、藏文等复杂书写系统中,公式识别错误率仍高于拉丁语系15%。
未来方向:团队正探索”多页上下文建模”与”超分辨率重建”技术,以突破当前限制。
总结与展望:OCR技术的下一章 🚀
Qianfan-OCR的诞生标志着OCR技术从”模块化拼接”向”统一智能体”的范式转变。其核心价值在于:
-
✅ 架构统一:单模型覆盖从字符识别到语义理解的全任务链; -
✅ 能力可选:通过 <think>标记动态切换”直接输出”与”结构化思考”模式; -
✅ 成本可控:4B参数规模在精度与推理成本间取得平衡,适合企业级部署。
行业影响:Qianfan-OCR的开源(GitHub: baidubce/Qianfan-VL)将加速OCR技术的发展,使中小企业也能部署媲美顶级管道系统的文档智能解决方案。未来,随着多页建模、跨模态推理等技术的演进,端到端OCR有望彻底取代传统管道系统,成为文档智能领域的”新标准”。
夜雨聆风