文档解析多模态最新进展:dots.mocr做图表转svg差异性及Qianfan-OCR引入思考做前置处理
今天是2026年3月18日,星期三,北京,天气晴
来看文档智能方向进展。两个工作。
一个是Qianfan-OCR引入思考做前置处理【包括布局检测、阅读顺序】。
一个是dots.mocr差异化做图表转svg【为了重建场景】
看看趋势,也好的,这里做个记录。
一、dots.mocr专注做图表转svg
先看第一个《Multimodal OCR: Parse Anything from Documents》,https://arxiv.org/pdf/2603.13032,https://github.com/rednote-hilab/dots.mocr【还未上传】,3B参数的dots.mocr模型,特点是将文本与图表、流程图、UI等图形元素均作为核心解析目标,转化为可复用SVG结构化代码而非像素裁剪图,高保真文档重建,这个我们之前介绍过dots.ocr.svg,应该是它的后续衍生版本。

从上面两个图看,打的点是将文档中文本、表格、公式、图表、UI、图标等所有信息元素均作为一等解析目标,统一输出有序结构化序列,输出形式:文字为纯文本/标记语言,图形转为可渲染SVG代码,复杂图像保留栅格内容。
这里再回顾下,看看对比现有其他代表模型的功能支持:

所以评测的时候,做的是对应的图生成评估,如下:

技术点不多,快速看下:
模型架构上,使用视觉编码器,1.2B参数,从头训练,支持最高1100万像素高分辨率输入;语言解码器实用Qwen2.5-1.5B;
训练方式上,使用三阶段预训练+指令微调;数据引擎来自四类数据:PDF文档(自动标注结构化文本)、渲染网页(提供复杂布局与HTML信号)、原生SVG资源(图像-SVG对)、通用视觉数据(保证泛化性),并经归一化、去重、质量校验。
最后看效果,对icon类的重绘:

又如,针对图表的重建:

又如,针对科学图表【化学式,电路图,几个图,架构图】

二、Qianfan-OCR引入思考做前置处理
看第二个工作,之前Qianfan已经出过Qianfan-VL系列,https://github.com/baidubce/Qianfan-VL/blob/main/docs/qianfan_vl_report_comp.pdf,提供3B、8B、70B三种规格的模型,适配不同场景:

最近,有更新,发布新版本。
《Qianfan-OCR: A Unified End-to-End Model for Document Intelligence》,https://arxiv.org/pdf/2603.13398,https://github.com/baidubce/Qianfan-VL,4B参数的Qianfan-OCR,【注意地址没对上,还没开源】单模型整合布局分析、文本识别、语义理解,支持图像直接转Markdown与提示词驱动多任务,性能亮点是关键信息提取(KIE)任务,支撑逻辑是专项KIE数据合成,含多模板、难例挖掘、业务规则校验。

看核心几点:
先看与MonkeyOCR、mineru、ppocr-vl模型等差异,前者是先做布局检测(YOLO/VLM做块检测,或者Relation:预测阅读顺序、块间关系),然后进行Recognition:分块识别文字、表格、公式。

后者是图像直接进一个模型,布局分析不是外部模块,而是模型自己的“思考步骤”,用Layout‑as‑Thought把布局变成思维链,而不是分阶段执行,目的减少阶段间误差,全程保留视觉上下文。
接着看模型架构,视觉编码器使用Qianfan-ViT,24层Transformer,支持4K输入,跨模态适配器使用两层MLP+GELU,语言部分使用Qwen3-4B,36层,32K原生窗口;
再看亮点,Layout‑as‑Thought,由特殊token“触发,用户在提示词末尾加“即可开启,不加则走普通快速模式。
模型先按顺序输出结构化布局表示(<box>:归一化到[0,999]的边界框坐标+<label>:25类布局标签(文本、标题、公式、表格、图片、页眉页脚等)+<brief>:内容摘要(只给文本类)),再生成最终OCR/解析结果。
生成阶段基于布局思考结果,输出:正确阅读顺序的文本、表格转HTML、公式用$$包裹、Markdown结构化排版,最后看效果:

参考文献
1、https://arxiv.org/pdf/2603.13032
2、https://arxiv.org/pdf/2603.13398
关于我们
老刘,NLP开源爱好者与践行者,主页:https://liuhuanyong.github.io。
对大模型&知识图谱&RAG&文档理解感兴趣,并对每日早报、老刘说NLP历史线上分享、心得交流等感兴趣的,欢迎加入社区,社区持续纳新。
加入社区方式:关注公众号,在后台菜单栏中点击会员社区加入。
夜雨聆风