乐于分享
好东西不私藏

96.33%新SOTA!企业版文档解析(PaddleOCR-VL)1.6同步上线

96.33%新SOTA!企业版文档解析(PaddleOCR-VL)1.6同步上线

合同扫描件多栏排版,解析出来乱成一团? 

财报里的图表数据,只能靠人工肉眼提取? 

研报里的复杂公式,识别出来全是乱码?

别急,文档解析(PaddleOCR-VL)1.6来了。

过去几个月,PaddleOCR-VL 系列凭借强大的文档解析能力,已被业界广泛用于大模型训练数据和应用数据构建。随着PaddleOCR-VL 1.6在开源社区正式发布,并在 OmniDocBench v1.6上以96.33%精度刷新SOTA,百度智能云同步将企业版文档解析(PaddleOCR-VL)API服务升级至1.6版本。

区别于开源版本「自行部署、自行运维」的使用方式,文档解析(PaddleOCR-VL)企业级API服务具备以下特性:

  • 开箱即用标准化API接入,无需GPU集群部署与模型调优

  • 生产级稳定企业SLA保障、弹性扩缩容与高可用架构,支撑业务高峰并发

  • 全格式覆盖除PDF、图片等版式文档外,原生支持Word、PPT等流式办公文档一键解析

  • 结构化输出直接返回Markdown /JSON,无缝对接大模型应用与知识库流水线

在继承开源版模型顶尖效果的同时,为企业提供更加便捷、稳定、全面的文档解析能力。

全面领先:96.33%新SOTA 

PaddleOCR-VL 1.6 在1.5版本基础上,通过对数据和训练策略的极致优化,实现全面能力跃升:

  • OmniDocBench v1.6总指标96.33%,文本、公式、表格识别等细项均全面领先

  • OmniDocBench v1.5/Real5-OmniDocBench同步刷新SOTA

  • 表格、古籍、生僻字识别效果进一步提升,印章、Spotting、图表识别等多场景显著增强

  • 模型结构与1.5完全一致,平台平滑升级,业务无感迁移

详细指标和技术点请见:《96.33% 新SOTA!PaddleOCR-VL-1.6 发布,大模型时代的数据基座再升级》

效果预览示例

表格识别场景

图表识别场景

公式识别场景

古籍识别场景

生僻字识别场景

印章识别场景

真实畸变场景

典型应用场景

场景

价值

大模型训练数据

高质量文档结构化标注,降低数据工程成本

RAG知

Word/PPT/PDF统一解析为Markdown,提升检索与问答质量

合同/财报分析

表格、印章、公式精准识别,支撑智能审阅

档案数字化

古籍、扫描件、拍照件等多形态文档批量处理

智能办公

汇报材料、方案文档结构化提取,接入 Agent 工作流

文档解析(PaddleOCR-VL)可与百度千帆大模型、Agent 开发平台、知识库等能力无缝组合,构建端到端文档智能应用。

点击阅读原文,立即体验文档解析(PaddleOCR-VL) 1.6版本