合同扫描件多栏排版,解析出来乱成一团?
财报里的图表数据,只能靠人工肉眼提取?
研报里的复杂公式,识别出来全是乱码?
别急,文档解析(PaddleOCR-VL)1.6来了。
过去几个月,PaddleOCR-VL 系列凭借强大的文档解析能力,已被业界广泛用于大模型训练数据和应用数据构建。随着PaddleOCR-VL 1.6在开源社区正式发布,并在 OmniDocBench v1.6上以96.33%精度刷新SOTA,百度智能云同步将企业版文档解析(PaddleOCR-VL)API服务升级至1.6版本。
区别于开源版本「自行部署、自行运维」的使用方式,文档解析(PaddleOCR-VL)企业级API服务具备以下特性:
开箱即用:标准化API接入,无需GPU集群部署与模型调优
生产级稳定:企业SLA保障、弹性扩缩容与高可用架构,支撑业务高峰并发
全格式覆盖:除PDF、图片等版式文档外,原生支持Word、PPT等流式办公文档一键解析
结构化输出:直接返回Markdown /JSON,无缝对接大模型应用与知识库流水线
在继承开源版模型顶尖效果的同时,为企业提供更加便捷、稳定、全面的文档解析能力。
全面领先:96.33%新SOTA
PaddleOCR-VL 1.6 在1.5版本基础上,通过对数据和训练策略的极致优化,实现全面能力跃升:
OmniDocBench v1.6总指标96.33%,文本、公式、表格识别等细项均全面领先
OmniDocBench v1.5/Real5-OmniDocBench同步刷新SOTA
表格、古籍、生僻字识别效果进一步提升,印章、Spotting、图表识别等多场景显著增强
模型结构与1.5完全一致,平台平滑升级,业务无感迁移
详细指标和技术点请见:《96.33% 新SOTA!PaddleOCR-VL-1.6 发布,大模型时代的数据基座再升级》
效果预览示例
表格识别场景


图表识别场景


公式识别场景


古籍识别场景



生僻字识别场景


印章识别场景

真实畸变场景



典型应用场景
场景 | 价值 |
大模型训练数据 | 高质量文档结构化标注,降低数据工程成本 |
RAG知识库 | Word/PPT/PDF统一解析为Markdown,提升检索与问答质量 |
合同/财报分析 | 表格、印章、公式精准识别,支撑智能审阅 |
档案数字化 | 古籍、扫描件、拍照件等多形态文档批量处理 |
智能办公 | 汇报材料、方案文档结构化提取,接入 Agent 工作流 |
文档解析(PaddleOCR-VL)可与百度千帆大模型、Agent 开发平台、知识库等能力无缝组合,构建端到端文档智能应用。
点击「阅读原文」,立即体验文档解析(PaddleOCR-VL) 1.6版本


夜雨聆风