在金融、法律等文档凭证处理压力较大的行业,每天有数以亿计的非结构化文档——扫描件、PDF、图片、表格、手写票据等,需要被快速、准确地转化为结构化数据。
但现有主流工作模式却面临三重困境:
1.通用大模型“难兼顾”:处理复杂文档时,识别遗漏/误差、理解偏差、逻辑不畅、幻觉频发;
2.传统OCR“只读不解”:虽可提取文字,却无法建立键值关联(如检测报告指标等),仍需人工处理。
3.小模型在专业场景下“泛化与理解能力差”:遇印章遮挡、表格跨页、手写草书等情况,识别率骤降,逻辑断裂、关键信息易丢失。
我们需要一个真正“看懂”,而不只是“扫描”文档的引擎。
今天,清瑶全栈自研的视觉语言文档理解模型Qinova-VL-2.0正式亮相。
它不仅能精准理解复杂长文档,包括印章遮挡、手写体、跨页表格等,又能秒级灵活抽取文档中的任意所需字段,让数据直接赋能业务。
依托强大的文档处理能力,Qinova高精度识别专业符号与手写体,吃透文档层级结构与逻辑关系,实现业务级精度的结构化输出——字段完整、键值准确、可直接输入业务系统,为金融机构及企业等提供开箱即用的文档智能化基座。
1
清晰识别复杂文档
金融等行业文档的复杂性远超通用场景:印章与文字重叠、表格跨页断裂、手写体随意潦草、图表与数据混排……Qinova针对这些痛点专项优化,在多个高难度场景下实现SOTA:
在上海人工智能实验室发布的Omnidocbench上,表格结构识别率达到95.2%;
在大型金融机构真实工作场景中,全方位实现了对通用大模型和传统OCR的大幅领先。

无论是对印章遮挡下的关键字段提取,还是对报纸水印、手写草书、百页级长表格的精准还原,Qinova模型均表现出极强的泛化能力、抗干扰能力和细节捕捉能力。例如在草书识别场景中,模型可精准区分连笔、变形字符,识别准确率高达91.5%(手写草书准确率),远超通用大模型或OCR工具。
实测案例:手写保单识别

2
深度理解文档内容
传统解析工具逐页处理文档,输出的是一堆碎片化文字和零散坐标,面对嵌套标题、图文混排、跨页表格时,数据断裂、逻辑混乱问题频发。
Qinova基于多模态大模型语义理解能力,自动识别金融单据、学术论文等复杂版式的阅读顺序与逻辑层级,并支持完整文档一次性输入,自动完成:
章节划分与层级关联:识别文档的目录结构、标题层级,构建逻辑树;
跨页元素合并:如跨页表格自动识别表头延续性,合并为完整表格,杜绝数据断裂;
图文/图表融合解析:不仅提取图表中的文字,更理解图表含义,如从体检报告中识别异常指标并生成智能分析。
比如,一份出资信息表格跨了两页,传统工具会把它拆成两个独立部分,造成数据断裂;Qinova能理解表格标题的关联性和构建数据的连续性,自动将其合并为一份完整的表格。
实测案例:跨页合并

3
精准输出核心字段
识别与理解只是前半程,如何让数据直接赋能业务系统才是关键。
Qinova内置键值对(KV)抽取引擎,可针对上百种文档类型——如原始凭证类、票据类、合同类、报表类、复杂表格类、手写类、现场照片类等,精准抽取核心字段,并输出标准JSON格式数据,业务系统无需二次加工即可直接调用。
比如从报告中提取关键指标数据、从合同里萃取关键条款、自动识别体检报告关键数据等。彻底解决了纯文本输出无法被下游业务系统直接调用的行业痛点,实现了从非结构化文本到高精度结构化数据的一步直达。
实测案例:结构化数据输出

部分实用场景:
对交通事故损毁的车辆照片进行检测及分类处理
根据报销规定,对医保药品库里的药品进行分类处理
对各类硬件设备材质、安装情况等进行识别处理(如光伏设备)
识别文档类型并进行分类处理

4
技术底座:视觉语言推理大模型
视觉-语言联合编码:共享Transformer架构,让视觉特征与语义特征在预训练阶段充分对齐;
文档布局感知:引入SFPN多尺度特征融合,精准捕捉表格、印章、手写区域的边界与关系;
自研训练数据:基于超过5千万页行业数据与案例、50B Token高质量训练数据集融合训练,精准契合金融逻辑。

在性能方面,Qinova同样做到极致高效:
兼容PDF、扫描件、图片、照片、Excel、PPT等主流文档全格式,用户无需转换,拖拽/批量上传即可。
单页文档解析500ms;非高并发批量处理且文本层不清晰的PDF处理吞吐量达2页/秒
支持百页文档表格一次性解析,无需分页预处理;
5
API调用接口已开放

戳👇阅读原文一键体验
夜雨聆风