乐于分享
好东西不私藏

DocIQ文档智能新突破!上海交通大学&合合信息打造文档图像质量“体检”模型

DocIQ文档智能新突破!上海交通大学&合合信息打造文档图像质量“体检”模型
论文名称:DocIQ: A Benchmark Dataset and Feature Fusion Network for Document Image Quality Assessment
论文链接:https://arxiv.org/abs/2509.17012
所属单位:上海交通大学,合合信息等

在文档智能系统中,图像质量往往是被低估的一环。很多OCR、版面分析、文档增强、信息抽取系统,表面上是在处理“图像”,本质上处理的却是“可读性”“结构完整性”和“任务可用性”。一旦输入文档图像存在阴影、遮挡、模糊、折痕或摩尔纹等退化,上游感知错误就会被不断放大,最终传导到识别、抽取乃至业务决策层面。

本篇论文聚焦的,正是这一前置问题:如何面向文档场景,建立更贴近真实任务的图像质量评估机制。

它的贡献主要体现在两个方面:

  • 构建了面向文档图像质量评估的主观数据集 DIQA-5000;
  • 提出了一种融合版面语义与多层特征的文档专用质量评估模型 DocIQ。

这篇论文的价值,不只是提出了一个新模型,更重要的是它在方法论上明确了一个判断:文档图像质量评估不能简单沿用自然图像 IQA 的范式,而必须引入文档结构、内容布局与任务可读性的先验。

一、为什么文档图像质量评估是一个独立问题?

传统图像质量评估(IQA)大量服务于自然场景图像,目标通常是预测图像主观观感或失真程度。但文档图像与自然图像有本质差异:

  • 文档图像的核心内容是文字、表格、公式、印章、版面结构;

  • 其质量判断标准并不等同于“视觉好看”,而是“是否可读、可识别、可抽取”;

  • 局部退化对任务的影响高度不均匀:文字区轻微模糊,可能直接影响 OCR;背景区噪声变化则未必重要。

因此,对文档图像而言,质量评估更接近一种结构感知型、任务驱动型的感知判断。

这也是为什么通用 IQA 方法在文档场景中经常表现不佳:它们往往关注全局纹理、对比度或一般性视觉失真,却忽略了文档图像中最关键的语义区域。

二、DIQA-5000:面向真实退化与增强结果的主观质量数据集

DocIQ 首先构建了一个新的主观数据集 DIQA-5000。该数据集包含 5000 张增强后的文档图像,其原始样本来自 500 张真实世界文档图像,覆盖了五类典型文档退化问题:阴影、遮挡、模糊、折痕和摩尔纹(Fig 1)。

与单纯合成退化数据不同,DIQA-5000 的设计更接近真实文档处理流程。本论文不仅采集了退化图像,还通过多种文档增强流水线生成不同版本的增强结果,处理步骤包括去畸变、去摩尔纹、去遮挡、去模糊、去阴影和外观增强等(Fig 2)。这样一来,数据集不仅可以用于评估原始图像质量,也可以用于比较不同文档增强方法的输出质量。

在标注方式上,DIQA-5000 采用多维主观评分,而不是单一总分。每张图像由多名受试者从整体质量、清晰度和颜色保真三个维度进行评价,并最终形成 MOS 分数。这种设计更符合文档图像质量的多维属性:一张图可能文字足够清晰,但颜色失真严重;也可能整体观感尚可,但局部关键区域已经影响识别。

因此,DIQA-5000 的意义不仅是提供了一个 benchmark,更重要的是将文档图像质量评估从单一视觉观感推进到了多维感知评价层面。

三、DocIQ:文档专用质量评估模型的设计逻辑

DocIQ 的核心思路可以概括为三个层次:

  • 先理解文档结构;
  • 再融合多层视觉特征;
  • 最后用多头回归建模多维评分。

1. Layout Fusion Downsampler:引入版面语义

普通 CNN 在逐层下采样时,往往会丢失高分辨率下的重要细节。而对文档图像而言,文字区、表格区、图片区的空间分布非常关键。因此,DocIQ 在下采样阶段引入了 Layout mask,将图像内容与版面语义联合输入。这一步的本质,是把“图像质量判断”从纯视觉任务,改造成带有版面先验的结构感知任务。

它带来的收益主要有两点:

  • 在压缩计算量的同时,保留关键区域信息;
  • 强化模型对文档语义区域的聚焦能力,避免把背景噪声与核心文本区域同等对待。

2. Feature Fusion Module:融合浅层细节与深层语义

文档图像质量的判断,既依赖局部边缘、纹理、清晰度,也依赖结构和内容语义。如果只看浅层特征,模型容易关注边缘细节,却无法理解版面组织;如果只看深层特征,模型又可能忽略细小模糊、局部失真等关键问题。DocIQ 的 Feature Fusion Module 试图解决这个问题:它从多个 Backbone Stage 中提取特征,并逐层融合高低层信息,形成兼具局部细节与全局语义的表征。

这实际上反映了一个更普遍的认知:文档质量不是单尺度问题,而是跨尺度结构问题。

3. Parallel Quality Regressors:多维、多标注者建模

与单输出回归模型不同,DocIQ 针对不同质量维度设置独立回归头,并进一步考虑不同评分者之间的差异。这是一种很现实的设计。因为文档质量评估从来不是绝对一致的,尤其是在“还能用”与“必须重拍”的边界上,不同标注者的主观判断可能存在差异。

因此,多头回归的意义不只是“多输出几个分数”,而是:

  • 学习不同维度之间的相对独立性;
  • 更好地拟合主观评分分布;
  • 提升对多标注者噪声的鲁棒性。

四、实验结果:文档专用模型优于通用 IQA 方法

论文在 DIQA-5000 和 SmartDoc-QA 两个数据集上进行实验,主要采用 SRCC 和 PLCC 衡量模型预测结果与人工评分或 OCR 相关指标之间的相关性。

实验结果在Table 1中显示,DocIQ 在整体质量、清晰度和颜色保真三个维度上均优于多种通用无参考 IQA 方法。这说明,针对文档场景引入版面结构信息和多层特征融合,确实能够提升模型对文档质量的建模能力。

更值得注意的是,DocIQ 在 SmartDoc-QA 上也取得了较好的表现。SmartDoc-QA 更偏向通过 OCR 结果衡量文档质量,例如字符准确率和词准确率。DocIQ 能够在该数据集上保持较高相关性,说明它并不只是拟合人眼主观观感,也在一定程度上与实际 OCR 可读性保持一致。

从消融实验来看(Table 2),去除版面感知模块、特征融合模块或多评分者建模策略,都会导致性能下降。这进一步说明,DocIQ 的几个核心设计并非简单叠加,而是分别对应了文档质量评估中的关键问题:结构在哪里、细节如何保留,以及人的主观判断如何建模。

五、从现实应用看:质量评估正在成为文档智能的前置门控

如果将 DocIQ 放到当前文档智能的发展趋势中来看,它的意义会更加清晰。随着 OCR、版面解析、文档增强和大模型文档理解能力的发展,越来越多业务开始依赖自动化文档处理流程。例如合同审查、票据报销、档案归档、金融材料审核、政务材料识别、专利交底书处理等场景,都需要将文档图像转换为可结构化、可检索、可理解的信息。

但这些流程有一个共同前提:输入必须足够可靠。

如果文档图像本身质量不足,后续模型并不会简单失败,而是可能产生更隐蔽的问题。例如 OCR 识别错误可能被大模型包装成看似合理的文本解释,字段抽取错误可能进入业务系统,最终造成审核误判或流程风险。因此,在 OCR 和大模型之前增加质量评估模块,实际上是在为整个文档智能系统建立一层输入可信度控制。

从这个角度看,DocIQ 代表的不只是图像质量评估模型,而是一种更系统化的工程思想:文档智能系统不能只关注识别与理解能力,也必须关注输入质量、任务适配性和结果可信度。

六、局限与未来方向

尽管 DocIQ 这项工作具有较强的现实价值,但仍存在一些明显局限。

首先,DIQA-5000 虽然覆盖了阴影、遮挡、模糊、折痕和摩尔纹等常见退化类型,但现实中的文档问题远比这更复杂,例如低光照、过曝、压缩伪影、手写干扰、印章遮挡、复杂背景以及多页结构不一致等情况尚未被充分纳入。

其次,论文的评估重点仍主要停留在图像主观质量与 OCR 相关性层面,还没有进一步延伸到更高层次的任务可用性指标,例如字段抽取准确率、LLM 理解稳定性、文档检索效果或审核流程通过率。

再次,该方法对版面检测结果存在一定依赖,layout mask 的质量直接影响后续特征聚焦效果,一旦版面分析出现偏差,模型性能也会受到连带影响。基于此,后续更值得探索的方向,是从单一图像分数预测转向更完整的任务感知质量评估体系,将视觉质量、OCR 可读性、关键字段可抽取性以及 LLM 理解可信度统一纳入同一框架,从而让质量评估真正嵌入文档智能处理链路之中。

七、应用

DocIQ 的价值不只在于提出了一个新的文档图像质量评估模型,更在于它明确了文档智能系统中的一个关键问题:文档图像不是普通自然图像,文档质量也不是单纯的视觉美学问题。

在 OCR 与多模态大模型广泛进入文档处理流程的背景下,质量评估正在从后验分析变成前置门控。它决定一张文档图像是否值得继续处理,是否需要增强,是否应触发人工复核,以及后续识别与理解结果应当被赋予多高的可信度。

如果说通用 IQA 关注的是“图像是否像一张好图”,那么 DocIQ 关注的则是:这张文档图像,是否足够支撑机器继续可信地理解它。

作为论文参与方之一,合合信息并未将DocIQ模型停留在学术研究阶段,而是进一步将其作为文档图像质量检测与评估工具,引入旗下文本智能产品的研发与测试链路。其核心作用,是对不同版本文档处理系统的输出结果进行质量评估与效果对比,判断图像增强、去阴影、去模糊、版面优化等能力是否真正提升了文档的可读性与下游任务可用性。

它主要通过客观、统一的质量检测,为问题定位、算法选择和版本迭代提供评估依据,帮助研发团队及时发现效果退化并持续优化处理方案。

因此,DocIQ的产品价值更多体现在质量保障层面:间接推动个人端扫描结果的清晰度与稳定性提升,同时为企业端的OCR、版面解析、字段抽取及文档理解等后续流程提供更可靠的输入质量保障。

八、作者介绍

上海合合信息科技股份有限公司是一家中国领先的人工智能产品公司,始终致力以AI技术创新赋能,向全球C端用户和多元行业B端客户提供“真有用、真好用”的产品,已成为全球多模态大模型文本智能技术的领先者。