乐于分享
好东西不私藏

给文档质量"打分":DIQA-5000 数据集与融合版面语义的 DocIQ 质量评估模型

给文档质量"打分":DIQA-5000 数据集与融合版面语义的 DocIQ 质量评估模型

向AI转型的程序员都关注公众号 机器学习AI算法工程

通俗解释:什么是"图像质量评估(IQA)"?IQA 就是让算法给一张图的"好不好看 / 清不清晰"打个分。分两种:有参考(拿原图比对,如 PSNR/SSIM)和无参考(盲评,只看图本身判断质量)。文档图大多是"拍完就处理",根本没有"完美原图"可对照,所以只能走无参考路线——这也是 DIQA 的难点。

一、为什么要专门做"文档"的质量评估

文档数字化早已是基础设施,但拍摄设备、环境光、纸张状态千差万别,拍出来的图常常有阴影、模糊、摩尔纹、折痕、遮挡。文档图像质量评估(DIQA)是评判"增强算法有没有把图变好"的关键工具,直接影响下游 OCR 识别率、文档复原效果,以及文档处理系统的体验。

但过去的研究大多围着自然图像转(KonIQ-10k、CLIVE、CSIQ 等数据集)。自然图和文档图根本不是一类东西

  • 退化模式不同
    :文档图典型的退化是模糊、噪点、光照不均、摩尔纹、几何畸变;自然图更多是压缩伪影、内容失真。
  • 语义结构不同
    :文档图有强结构(文字行、表格、图表),"字清楚不清楋"比"画面美不美"重要得多。
  • 评判标准不同
    :文档图质量直接挂钩"能不能被机器读懂"(OCR 准确率),而不是人眼主观悦目。

传统 DIQA 方法靠手工特征(梯度幅值、方向锐度),泛化差;深度学习 IQA 能自动学多级特征,但一直缺一个"文档专用、带真人多维评分"的数据集。这篇论文的两大贡献,正好补齐这个缺口。

论文标题:DocIQ: A Benchmark Dataset and Feature Fusion Network for Document Image Quality AssessmentarXiv:https://arxiv.org/pdf/2509.17012
2509.17012(v1,2025-09-21 提交)

二、DIQA-5000:一把来自真人的"主观尺子"

DIQA-5000 是一个主观(subjective)数据集——即质量分数来自真人打分,而非算法。它是目前文档图像质量评估里,标注维度最细、流程最系统的数据集之一。

2.1 原始图怎么来:500 张"故意拍坏"的图

作者从公开 PDF 里挑了覆盖文本、表格、混合版式的文档,用 300 dpi 打印成纸件,再用手机在真实场景下拍出 5 类失真,每类 100 张,共 500 张

失真类型
成因
Shadow(阴影)
手机拍摄时光照不均
Occlusion(遮挡)
物体部分挡住文档
Blurring(模糊)
运动模糊 / 失焦
Creases(折痕)
打印件物理折叠
Moiré(摩尔纹)
对着屏幕拍文档产生的条纹

2.2 处理流水线:6 类操作随机组合,1 张变 10 张

关键是——这 500 张"坏图"还要经过一套文档增强流水线处理,每条流水线由 6 个核心操作随机组合而成:

操作
作用
可用算法数
dewarp(纠畸变)
校正透视/弯曲变形
3
demoiré(去摩尔纹)
消除屏幕条纹
2
occlusion removal(去遮挡)
移除遮挡物
2
deblur(去模糊)
处理运动/失焦模糊
3
deshadow(去阴影)
去除光照/遮挡阴影
4
appearance enhancement(外观增强)
提升观感,逼近扫描件
9

流水线的执行顺序(去模糊/去阴影/增强的先后)也随机化,且每个阶段可在"可用算法中随机选"或"跳过"。这种随机组合设计为每张原图生成 10 个不同增强版本,500 × 10 = 5000 张。增强实现同时用了开源方案(DocDiff、DocRes、UVDoc 等)和商业 SDK,确保方法多样性、避免"只用一种算法"带来的数据偏置。

为什么是"500 原图 × 10 增强 = 5000",而不是 5000 张独立拍摄?真实拍摄 5000 张不同文档成本极高,且难控制失真类型均衡。用"有限原图 + 多增强变体"能在可控成本下覆盖海量"失真→增强"组合,专门考验模型对增强效果的评判能力。代价是:同一原图的 10 个版本彼此同源,评估泛化时要留个心眼(见文末冷静视角)。

2.3 真人打分:3 维度、15 人/图、按 ITU 标准清洗

每张图在 3 个维度上打分:

  • overall quality(整体质量)
  • sharpness(清晰度)
  • color fidelity(色彩保真度)

23 名有经验的受试者参与,5000 张图分成 5 批均衡分配,每批 15 人评分——即每张图在每个维度都拿到 15 个独立分数。随后按 ITU-R BT.500(电视图像主观评估国际标准)做数据清洗,剔除不一致/不可靠评分,最终标注为 MOS(Mean Opinion Score,平均意见分)

通俗解释:MOS 是什么?MOS 就是把 15 个人打的分取平均,得到一个"大家普遍认为这张图质量几分"的基准真值。它是主观质量评估的黄金标准——模型预测的分,最终要和这个 MOS 比相关性。15 人而非 1 人,是为了消掉个人偏好噪声。

三、DocIQ 模型:融合版面语义与多级特征的"自动打分器"

DocIQ 是一个无参考 DIQA 模型,网络由 4 个关键组件构成(见图 3):版面融合下采样器 → 骨干网络 → 特征融合模块 → 并行质量回归头。

3.1 Layout Fusion Downsampler(版面融合下采样器)

动机:文档图分辨率极高(论文用 1600×1600),直接跑全分辨率算力爆炸。常规做法是空间下采样,但会丢失文字区域的精细结构。

做法:双路架构——

  • 主路
    :常规空间下采样;
  • 次路
    :把"原图 + 语义版面掩码"拼接后处理。版面掩码标出文本、表格、图区域,由预训练文档版面检测模型(DocLayout-YOLO / MinerU)生成。

两路融合后,模型在降算力的同时,通过"语义区域聚焦"增强特征相关性、保留关键空间关系——简单说,就是让模型"知道哪块是字、哪块是背景",把算力花在刀刃上。

重点澄清:DocIQ 是"无参考",但"有语义先验"。它不依赖"完美原图"做参考(这是无参考的含义),但接入了版面掩码这种来自预训练模型的语义信息。所以更准确的说法是:无参考图像质量 + 有文档语义引导。写推文时别把它宣传成"纯盲评"。

3.2 Backbone + Feature Fusion Module(骨干 + 特征融合模块)

骨干用 ResNet50(ImageNet 预训练)。论文指出一个关键问题:CNN 一层层下采样会丢掉低层细节(边缘、纹理),而这些恰恰是判断"清不清晰、有没有噪点"的关键。

特征融合模块的解决方案:从最低层特征图开始,逐层把低层空间特征和高层语义特征融合——在每个阶段,把"融合后的表示"再加回骨干对应的高层特征。每个融合单元(hyper-structure)由瓶颈卷积组成:压缩通道 → 空间变换 → 恢复维度。最终输出一个既紧凑又富含语义的全局特征,同时捕获"结构保真"与"语义相关性"。

通俗解释:为什么要"多级特征融合"?判断一张图质量,既要看"微观"(边缘锐不锐、有没有噪点——低层特征),也要看"宏观"(版面整不整齐、字块对不对——高层语义)。只靠最后一层高维特征,微观细节早被下采样冲掉了。DocIQ 的做法是"从底往上,每层都把细节掺进去",相当于让模型边看大局边盯细节。

3.3 Parallel Quality Regressors(并行质量回归头)

DIQA 要评多个维度、且每个维度有多个评分者。DocIQ 用多头部回归架构

  • 全局特征送入一组并行全连接回归头
  • 每个回归头含两层:共享第一层 + 维度专属第二层
  • 每个维度独立预测每个评分者的分数,再聚合成最终 MOS。

这个设计的妙处:模型不光学"平均质量",还学"质量分布"——所以即使部分评分者信息缺失,它也能保持鲁棒(因为它学到的是完整分布,而非死记某个平均)。

四、实验与成果

4.1 评测设置

  • 两个基准
    :DIQA-5000(本工作,5000 张多维标注)+ SmartDoc-QA(公开,清洗后 2130 张手机拍文档,用 OCR 准确率 CACC/W ACC 评估)。
  • 6 个对比模型
    (均为通用无参考 IQA):DBCNN、HyperIQA、MUSIQ、RichIQA、StairIQA、TReS。全部按原配置重训,保证公平。
  • 指标
    :SRCC(Spearman 秩相关,衡量"排序对不对")+ PLCC(Pearson 线性相关,衡量"数值准不准")。
  • 实现
    :80%-20% 划分;ResNet50 骨干 + 1600×1600 输入 + 版面掩码;Adam(lr 2e-4,step decay 10 轮 ×0.6),60 epoch,batch 20,NVIDIA A10。

4.2 主结果(DIQA-5000,数值越高越好)

方法
Overall PLCC
Overall SRCC
Sharp PLCC
Sharp SRCC
Color PLCC
Color SRCC
DBCNN
0.5869
0.5421
0.6163
0.6037
0.6335
0.6399
HyperIQA
0.8437
0.8024
0.8542
0.8197
0.8439
0.8155
MUSIQ
0.8585
0.8554
0.8698
0.8460
0.8460
0.8383
RichIQA
0.8660
0.8541
0.8770
0.8357
0.8622
0.8557
StairIQA
0.8502
0.8004
0.8671
0.8359
0.8691
0.8476
TReS
0.8628
0.8080
0.8800
0.8267
0.8658
0.8338
DocIQ
0.9083
0.8832
0.9006
0.8615
0.8907
0.8666

DocIQ 在 DIQA-5000 上三个维度全面占优,平均 SRCC 0.8704、平均 PLCC 0.8999,且一次输入同时输出多维分数(对比模型只能单头出单分),更高效灵活。

4.3 SmartDoc-QA(与 OCR 准确率的相关性)

方法
CACC PLCC
CACC SRCC
W ACC PLCC
W ACC SRCC
HyperIQA
0.8900
0.8828
0.8919
0.8557
StairIQA
0.9138
0.8921
0.8980
0.8857
TReS
0.8893
0.8841
0.8753
0.8701
DocIQ
0.9218
0.9086
0.9107
0.8989

在 SmartDoc-QA 上,DocIQ 与 OCR 字符/词准确率保持强相关(CACC SRCC 0.9086、W ACC SRCC 0.8989),说明它的"感知质量"和"机器可读性"高度一致——版面建模 + 特征融合确实有效。

4.4 消融实验(每个模块的贡献)

Layout Fusion
Feature Fusion
Multi-Raters
Overall SRCC
Sharp SRCC
Color SRCC
0.8832
0.8615
0.8666
0.8636
0.8545
0.8553
0.8696
0.8481
0.8589
0.8448
0.8293
0.8401
0.8162
0.7901
0.8137

三个模块的增量贡献(平均 SRCC 下降幅度):

  • 去掉 Feature Fusion → 降 0.0323(影响最大,证明多级特征融合是核心);
  • 去掉 Multi-Raters 策略(改为直接回归 MOS)→ 降 0.0126;
  • 去掉 Layout Fusion Downsampler → 降 0.0115(结构感知很重要,尤其清晰度估计)。

机器学习算法AI大数据技术

 搜索公众号添加:datanlp

长按图片,识别二维码

阅读过本文的人还看了以下文章:

YOLO实时定位,Qwen3-VL-Seg深度诊断,两者协同完成从"看见"到"看懂"再到"审断"的AI质检全链路
GPT-4o做大脑,Qwen2-VL做眼睛,让无人机+无人船自动巡检港口
NVIDIA开源LocateAnything深度解读:3B参数,比Qwen3-VL快10倍,最强3B视觉定位大模型来了
本地部署AI Agent,6G显存跑Qwen3.6-35B-A3B 从入门到实战全流程
TexMS-YOLO:纹理感知特征融合 + 多尺度交互实现工业缺陷检测91.99% mAP
汇集所有大模型架构图!大模型架构演进全解析
98%准确率!这个双分支AI模型,精准识别木薯叶病害(附代码)
2026论文解读,ASAHI:自适应切片助力小目标检测,速度提升25%、精度创新高
TexMS-YOLO:纹理感知特征融合 + 多尺度交互实现工业缺陷检测91.99% mAP
14.7M参数,小目标AP达到13.9%!FSDETR用频空融合重新定义目标检测
skill刚开源就斩获 1.7K Star!web-access让AI真正"上网"
Qwen3.5实战教程:从0到1掌握本地部署与微调
引入小目标注意力模块改进YOLO12用于无人机视角下的岸边人员玩水检测
pdf2skill:让计算机视觉初学者把PDF文档变成AI技能包
next-ai-draw-io 用这款AI 画图几十秒就搞定了
10 万文档 RAG 落地实战:从 Demo 到生产,我踩过的所有坑
最强一键抠图19Kstar 的 Rembg 开源神器
YOLO12改进引入DINOv3少样本目标检测精度飙升,分享训练自定义数据集代码
基于DINOv2和SAM2改进的U-Net模型
Ultralytics & lightly-train:简化计算机视觉模型训练,无需标签
最新视觉大模型 DINOv3论文精读(逐段解析)
医学影像数据集汇总(持续更新)150个
【医学影像分割】UN-SAM:一种高效且通用的细胞核分割模型
小目标检测难点分析和解决策略

【模型高效部署】tensorrtx 深度解读,yolov11高性能推理实战案例

实时语义分割ENet算法,提取书本/票据边缘

整理开源的中文大语言模型,以规模较小、可私有化部署、训练成本较低的模型为主

《大语言模型》PDF下载

动手学深度学习-(李沐)PyTorch版本

基于40万表格数据集TableBank,用MaskRCNN做表格检测

《基于深度学习的自然语言处理》中/英PDF

Deep Learning 中文版初版-周志华团队

【全套视频课】最全的目标检测算法系列讲解,通俗易懂!

《深度学习入门:基于Python的理论与实现》高清中文PDF+源码

python就业班学习视频,从入门到实战项目

2019最新《PyTorch自然语言处理》英、中文版PDF+源码

《21个项目玩转深度学习:基于TensorFlow的实践详解》完整版PDF+附书代码

《深度学习之pytorch》pdf+附书源码

《Python数据分析与挖掘实战》PDF+完整源码

不断更新资源

深度学习、机器学习、数据分析、python

 搜索公众号添加:datayx