夜雨聆风学习资料网

ARTICLE · 1048287

Unet踩坑第三篇:推理结果对比说明

Unet踩坑第三篇:推理结果对比说明

U-Net 系列推理结果对比说明

本文对 Qilian.tif 的六种模型推理结果进行对比:U-Net、ResUNet、Attention U-Net、U-Net++、TransUNet、Swin-UNet。所有结果均来自同一套五分类权重目录:models/Unet/qilian_multiclass_5class_refined/<模型>/best.pth推理结果目录:Unet/out/qilian_multiclass_5class_refined/<模型>/

当前分类体系为:0=道路1=居民地/建筑2=耕地/植被3=裸地4=光伏场。需要特别说明:当前训练样本中没有单独的自然植被类别,因此本文中的“植被提取”实际对应 cropland / 耕地,也可以理解为当前样本条件下的绿色地物提取。

图例

插图放置说明

推理影像:

原始影像

推理文件

unet_classification U-Net 分类结果
resunet_classification ResUNet 分类结果
attention_unet_classification  attention_unet分类
unet++_classification
transunet_classification
swin_unet_classification
unet_building
resunet_building
attention_unet_building
unet++_building
transunet_building
swin_unet_building
unet_vegetation
resunet_vegetation
attention_unet_vegetation
unetpp_vegetation
transunet_vegetation
swin_unet_vegetation

整体分类结果对比

统计范围为整幅 Qilian.tif 推理后的 10 米分辨率结果,共 31,289,913 个像元,约 312,899.13 ha。下表为各类别面积比例。

模型
道路
建筑/居民地
耕地/植被
裸地
光伏场
主要倾向
U-Net
10.42%
0.68%
25.50%
50.16%
13.24%
建筑最保守,整体较平稳
ResUNet
9.83%
2.29%
27.38%
46.72%
13.79%
建筑和光伏较均衡,结果比 U-Net 更积极
Attention U-Net
12.37%
1.24%
34.85%
46.47%
5.06%
更偏向耕地/植被,道路响应偏强
U-Net++
3.17%
7.48%
22.68%
51.80%
14.87%
建筑提取最多,小目标更敏感,但可能偏多
TransUNet
6.09%
4.00%
41.31%
45.29%
3.32%
耕地/植被范围最大,整体连片性强
Swin-UNet
5.58%
1.34%
28.84%
59.19%
5.06%
裸地判断最强,其他类别相对保守

从整体分类看,六个模型都能输出完整五分类结果,但倾向明显不同。U-Net 与 ResUNet 更适合作为基础对照;U-Net++ 对建筑、光伏等小斑块较敏感;TransUNet 更依赖全局上下文,因此对大面积耕地/植被连通区域提取得更多;Swin-UNet 在该样本条件下更容易把区域归为裸地。

分类结果

建筑提取结果对比

建筑提取由五分类结果中的 class_id=1 / built_up / 居民地 派生,二值图中 1=建筑/居民地0=非建筑。统一派生成果位于:

Unet/out/qilian_multiclass_5class_refined/<模型>/derived_extracts/building_mask.tif
模型
建筑像元数
建筑比例
建筑面积
U-Net
211,943
0.68%
2,119.43 ha
ResUNet
715,123
2.29%
7,151.23 ha
Attention U-Net
389,554
1.24%
3,895.54 ha
U-Net++
2,340,388
7.48%
23,403.88 ha
TransUNet
1,250,582
4.00%
12,505.82 ha
Swin-UNet
417,889
1.34%
4,178.89 ha

建筑提取差异最大的是 U-Net++ 和 U-Net。U-Net++ 建筑面积最高,说明它对居民地、小块建设用地和纹理复杂区域更敏感,适合观察潜在建筑斑块,但也更需要人工核查误提。U-Net 建筑面积最低,属于明显保守型结果,适合做低误报参考,但容易漏掉小村庄和边界不清的建筑。ResUNet 与 TransUNet 居中,ResUNet 更适合作为当前阶段的稳健对比结果,TransUNet 在连片居民地上会更积极。

建筑提取总览图

此处放六模型建筑提取结果,建筑为橙色,其他为黑背景。

建筑提取

植被/耕地提取结果对比

植被/耕地提取由五分类结果中的 class_id=2 / cropland / 耕地 派生,二值图中 1=耕地/植被0=其他地类。统一派生成果位于:

Unet/out/qilian_multiclass_5class_refined/<模型>/derived_extracts/vegetation_mask.tif
模型
植被/耕地像元数
植被/耕地比例
植被/耕地面积
U-Net
7,978,592
25.50%
79,785.92 ha
ResUNet
8,566,831
27.38%
85,668.31 ha
Attention U-Net
10,905,942
34.85%
109,059.42 ha
U-Net++
7,097,716
22.68%
70,977.16 ha
TransUNet
12,924,850
41.31%
129,248.50 ha
Swin-UNet
9,025,396
28.84%
90,253.96 ha

植被/耕地提取中,TransUNet 面积最大,说明它更强调大范围连续地类和上下文一致性,适合观察连片耕地区域,但可能把部分裸地或相似纹理区域并入耕地。Attention U-Net 次之,对耕地响应也较强。U-Net++ 的耕地面积最低,说明它更偏向将区域分配给建筑、裸地、光伏等其他类别。ResUNet、U-Net、Swin-UNet 位于中间区间,可作为稳健对照。

植被/耕地提取总览图

此处放六模型植被/耕地提取结果,建议统一用绿色显示耕地/植被、黑显示背景。

植被结果对比

训练验证指标对比

验证集很小,因此指标只能作为当前样本条件下的参考,不能直接代表正式精度。

模型
最佳 epoch
mIoU
道路 IoU
建筑 IoU
耕地 IoU
裸地 IoU
光伏 IoU
U-Net
63
0.4165
0.178
0.185
0.858
0.510
0.351
ResUNet
49
0.4525
0.135
0.289
0.828
0.530
0.481
Attention U-Net
36
0.4436
0.083
0.194
0.851
0.554
0.536
U-Net++
50
0.4866
0.213
0.336
0.827
0.565
0.492
TransUNet
31
0.5017
0.343
0.355
0.818
0.461
0.531
Swin-UNet
34
0.4579
0.307
0.281
0.790
0.455
0.457

从验证指标看,TransUNet 的综合 mIoU 最高,U-Net++ 次之。若重点是建筑提取,U-Net++ 与 TransUNet 的验证表现更好;若重点是光伏识别,Attention U-Net、TransUNet、U-Net++ 都有较高参考价值;若重点是整体稳健性,ResUNet 的分类面积分布和验证指标比较均衡。

各模型特点总结

U-Net

U-Net 是最基础的编码器-解码器结构,结果偏保守。建筑提取面积最少,说明它对小居民地和边界复杂区域不够敏感;但耕地、裸地、光伏的整体分布较稳定,适合作为基线模型。

ResUNet

ResUNet 加入残差结构后,训练和推理表现比基础 U-Net 更稳。建筑面积明显高于 U-Net,耕地和光伏比例也较均衡,适合当前数据条件下作为首选对照结果。

Attention U-Net

Attention U-Net 对目标区域有注意力筛选能力,在当前结果中更偏向识别耕地/植被,道路比例也偏高。它的光伏面积偏少,说明对光伏场可能较保守,适合用于检查耕地连片区域。

U-Net++

U-Net++ 通过更密集的跳跃连接增强多尺度细节表达。当前结果中建筑提取最多,光伏比例也最高,对小斑块、小目标更敏感。但这种敏感性也可能带来误提,建议配合原始影像人工检查。

TransUNet

TransUNet 引入 Transformer 的全局上下文表达,验证集 mIoU 最高。当前结果中耕地/植被提取范围最大,建筑面积也处于较高水平,适合做大范围地类连通区域分析。但对光伏场比例较低,可能存在把部分光伏或裸地归入其他大类的情况。

Swin-UNet

Swin-UNet 使用窗口注意力,理论上兼顾局部和全局信息。当前结果中裸地比例最高,建筑和光伏偏少,说明在当前小样本条件下更容易把不确定区域归入裸地。它可以作为裸地范围判断的参考,但建筑和光伏提取需要谨慎。

相关学习资料