[硕]基于改进CLIPSeg算法的灾后遥感图像语义分割---王昀青(2026届 应用统计专业)
基于改进CLIPSeg算法的灾后遥感图像语义分割
王昀青
2026届 应用统计专业
中文摘要:近年来,自然灾害频发,灾后废墟空间分布信息的快速提取对于灾情评估与应急决策具有重要意义。高分辨率遥感影像为大范围灾后信息获取提供了技术支撑,但灾后废墟目标在形态结构、空间尺度和背景纹理等方面具有较强复杂性,且像素级标注样本有限,使得传统卷积神经网络在复杂场景下仍存在边界刻画不足、多尺度特征表达受限以及小样本条件下泛化能力不足等问题。视觉-语言预训练模型在跨模态语义对齐方面具有一定优势,但其在遥感图像像素级密集预测 任务中的空间细节建模能力仍有待提升。针对上述问题,本文围绕视觉-语言模型在灾后废墟遥感图像语义分割任务中的适配展开研究。
本文以CLIPSeg为基础模型,从文本语义提示优化、参数高效微调和解码端多尺度特征增强三个方面对模型进行改进,构建了面向灾后废墟遥感图像语义分割的协同优化模型。具体而言,在文本编码端引入可学习提示(Learnable Prompt)机制,以增强文本先验与任务语义之间的匹配程度;在图像编码器关键层引入低秩适配(LoRA)策略,实现参数高效微调,提升模型对灾后场景特征的适应能力;在解码端引入轻量化空洞空间金字塔池化(Lite-ASPP)模块,以增强模型对不同尺度废墟区域的上下文表征能力。同时,结合Focal Loss等训练优化策略, 对类别不平衡问题进行处理,以提高模型训练稳定性。
实验结果表明,CLIPSeg微调基线模型的Dice、Dice_debris和IoU_debris分别为85.97%、81.84%和69.28%;在引入Learnable Prompt、LoRA和Lite-ASPP进行协同优化后,上述指标分别提升至87.27%、85.19%和77.49%。结果表明, 所提出方法在整体分割精度和废墟类别识别能力方面均取得了一定提升,且优于 本文选取的传统卷积神经网络基准模型。 综上,本文提出的基于视觉-语言协同的灾后废墟遥感图像语义分割方法, 能够在一定程度上提升复杂灾后场景下的废墟区域识别与精细分割能力,可为视觉-语言预训练模型在遥感图像语义分割任务中的应用提供参考。
关键词:灾后遥感图像;语义分割;视觉-语言模型;CLIPSeg;LoRA



