伪装目标检测(CSOD)和水下显著性检测(USOD)看起来是完全不同的任务——一个在陆地上找隐藏的动物,一个在水下找显著的物体。但深入分析后你会发现,两者在视觉挑战的底层结构上高度同构

CSOD 与 USOD 的结构同构性

CSOD 的核心难点是:目标通过伪装融入背景,边界模糊,纹理特征不可靠。而 USOD 面临的是:水下光线衰减导致颜色退化,悬浮颗粒造成纹理丢失,水体的蓝绿色偏破坏颜色恒常性。

两者的本质区别只在于退化来源不同(生物伪装 vs 物理光学),但底层特征退化模式惊人地相似——都是"边界模糊 + 纹理丢失 + 颜色退化"的三重困境。这意味着 CSOD 的解决方案有可能迁移到 USOD 上,而不需要从零设计全新的网络。

DGNet 的梯度解耦思路

DGNet(Decomposition-Guidance Network)的核心洞察是:显著性检测网络的梯度信号中,上下文梯度和纹理梯度往往是耦合的,导致模型在模糊边界区域产生振荡。DGNet 通过一个分解模块将两者分开:上下文分支负责大范围语义理解("这是鱼还是石头"),纹理分支负责局部边界精修("鱼的边缘在哪里")。

我们将这个思路引入 USOD,设计了梯度特征调制模块(GFM):在反向传播阶段,GFM 根据当前像素的上下文置信度动态缩放纹理分支的梯度权重——背景区域上下文置信度高时,纹理梯度几乎不传播;边界区域则反向放大纹理梯度。

Charbonnier Loss 的陷阱

最初的实验使用了 Charbonnier Loss(一种平滑的 L1 变体),但发现它用一个全局平滑参数淹没了所有像素的梯度差异。在水下场景中,前景(鱼、珊瑚)和背景(沙地、海水)的梯度分布悬殊,Charbonnier 的固定 epsilon 把前景的微弱梯度信号也平滑掉了。

我们的替代方案是梯度特征驱动损失:在损失函数层面直接操作梯度图,让网络关注"梯度变化剧烈"的边界像素,而不是全局平滑。实验表明,仅这项替换就带来了 2.3% 的 F-measure 提升。

GGEM 模块设计思路

GFM 解决了训练时的梯度分配,但推理时的特征融合同样关键。我们设计了全局-局部特征增强模块(GGEM):在编码器-解码器跳跃连接中,GGEM 先通过全局池化捕获水下场景的整体光照分布,再将其注入到局部特征图中做逐通道的仿射变换。这实际上是在特征空间里做了一次"白平衡校正"。

训练配置

所有实验在单张 RTX 3070(8GB)上完成。输入分辨率 256×256,batch size=8,优化器使用 AdamW(lr=1e-4,weight_decay=1e-4)配合 cosine annealing 调度。启用 mixed precision 训练,200 个 epoch 约需 5.5 小时。


从 CSOD 到 USOD 的迁移不是简单的网络复制,而是对梯度信号传播机制的重新思考。GFM 和 GGEM 这两个模块的设计哲学可以概括为一句话:让网络学会"在哪里看得仔细,在哪里粗略扫过"——这正是梯度解耦的核心价值。