水下计算机视觉有一个绕不开的敌人:水对可见光的非线性吸收。红光在 5 米深度就衰减殆尽,蓝绿光虽然穿透更深,但会造成严重的色偏。纯 RGB 方案在这些极端条件下很容易失效。而热成像(Thermal)恰好不受水色偏影响——这为多光谱融合打开了新思路。

RGB + Thermal 双模态的互补优势

两种模态在水下场景中形成了天然互补:

RGBT 数据集的标注挑战

RGBT 显著性检测最大的瓶颈不是模型设计,而是数据。水下 RGBT 配对数据极度稀缺——需要同时部署 RGB 相机和热成像仪在水下拍摄,设备成本高、部署困难。已有的公开数据集(如 VT5000)主要面向陆地场景,水下场景中温度梯度更小,热对比度显著降低。我们目前使用的是自采的 1200 组配对数据,标注工作仍在持续扩展中。标注的关键难点在于:Thermal 图像中的显著性边界与 RGB 不完全对齐——由于热扩散效应,热成像中的物体边缘天然比 RGB 模糊 2-5 个像素。

双流网络架构设计

我们的融合架构采用非对称双流设计:RGB 流使用较深的编码器(ResNet-34 骨干),捕获纹理和颜色特征;Thermal 流使用较浅的编码器(ResNet-18 骨干),因为热成像本身信息密度较低。两个编码器的输出在三个尺度上进行融合——浅层做通道拼接 + 1×1 卷积降维,中层做逐元素加法,深层通过交叉注意力融合模块进行选择性特征增强。

注意力机制在模态融合中的作用

交叉注意力融合模块的核心思路是:让 RGB 特征和 Thermal 特征互相查询。当一个像素在 Thermal 中温度差异显著时,注意力权重向 Thermal 倾斜;当 RGB 纹理清晰时,权重向 RGB 倾斜。这实际上是在像素级别动态选择"相信哪个模态"

初步实验结果

在小规模水下测试集(200 组)上,RGBT 双模态方案在浑浊水体子集上相比纯 RGB 方案 F-measure 提升 5.8%。但在清澈水体子集上提升仅 0.6%——说明 Thermal 的真正价值在于"救场"极端情况,而非全面替代 RGB。


多光谱融合不是银弹,但它在RGB 失效的场景中提供了兜底方案。对于实际部署的水下检测系统,RGBT 双模态意味着更强的鲁棒性——即使水体突然变浑浊,检测系统也不会直接"瞎掉"。这是单模态方案难以企及的容错能力。