多模态图像融合(如红外与可见光图像融合)技术,旨在将来自不同传感器的信息聚合起来,生成单一的、信息更丰富的图像。这种融合图像对于下游的高级视觉任务(如语义分割、目标检测)至关重要,因为它能提供比单一来源图像更鲁棒的感知特征。
核心问题在于:目前主流的融合方法,其优化目标(即损失函数)大多是预先定义 (predefined) 的。这些固定的损失函数(例如 $L_1$ 损失、SSIM、感知损失等)主要关注于提升图像的视觉质量,比如清晰度、对比度等。
发现的"鸿沟" (Gap):一个视觉上"好看"的融合图像,并不等同于一个对下游任务"友好"的图像。预定义的损失函数与特定下游任务(如"检测一个远处的小目标"或"分割出物体的精确边缘")的真正需求之间,存在着"任务错配" (task mismatch) 的问题。这种固定的、手动的先验约束限制了模型的灵活性,无法根据具体的任务需求动态调整融合策略。
本文的意义 (Significance):为了解决这一问题,本文提出了 TDFusion,一个核心思想是让融合损失函数本身变得可学习。框架引入了一个"损失生成模块",它不再使用固定的融合规则,而是通过 meta-learning(元学习)的方式,被下游任务的损失(Task Loss)反向指导。其最终目标是:驱动融合网络 $\mathcal{F}$ 的进化,使其生成的融合图像能够最大程度地最小化下游任务的损失 $\mathcal{L}_t$。这使得融合过程真正实现了"任务驱动" (task-driven),具有极高的适应性和灵活性。
TDFusion 框架由三个关键模块组成:融合网络 $\mathcal{F}(\cdot)$(参数为 $\theta_{\mathcal{F}}$)、下游任务网络 $\mathcal{T}(\cdot)$(参数为 $\theta_{\mathcal{T}}$)以及核心的损失生成模块 $\mathcal{G}(\cdot)$(参数为 $\theta_{\mathcal{G}}$)。
整个框架的基石是这个可学习的融合损失 $\mathcal{L}_f$,它由强度项 $\mathcal{L}_{f}^{int}$ 和梯度项 $\mathcal{L}_{f}^{grad}$ 构成:
(Equation 1)
梯度项 ($\mathcal{L}_{f}^{grad}$): 这是一个常规项,用于保留源图像中显著的纹理细节。它被定义为融合图像 $I_f$ 的梯度与两张源图像 $I_k$ ($k \in \{a, b\}$) 的最大梯度之间的 $L_1$ 距离:
(Equation 3)
强度项 ($\mathcal{L}_{f}^{int}$): 这是 TDFusion 的创新核心。它不是简单地让 $I_f$ 逼近 $I_a$ 或 $I_b$,而是引入了一组由 $\mathcal{G}$ 模块生成的可学习权重 $\{w_a, w_b\}$:
(Equation 2)
其中,$\{w_{a}, w_{b}\} = \mathcal{G}(I_{a}, I_{b})$。$\mathcal{G}$ 模块的输出经过 Softmax 函数,确保在每个像素 $(i, j)$ 上,$w_{a}^{ij} + w_{b}^{ij} = 1$。这意味着 $\mathcal{G}$ 模块学会了在每个像素上,应该更"相信"哪一张源图像,从而动态地为融合损失 $\mathcal{L}_f$ 分配权重。
如何训练 $\mathcal{G}$ 来生成"最优"的 $\{w_a, w_b\}$ 呢?答案是元学习。训练过程分为"内更新"和"外更新"两个阶段,这在 $\mathcal{G}$ 模块的 $M$ 次迭代中进行:
a. 内更新 (Inner Update):
在元训练集 $\{I^{mtr}\}$ 上,我们创建融合网络 $\mathcal{F}$ 的一个"克隆"或"代理" $\mathcal{F}'$。这个代理网络使用由当前 $\mathcal{G}$ 生成的损失 $\mathcal{L}_f$ 进行一次梯度下降更新,得到更新后的参数 $\theta_{\mathcal{F}'}$:
(Equation 4)
这一步的目的是模拟:如果 $\mathcal{F}$ 真的使用了 $\mathcal{L}_f$,它会变成什么样?
b. 外更新 (Outer Update):
我们使用上一步得到的"代理网络" $\mathcal{F}'$ 来处理元测试集 $\{I^{mts}\}$,生成融合图像 $I_f^{mts} = \mathcal{F}'(I_a^{mts}, I_b^{mts})$。然后,我们将 $I_f^{mts}$ 送入下游任务网络 $\mathcal{T}$,计算出最终的任务损失 $\mathcal{L}_t$(例如分割的交叉熵损失)。
这个 $\mathcal{L}_t$ 才是我们真正的优化目标。我们计算 $\mathcal{L}_t$ 关于损失生成器参数 $\theta_{\mathcal{G}}$ 的梯度,并用它来更新 $\mathcal{G}$:
(Equation 6)
这个梯度的计算(如 Eq. 7 所示)需要二阶导数(Hessian-vector product),是 MAML 的标准做法。这一步的含义是:"更新 $\mathcal{G}$,使得它生成的 $\mathcal{L}_f$ 在内更新中,能让 $\mathcal{F}'$ 产出在任务上表现更好的 $I_f^{mts}$。"
在 $\mathcal{G}$ 模块进行了 $M$ 次的元学习迭代更新后,我们得到了一个更优的损失生成器。此时,我们再回到主循环,使用这个更新后的 $\mathcal{G}$ 生成的 $\mathcal{L}_f$ 来对主融合网络 $\mathcal{F}$ 进行 $N$ 次常规训练:
(Equation 8)
这两个过程(训练 $\mathcal{G}$ 和训练 $\mathcal{F}$)交替进行,共同推动模型向着任务最优的方向进化。
为了验证 TDFusion 的有效性并确保可复现性,论文提供了详尽的实验设置。
这是复现的关键:为了公平比较不同融合方法对下游任务的影响,作者们执行了以下流程:
评估指标 (Metrics):
首先,在传统的图像融合指标上,TDFusion 表现出色。论文中的 Figure 2 (视觉对比) 显示 TDFusion 能有效保留红外图像中的显著目标(如行人)和可见光图像中的背景细节(如路灯光晕),同时实现均衡的亮度和高对比度。
在定量指标 (Table 1) 上,TDFusion 在四个数据集上均取得了 SOTA 或次优的成绩,尤其是在 EN, SF, SCD 等指标上优势明显,证明了其融合图像的鲁棒性和高信息量。
此处为论文中 Figure 2 的占位符。
图像显示 TDFusion (最右列) 在 MSRS, FMB, M3FD, LLVIP 数据集上的融合结果,对比其他7种方法,在保留红外目标和可见光纹理方面表现更优越。
Figure 2. 视觉对比。TDFusion 在各种场景下均能生成更自然、细节更清晰的图像。
下表(节选自论文 Table 1)展示了在 FMB 和 LLVIP 数据集上的定量对比:
Table 1 (节选): 图像融合质量定量对比
| Dataset | Method | EN $\uparrow$ | SF $\uparrow$ | SCD $\uparrow$ | VIF $\uparrow$ | $Q^{AB/F}$ $\uparrow$ | SSIM $\uparrow$ |
|---|---|---|---|---|---|---|---|
| FMB [34] | TarDAL [32] | 6.63 | 6.94 | 1.03 | 0.28 | 0.29 | 0.74 |
| SegMIF [34] | 6.83 | 13.69 | 1.72 | 0.39 | 0.65 | 0.60 | |
| MRFS [76] | 6.78 | 12.42 | 1.24 | 0.38 | 0.62 | 0.73 | |
| TDFusion (Ours) | 6.86 | 14.16 | 1.76 | 0.43 | 0.68 | 0.75 | |
| LLVIP [17] | EMMA [86] | 7.35 | 15.37 | 1.57 | 0.64 | 0.41 | 0.66 |
| MRFS [76] | 6.83 | 11.04 | 1.23 | 0.31 | 0.42 | 0.64 | |
| TIMFusion [40] | 6.58 | 13.52 | 1.14 | 0.33 | 0.46 | 0.64 | |
| TDFusion (Ours) | 7.36 | 16.38 | 1.75 | 0.46 | 0.70 | 0.67 |
这才是 TDFusion 真正的"考场"。如 Figure 3 (分割) 和 Figure 4 (检测) 所示,TDFusion 生成的融合图像使得下游模型能产生更清晰的分割边界和更准确的检测框。
定量结果 (Table 2) 证实了这一点:TDFusion 在所有四个数据集、两个下游任务上均取得了最佳性能。这有力地证明了其核心论点:通过元学习优化融合损失,可以显著提升融合图像对下游任务的"友好度"。
此处为 Figure 3 (分割) 和 Figure 4 (检测) 的占位符。
图像显示,基于 TDFusion 融合图像训练的任务模型,其分割掩码 (mask) 和检测框 (bbox) 都最接近 Ground Truth。
Table 2: 下游任务性能对比
| Method | 语义分割 (MSRS) | 语义分割 (FMB) | 目标检测 (M3FD) | 目标检测 (LLVIP) | ||||
|---|---|---|---|---|---|---|---|---|
| mAcc $\uparrow$ | mIoU $\uparrow$ | mAcc $\uparrow$ | mIoU $\uparrow$ | mAP50 $\uparrow$ | mAP75 $\uparrow$ | AP50 $\uparrow$ | AP75 $\uparrow$ | |
| Infrared | 83.23 | 69.49 | 58.85 | 51.98 | 79.12 | 53.05 | 96.03 | 72.07 |
| Visible | 83.44 | 73.76 | 57.96 | 65.12 | 82.21 | 54.82 | 48.66 | 91.78 |
| SegMIF [34] | 85.73 | 74.25 | 65.97 | 58.41 | 83.61 | 58.23 | 93.95 | 66.45 |
| MRFS [76] | 84.76 | 74.50 | 61.93 | 55.71 | 83.28 | 57.74 | 93.03 | 67.21 |
| TIMFusion [40] | 83.67 | 73.58 | 63.70 | 57.24 | 83.22 | 56.08 | 93.76 | 61.33 |
| TDFusion (Ours) | 86.04 | 75.09 | 67.17 | 60.50 | 86.27 | 59.71 | 95.00 | 69.18 |
这是论文中最具洞察力的部分。为了探究可学习损失 $\mathcal{L}_f$ 究竟学到了什么,作者将为"语义分割 (SS)"任务训练的 $\mathcal{G}$ 和为"目标检测 (OD)"任务训练的 $\mathcal{G}$ 进行了可视化 (Figure 5)。
结果发现:
结论:TDFusion 成功地让 $\mathcal{G}$ 模块学会了针对不同下游任务,从源图像中提取最相关信息的不同融合策略。这证明了可学习损失的必要性和有效性。
此处为 Figure 5 的占位符。
图像展示了 $w_a^{SS}$ (分割任务的红外权重) 和 $w_a^{OD}$ (检测任务的红外权重) 的热力图。两者表现出明显差异,证明了融合策略的任务特异性。
Figure 5. 可视化分析。不同任务学到的融合权重(偏好)是截然不同的。
论文通过一系列消融实验证明了框架中每个组件的必要性(在 FMB 数据集上进行):
"TDFusion 是一项非常出色且立意新颖的工作。它准确地抓住了当前多模态融合领域的核心痛点——即融合质量与下游任务性能的'解耦'(decoupling) 问题,并为此提供了一个极其精巧(elegant)的解决方案。"
为了达到"可复现"的目标,TDFusion 的核心训练算法 (Algorithm 1) 值得我们单独梳理。整个流程是一个精妙的交替优化:
初始化: 随机初始化融合网络 $\mathcal{F}$ (参数 $\theta_{\mathcal{F}}$), 任务网络 $\mathcal{T}$ (参数 $\theta_{\mathcal{T}}$), 和损失生成器 $\mathcal{G}$ (参数 $\theta_{\mathcal{G}}$)。
...重复 L 个 Epochs,直到模型收敛。