CVPR 2026 | Degradation-Robust Fusion: An Efficient Degradation-Aware Diffusion Framework 上图为ChatGPT生成用于辅助理解但它也可能会犯错请核对重要信息。1 论文信息英文题目Degradation-Robust Fusion: An Efficient Degradation-Aware Diffusion Framework for Multimodal Image Fusion in Arbitrary Degradation Scenarios中文标题退化鲁棒融合面向任意退化场景下多模态图像融合的高效退化感知扩散框架作者Yu Shi¹, Yu Liu¹*, Zhong-Cheng Wu¹, Juan Cheng¹, Huafeng Li², Xun Chen³单位¹Department of Biomedical Engineering, Hefei University of Technology合肥工业大学 生物医学工程系²Faculty of Information Engineering and Automation, Kunming University of Science and Technology昆明理工大学 信息工程与自动化学院³School of Information Science and Technology, University of Science and Technology of China中国科学技术大学 信息科学技术学院代码https://github.com/YShi-cool/DRFusion下载https://arxiv.org/abs/2604.089222 论文摘要噪声、模糊、低分辨率等复杂退化是真实世界图像融合任务中的常见挑战严重限制了现有方法的性能与实用性。基于端到端神经网络的方法设计简单、推理高效但黑盒特性导致可解释性受限基于扩散模型的方法虽然凭借强大的生成先验和结构化推理过程在一定程度上缓解了这一问题但它们通常被训练用于学习单域目标分布而图像融合本身缺乏天然的融合标签数据且依赖于对多源互补信息的建模这使得扩散模型难以直接应用于融合任务。为此本文提出了一种面向任意退化场景下图像融合的高效退化感知扩散框架。具体而言本方法摒弃了传统扩散模型显式预测噪声的范式转而通过直接回归融合图像实现隐式去噪从而能够以有限的扩散步数灵活适应各种复杂退化下的融合任务。此外作者还设计了一种联合观测模型修正机制在采样过程中同时施加退化约束与融合约束确保高质量的重建精度。在多种融合任务和退化配置上的实验验证了所提方法在复杂退化场景下的优越性。创新总结① 高效退化感知扩散框架对应 3.1 节将退化建模与多模态图像融合统一在单一扩散过程中。不再显式预测噪声而是直接回归融合图像使扩散模型在架构上更接近端到端网络既能以自监督方式应对融合标签缺失问题又能在少量扩散步数内取得有竞争力的结果。② 联合观测修正机制对应 3.2 节将退化约束与融合约束同时注入 DDIM 采样过程强制中间样本既符合退化模型又保留跨模态互补信息。通过构造联合退化矩阵及其隐式伪逆求解方式巧妙避免了显式计算大规模伪逆带来的高计算开销。③ 灵活适配复杂退化与多种融合任务对应 3.3 节框架支持噪声、模糊、低分辨率以及它们的复合退化形式并可针对红外可见光融合、医学图像融合等不同任务采用相应的损失函数如最大值损失、SSIM 损失等打破了传统扩散融合方法中单一噪声预测目标的刚性束缚。3 方法整个方法围绕让扩散模型既能处理融合又能感知退化这一目标展开主要包含三个组件1面向融合的扩散框架摒弃标准扩散模型中的显式噪声预测步骤仅保留逆向过程通过有限次扩散迭代直接将退化输入映射到融合输出。每一步采用基于 DDIM 的加速采样先估计去噪结果 然后再生成下一时刻样本 。具体迭代形式如下这一设计使扩散模型架构上更接近端到端网络可以自监督训练无需融合标签。2联合观测修正机制作者将两个源图像的退化约束与融合约束统一写成联合矩阵形式整理为联合观测模型进而得到联合退化矩阵 的隐式伪逆将其嵌入 DDIM 采样过程得到最终的扩散迭代值得一提的是融合权重 、 并非固定值而是通过多任务 U-Net 在预测噪声的同时数据驱动地学习得到满足 。3任务自适应损失总损失由源图像重建损失 与融合损失两部分组成其中重建损失为针对红外可见光融合采用最大值梯度损失针对医学图像融合采用 L1 SSIM 联合损失对于含噪场景仅需在修正项前乘以一个尺度系数 对于多种退化复合其伪逆按以下顺序组合框架可统一处理(具体公式见原文)4 实验实验设置PyTorch 实现Adam 优化器batch size 8训练 100 epoch初始学习率 0.0001硬件采用双 NVIDIA RTX 4090 GPU。数据集包括红外可见光融合数据集 M3FD与哈佛医学图像融合数据集中的 PET-MRI 配对图像。考察三种退化场景噪声、模糊、复合退化噪声模糊低分辨率。对比方法涵盖 IFCNN、U2Fusion、MURF、DDFM、Text-DiFuse、VDMUFusion、RFfusion、Mask-DiFuser 等 8 种代表性方法。评价指标采用六个常用客观指标Q_MI、Q_NCIE、Q_AB/F、Q_P、Q_CB、Q_W。① 定性实验在 M3FD 与 Harvard 数据集上进行可视化对比。对比方法采用先复原后融合的级联流程往往残留模糊伪影或细节丢失本文方法直接从退化输入端到端重建融合结果在颜色保真度、纹理细节、热辐射信息保留等方面均明显优于竞争方法。例如避免了 Mask-DiFuser 在树木区域的色彩失真文字与车辆等局部细节也更清晰。② 定量实验M3FD 数据集本文方法在三种退化场景的大多数指标上取得最佳或次佳尤其在 Blur 与 Composite degradation 场景下Q_MI、Q_NCIE、Q_AB/F、Q_P、Q_W 显著领先Harvard 数据集在三种退化条件下 Q_AB/F、Q_P、Q_W 均取得最高分复合退化下提升尤为明显效率与参数量相比 DDFM、VDMUFusion 等扩散方法本方法运行时间显著更低、接近神经网络速度参数量也保持合理水平下游任务补充材料 E在 M3FD 目标检测实验中本方法取得 Precision 0.9750、Recall 0.8005、mAP0.5 0.9108较最强基线 IFCNN 提升约 2 个百分点。③ 消融实验作者重点验证了联合约束修正机制的有效性。结果表明去除该机制后融合图像噪声残留明显增多结构细节模糊边缘伪影增加尤其在复合退化场景下性能下降最为显著。在 Q_MI、Q_NCIE、Q_AB/F、Q_P、Q_W 等指标上加入联合约束的版本几乎全面优于无约束版本。此外作者还分析了迭代步数 T的影响T 从 1 增至 3 时性能稳步提升T 3 时达到最优继续增大 T 反而带来轻微性能下降并显著增加推理时间因此默认设置 T 3。5 总结本文针对真实场景中图像融合任务普遍面临的复杂退化难题提出了一种退化感知的扩散融合框架 DRFusion。其关键贡献在于▍范式革新摒弃标准扩散模型中显式噪声预测的束缚转而直接回归融合图像使扩散模型可以像端到端网络一样灵活处理无融合标签的多输入任务并在少量步数内完成高质量重建。▍机制创新设计联合观测修正机制通过构造联合退化矩阵与隐式伪逆求解将退化约束与融合约束统一注入采样过程显著提升复杂退化下的重建精度。▍效果显著在红外可见光与医学 PET-MRI 两类典型融合任务、三种退化场景下均取得优于现有方法的定性与定量表现运行效率上接近神经网络方法并在下游目标检测任务中验证了其实用价值。这项工作为扩散模型 图像融合的研究方向提供了一种更高效、更通用、更可解释的新视角对于真实场景下多模态成像系统具有重要的应用潜力。

相关新闻

最新新闻

Java Agent 异常处理的可选性:从 Optional 到 CompletableFuture 的降级策略实践

Java Agent 异常处理的可选性:从 Optional 到 CompletableFuture 的降级策略实践

如果把 Agent 的异常处理写成传统的try-catch,大概率会在第一个真实故障面前失灵。这不是危言耸听,而是 Agent 应用与传统后端服务的本质差异决定的:Agent 的执行结果不确定、调用链不固定、外部依赖多,而且它并不是每一次失败都值…

2026/8/30 7:38:08
Minimax H3提示词Skill实战指南:从安装到效果验证

Minimax H3提示词Skill实战指南:从安装到效果验证

说实话,最近视频生成模型圈子里讨论度最高的名字之一就是 Minimax H3。很多人第一眼看到演示视频时,第一反应都是“这是 CG 吧”,结果发现确实是模型直出。但等自己真正部署完、跑起来之后,反馈却往往两极分化:有人觉得…

2026/8/30 7:38:08
AI进入大学:教学考核如何重构?从Carson Gross见解到RAG实践

AI进入大学:教学考核如何重构?从Carson Gross见解到RAG实践

最近在技术社区里,Carson Gross 的一段分享《AI and the University》被反复讨论。如果你熟悉 htmx 和《Hypermedia Systems》这本书,应该对这个名字不陌生。他作为长期在 Web 开发领域坚持“简化”理念的技术人,这次把目光投向了大学教育&am…

2026/8/30 7:38:08
大模型为何“不知道自己在做什么”?Agent工程中的自验证与可靠性实践

大模型为何“不知道自己在做什么”?Agent工程中的自验证与可靠性实践

“OpenAI just proved AI has no idea what its doing (July) [video]”这段带有挑衅意味的视频标题在技术社区流传时,真正值得关注的不是“OpenAI 又要炒作什么”,而是一个反复出现的工程现象:AI 能生成非常自信、流畅、结构完整的回答&…

2026/8/30 7:38:08
基于Claude Tag的标签驱动值班:从请求埋点到连接错误排查

基于Claude Tag的标签驱动值班:从请求埋点到连接错误排查

在实际依赖 Claude 模型的业务系统里,值班工作很少只是“看日志、找原因”这么简单。真正麻烦的是:请求量大之后,同一个错误可能来自多个服务、多个用户、多个批次,值班人员收到告警却不知道这条错误影响谁、该由谁处理、是不是已…

2026/8/30 7:38:08
从vibe coding到spec coding:打造可控的AI辅助编程工作流

从vibe coding到spec coding:打造可控的AI辅助编程工作流

当“Im done coding with AI”这类标题开始频繁出现在开发者社区时,很多人的真实态度并不是“我再也不碰 AI”,而是被 AI 编程工具“看起来很快、实际收尾很慢”的体验反复折磨之后,决定重新审视自己的使用方式。早期的兴奋很容易理解&#x…

2026/8/30 7:33:08