云计算百科
云计算领域专业知识百科平台

(论文速读)DarkIR:稳健的微光图像恢复

论文题目:DarkIR: Robust Low-Light Image Restoration(DarkIR:稳健的微光图像恢复)

会议:CVPR2025

摘要:夜间或黑暗条件下的摄影通常会受到噪音、光线不足和模糊问题的困扰,这是因为环境昏暗和常见的长时间曝光。虽然去模糊和微光图像增强(LLie)在这些条件下是相关的,但大多数图像恢复方法都是单独解决这两个问题的。本文提出了一种用于多任务微光图像恢复的高效、稳健的神经网络。我们没有跟随当前基于变压器的模型的发展趋势,而是提出了新的注意机制来增强有效的CNN的接受场。与以前的方法相比,我们的方法在参数和MAC运算方面减少了计算代价。我们的模型DarkIR在流行的LOLBlur、LOLv2和Real-LOLBlur数据集上取得了新的最先进的结果,能够在真实世界的夜晚和黑暗图像上生成。

代码:https://github.com/cidautai/DarkIR


DarkIR:让夜间拍摄不再是噩梦的高效图像恢复网络

一、问题背景:夜间拍摄,到底难在哪?

我们都经历过这样的沮丧:在昏暗的餐厅、夜晚的街头举起手机拍照,结果要么一片漆黑,要么模糊不清,要么充满颗粒感噪声。这不是手机性能不够好,而是夜间摄影在物理层面上就面临三重叠加的退化:

$\\mathbf{y} = \\gamma(\\mathbf{x} \\otimes \\mathbf{k}) + \\mathbf{n}$

  • $\\mathbf{y}$:我们拍到的暗图
  • $\\mathbf{x}$:理想中清晰、明亮的场景
  • $\\mathbf{k}$:镜头模糊核(PSF),代表运动模糊
  • $\\mathbf{n}$:传感器噪声
  • $\\gamma$:动态范围压缩函数

为了让更多光线进入传感器,夜间摄影往往需要长曝光。长曝光意味着快门速度慢,手持拍摄的轻微抖动就会留下运动模糊。而手机传感器尺寸有限,暗光下噪声本就高,三种退化同时存在,共同毁掉一张照片。

【论文 Figure 1 — 展示有无模糊的低光图像,以及现有方法 vs DarkIR 的对比效果】

现有方法的根本缺陷

面对这一问题,学界长期以来分两条路线走:

  • 低光增强(LLIE):RetinexFormer、LEDNet、FourLLIE 等方法专注于把暗图变亮,但它们对模糊无能为力。
  • 图像去模糊:DeblurGAN-v2、NAFNet、Restormer 等方法专注于恢复清晰度,但在低光场景中严重失效。
  • 最自然的想法是将两步串联——先增光再去模糊,或者先去模糊再增光。但论文的实验数据给出了残酷的答案:

    【论文 Table 2 — 两步串联管道的量化结果】

    任何两步管道,PSNR 最高只有 18.33 dB,而 DarkIR 端到端达到 27.00 dB,差距接近 9 dB。这是因为两个任务之间存在强烈的相互干扰:未经修复的噪声会放大去模糊的误差,而未经去模糊的残影则会误导增光的方向。


    二、核心思路:分而治之,各司其职

    DarkIR 的出发点清晰而优雅:既然低光增强和去模糊是两种性质不同的任务,何不让网络的不同部分分别专精于此?

    论文观察到两个关键物理事实:

    • 低光问题本质上是全局的:图像的整体亮度与 Fourier 频域的振幅(amplitude)高度相关,而且这种相关性在不同分辨率下一致——这意味着可以在低分辨率下高效地做低光修复。
    • 去模糊问题本质上是局部的:运动模糊是空间域的非均匀退化,需要大感受野的空间注意力才能捕捉长程模糊核。

    于是,DarkIR 设计了一个非对称编码器-解码器网络:编码器在频域做低光增强,解码器在空间域做去模糊。

    【论文 Figure 2 — DarkIR 完整网络架构图,包含 EBlock、DBlock 和整体 encoder-decoder 流程】


    三、网络设计详解

    DarkIR 整体遵循 Metaformer 框架,将每个 block 分为两个部分:全局注意力模块(token mixer)+ 前馈网络(FFN)。但编码器和解码器采用了完全不同的专用设计。

    3.1 编码器块(EBlock)——频域低光增强

    EBlock 由两个核心组件构成:

    SpAM(空间注意力模块) 类似 NAFBlock,使用倒残差结构 + 简化通道注意力(SCA),通过门控机制(而非激活函数)提取空间信息。

    FreMLP(频域前馈网络) 这是 EBlock 最关键的设计:

  • 对特征图做快速 Fourier 变换(FFT)
  • 只操作振幅,不动相位(相位包含结构信息,不应干扰)
  • 通过 1×1 卷积 + LeakyReLU 增强振幅
  • 做逆 Fourier 变换(IFFT)回到空间域
  • 这种做法计算开销极低,却能精准地修正全局光照。编码器使用 stride 卷积逐层下采样,在更低的分辨率上用更少的 MACs 完成低光修复。

    架构引导损失:编码器最终输出一个 8× 下采样的中间重建图像 $\\hat{x}_{\\downarrow 8}$,并用额外损失监督:

    $L_{lol} = |x_{\\downarrow 8} - \\hat{x}_{\\downarrow 8}|_1$

    这个设计确保编码器"真的在做低光增强",而不是把任务都甩给解码器。

    3.2 解码器块(DBlock)——大感受野空间去模糊

    解码器的输入已经是光照修复后的编码特征,因此可以专注于一件事:恢复清晰度。

    DBlock 的核心创新是 Di-SpAM(膨胀空间注意力模块),灵感来自 LKA(大核注意力),但做了关键改进:

    • 使用 3 个并行的膨胀深度可分离卷积,膨胀率分别为 1、4、9
    • 三个分支的特征逐元素相乘融合,之后经简化通道注意力处理
    • 最终通过带门控的 FFN 输出

    三种不同膨胀率组合在一起,感受野大幅扩展,能捕捉长程的非均匀运动模糊,同时参数量远少于直接使用大核卷积。

    消融对比(Table 7):Di-SpAM vs LKA,参数减少 18%,计算减少 21%,PSNR 还提升 0.55 dB——这正是专用设计的价值所在。

    【论文 Table 7 — Di-SpAM vs LKA 消融对比】

    3.3 损失函数设计

    $\\mathcal{L} = \\lambda_p \\cdot L_{l1} + \\lambda_{pe} \\cdot L_{percep} + \\lambda_{ed} \\cdot L_{edge} + L_{lol}$

    四个损失各有分工:

    • $L_{l1}$(像素损失,$\\lambda_p=1$):保证像素级保真度
    • $L_{percep}$(LPIPS 感知损失,$\\lambda_{pe}=10^{-2}$):基于 VGG19 特征,保证视觉感知质量
    • $L_{edge}$(梯度边缘损失,$\\lambda_{ed}=50$):$|\\nabla x - \\nabla \\hat{x}|_2^2$,专门监督高频边缘细节的恢复
    • $L_{lol}$(架构引导损失):监督编码器中间输出,确保低光增强任务的正确解耦

    【论文 Table A(补充材料)— 不同损失函数组合的消融实验】


    四、实验结果

    4.1 与现有方法的全面比较(LOLBlur 数据集)

    LOLBlur 是低光去模糊任务的主要 benchmark,包含 10200 组训练对和 1800 组测试对,使用真实传感器噪声版本。

    【论文 Table 1 — LOLBlur 上的完整量化对比】

    核心数据:

    方法PSNR(dB)↑SSIM↑LPIPS↓参数量(M)↓MACs(G)↓
    LEDNet 25.74 0.850 0.224 7.4 38.65
    Restormer 26.72 0.902 0.133 26.13 144.25
    DarkIR-m 27.00 0.883 0.162 3.31 7.25
    DarkIR-l 27.30 0.898 0.137 12.96 27.19

    DarkIR-m 以比 LEDNet 少 55% 的参数量、少 81% 的计算量,取得了比 LEDNet 高 +1.26 dB PSNR 的效果。DarkIR-l 的 LPIPS 甚至与 Restormer 持平(0.137 vs 0.133),但参数量只有后者的 50%,计算量只有后者的 19%。

    【论文 Figure 3 — LOLBlur 测试集上的定性对比图】

    4.2 真实数据泛化能力(Real-LOLBlur)

    Real-LOLBlur 包含 482 张真实夜间模糊照片,没有 ground truth,使用盲质量评估指标评测。

    【论文 Table 5 — Real-LOLBlur 上的感知质量指标对比】

    DarkIR 在 MUSIQ(颜色对比度与清晰度)指标上达到 48.79,全面超越 LEDNet(39.11)和 RetinexFormer(45.30),证明了模型对真实世界场景的强泛化能力。

    【论文 Figure 5 — Real-LOLBlur 真实夜景定性对比】

    4.3 纯低光增强任务(LOLv2)

    将 DarkIR 扩展为多任务版本(DarkIR-mt,联合 LOLBlur + LOLv2 + LSRW 训练),在纯低光增强 benchmark 上同样取得 SOTA:

    【论文 Table 3 — LOLv2-Real 和 LOLv2-Synthetic 上的结果对比】

    DarkIR-mt 在 LOLv2-Real 上取得 23.87 dB,超过 RetinexFormer(22.80 dB),同时只需 7.25 GMACs 的计算量(RetinexFormer 为 15.57 GMACs)。

    【论文 Figure 7 — LOLv2-Real 上与 RetinexFormer 的定性对比】

    4.4 消融实验:每个设计的贡献

    Block 组合的影响(Table 6):

    【论文 Table 6 — 不同 block 组合的消融实验】

    • 只用 NAFBlock:26.24 dB
    • 只用 EBlock:26.17 dB(频域擅长增光但感受野不足)
    • 只用 DBlock:26.68 dB(空间能力强但缺少频域引导)
    • EBlock + DBlock(DarkIR-m):27.00 dB ✓

    两种专用 block 各取所长,组合后才能发挥最大效果。

    模型规模的可扩展性(Table 8):

    【论文 Table 8 — 不同 channel embedding 维度的扩展实验】

    三个版本覆盖了从边缘设备到服务器端的不同部署需求,且随参数量增加性能持续提升,说明架构设计具有良好的可扩展性。


    五、局限性与未来方向

    论文作者诚实地指出了一个现实问题:DarkIR 大量使用深度可分离卷积(depth-wise convolution)来降低参数量和 MACs,但这类操作在许多 GPU 架构上缺乏算术强度,实际推理速度的提升并不与 MACs 的减少成正比。换言之,理论计算量减少了 4 倍,实际运行速度未必有同等加速。

    未来工作方向:在保持低计算量的同时,探索对硬件更友好的算子设计,实现更大幅度的实际推理加速——这对真正落地到手机端至关重要。


    六、总结

    DarkIR 的贡献可以用三个词概括:分工、高效、强泛化。

    • 分工:编码器做频域低光增强,解码器做空间域去模糊,专用设计远胜通用模块。
    • 高效:DarkIR-m 以 3.31M 参数、7.25 GMACs,击败参数量是其 2 倍以上的所有竞品。
    • 强泛化:从合成数据集到真实夜景,从低光增强到联合去模糊,均取得 SOTA 或接近 SOTA 的结果。

    对于计算摄影领域而言,DarkIR 提供了一个清晰的范式:理解任务的物理本质,让网络的不同部分各司其职,往往比堆叠更多的通用注意力机制更加有效。

    赞(0)
    未经允许不得转载:网硕互联帮助中心 » (论文速读)DarkIR:稳健的微光图像恢复
    分享到: 更多 (0)

    评论 抢沙发

    评论前必须登录!