论文题目:DarkIR: Robust Low-Light Image Restoration(DarkIR:稳健的微光图像恢复)
会议:CVPR2025
摘要:夜间或黑暗条件下的摄影通常会受到噪音、光线不足和模糊问题的困扰,这是因为环境昏暗和常见的长时间曝光。虽然去模糊和微光图像增强(LLie)在这些条件下是相关的,但大多数图像恢复方法都是单独解决这两个问题的。本文提出了一种用于多任务微光图像恢复的高效、稳健的神经网络。我们没有跟随当前基于变压器的模型的发展趋势,而是提出了新的注意机制来增强有效的CNN的接受场。与以前的方法相比,我们的方法在参数和MAC运算方面减少了计算代价。我们的模型DarkIR在流行的LOLBlur、LOLv2和Real-LOLBlur数据集上取得了新的最先进的结果,能够在真实世界的夜晚和黑暗图像上生成。
代码:https://github.com/cidautai/DarkIR
DarkIR:让夜间拍摄不再是噩梦的高效图像恢复网络
一、问题背景:夜间拍摄,到底难在哪?
我们都经历过这样的沮丧:在昏暗的餐厅、夜晚的街头举起手机拍照,结果要么一片漆黑,要么模糊不清,要么充满颗粒感噪声。这不是手机性能不够好,而是夜间摄影在物理层面上就面临三重叠加的退化:

:我们拍到的暗图
:理想中清晰、明亮的场景
:镜头模糊核(PSF),代表运动模糊
:传感器噪声
:动态范围压缩函数
为了让更多光线进入传感器,夜间摄影往往需要长曝光。长曝光意味着快门速度慢,手持拍摄的轻微抖动就会留下运动模糊。而手机传感器尺寸有限,暗光下噪声本就高,三种退化同时存在,共同毁掉一张照片。

【论文 Figure 1 — 展示有无模糊的低光图像,以及现有方法 vs DarkIR 的对比效果】
现有方法的根本缺陷
面对这一问题,学界长期以来分两条路线走:
最自然的想法是将两步串联——先增光再去模糊,或者先去模糊再增光。但论文的实验数据给出了残酷的答案:

【论文 Table 2 — 两步串联管道的量化结果】
任何两步管道,PSNR 最高只有 18.33 dB,而 DarkIR 端到端达到 27.00 dB,差距接近 9 dB。这是因为两个任务之间存在强烈的相互干扰:未经修复的噪声会放大去模糊的误差,而未经去模糊的残影则会误导增光的方向。
二、核心思路:分而治之,各司其职
DarkIR 的出发点清晰而优雅:既然低光增强和去模糊是两种性质不同的任务,何不让网络的不同部分分别专精于此?
论文观察到两个关键物理事实:
- 低光问题本质上是全局的:图像的整体亮度与 Fourier 频域的振幅(amplitude)高度相关,而且这种相关性在不同分辨率下一致——这意味着可以在低分辨率下高效地做低光修复。
- 去模糊问题本质上是局部的:运动模糊是空间域的非均匀退化,需要大感受野的空间注意力才能捕捉长程模糊核。
于是,DarkIR 设计了一个非对称编码器-解码器网络:编码器在频域做低光增强,解码器在空间域做去模糊。

【论文 Figure 2 — DarkIR 完整网络架构图,包含 EBlock、DBlock 和整体 encoder-decoder 流程】
三、网络设计详解
DarkIR 整体遵循 Metaformer 框架,将每个 block 分为两个部分:全局注意力模块(token mixer)+ 前馈网络(FFN)。但编码器和解码器采用了完全不同的专用设计。
3.1 编码器块(EBlock)——频域低光增强
EBlock 由两个核心组件构成:
SpAM(空间注意力模块) 类似 NAFBlock,使用倒残差结构 + 简化通道注意力(SCA),通过门控机制(而非激活函数)提取空间信息。
FreMLP(频域前馈网络) 这是 EBlock 最关键的设计:
这种做法计算开销极低,却能精准地修正全局光照。编码器使用 stride 卷积逐层下采样,在更低的分辨率上用更少的 MACs 完成低光修复。
架构引导损失:编码器最终输出一个 8× 下采样的中间重建图像
,并用额外损失监督:

这个设计确保编码器"真的在做低光增强",而不是把任务都甩给解码器。
3.2 解码器块(DBlock)——大感受野空间去模糊
解码器的输入已经是光照修复后的编码特征,因此可以专注于一件事:恢复清晰度。
DBlock 的核心创新是 Di-SpAM(膨胀空间注意力模块),灵感来自 LKA(大核注意力),但做了关键改进:
- 使用 3 个并行的膨胀深度可分离卷积,膨胀率分别为 1、4、9
- 三个分支的特征逐元素相乘融合,之后经简化通道注意力处理
- 最终通过带门控的 FFN 输出
三种不同膨胀率组合在一起,感受野大幅扩展,能捕捉长程的非均匀运动模糊,同时参数量远少于直接使用大核卷积。
消融对比(Table 7):Di-SpAM vs LKA,参数减少 18%,计算减少 21%,PSNR 还提升 0.55 dB——这正是专用设计的价值所在。

【论文 Table 7 — Di-SpAM vs LKA 消融对比】
3.3 损失函数设计

四个损失各有分工:
(像素损失,
):保证像素级保真度
(LPIPS 感知损失,
):基于 VGG19 特征,保证视觉感知质量
(梯度边缘损失,
):
,专门监督高频边缘细节的恢复
(架构引导损失):监督编码器中间输出,确保低光增强任务的正确解耦

【论文 Table A(补充材料)— 不同损失函数组合的消融实验】
四、实验结果
4.1 与现有方法的全面比较(LOLBlur 数据集)
LOLBlur 是低光去模糊任务的主要 benchmark,包含 10200 组训练对和 1800 组测试对,使用真实传感器噪声版本。

【论文 Table 1 — LOLBlur 上的完整量化对比】
核心数据:
| LEDNet | 25.74 | 0.850 | 0.224 | 7.4 | 38.65 |
| Restormer | 26.72 | 0.902 | 0.133 | 26.13 | 144.25 |
| DarkIR-m | 27.00 | 0.883 | 0.162 | 3.31 | 7.25 |
| DarkIR-l | 27.30 | 0.898 | 0.137 | 12.96 | 27.19 |
DarkIR-m 以比 LEDNet 少 55% 的参数量、少 81% 的计算量,取得了比 LEDNet 高 +1.26 dB PSNR 的效果。DarkIR-l 的 LPIPS 甚至与 Restormer 持平(0.137 vs 0.133),但参数量只有后者的 50%,计算量只有后者的 19%。

【论文 Figure 3 — LOLBlur 测试集上的定性对比图】
4.2 真实数据泛化能力(Real-LOLBlur)
Real-LOLBlur 包含 482 张真实夜间模糊照片,没有 ground truth,使用盲质量评估指标评测。

【论文 Table 5 — Real-LOLBlur 上的感知质量指标对比】
DarkIR 在 MUSIQ(颜色对比度与清晰度)指标上达到 48.79,全面超越 LEDNet(39.11)和 RetinexFormer(45.30),证明了模型对真实世界场景的强泛化能力。

【论文 Figure 5 — Real-LOLBlur 真实夜景定性对比】
4.3 纯低光增强任务(LOLv2)
将 DarkIR 扩展为多任务版本(DarkIR-mt,联合 LOLBlur + LOLv2 + LSRW 训练),在纯低光增强 benchmark 上同样取得 SOTA:

【论文 Table 3 — LOLv2-Real 和 LOLv2-Synthetic 上的结果对比】
DarkIR-mt 在 LOLv2-Real 上取得 23.87 dB,超过 RetinexFormer(22.80 dB),同时只需 7.25 GMACs 的计算量(RetinexFormer 为 15.57 GMACs)。

【论文 Figure 7 — LOLv2-Real 上与 RetinexFormer 的定性对比】
4.4 消融实验:每个设计的贡献
Block 组合的影响(Table 6):

【论文 Table 6 — 不同 block 组合的消融实验】
- 只用 NAFBlock:26.24 dB
- 只用 EBlock:26.17 dB(频域擅长增光但感受野不足)
- 只用 DBlock:26.68 dB(空间能力强但缺少频域引导)
- EBlock + DBlock(DarkIR-m):27.00 dB ✓
两种专用 block 各取所长,组合后才能发挥最大效果。
模型规模的可扩展性(Table 8):

【论文 Table 8 — 不同 channel embedding 维度的扩展实验】
三个版本覆盖了从边缘设备到服务器端的不同部署需求,且随参数量增加性能持续提升,说明架构设计具有良好的可扩展性。
五、局限性与未来方向
论文作者诚实地指出了一个现实问题:DarkIR 大量使用深度可分离卷积(depth-wise convolution)来降低参数量和 MACs,但这类操作在许多 GPU 架构上缺乏算术强度,实际推理速度的提升并不与 MACs 的减少成正比。换言之,理论计算量减少了 4 倍,实际运行速度未必有同等加速。
未来工作方向:在保持低计算量的同时,探索对硬件更友好的算子设计,实现更大幅度的实际推理加速——这对真正落地到手机端至关重要。
六、总结
DarkIR 的贡献可以用三个词概括:分工、高效、强泛化。
- 分工:编码器做频域低光增强,解码器做空间域去模糊,专用设计远胜通用模块。
- 高效:DarkIR-m 以 3.31M 参数、7.25 GMACs,击败参数量是其 2 倍以上的所有竞品。
- 强泛化:从合成数据集到真实夜景,从低光增强到联合去模糊,均取得 SOTA 或接近 SOTA 的结果。
对于计算摄影领域而言,DarkIR 提供了一个清晰的范式:理解任务的物理本质,让网络的不同部分各司其职,往往比堆叠更多的通用注意力机制更加有效。
网硕互联帮助中心





评论前必须登录!
注册