一、为什么需要 DIFF?
在 Transformer 结构中,Attention 负责建模长距离依赖,FFN(Feed-Forward Network)负责特征变换。
但传统 FFN 存在两个明显问题:
内容无关:无论输入是雨条纹、雪块还是干净区域,FFN 都用同一套权重处理
空间建模弱:标准 FFN 是逐点 1×1 卷积,缺乏多尺度空间上下文
在 All-in-one Image Restoration(AIR) 中,这种“一刀切”的方式会导致:
-
干净区域被过度平滑
-
重度退化区域恢复不充分
-
不同退化之间特征纠缠
HOGformer 提出的 DIFF(Dynamic Interaction Feed-Forward),正是为了解决这些问题。
二、DIFF 做了什么?
DIFF 的核心思想是:让 FFN 变得“动态”和“空间感知”。
它由三个关键设计组成:
1️⃣ 多尺度空间上下文(Multi-scale Spatial Context)
并行使用:
-
3×3 深度卷积 → 捕捉局部细节(雨纹、边缘)
网硕互联帮助中心


评论前必须登录!
注册