云计算百科
云计算领域专业知识百科平台

【yolo26改进】CVPR 2026 CPUBone:GrFuMBConv 分组融合倒置瓶颈,即插即用!附二次创新

一、为什么需要 GrFuMBConv?

主流轻量模型(MobileNet / EfficientNet / RepViT 等)普遍用 Depthwise Convolution(DWConv)​ 来压低 MACs。但 CPUBone 论文通过大量实测揭示了一个反直觉的事实:

DWConv 虽然 MACs 极低,但在 CPU 上的硬件执行效率(MACpS = MACs per second)同样极低,导致实际延迟并不占优。

原因有两个:

  • DWConv 逐通道独立计算,并行度极低,而这恰恰是 CPU 的短板(CPU 并行能力远弱于 GPU / NPU)
  • DWConv 内存访问成本(MAC)偏高,进一步拖慢速度

CPUBone 的解决思路不是换回标准卷积,而是从两个维度直接削减 MACs,同时保证 MACpS 不掉:

  • 分组卷积(groups=2):把标准卷积的 groups 设为 2,MACs 直接减半(论文公式 (2):$M \\propto 1/\\text{groups}$)
  • 小卷积核(2×2):把 3×3 换成 2×2,MACs 再降约 56%(公式 (3):$M \\propto K_H \\times K_W$)
  • 赞(0)
    未经允许不得转载:网硕互联帮助中心 » 【yolo26改进】CVPR 2026 CPUBone:GrFuMBConv 分组融合倒置瓶颈,即插即用!附二次创新
    分享到: 更多 (0)

    评论 抢沙发

    评论前必须登录!