一、为什么需要 GrFuMBConv?
主流轻量模型(MobileNet / EfficientNet / RepViT 等)普遍用 Depthwise Convolution(DWConv) 来压低 MACs。但 CPUBone 论文通过大量实测揭示了一个反直觉的事实:
DWConv 虽然 MACs 极低,但在 CPU 上的硬件执行效率(MACpS = MACs per second)同样极低,导致实际延迟并不占优。
原因有两个:
- DWConv 逐通道独立计算,并行度极低,而这恰恰是 CPU 的短板(CPU 并行能力远弱于 GPU / NPU)
- DWConv 内存访问成本(MAC)偏高,进一步拖慢速度
CPUBone 的解决思路不是换回标准卷积,而是从两个维度直接削减 MACs,同时保证 MACpS 不掉:
网硕互联帮助中心



评论前必须登录!
注册