
📖标题:Multi-Mask Diffusion Language Models for Few-Step Generation
🌐来源:arXiv, 2607.19686v1
🛎️文章简介
🔸研究问题:如何解决掩码扩散模型因终端状态熵为零而难以进行一致性蒸馏加速的问题?
🔸主要贡献:论文提出MultiMDM,通过引入多掩码机制保留掩码结构并解决终端退化,实现了高质量少步生成。
📝重点思路
🔸设计多掩码前向过程,将单一吸收态扩展为多个掩码集合,每个干净Token映射到指定掩码,使前向轨迹在混合前偏向指定掩码,从而在反向过程中保留部分信息以支持草稿生成。
🔸推导闭式ELBO训练目标,包含干净Token重建项和掩码内识别项,该目标支持从预训练的单掩码扩散模型进行持续微调,无需从头训练。
🔸提出纯离散状态的一致性蒸馏方案,利用共享Gumbel噪声耦合构建低熵路径,将一致性目标定义为沿耦合路径的未来滤波后验,从而减少路径随机性并实现少步采样。
🔎分析总结
🔸在LM1B和OpenWebText数据集上的预训练实验显示,MultiMDM在困惑度与样本熵的权衡上优于现有的均匀态扩散和单掩码扩散基线,且从预训练模型持续微调效果更佳。
🔸经过一致性蒸馏后,MultiMDM在极少步数(如4步)生成下显著降低了生成困惑度,证明了多掩码教师模型能为蒸馏提供更丰富的中间状态信息。
🔸消融实验表明,增加掩码数量能提升性能,但在M=50左右达到饱和;将该方法适配到8B参数规模的LLaDA模型上,在数学和代码基准测试中也取得了改进,验证了其可扩展性。
💡个人观点
论文在离散扩散中引入了“多掩码”这一中间态,既避免了均匀态扩散中噪声与语义难以区分的问题,又解决了传统掩码扩散终端无信息的困境。

网硕互联帮助中心




评论前必须登录!
注册