Improved Distribution Matching Distillation for Fast Image Synthesis
论文的核心贡献
- 消除回归损失,实现更廉价的大规模训练: 原始 DMD 依赖预计算的“噪声-图像”配对数据来计算回归损失,以稳定训练。本文直接去除这一目标,避免用教师确定性采样器生成数百万配对样本,使蒸馏更容易扩展到 SDXL 这类大规模文本到图像模型。相对旧方法,这保留了分布匹配“不绑定单条采样轨迹”的优势,也减少了训练前的数据构造成本。
- 用双时间尺度更新规则稳定纯分布匹配: 去掉回归损失后,生成器分布持续变化,fake score function 如果学习滞后,会给生成器提供偏差梯度。作者让 fake score function 比生成器更新更频繁,例如多次 fake score 更新对应一次生成器更新,使其更好地追踪当前生成分布。这个机制替代了原先回归损失的稳定器角色。
- 引入 GAN 损失和真实数据监督: 仅依赖教师模型 real score function 时,学生可能继承教师近似误差。DMD2 在分布匹配框架中加入 GAN 判别器,用真实图像和生成图像进行对抗训练,让学生除向教师分布靠近外,还能直接接收真实数据分布的反馈。论文报告称,这有助于学生生成器在部分设置下超过教师质量。
- 用 backward simulation 缓解多步生成的训练-推理偏差: 多步蒸馏时,如果训练输入来自真实图像加噪,而推理输入来自学生上一步生成结果,就会出现域偏差。Backward simulation 在训练中让学生模型先模拟推理过程,生成带有自身误差特征的中间输入,再训练下一步去噪,从而更贴近实际推理分布。
复杂 Pipeline 深度解析
Figure 3 展示 iDMD 的训练闭环:少步学生生成 fake image,real/fake score 差提供 DMD 梯度,GAN 分支接入真实数据反馈。
逐帧图解
文字版补充
- 上面的逐帧图解只对论文原图做淡化、高亮、箭头和编号标注;被高亮区域仍是原论文图像内容。
- 每一帧只解释当前深色区域,浅色区域作为上下文保留,避免在一张复杂图里来回跳读。
- 若原图是概念图、算法伪代码或采样示意,而不是完整工程架构图,本文按辅助视觉证据解读,不把它包装成传统 pipeline。
- 图中没有直接显示的指标、速度倍数、SOTA 结论或数据集细节,仍以论文正文报告为准,不从图解中过度外推。
关键术语
- Distribution Matching Distillation (DMD): 本文的技术基础。它关注学生最终输出分布是否匹配教师/目标分布,而不是要求学生沿着教师的采样轨迹做逐点回归,因此理论上给学生更大的映射自由度。
- Regression loss: 原始 DMD 中用于稳定训练的附加项。本文认为它既昂贵,又把学生绑定到教师采样路径上,因此成为 DMD2 首先移除的组件。
- Two Time-scale Update Rule: DMD2 的稳定训练机制。它让 fake score function 更快更新,以便追踪非平稳的学生生成分布,降低 fake score 滞后造成的梯度偏差。
- GAN loss: DMD2 用来引入真实数据监督的补充目标。它不是替代分布匹配,而是与 DMD 梯度并行更新生成器。
- Backward simulation: 多步学生模型的训练策略。它用学生自身生成的中间状态模拟推理时输入,避免训练时“加噪真图”和推理时“学生生成中间态”之间的分布错位。
为什么 Figure 3 是核心图
Figure 3 同时串联了 DMD2 的三个关键设计:去掉回归损失后的分布匹配主路径、用于稳定 fake score 的 diffusion loss 路径,以及引入真实图像监督的 GAN loss 路径。它不是结果图或示例图,而是完整展示了学生生成器、教师 real score、可训练 fake score、判别器和各类梯度如何相互作用的训练框架图。