codex_agy_batch_20260704_2235 / distribution_matching_distillation · paper

One-step Diffusion with Distribution Matching Distillation

论文的核心贡献

1. 基于分布匹配的单步扩散蒸馏

  • 具体做法: 训练一个 one-step generator \(G_\theta\),将随机噪声 \(z\) 一次前向映射为图像 \(x\)。训练时不要求学生逐步复现教师扩散模型的完整去噪轨迹,而是通过分布匹配梯度推动生成分布接近真实/教师分布。
  • 为什么重要: 单步生成器如果只做轨迹回归,很容易在复杂数据分布上损失细节和真实感。DMD 把目标提升到分布层面,使训练信号更接近“生成图像是否整体像真实图像”。
  • 相对旧方法解决的问题: 相比 progressive distillation、consistency model 等逐步压缩采样步数的方法,DMD 试图避免在压缩到 1 步时质量急剧下降。

2. 用真实/假数据两个 score function 构造分布匹配梯度

  • 具体做法: 对生成器输出的假图像加入随机强度噪声,得到 \(x_t\)。然后把 \(x_t\) 同时送入两个扩散去噪器:一个是真实数据 score function,另一个是假数据 score function。两者的 denoising score 差值近似给出 KL 散度下降方向,并反传给生成器。
  • 为什么重要: 在高维图像空间里直接计算真假分布之间的散度不可行。score function 提供了可训练、可反传的局部方向,使“分布匹配”变成实际可优化的目标。
  • 相对旧方法解决的问题: 它不依赖完整教师采样链的逐步监督,也不只靠 GAN 式判别器给一个真假标量,而是利用扩散模型的去噪方向作为更细粒度的训练信号。

3. 动态学习 fake score model

  • 具体做法: fake data score function 不是固定模型,而是随着生成器输出分布变化持续用 diffusion loss 在假图像上训练。
  • 为什么重要: 单步生成器在训练过程中不断变化,假分布也随之移动。动态 fake score model 能估计当前假分布的 score,从而让 real score 和 fake score 的差值更有意义。
  • 相对旧方法解决的问题: 避免用静态模型估计不断变化的生成分布,降低分布匹配梯度失真的风险。

4. 用 LPIPS 回归损失稳定训练并保留模式

  • 具体做法: 论文预先用多步扩散模型生成噪声-图像配对数据,在训练时偶尔加载相同噪声对应的教师输出,并对单步生成器结果施加 LPIPS regression loss。
  • 为什么重要: 纯分布匹配可能只保证整体分布接近,却不保证每个输入噪声都对应合理内容,也可能导致模式缺失。
  • 相对旧方法解决的问题: 回归分支为生成器提供锚点,约束其保留教师模型的多样性和粗结构,缓解模式崩塌或语义漂移。

5. 针对扩散时间步的加权策略

  • 具体做法: 论文为分布匹配梯度引入时间相关权重,控制不同噪声强度下梯度尺度的影响。
  • 为什么重要: 扩散不同时间步的 score 尺度差异很大,直接合并可能使训练被某些噪声区间主导。
  • 相对旧方法解决的问题: 该设计提升训练稳定性;相关质量提升和 FID 改善在本文中应理解为论文报告结果,未在此处做跨协议可比性复核。

复杂 Pipeline 深度解析

Figure 2/方法图展示 DMD:one-step generator 直接出 fake image,再通过 real/fake score 差形成分布匹配梯度,并用回归分支稳定结构。

逐帧图解

第 1 帧:单步生成器直接从噪声出图
第 2 帧:离线配对数据提供结构锚点
第 3 帧:假图像加噪后比较 score
第 4 帧:real-fake score 差形成梯度
第 5 帧:fake score model 动态跟随生成器

文字版补充

  • 上面的逐帧图解只对论文原图做淡化、高亮、箭头和编号标注;被高亮区域仍是原论文图像内容。
  • 每一帧只解释当前深色区域,浅色区域作为上下文保留,避免在一张复杂图里来回跳读。
  • 若原图是概念图、算法伪代码或采样示意,而不是完整工程架构图,本文按辅助视觉证据解读,不把它包装成传统 pipeline。
  • 图中没有直接显示的指标、速度倍数、SOTA 结论或数据集细节,仍以论文正文报告为准,不从图解中过度外推。

关键术语解释

  • Distribution Matching Distillation: 这不是简单的采样步数压缩,而是把教师扩散模型隐含的输出分布压缩到一个单步生成器里。核心是让学生输出分布与目标分布匹配。
  • Score Function: 在本文里指扩散去噪模型提供的局部方向信息。它不是分类分数,而是告诉 noisy sample 应该如何移动才能更接近某个数据分布。
  • Real Data Score Function: 代表目标/真实分布的方向,通常来自预训练扩散模型,是生成器学习“更真实”的参照。
  • Fake Data Score Function: 代表当前生成器输出分布的方向,随训练动态更新,用来刻画假分布自身。
  • Distribution Matching Gradient: real score 与 fake score 的差值所形成的生成器更新信号,功能是提高真实感并减少当前假分布特征。
  • Regression Loss: 使用离线教师样本进行 LPIPS 约束,功能是保留输入噪声到图像的结构对应关系和模式覆盖。

为什么 Figure 2 是论文核心

Figure 2 把 DMD 的两个关键训练机制放在同一张图里:左下方的配对回归分支负责稳定和保模式,右侧的 real/fake score 分支负责分布级真实感优化。它清楚说明 DMD 为什么能不同于传统逐步蒸馏:训练目标不只是复刻教师采样轨迹,而是用分布匹配梯度把单步生成器的输出整体推向高质量扩散模型的输出分布。文中关于速度、FID、CLIP score 等优势均为论文报告结果;这里未单独验证跨方法实验协议的完全可比性。