codex_agy_batch_20260704_1609 / guided_diffusion_distillation · paper

On Distillation of Guided Diffusion Models

论文的核心贡献

  • 支持 guidance weight 的单模型蒸馏: 第一阶段把 classifier-free guidance 中条件预测和无条件预测按权重组合后的输出,蒸馏到一个学生模型中。学生模型把连续的 guidance weight w 作为额外输入,因此同一个模型可以覆盖不同的质量-多样性权衡。重要性在于,它把原本每个采样步需要两次模型评估的 guided sampling,压缩成一次模型评估。
  • 把 progressive distillation 扩展到 guided diffusion: 第二阶段从第一阶段得到的 w-conditioned 学生模型出发,反复把 N 步教师蒸馏成 N/2 步学生。这样避免直接让一个学生模型一次性拟合长去噪轨迹,降低了极少步采样时的训练难度。
  • 同时覆盖 pixel-space 和 latent-space diffusion: 作者把两阶段蒸馏用于像素空间 DDPM,也用于 Stable Diffusion 这类 latent diffusion。论文报告称,该方法在 ImageNet、CIFAR-10、LAION 文本生成、图像翻译和 inpainting 中都能在少步数下保持较好质量。
  • 提出少步随机采样过程: 除了 deterministic sampler,论文还给出 stochastic sampling:先做大步长 denoise,再通过 add noise 回到中间噪声水平,为下一次去噪提供修正空间。这个设计是为了缓解极少步采样中误差累积和细节损失。

复杂 Pipeline 深度解析

Figure 5 是蒸馏模型的采样流程图,展示 deterministic 与 stochastic 两种 4-step denoising 路由。

逐帧图解

第 1 帧:同一个蒸馏模型,两种采样路由
第 2 帧:Deterministic:只沿去噪箭头前进
第 3 帧:Stochastic:去噪之间插入加噪回退
第 4 帧:同样 4 次 Denoise,不同状态规则

文字版补充

  • 上面的逐帧图解只对论文原图做淡化、高亮、箭头和编号标注;被高亮区域仍是原论文图像内容。
  • 每一帧只解释当前深色区域,浅色区域作为上下文保留,避免在一张复杂图里来回跳读。
  • 若原图是概念图、算法伪代码或采样示意,而不是完整工程架构图,本文按辅助视觉证据解读,不把它包装成传统 pipeline。
  • 图中没有直接显示的指标、速度倍数、SOTA 结论或数据集细节,仍以论文正文报告为准,不从图解中过度外推。

关键术语

  • Classifier-free guidance: 在本文中,它是教师模型的基础生成机制。推理时用条件预测和无条件预测的组合来增强条件控制,但代价是每一步通常需要两次网络评估。本文第一阶段蒸馏的目标就是把这个组合输出变成单模型输出。
  • Guidance weight w w 控制生成质量与多样性的权衡。本文把 w 编码后输入学生模型,使蒸馏模型不是固定在某一个 guidance strength 上,而是能覆盖一个连续区间。
  • Stage-one distillation: 把 classifier-free guided teacher 的合成输出蒸馏成一个 w-conditioned student。它主要减少每步模型评估次数。
  • Stage-two progressive distillation: 把已经得到的学生模型继续从多步采样压缩到少步采样。它主要减少采样步数。
  • Deterministic / stochastic sampling: deterministic 路径只做大步 denoise;stochastic 路径在 denoise 之间插入 add-noise 回退。两者都使用蒸馏后的单模型,但随机路径试图改善极少步采样的稳定性。

为什么 Figure 5 是核心图

Figure 5 把论文的两个主要贡献串在同一条推理路径里:每个 Denoise 箭头内部代表第一阶段得到的 w-conditioned 单模型,箭头数量很少则代表第二阶段 progressive distillation 对时间步的压缩。图中的 Add noise 分支进一步说明,作者并不只依赖确定性大步跳跃,还为极少步生成设计了随机修正机制。

论文中关于 “up to 256x faster”、“at least 10-fold” 和少步数匹配教师质量的说法,均应理解为作者在其设定、数据集、指标和实现下报告的结果;这里没有独立验证跨方法、跨协议的可比性。