codex_agy_batch_20260704_2235 / latent_adversarial_diffusion_distillation · paper

Fast High-Resolution Image Synthesis with Latent Adversarial Diffusion Distillation

论文的核心贡献

  • 潜空间对抗扩散蒸馏 LADD: 论文不再把学生输出解码到像素空间后计算判别器损失,而是在 latent 空间中完成学生生成、教师特征提取和对抗监督。这降低了高分辨率训练的显存和计算负担,解决了 ADD 在像素空间判别时需要昂贵 decoder 的瓶颈。
  • 用生成式特征替代 DINOv2 判别式特征: LADD 将 real/fake latent 重新加噪后送入冻结的 teacher diffusion model,并抽取 attention block 后的 token 序列作为 discriminator head 的输入。这样判别器看到的是教师生成模型内部的多层语义/结构表征,而不是固定 DINOv2 的判别式视觉特征,避免了 518 x 518 分辨率限制,也更自然地支持多长宽比 latent token。
  • 用合成数据简化蒸馏目标: 论文使用 teacher 模型以较强 CFG 生成的合成 latent 作为 real 样本,而不是依赖真实图像数据集。作者认为合成样本的文本对齐更稳定,因此可以去掉 ADD 中额外的 distillation loss,让训练目标更接近纯对抗蒸馏。
  • 扩展到 SD3-Turbo 与编辑/修复任务: 论文将 LADD 应用于 8B 参数 Stable Diffusion 3,并展示文本到图像、图像编辑和 inpainting 场景。论文报告称 LADD 相比前作 ADD 训练更简单并带来更好的少步生成效果;这些 outperform/SOTA 类表述在本总结中均按“论文报告”处理。

复杂 Pipeline 深度解析

Figure 3 对比 ADD 与 LADD:上半部分依赖像素空间 decode 与 DINOv2 对抗损失,下半部分把 real/fake 比较搬到 latent/teacher feature 空间。

逐帧图解

第 1 帧:ADD 的像素空间负担
第 2 帧:Teacher 合成 latent 数据
第 3 帧:Student 生成 fake latent
第 4 帧:Teacher Features 上的 GAN
第 5 帧:ADD 到 LADD 的核心对比

文字版补充

  • 上面的逐帧图解只对论文原图做淡化、高亮、箭头和编号标注;被高亮区域仍是原论文图像内容。
  • 每一帧只解释当前深色区域,浅色区域作为上下文保留,避免在一张复杂图里来回跳读。
  • 若原图是概念图、算法伪代码或采样示意,而不是完整工程架构图,本文按辅助视觉证据解读,不把它包装成传统 pipeline。
  • 图中没有直接显示的指标、速度倍数、SOTA 结论或数据集细节,仍以论文正文报告为准,不从图解中过度外推。

关键术语

  • LADD: Latent Adversarial Diffusion Distillation,指在 latent 空间中进行 adversarial diffusion distillation 的完整框架。它的设计动机是消除像素空间判别带来的 decoder 开销和分辨率限制。
  • Generative Features: 从预训练扩散 teacher 中间层抽取的特征。它们不是为分类训练的判别式特征,而是生成模型在去噪过程中形成的结构/语义表征,用来给 discriminator heads 提供判断依据。
  • Noise-level specific feedback: LADD 在判别前重新加噪 latent,并用不同噪声级别控制反馈语义。高噪声更强调全局形状和布局,低噪声更强调纹理与细节。
  • Synthetic Data: 由 teacher 直接生成的训练目标 latent。论文使用它替代真实图像数据,主要是为了获得更稳定的图文对齐,并简化 ADD 中额外的蒸馏约束。

为什么 Figure 3 是核心

Figure 3 同时展示了旧方法 ADD 的复杂路径和新方法 LADD 的闭环路径:ADD 需要 encode/decode、DINOv2 特征和额外 distillation loss;LADD 则把 synthetic data generation、student prediction、teacher feature extraction 和 projected GAN loss 统一在 latent 空间中。它串联了论文的全部关键设计:高分辨率训练来自 latent-space closure,多长宽比支持来自 teacher token features,训练简化来自 synthetic data 和纯对抗目标。因此它是本论文最合适的 method/framework 图。