Latent Consistency Models: Synthesizing High-Resolution Images with Few-Step Inference
论文的核心贡献
- 提出 Latent Consistency Models (LCMs): 论文不在像素空间训练一致性模型,而是使用 Stable Diffusion 的预训练自编码器,在压缩后的 latent space 中学习 consistency mapping。这样可以避开高分辨率像素空间的巨大计算量,让一致性模型服务于 512x512、768x768 等高分辨率文生图场景,而不是停留在低分辨率像素生成。
- 提出 one-stage guided consistency distillation: 作者把 classifier-free guidance 写入 augmented probability flow ODE,让学生 LCM 直接学习带 guidance 的 ODE 轨迹端点。这样避免了为支持 CFG 而先训练无引导学生、再做额外引导蒸馏的复杂两阶段流程。
- 引入 Skipping-Step 蒸馏: 训练时不只约束相邻时间步的一致性,而是让相隔
k步的两个轨迹点映射到同一个干净端点。对 Stable Diffusion 这类长时间步调度来说,相邻点差异太小,损失信号弱;跳步拉大状态差距,使一致性训练更有效。 - 提出 Latent Consistency Fine-tuning (LCF): 对定制数据集,论文提出直接微调预训练 LCM,而不是先微调一个教师扩散模型再重新蒸馏。这降低了定制风格或小众数据场景下获得少步推理模型的训练成本。
- 少步推理效果为论文报告结论: 论文报告 LCM 在 LAION-Aesthetics 子集上,在 1-4 step 区间优于多种基线,并称其达到 few-step text-to-image generation 的 state-of-the-art 表现。这里未独立复核所有数据集、指标定义、采样协议和分辨率条件,因此该类强结论应标注为 paper-reported,而不是外部可比 leaderboard 结论。
复杂 Pipeline 深度解析
这篇论文没有真实 pipeline 图;这里使用 Algorithm 1 伪代码作为辅助视觉证据,只解释 LCD 训练流程,不把它称为架构图。
逐帧图解
文字版补充
- 上面的逐帧图解只对论文原图做淡化、高亮、箭头和编号标注;被高亮区域仍是原论文图像内容。
- 每一帧只解释当前深色区域,浅色区域作为上下文保留,避免在一张复杂图里来回跳读。
- 若原图是概念图、算法伪代码或采样示意,而不是完整工程架构图,本文按辅助视觉证据解读,不把它包装成传统 pipeline。
- 图中没有直接显示的指标、速度倍数、SOTA 结论或数据集细节,仍以论文正文报告为准,不从图解中过度外推。
关键术语
- Latent Consistency Model: 在 latent space 中学习 consistency function 的模型。它的功能是把 noisy latent 直接映射到同一轨迹对应的干净 latent 端点,动机是用少步推理替代长链式去噪。
- Augmented PF-ODE: 把 classifier-free guidance 合入 probability flow ODE 后得到的确定性反向轨迹。它让蒸馏目标天然包含文本条件与 guidance scale,不需要额外的后处理式引导阶段。
- Skipping-Step: 在蒸馏损失中跨越
k个时间步做一致性约束。它解决相邻步状态差别过小、训练信号弱的问题,是论文加速 LCD 收敛的重要技巧。 - Latent Consistency Fine-tuning: 在已有 LCM 上针对新数据继续训练的方案。它服务于定制数据集,目标是避免为每个定制场景重新训练并蒸馏一个完整教师扩散模型。
视觉证据结论
本文没有可接受的真实 pipeline / framework / architecture figure。最终视觉证据采用 figures/paper_page_007_closest_overview_algorithm1_accepted.png 作为 closest_overview pseudocode,用来说明 Algorithm 1 的训练流程;它不应被标注为 pipeline figure。