Score-Based Generative Modeling through Stochastic Differential Equations
论文的核心贡献
- 提出连续时间的统一 SDE 框架: 作者用前向 SDE(添加连续噪声)和逆向 SDE(连续去噪)取代离散马尔可夫链,并说明先前的 SMLD 和 DDPM 可以看作方差爆炸(VE)和方差保持(VP)两类 SDE 的特定离散化近似。这重要之处在于,它把原本分散的 score matching、Langevin dynamics 和 diffusion probabilistic modeling 放进同一个连续时间框架中讨论。
- 引入 Predictor-Corrector (PC) 混合采样器: 在求解逆向 SDE 生成数据时,论文结合通用数值 SDE 求解器(Predictor,先沿逆向动力学推进)和基于分数的 MCMC 方法(Corrector,在当前噪声尺度校正分布误差)。这种做法针对单纯离散求解器的截断误差累积问题,用局部校正提高样本质量;论文报告其在 CIFAR-10 上取得当时很强的 FID 和 Inception Score。
- 推导 Probability Flow ODE 支持似然计算: 论文证明每个 SDE 都有一个对应的确定性常微分方程,二者在任意时间具有相同的边缘概率密度。这个 ODE 视角允许使用黑盒 ODE 求解器采样,并可结合瞬时变量替换公式计算对数似然,补上早期分数生成模型难以直接评估 likelihood 的短板。
- 实现免重训的条件/逆问题生成: 利用逆向 SDE 的分析形式,作者将条件信息写进逆向过程,展示图像修复、上色和类别条件生成等任务。这意味着可以从一个无条件 score model 出发,在采样阶段引入观测约束,而不是为每个逆问题重新训练完整生成模型。
复杂 Pipeline 深度解析
Figure 2 展示 score-based SDE 的总流程:Forward SDE 从数据扩散到先验,Reverse SDE 或 Probability Flow ODE 再从先验回到数据。
逐帧图解
文字版补充
- 上面的逐帧图解只对论文原图做淡化、高亮、箭头和编号标注;被高亮区域仍是原论文图像内容。
- 每一帧只解释当前深色区域,浅色区域作为上下文保留,避免在一张复杂图里来回跳读。
- 若原图是概念图、算法伪代码或采样示意,而不是完整工程架构图,本文按辅助视觉证据解读,不把它包装成传统 pipeline。
- 图中没有直接显示的指标、速度倍数、SOTA 结论或数据集细节,仍以论文正文报告为准,不从图解中过度外推。
关键术语解析
- Stochastic Differential Equation (SDE): 在本文中,SDE 是定义扩散和生成过程的连续时间引擎。它把“固定若干噪声层”的离散设计转化为可任意离散化、可调用成熟数值求解器的连续动力系统。
- Score: 指 $\nabla_{\mathbf{x}}\log p_t(\mathbf{x})$,即当前噪声水平下对数密度对数据的梯度。它的功能不是直接给出样本概率,而是告诉采样器该往哪个方向移动才能更接近高概率数据区域。
- Reverse-time SDE: 前向扩散过程的时间反演形式。它依赖未知的真实 score,因此论文用神经网络估计 score,再把估计结果代入逆向方程生成样本。
- Probability Flow ODE: 与 SDE 共享时间边缘分布的确定性方程。它去掉随机布朗项,但通过修正漂移项保留相同的分布演化,因此可以支持确定性采样和 likelihood 评估。
- Predictor-Corrector Sampler: 一种混合采样范式。Predictor 用数值 SDE 求解器推进一步,Corrector 用当前时间的 score 执行 MCMC 校正,目标是在有限离散步数下减少偏离目标边缘分布的误差。
为什么 Figure 2 是论文核心
Figure 2 不是普通结果图,而是整篇论文的方法骨架。左半部分对应前向 SDE:数据被连续加噪并映射到先验;右半部分对应逆向生成:利用 score 反向求解 SDE 或 ODE,从先验回到数据。图中的红色随机路径和白色 ODE 路径同时串起采样质量、似然计算和可控逆问题求解这几条贡献线,因此它是本文最适合作为方法说明的 framework 图。