codex_agy_batch_20260704_1609 / rectified_flow_transformers · paper

这篇论文的关键价值在于,它跳出了传统扩散模型“使用 U-Net 结合交叉注意力进行单向文本引导”以及“沿着弯曲轨迹去噪”的旧范式。作者通过引入具有双向信息交互的双流多模态 Transformer 架构(MM-DiT),并结合改进的 Rectified Flow(修正流)直线轨迹与重加权采样策略,论文报告其缓解了模型对复杂文本遵循困难(尤其是图像内的文字拼写)以及高分辨率生成推理成本过高的痛点。

论文的核心贡献

  • 提出针对 Rectified Flow 的新型噪声采样策略 (Tailored SNR Samplers): 论文采用 Logit-Normal 等分布在训练时对时间步进行采样,从而为中间的去噪时间步赋予更大的权重。这解决了标准 Rectified Flow 均匀采样导致难度最高的中间生成阶段学习不足的问题,在保持直线轨迹优势(少步推理)的同时,论文报告其采样质量提升,并在作者实验设置下优于传统扩散模型目标函数。
  • 设计双流多模态扩散 Transformer 架构 (MM-DiT): 作者放弃了在 U-Net 中用固定文本特征进行交叉注意力的做法,而是为图像和文本标记(Tokens)分配了两组独立的网络权重,并在同一个自注意力块中进行拼接计算。这种双向信息流动让图像和文本在同一个特征空间中深度混合,论文报告其增强了模型对复杂 Prompt 的理解能力和图像内排版文字生成能力。
  • 验证可预测的模型扩展规律 (Predictable Scaling Trends): 论文系统地将模型参数规模扩展至 8B,并展示验证损失(Validation Loss)的平滑下降与各项生成质量指标(如自动评测指标及人类偏好评分)呈现出较强相关性。这为大规模生成模型的训练提供了明确的扩展证据,表明该架构在作者实验范围内仍有继续扩展的潜力。

复杂 Pipeline 深度解析

Figure 2 展示 SD3/MM-DiT 架构:三路文本编码器、图像 latent token、timestep 调制进入 MM-DiT 主干,最后输出 rectified-flow 预测。

逐帧图解

第 1 帧:三路文本编码器输入 Caption
第 2 帧:图像潜变量与时间步进入主干
第 3 帧:MM-DiT 堆叠反复交互
第 4 帧:单个 block:独立权重,共同注意力
第 5 帧:输出头回到潜空间预测

文字版补充

  • 上面的逐帧图解只对论文原图做淡化、高亮、箭头和编号标注;被高亮区域仍是原论文图像内容。
  • 每一帧只解释当前深色区域,浅色区域作为上下文保留,避免在一张复杂图里来回跳读。
  • 若原图是概念图、算法伪代码或采样示意,而不是完整工程架构图,本文按辅助视觉证据解读,不把它包装成传统 pipeline。
  • 图中没有直接显示的指标、速度倍数、SOTA 结论或数据集细节,仍以论文正文报告为准,不从图解中过度外推。