codex_agy_batch_20260704_1609 / flux_kontext · paper

FLUX.1 Kontext: Flow Matching for In-Context Image Generation and Editing in Latent Space

论文的核心贡献

  • 用序列拼接统一图像生成与编辑。 论文将冻结 FLUX VAE 编码得到的上下文图像 token 直接附加到目标图像 token 序列中,再送入 FLUX.1 Kontext 主干。这样做不要求输入图像和输出图像在像素网格上严格对齐,天然支持不同分辨率、不同宽高比以及多张上下文图像。相对于 channel-wise concatenation 或任务专属控制模块,这种设计把编辑问题改写成统一的视觉 in-context learning 问题。
  • 用 3D RoPE 区分目标图像和上下文图像。 当多个图像 token 被拼成同一条序列时,模型需要知道哪些 token 属于待生成目标、哪些属于参考上下文。论文为 token 使用 (t, h, w) 形式的位置编码:目标 token 设为 t=0,第 i 个上下文图像 token 设为 t=i。这个虚拟时间维度保留了每张图内部的二维空间结构,同时把不同图像块在逻辑坐标上分离。
  • 在 rectified flow / flow matching 目标下训练统一条件分布。 论文建模 p_theta(x | y, c),其中 x 是目标图像,y 是可选上下文图像,c 是文本提示。训练时在 latent 空间中对目标图像和噪声做线性插值,并让网络预测从噪声到数据的速度场。无上下文时省略 y token,从而保留文本到图像生成能力;有上下文时同一网络执行 in-context 编辑。
  • 通过 LADD 蒸馏提升交互速度。 论文报告使用 latent adversarial diffusion distillation 将采样步数大幅减少,使高分辨率生成和编辑进入数秒级交互范围。这里的速度和质量结论是 paper-reported;本文档没有独立复现实验,也没有验证其与所有对比系统在完全相同协议下的可比性。
  • 提出 KontextBench 作为多任务评测集。 论文构建了包含 1026 个图像-提示词对的 benchmark,覆盖局部编辑、全局编辑、角色参考、风格参考和文本编辑五类任务。它试图补足现有编辑评测中合成偏差、分辨率较低、任务覆盖窄的问题。相关优于或领先结论同样按 paper-reported 处理。

复杂 Pipeline 深度解析

Figure 4 展示 FLUX.1 Kontext:文本指令、目标 latent 和上下文图像 latent 进入统一 Transformer,经过双流与融合 DiT 后由 VAE 解码输出。

逐帧图解

第 1 帧:文本指令与上下文图像进入系统
第 2 帧:Visual Stream 分源标记
第 3 帧:先分流,再融合
第 4 帧:从目标 latent 解码输出

文字版补充

  • 上面的逐帧图解只对论文原图做淡化、高亮、箭头和编号标注;被高亮区域仍是原论文图像内容。
  • 每一帧只解释当前深色区域,浅色区域作为上下文保留,避免在一张复杂图里来回跳读。
  • 若原图是概念图、算法伪代码或采样示意,而不是完整工程架构图,本文按辅助视觉证据解读,不把它包装成传统 pipeline。
  • 图中没有直接显示的指标、速度倍数、SOTA 结论或数据集细节,仍以论文正文报告为准,不从图解中过度外推。

关键术语

Sequence concatenation 在这篇论文中不是简单的张量拼接,而是统一建模策略。上下文图像不再被硬性对齐到目标图像的通道维度,而是像语言上下文一样附加到 token 序列里。这样模型可以用同一套注意力机制处理单图、多图、不同分辨率和不同任务类型。

3D RoPE 的功能是为拼接后的视觉 token 提供三维坐标。h,w 保留图像内部空间关系,t 区分目标图像和上下文图像。这个设计的动机是让模型知道“这是参考图中的位置”还是“这是要生成图中的位置”,同时不破坏每张图内部的二维结构。

Rectified flow / flow matching 是训练目标。模型不是直接预测最终像素,而是在 latent 空间中学习从噪声到数据的速度场。该目标让 FLUX.1 Kontext 可以沿用 FLUX.1 文生图主干,同时扩展到带图像上下文的条件生成。

KontextBench 是论文提出的评测集,用来覆盖真实编辑需求中的多个任务类别。它的作用是评价模型是否能同时做好局部编辑、全局编辑、参考保持、风格迁移和文本修改,而不是只在单一编辑类型上优化。

为什么 Figure 4 是核心图

Figure 4 直接串联了论文的三个关键点:上下文图像如何进入模型、文本和视觉流如何融合、最终目标 latent 如何被解码成编辑结果。它不是结果图、表格或 teaser,而是 FLUX.1 Kontext 的方法/架构概览图。通过这张图可以看出,论文的核心并不是新增复杂控制网络,而是把图像上下文转成 token 并交给统一的 DiT/flow matching 主干处理。