M6-067M6: Multimodal & Generative ModelsFlow Matching & Rectified FlowEasy
Mastery:

Flow Matching & Rectified Flow: 解释 Flow Matching 的核心目标与训练损失。

📐 Mathematical Definition
LFM=Et,x0,x1∥vθ(xt,t)−(x1−x0)∥2,xt=(1−t)x0+tx1\mathcal{L}_{\text{FM}}=\mathbb{E}_{t,x_0,x_1}\left\|v_\theta(x_t,t)-(x_1-x_0)\right\|^2,\quad x_t=(1-t)x_0+tx_1
⚡ Executive Summary
Core Concept: 学习一个向量场 v_θ(x,t) 使 ODE dx/dt=v 把噪声输运到数据;用回归'条件向量场'的 MSE 训练。

📌 Key Takeaways

  • •
    定义一条从噪声 x_0 到数据 x_1 的路径 x_t
  • •
    网络学习该路径的'速度'(向量场)v_θ
  • •
    损失:回归'目标速度'(直线路径下即 x_1−x_0)

📐 Mathematical Derivations

数学机理:<strong>Flow Matching(Lipman 等 2023)</strong> 的核心思想——(1) <strong>连续流</strong>——定义一条从<strong>噪声分布</strong>到<strong>数据分布</strong>的连续路径:用 ODE dx/dt=v(x,t) 描述'粒子如何移动';若知道正确的向量场 v,则从噪声出发积分即可生成数据。(2) <strong>条件路径(训练用)</strong>——对每个训练样本 (x_0,x_1)(x_0∼噪声、x_1∼数据),定义一条<strong>连接它们的路径</strong>;最简单是<strong>直线</strong>:x_t=(1−t)·x_0+t·x_1(t∈[0,1]),其<strong>速度</strong>为常数 v=x_1−x_0(因为 d/dt x_t=x_1−x_0)。(3) <strong>训练损失</strong>——让网络回归这个条件速度:L_FM=E_{t,x_0,x_1}[‖v_θ(x_t,t)−(x_1−x_0)‖²]。<strong>关键理论结果</strong>——回归'<strong>条件</strong>速度'(每条路径的速度)<strong>等价于</strong>回归'<strong>边缘</strong>速度'(真实分布演化的速度场)(在期望意义上):∇_θ E‖v_θ−v_cond‖² 与 ∇_θ E‖v_θ−v_marginal‖² 的梯度相同。<strong>为什么这一等价性重要</strong>——因为'边缘速度'(我们真正想要的)<strong>不可计算</strong>(需要知道整个分布);而'条件速度'<strong>可计算</strong>(只需采样一对 (x_0,x_1) 并算 x_1−x_0);故该定理使 FM 的训练<strong>像监督学习一样简单</strong>。<strong>采样</strong>——从 x_0∼N(0,I) 出发,用 ODE 求解器(Euler/Heun/RK4)积分 dx/dt=v_θ(x,t) 从 t=0 到 1,得到 x_1(数据)。<strong>与扩散的关系</strong>——(a) <strong>FM 是'扩散的一般化'</strong>——扩散定义的是'加噪路径'(x_t=√ᾱ_t x_0+√(1−ᾱ_t)ε),FM 可定义<strong>任意路径</strong>(含直线);(b) <strong>FM 的目标更简单</strong>(直接回归速度,无需变分推断/ELBO);(c) <strong>直线路径</strong>使采样可用<strong>更少步数</strong>(因为路径更'直',ODE 更易积分)——这是 FM 在少步采样上的优势(SD3、Flux 用 FM)。<strong>优势</strong>——(a) 训练简单(回归目标明确);(b) 路径设计灵活(可选直线、OT 路径、扩散路径);(c) 少步采样质量好;(d) 理论优雅(连续流)。<strong>劣势/挑战</strong>——(a) <strong>路径交叉</strong>——若多条条件路径交叉,则'边缘速度'在交叉点有歧义(导致训练目标有噪声);这正是 <strong>Reflow</strong> 要解决的(见 Reflow 题);(b) 需选路径与求解器。

🏭 Production Trade-offs

深度剖析与工程权衡:① <strong>'条件速度回归等价于边缘速度回归'是 FM 的理论基石</strong>——没有它,FM 无法训练(因为边缘速度不可计算);面试中能陈述这一等价性是深度理解的标志。② <strong>'路径设计灵活'是 FM 相比扩散的优势</strong>——扩散固定了'加噪路径',FM 可选任意路径(含直线);这使 FM 可优化'采样效率'。③ <strong>'直线路径更易少步采样'</strong>——因为 ODE 的路径越直,数值积分误差越小(可用更大步长);这是 SD3/Flux 用 FM 的原因之一。④ <strong>'路径交叉'是 FM 的固有难题</strong>——多对 (x_0,x_1) 的路径可能交叉,导致'同一位置有多个目标速度'(训练目标冲突);Reflow 通过'迭代拉直'缓解。⑤ <strong>'与扩散的统一'</strong>——扩散可视为 FM 的一个特例(路径为'加噪路径');故 FM 是更一般的框架。⑥ <strong>面试要点</strong>——被问'Flow Matching 是什么',应给出'<strong>学向量场 + ODE 输运 + 回归条件速度(等价于边缘速度)+ 直线路径</strong>'与'<strong>训练更简单、少步采样更好、路径可设计</strong>';能陈述'条件速度回归等价于边缘速度回归'是深度理解的标志。
⚠️ Common Interview Pitfalls
  • ✕
    以为需要知道'边缘速度'才能训练(等价性使其可用条件速度)
  • ✕
    忽略路径交叉导致的目标冲突
🎯 Interviewer Follow-ups
  • ?
    为什么回归条件速度等价于回归边缘速度?
  • ?
    FM 与扩散的本质区别?
📚

Associated Knowledge Base Guides & Mindmaps

Explore the comprehensive technical article, exam cards, and global architecture tree.

← PreviousM6-066: Latent Diffusion & DiT Architecture: 解释潜空间自编码器的选择(连续 VAE vs VQ-VAE)。📋Back to BankNext →M6-068: Flow Matching & Rectified Flow: 解释 Rectified Flow / Reflow 的作用。