M6-073M6: Multimodal & Generative ModelsFlow Matching & Rectified FlowHard
Mastery:

Flow Matching & Rectified Flow: 解释 Flow Matching 的向量场回归目标推导。

📐 Mathematical Definition
dxtdt=x1−x0 (constant);L=E∥vθ(xt,t)−(x1−x0)∥2\frac{d x_t}{dt}=x_1-x_0\ \text{(constant)};\qquad \mathcal{L}=\mathbb{E}\|v_\theta(x_t,t)-(x_1-x_0)\|^2
⚡ Executive Summary
Core Concept: 对直线路径 x_t=(1−t)x_0+tx_1,条件速度恒为 x_1−x_0;回归它即回归边缘速度(条件期望定理)。

📌 Key Takeaways

  • •
    直线路径下 x_t=(1−t)x_0+tx_1,速度恒为 x_1−x_0
  • •
    回归该常数速度即得损失
  • •
    条件期望定理保证:其梯度与回归边缘速度相同

📐 Mathematical Derivations

数学机理:<strong>推导步骤</strong>——(1) <strong>定义路径</strong>——给定一对 (x_0,x_1),定义 x_t=(1−t)·x_0+t·x_1,t∈[0,1]。(2) <strong>求速度</strong>——对 t 求导:dx_t/dt=−x_0+x_1=<strong>x_1−x_0</strong>(<strong>与 t 无关的常数</strong>)。(3) <strong>定义损失</strong>——L=E_{t,x_0,x_1}[‖v_θ(x_t,t)−(x_1−x_0)‖²],其中 x_t 由上式构造。(4) <strong>理论保证</strong>——由'条件期望 = 边缘量'(见条件流匹配题),该损失的梯度与'回归真实边缘速度'相同;故训练有效。<strong>为什么'速度是常数'很重要</strong>——(a) <strong>目标简单</strong>——不需要'根据 t 计算复杂的目标'(对比扩散:目标是 ε 或 v,其含义随 t 变化);(b) <strong>尺度均匀</strong>——x_1−x_0 的尺度与 t 无关(不随 SNR 剧变),故<strong>训练目标方差小、易训</strong>(这是 FM'更好训'的技术原因);(c) <strong>无参数化难题</strong>——扩散需选 ε/v/x_0-prediction(因为不同 SNR 区间的目标难度不同);FM 的直线路径<strong>无此问题</strong>。(d) <strong>一步生成的理论依据</strong>——若路径完全直且网络完美,则 x_1=x_0+v·1(一步)。<strong>时间 t 的采样</strong>——(a) <strong>均匀</strong>(U[0,1])——最简单;(b) <strong>logit-normal</strong>(SD3)——偏向中间 t(因为中间 t 的'任务最难');(c) <strong>其他</strong>(如偏向 t 小);<strong>选择影响</strong>——各时间步的训练权重(从而影响质量);这与扩散的'噪声调度'作用类似(都是在'设计各时间步的难度分布')。<strong>与扩散损失的对比</strong>——(a) <strong>扩散(ε-prediction)</strong>:目标 ε,x_t=√ᾱ_t x_0+√(1−ᾱ_t)ε;目标的'意义'随 t 变化(t 小时 ε 是'微小噪声'、t 大时 ε 是'主要成分')。(b) <strong>FM(直线)</strong>:目标 x_1−x_0,恒定;意义明确('从噪声到数据的位移')。<strong>故 FM 的目标更'直观'</strong>。<strong>实际实现</strong>——(1) 采 x_1(数据)、x_0∼N(0,I);(2) 采 t∼p(t);(3) 构造 x_t=(1−t)x_0+t x_1;(4) 前向 v_θ(x_t,t);(5) 损失 ‖v_θ−(x_1−x_0)‖²;(6) 反向传播。<strong>注意</strong>——x_0 与 x_1 的'角色':x_0 是噪声、x_1 是数据(t 从 0 到 1 表示'从噪声到数据');这与扩散的 t 方向(从数据到噪声)<strong>相反</strong>,需注意符号约定。<strong>变体</strong>——(a) <strong>扩散路径</strong>(x_t=√ᾱ_t x_0+√(1−ᾱ_t)ε)——此时速度不是常数(需按公式计算);(b) <strong>OT 路径</strong>(用 OT 配对);(c) <strong>一般高斯路径</strong>(统一形式)。<strong>实践建议</strong>——(a) <strong>直线路径</strong> → 最简单的 FM(推荐起点);(b) <strong>t 采样</strong>用 logit-normal 或均匀(需实测);(c) 若要'更直'则加 Reflow。<strong>度量</strong>——(a) 训练损失的收敛;(b) 采样质量(步数 vs FID);(c) 不同 t 分布的对比。

🏭 Production Trade-offs

深度剖析与工程权衡:① <strong>'速度恒定'是 FM 训练简单的根本</strong>——它使目标'尺度均匀、无参数化难题';面试中能指出这一点是深度理解的标志。② <strong>'t 采样分布影响质量'</strong>——与扩散的噪声调度同源(都是设计'各时间步的难度分布');故需调。③ <strong>'符号约定易错'</strong>——FM 的 t 从噪声到数据(与扩散相反);实现时需注意。④ <strong>'直线路径的无参数化优势'</strong>——扩散需选 ε/v/x_0(因为不同 SNR 难度不同);FM 直线路径无此问题(这是'更易训'的原因)。⑤ <strong>'一步生成的理论依据'</strong>——路径完全直时一步即得;这解释了为什么 Reflow/OT(拉直路径)能实现少步生成。⑥ <strong>面试要点</strong>——被问'FM 的损失怎么来',应给出'<strong>直线路径 x_t=(1−t)x_0+tx_1 → 速度恒为 x_1−x_0 → 回归它(条件期望定理保证等价)</strong>'与'<strong>目标尺度均匀、无参数化难题</strong>';能指出't 采样分布与扩散的噪声调度同源'是深度理解的标志。
⚠️ Common Interview Pitfalls
  • ✕
    按扩散的方式给 FM 设计复杂的参数化(直线路径不需要)
  • ✕
    搞错 t 的方向(FM 从噪声到数据)
🎯 Interviewer Follow-ups
  • ?
    为什么'速度是常数'很重要?
  • ?
    时间 t 如何采样?
📚

Associated Knowledge Base Guides & Mindmaps

Explore the comprehensive technical article, exam cards, and global architecture tree.

← PreviousM6-072: Flow Matching & Rectified Flow: 解释 Flow Matching 的采样与求解器选择。📋Back to BankNext →M6-074: Flow Matching & Rectified Flow: 解释一致性模型(Consistency Models)与 LCM 的机制。