M6-072M6: Multimodal & Generative ModelsFlow Matching & Rectified FlowHard
Mastery:
Flow Matching & Rectified Flow: 解释 Flow Matching 的采样与求解器选择。
📐 Mathematical Definition
⚡ Executive Summary
Core Concept: FM 采样是 ODE 积分(Euler/Heun/RK4);路径越直、求解器阶数越高,所需步数越少。
📌 Key Takeaways
- •采样 = 从 x_0∼N(0,I) 积分 ODE 到 t=1
- •求解器:Euler(一阶)/Heun(二阶)/RK4(四阶)
- •阶数越高、路径越直 → 步数越少(1~50 步)
📐 Mathematical Derivations
数学机理:<strong>FM 采样 = ODE 积分</strong>——从 x_0∼N(0,I) 出发,数值求解 dx/dt=v_θ(x,t) 从 t=0 到 t=1,得到 x_1(数据)。<strong>求解器</strong>——(a) <strong>Euler</strong>(一阶)——x_{t+h}=x_t+h·v_θ(x_t,t)(每步一次前向);(b) <strong>Heun / 中点法</strong>(二阶)——每步两次前向(预测 + 校正);(c) <strong>RK4</strong>(四阶)——每步四次前向;(d) <strong>自适应步长</strong>(如 dopri5)——按误差估计调整步长。<strong>选择依据</strong>——(a) <strong>每步成本 × 步数</strong>——高阶求解器每步更贵但可用更少步;实践中'二阶(Heun)'常是折中(如 Flux 用 Euler + 特定调度);(b) <strong>路径直度</strong>——路径越直,低阶求解器就足够(极端情况'完全直'时 Euler 一步即精确);(c) <strong>质量 vs 速度</strong>——更多步/更高阶 → 质量更好但更慢。<strong>与扩散采样器的关系</strong>——(a) <strong>数学上同源</strong>(都是 ODE/SDE 的数值求解);(b) <strong>差异在'路径'</strong>——扩散的路径(加噪路径)'弯曲',故需更多步;FM 的直线/OT 路径更直,故可用更少步;(c) 故'FM 的采样优势来自路径而非求解器'。<strong>为什么 FM 能做到 1~4 步</strong>——(a) <strong>直线路径</strong>(若路径完全直,则 x_1=x_0+v·1,一步即得);(b) <strong>Reflow/OT</strong> 使路径更直;(c) <strong>蒸馏</strong>(一致性模型/LCM)进一步压缩(见一致性模型题);(d) 实践中 SD3/Flux 用 <strong>20~30 步</strong>(质量优先),而 <strong>Turbo/LCM 类</strong>用 1~4 步(速度优先)。<strong>FM 特有的采样细节</strong>——(a) <strong>时间采样</strong>(t 从 0 到 1,需与训练的 t 分布一致);(b) <strong>调度</strong>(可用'非均匀步长'——在'变化快'的区间用更多步);(c) <strong>CFG 的组合</strong>(与扩散相同);(d) <strong>随机性</strong>——纯 FM 是确定性 ODE(可复现);若加噪则为 SDE(随机)。<strong>与扩散采样器的技术迁移</strong>——DPM-Solver 类'高阶求解器'的设计思想可迁移到 FM(因为都是 ODE);有专门为 FM 设计的求解器(如'flow map matching'、'consistency FM')。<strong>实践建议</strong>——(a) <strong>默认</strong> → Euler + 20~30 步(或 Heun + 10~15 步);(b) <strong>少步</strong> → 用 Reflow/OT 拉直 + Euler(4~8 步);(c) <strong>极致少步</strong> → 蒸馏(一致性模型/LCM,1~4 步);(d) <strong>质量优先</strong> → 更多步或高阶求解器。<strong>度量</strong>——(a) 步数 vs 质量曲线;(b) 延迟;(c) 不同求解器的质量对比。
🏭 Production Trade-offs
深度剖析与工程权衡:① <strong>'FM 的采样优势来自路径而非求解器'</strong>——这是关键区分;面试中能指出这一点是深度理解的标志。② <strong>'路径越直、阶数越高 → 步数越少'</strong>——这是两条独立的加速路径(可叠加)。③ <strong>'二阶求解器是常见折中'</strong>——每步两次前向但可用更少步;需实测'总成本'。④ <strong>'确定性 ODE 的副产品'</strong>——FM 天然可复现、支持 inversion(图像编辑);这与 DDIM 相同。⑤ <strong>'与扩散求解器的技术迁移'</strong>——因为数学同源,可互相借鉴(如 DPM-Solver 的思想)。⑥ <strong>面试要点</strong>——被问'FM 怎么采样',应给出'<strong>ODE 积分 + 求解器(Euler/Heun/RK4)+ 路径直度与阶数共同决定步数</strong>'与'<strong>FM 的少步优势来自路径</strong>';能指出'1~4 步需 Reflow/蒸馏'是深度理解的标志。
⚠️ Common Interview Pitfalls
- ✕以为 FM 天然就能 1 步生成(需直线路径或蒸馏)
- ✕把 FM 的加速归因于求解器(主要来自路径)
🎯 Interviewer Follow-ups
- ?FM 采样与扩散采样器有何不同?
- ?为什么 FM 能做到 1~4 步?
📚
Associated Knowledge Base Guides & Mindmaps
Explore the comprehensive technical article, exam cards, and global architecture tree.