M6-078M6: Multimodal & Generative ModelsFlow Matching & Rectified FlowHard
Mastery:
Flow Matching & Rectified Flow: 解释 CFG 在 Flow Matching 中的形式与实现。
📐 Mathematical Definition
⚡ Executive Summary
Core Concept: FM 中 CFG 用条件与非条件速度场的线性组合,形式与扩散一致;同样需要随机丢条件的训练与两次前向。
📌 Key Takeaways
- •FM 的 CFG:条件与非条件速度场的线性组合(与扩散同形式)
- •训练时同样需随机丢条件(否则无 v(∅) 可用)
- •成本同样 ×2(可用批量并行 / CFG distillation)
📐 Mathematical Derivations
数学机理:<strong>FM 中的 CFG</strong>——(1) <strong>形式</strong>——v_CFG=v_θ(x_t,∅)+s·(v_θ(x_t,c)−v_θ(x_t,∅));即用'条件速度'与'非条件速度'的差作为引导方向,放大 s 倍。<strong>与扩散形式完全相同</strong>(只是把 ε 换成 v)——因为 (a) 两者都是'场'的线性组合;(b) 由 v=f−½g²∇log p 的关系,'速度的差'与'score 的差'成正比(对同一路径)。(2) <strong>训练时的随机丢条件</strong>——与扩散相同(10% 概率把 c 置空);<strong>为什么必要</strong>——否则模型没有'非条件速度'的能力,CFG 无法使用。(3) <strong>成本</strong>——同样需两次前向(条件 + 非条件)→ 成本 ×2;优化手段相同(批量并行、CFG distillation、部分步 CFG、减少步数)。<strong>FM 的 CFG 特殊之处</strong>——(a) <strong>引导的'方向'语义更明确</strong>——因为 FM 的速度是'从噪声到数据的位移',故'条件速度 − 非条件速度'可解释为'朝 prompt 的位移修正'(比扩散的 score 差更直观);(b) <strong>时间依赖</strong>——FM 的 CFG 也需按 t 应用(s 可随时间变化);(c) <strong>与路径的交互</strong>——在直线路径下,CFG 的效果与扩散类似;但在'OT 路径'下,引导的数值行为可能不同(因为路径更直);(d) <strong>与蒸馏的交互</strong>——FM 的 CFG 蒸馏(把带 CFG 的两次前向压成一次)与扩散相同(见 CFG 成本题)。<strong>实现细节</strong>——(a) <strong>时间步编码</strong>——FM 的 t∈[0,1](与扩散的 1..T 不同);实现时需注意归一化;(b) <strong>符号约定</strong>——FM 的 t 从噪声到数据(与扩散相反);故'引导'的方向在实现时需注意;(c) <strong>与 Reflow 的交互</strong>——Reflow 后路径更直,CFG 的效果可能更'干净'(因为向量场更确定)。<strong>实证</strong>——(a) SD3/Flux 用 FM + CFG(s 常取 3.5~7);(b) 因为 FM 训练更好,故对引导的依赖更低(s 更小即可);(c) <strong>CFG++</strong>(改进的引导形式)在 FM 中也适用(通过改进数值形式减少伪影)。<strong>实践建议</strong>——(a) 训练时<strong>随机丢条件</strong>(必须);(b) 推理时<strong>批量并行</strong>(零成本);(c) s 从 3.5~5 起步(FM 模型通常需要更小的 s);(d) 若过饱和则开 CFG rescale。<strong>度量</strong>——(a) s 与质量/多样性的曲线;(b) 成本(两次前向);(c) 与扩散 CFG 的效果对比。
🏭 Production Trade-offs
深度剖析与工程权衡:① <strong>'FM 的 CFG 与扩散形式相同'源于统一框架</strong>——面试中能指出'因为两者都是场、且 v 与 score 线性相关'是深度理解的标志。② <strong>'FM 需要更小的 s'</strong>——因为 FM 训练更好、条件遵循更强;故 s 的默认值在下降(这也是'新模型 s 更小'的原因之一)。③ <strong>'引导方向语义更直观'</strong>——FM 的速度是'位移',故'条件 − 非条件'可解释为'朝 prompt 的位移修正';这比扩散的 score 差更易理解。④ <strong>'随机丢条件仍是必需'</strong>——无论扩散还是 FM,CFG 都需'非条件预测';这是实现中的常见遗漏。⑤ <strong>'与 Reflow 的交互'</strong>——拉直路径后,CFG 的效果可能更干净(向量场更确定);故'Reflow + CFG'是常见组合。⑥ <strong>面试要点</strong>——被问'FM 怎么做 CFG',应给出'<strong>与扩散同形式的线性组合 + 需随机丢条件 + 成本 ×2 + 同样的优化手段</strong>'与'<strong>FM 因训练更好故需更小的 s</strong>';能指出'统一框架解释了两者形式相同'是深度理解的标志。
⚠️ Common Interview Pitfalls
- ✕训练时不随机丢条件(CFG 无法使用)
- ✕沿用扩散的大 s(FM 通常需更小)
🎯 Interviewer Follow-ups
- ?为什么 FM 的 CFG 与扩散形式相同?
- ?FM 的 CFG 有什么特殊之处?
📚
Associated Knowledge Base Guides & Mindmaps
Explore the comprehensive technical article, exam cards, and global architecture tree.