返回 多模态 思维导图
中文·English
👁️ 多模态ID: cfg-guidance

Classifier-Free Guidance (CFG)

Classifier-Free Guidance
🎯核心定义
Classifier-Free Guidance (无分类器引导) 用“条件预测 + 无条件预测”的线性外推, 在采样期放大条件 cc 的影响。训练时以概率 pp (CFG dropout, 通常 10–15%) 丢弃条件并把 cc 替换为空条件 \emptyset, 使同一个网络同时学会预测 ϵθ(xt,c)\epsilon_\theta(x_t, c)ϵθ(xt,)\epsilon_\theta(x_t, \emptyset)。采样时把两个噪声预测按强度 ww 组合:
📌核心概述
ϵ^θ(xt,c)=ϵθ(xt,)+w(ϵθ(xt,c)ϵθ(xt,)),w1\hat\epsilon_\theta(x_t, c) = \epsilon_\theta(x_t, \emptyset) + w\left(\epsilon_\theta(x_t, c) - \epsilon_\theta(x_t, \emptyset)\right),\qquad w \ge 1
📌核心概述
w=1w=1 退化为纯条件生成; ww 越大, 采样轨迹越被推向条件分布(与提示一致性越强), 但多样性下降、颜色易过饱和; 典型取值 w=78w = 7\text{–}8 (Stable Diffusion), 视频/级联模型常用 w=35w = 3\text{–}5。其本质是对 score 的重新加权: 与分类器引导 xtlogp(xt)+γxtlogp(cxt)\nabla_{x_t}\log p(x_t) + \gamma\nabla_{x_t}\log p(c \mid x_t) 等价地把梯度外推向条件似然方向, 但无需训练任何额外分类器。
💡使用场景
文生图/文生视频的提示对齐 (SD/Flux 默认开启), 面试高频追问 “CFG 怎么实现? w 取多大? 为什么 w 过大图会过饱和、多样性变差?”。
解决的核心痛点
纯条件扩散模型文本控制弱、采样结果偏离提示; 分类器引导需要额外的判别模型且对对抗噪声敏感; CFG 只需一次训练 (dropout) 与两次前向推理 (条件/无条件), 零额外模型即可在推理期大幅提升条件一致性。
🎯5 个高频面试考点 (Exam Points)
1
写出 CFG 采样公式 ε̂ = ε_θ(x_t,∅) + w·(ε_θ(x_t,c) − ε_θ(x_t,∅)), 并解释各符号含义?
2
CFG dropout 概率一般取多少? 训练时如何让条件与无条件分支共用同一网络?
3
w 增大对提示一致性、多样性、过饱和分别有什么影响? 为什么?
4
Classifier-Free Guidance 与分类器引导 (classifier guidance) 的关系? 各自优缺点?
5
w=1 与 w=0 分别对应什么? CFG 在推理期的额外计算开销是多少?
📖 关联深度指南:📄 diffusion-models
更新于 2026-08-12
🎯
检验攻克程度:针对「Classifier-Free Guidance (CFG)」专属刷题排雷
做单选排雷题、推导选项机制,答错自动收录进专属错题本。
🚀 开始本考点专项刷题
上一个知识点DDPM 前向/反向过程下一个知识点潜空间扩散 (LDM)

🔗 更多 多模态 知识点卡片

语音识别 ASR音频表示CLIP 应用CLIP 双塔架构