TalentMe
How To
🗺️
AI Industry Map
NEW
Knowledge ▾
Intro & Usage
Machine Learning Repo
Data Science Repo
Resources ▾
Intro & Usage
AI Tech Vault (Tech Wiki)
Industry News
Tech Blogs
Research Papers
Open Source Projects
Tools Hub ▾
🛠️ Tools & Skills Overview
🌐 Interactive Web Tools
🗺️ AI Industry & Career Map
🧭 AI Career Transition Navigator & Roadmap
📚 AI Multi-Module Practice Hub
🎯 AI Skill Assessment
🧠 AI Skills Library
AI Skills & Prompts Overview
Local Agent Guide
Cloud Skills Templates
⚡ MCP Tools Suite
TalentMe MCP Guide
CLI Tools & Commands
Services ▾
🚀 Services & Plans Suite
🧭 1v1 Coaching & Services
💎 Plans & Pricing
💬 Contact & Consultation
Contact Us
💬 Discord
🌐
中
☀️
🔑
Login / Register
☰
技术知识库
›
复习路线图
›
多模态 思维导图
›
Classifier-Free Guidance (CFG)
← 返回 多模态 思维导图
中文
·
English
👁️ 多模态
ID:
cfg-guidance
Classifier-Free Guidance (CFG)
Classifier-Free Guidance
🎯
核心定义
Classifier-Free Guidance (无分类器引导) 用“条件预测 + 无条件预测”的线性外推, 在采样期放大条件
c
c
c
的影响。训练时以概率
p
p
p
(CFG dropout, 通常 10–15%) 丢弃条件并把
c
c
c
替换为空条件
∅
\emptyset
∅
, 使同一个网络同时学会预测
ϵ
θ
(
x
t
,
c
)
\epsilon_\theta(x_t, c)
ϵ
θ
(
x
t
,
c
)
与
ϵ
θ
(
x
t
,
∅
)
\epsilon_\theta(x_t, \emptyset)
ϵ
θ
(
x
t
,
∅
)
。采样时把两个噪声预测按强度
w
w
w
组合:
📌
核心概述
ϵ
^
θ
(
x
t
,
c
)
=
ϵ
θ
(
x
t
,
∅
)
+
w
(
ϵ
θ
(
x
t
,
c
)
−
ϵ
θ
(
x
t
,
∅
)
)
,
w
≥
1
\hat\epsilon_\theta(x_t, c) = \epsilon_\theta(x_t, \emptyset) + w\left(\epsilon_\theta(x_t, c) - \epsilon_\theta(x_t, \emptyset)\right),\qquad w \ge 1
ϵ
^
θ
(
x
t
,
c
)
=
ϵ
θ
(
x
t
,
∅
)
+
w
(
ϵ
θ
(
x
t
,
c
)
−
ϵ
θ
(
x
t
,
∅
)
)
,
w
≥
1
📌
核心概述
w
=
1
w=1
w
=
1
退化为纯条件生成;
w
w
w
越大, 采样轨迹越被推向条件分布(与提示一致性越强), 但多样性下降、颜色易过饱和; 典型取值
w
=
7
–
8
w = 7\text{–}8
w
=
7
–
8
(Stable Diffusion), 视频/级联模型常用
w
=
3
–
5
w = 3\text{–}5
w
=
3
–
5
。其本质是对 score 的重新加权: 与分类器引导
∇
x
t
log
p
(
x
t
)
+
γ
∇
x
t
log
p
(
c
∣
x
t
)
\nabla_{x_t}\log p(x_t) + \gamma\nabla_{x_t}\log p(c \mid x_t)
∇
x
t
lo
g
p
(
x
t
)
+
γ
∇
x
t
lo
g
p
(
c
∣
x
t
)
等价地把梯度外推向条件似然方向, 但无需训练任何额外分类器。
💡
使用场景
文生图/文生视频的提示对齐 (SD/Flux 默认开启), 面试高频追问 “CFG 怎么实现? w 取多大? 为什么 w 过大图会过饱和、多样性变差?”。
⚡
解决的核心痛点
纯条件扩散模型文本控制弱、采样结果偏离提示; 分类器引导需要额外的判别模型且对对抗噪声敏感; CFG 只需一次训练 (dropout) 与两次前向推理 (条件/无条件), 零额外模型即可在推理期大幅提升条件一致性。
🎯
5 个高频面试考点 (Exam Points)
1
写出 CFG 采样公式 ε̂ = ε_θ(x_t,∅) + w·(ε_θ(x_t,c) − ε_θ(x_t,∅)), 并解释各符号含义?
2
CFG dropout 概率一般取多少? 训练时如何让条件与无条件分支共用同一网络?
3
w 增大对提示一致性、多样性、过饱和分别有什么影响? 为什么?
4
Classifier-Free Guidance 与分类器引导 (classifier guidance) 的关系? 各自优缺点?
5
w=1 与 w=0 分别对应什么? CFG 在推理期的额外计算开销是多少?
📖 关联深度指南:
📄 diffusion-models →
更新于 2026-08-12
🎯
检验攻克程度:针对「Classifier-Free Guidance (CFG)」专属刷题排雷
做单选排雷题、推导选项机制,答错自动收录进专属错题本。
🚀 开始本考点专项刷题 ➔
← 上一个知识点
DDPM 前向/反向过程
下一个知识点 →
潜空间扩散 (LDM)
🔗 更多 多模态 知识点卡片
语音识别 ASR
音频表示
CLIP 应用
CLIP 双塔架构