返回 强化学习 思维导图
中文·English
🎮 强化学习ID: cql

CQL 保守 Q 学习

Conservative Q-Learning
🎯核心定义
保守 Q 学习 (Conservative Q-Learning, CQL) 是离线 RL 的 SOTA 基线之一,在标准 Bellman 更新上叠加保守正则项,系统性压低 OOD 动作的 Q 估计: minQα(Eaπβ[logaexpQ(s,a)]E(s,a)D[Q(s,a)])+Bellman\min_Q \alpha \left( \mathbb{E}_{a \sim \pi_\beta} \left[ \log \sum_{a'} \exp Q(s,a') \right] - \mathbb{E}_{(s,a) \sim \mathcal{D}}[Q(s,a)] \right) + \text{Bellman}——第一项 (log-sum-exp) 抬高所有动作的 Q (soft-max 近似 maxa\max_{a'}),第二项只抬高数据内 (s,a)(s,a) 的 Q;两项相减后,数据外动作被系统压低、数据内动作保持真实。
💡使用场景
无法在线交互的离线决策——推荐/广告历史日志、安全敏感的机器人/自动驾驶控制;也常作为 offline-to-online 微调的初始化。
解决的核心痛点
提供可证明的保守性: CQL 学到的 Q^π\hat{Q}^\pi 是真实 QπQ^\pi 的下界 (处处满足 Q^π(s,a)Qπ(s,a)\hat{Q}^\pi(s,a) \le Q^\pi(s,a))——正则项在每个状态注入保守偏移,Bellman 迭代使下界性质得以保持,策略优化因此不会因 Q 虚高去采 OOD 动作,从价值层面掐断外推误差。
🎯5 个高频面试考点 (Exam Points)
1
为什么 CQL 能给出 Q 下界?写出 CQL 目标,并给出 Q^πQπ\hat{Q}^\pi \le Q^\pi 的推导直觉。
2
CQL 目标中 log-sum-exp 项与数据期望项各起什么作用?为什么用 soft-max 而非 max?
3
CQL 与策略约束法 (BCQ / TD3+BC) 的路线差异?『保守价值』 vs 『约束策略』?
4
CQL 的系数 α\alpha 如何权衡保守性与最优性?过大/过小的后果?
5
CQL 学到的 Q 下界如何服务于 offline-to-online 微调?
更新于 2026-08-12
🎯
检验攻克程度:针对「CQL 保守 Q 学习」专属刷题排雷
做单选排雷题、推导选项机制,答错自动收录进专属错题本。
🚀 开始本考点专项刷题
上一个知识点GAIL 与逆向 RL下一个知识点IQL expectile 回归

🔗 更多 强化学习 知识点卡片

Actor-Critic 框架行为克隆 BC上下文老虎机思维链与推理强化