保守 Q 学习 (Conservative Q-Learning, CQL) 是离线 RL 的 SOTA 基线之一,在标准 Bellman 更新上叠加保守正则项,系统性压低 OOD 动作的 Q 估计:
minQα(Ea∼πβ[log∑a′expQ(s,a′)]−E(s,a)∼D[Q(s,a)])+Bellman——第一项 (log-sum-exp) 抬高所有动作的 Q (soft-max 近似
maxa′),第二项只抬高数据内
(s,a) 的 Q;两项相减后,数据外动作被系统压低、数据内动作保持真实。