返回 强化学习 思维导图
中文·English
🎮 强化学习ID: dqn

DQN 三件套

DQN Trio
🎯核心定义
DQN (Deep Q-Network) 用深度网络 Qθ(s,a)Q_\theta(s,a) 逼近最优动作价值,对固定的 TD 目标做最小二乘回归:
📌核心概述
L(θ)=E(s,a,r,s)D[(r+γmaxaQθ(s,a)Qθ(s,a))2]L(\theta) = \mathbb{E}_{(s,a,r,s')\sim\mathcal{D}}\left[\left(r + \gamma \max_{a'} Q_{\theta^-}(s',a') - Q_\theta(s,a)\right)^2\right]
📌核心概述
推导链: 1. Bellman 最优方程给出 TD 目标 y=r+γmaxaQθ(s,a)y = r + \gamma \max_{a'} Q_{\theta^-}(s',a'):目标网络 θ\theta^-(每 CC 步硬拷贝或 Polyak 加权平均 θτθ+(1τ)θ\theta^- \leftarrow \tau\theta + (1-\tau)\theta^-)把自举回归变成对固定常数的回归,消除“目标随自身一起漂移”的振荡; 2. 对 θ\theta 求梯度:θL=2E[(yQθ(s,a))θQθ(s,a)]\nabla_\theta L = -2\mathbb{E}[(y - Q_\theta(s,a))\nabla_\theta Q_\theta(s,a)],目标 yy 不参与反传; 3. 经验回放 D\mathcal{D}:按 (s,a,r,s)(s,a,r,s') 存储、均匀随机抽样,打破相邻样本的强时间相关性,并支持样本复用与稳定批训练; 4. 双 DQN 高估修正:max\max 算子带来正偏差——E[maxXi]maxE[Xi]\mathbb{E}[\max X_i] \ge \max \mathbb{E}[X_i](max 为凸函数,由 Jensen 不等式),噪声 + 自举使误差层层放大,高估的坏动作被不断选中。Double DQN 把动作选择与价值评估解耦:y=r+γQθ(s,argmaxaQθ(s,a))y = r + \gamma Q_{\theta^-}(s', \arg\max_{a'} Q_\theta(s', a')) —— 在线网络选动作、目标网络打分,显著压低高估。
💡使用场景
离散动作空间(游戏、推荐候选排序、组合动作);深度 RL 的奠基算法。
解决的核心痛点
状态连续/高维,无法查表。三件套对应深度学习的三大敌人:回放破相关、目标网络稳目标、Double-DQN 去 max 高估;后续改进(优先回放、dueling、n-step、C51、Rainbow)都沿这一脉络叠加。
🎯5 个高频面试考点 (Exam Points)
1
写出 DQN 损失 L=E[(r+γ max Q_{θ⁻}(s',a') − Q_θ(s,a))²],说明目标网络的作用与更新方式?
2
白板手推: 用 Jensen 不等式证明 max 算子带来高估 E[max X] ≥ max E[X],并推导 Double DQN 的解耦目标?
3
经验回放解决什么问题?均匀采样有何局限,优先级回放如何改进?
4
DQN 三件套: 回放、目标网络、Double-DQN 各解决哪个问题?还有哪些改进?
5
为什么 TD 目标必须固定?目标网络更新太频繁或太慢各有什么后果?
📖 关联深度指南:📄 foundations-and-deep-rl
更新于 2026-08-12
🎯
检验攻克程度:针对「DQN 三件套」专属刷题排雷
做单选排雷题、推导选项机制,答错自动收录进专属错题本。
🚀 开始本考点专项刷题
上一个知识点TRPO 与 PPO 脉络下一个知识点Actor-Critic 框架

🔗 更多 强化学习 知识点卡片

行为克隆 BC上下文老虎机思维链与推理强化CQL 保守 Q 学习