返回 强化学习 思维导图
中文·English
🎮 强化学习ID: exploration-exploitation

探索-利用权衡

Exploration-Exploitation
🎯核心定义
探索-利用权衡 (Exploration-Exploitation Dilemma) 指学习智能体必须在"尝试未知动作以获取信息"与"利用当前最佳动作以获取奖励"之间取舍——两者不能兼得, 最优解需按信息增益分配探索。最简单的策略是 ε\varepsilon-greedy: 以概率 1ε1-\varepsilon 选择贪心动作, 以概率 ε\varepsilon 均匀随机探索, 即贪心动作的选中概率为 π(as)=1ε+εA\pi(a|s) = 1 - \varepsilon + \frac{\varepsilon}{|A|}, 其余动作各为 εA\frac{\varepsilon}{|A|};ε\varepsilon 随训练线性/指数退火 (如从 1.01.0 降到 0.010.01), 保证每个动作被无限次探索, 使 Q-Learning 等算法可收敛。更优的"乐观"策略 UCB1: at=argmaxa[μ^a+2lntna]a_t = \arg\max_a \left[ \hat{\mu}_a + \sqrt{\frac{2\ln t}{n_a}} \right], 其中 μ^a\hat{\mu}_a 是动作 aa 的经验平均奖励, nan_aaa 被选中的次数, tt 是总步数——置信上界随 nan_a 增大而收缩, 以"乐观面对不确定性"自动平衡探索与利用, 多臂老虎机上后悔 RT=t=1T(μμat)R_T = \sum_{t=1}^T (\mu^* - \mu_{a_t})O(lnT)O(\ln T)
💡使用场景
一切在线学习——多臂老虎机、推荐/广告的 A/B 与在线决策、RL 训练 (ε 退火、初始化乐观值)、以及 RLHF 采样 (需多样性数据);面试常把 ε-greedy vs UCB vs Thompson 采样对比提问。
解决的核心痛点
纯利用会陷入局部最优 (低估未尝试动作), 纯探索浪费奖励;ε\varepsilon-greedy 简单但线性浪费 (永远以固定概率随机选臂), UCB/Thompson 采样按不确定性加权探索, 把后悔降到对数级——探索的本质是为未来信息买单, 应优先探索信息增益大的动作。
🎯5 个高频面试考点 (Exam Points)
1
写出 ε-greedy 的策略公式并解释:为什么贪心动作概率是 1-ε+ε/|A|?
2
写出 UCB1 的选臂公式并逐项解释?置信项 √(2ln t / n_a) 为什么随 n_a 收缩?
3
ε-greedy、UCB、Thompson 采样三种策略的对比:探索逻辑、后悔界、适用场景?
4
什么是后悔 (regret)?MAB 上 UCB 为什么能达到 O(ln T) 的后悔?
5
为什么最优探索要按信息增益分配?RL 训练中还有哪些探索技巧 (乐观初始化、计数奖励)?
📖 关联深度指南:📄 foundations-and-deep-rl
更新于 2026-08-12
🎯
检验攻克程度:针对「探索-利用权衡」专属刷题排雷
做单选排雷题、推导选项机制,答错自动收录进专属错题本。
🚀 开始本考点专项刷题
上一个知识点Q-Learning 离策略下一个知识点策略梯度 REINFORCE

🔗 更多 强化学习 知识点卡片

Actor-Critic 框架行为克隆 BC上下文老虎机思维链与推理强化