探索-利用权衡 (Exploration-Exploitation Dilemma) 指学习智能体必须在"尝试未知动作以获取信息"与"利用当前最佳动作以获取奖励"之间取舍——两者不能兼得, 最优解需按信息增益分配探索。最简单的策略是
ε-greedy: 以概率
1−ε 选择贪心动作, 以概率
ε 均匀随机探索, 即贪心动作的选中概率为
π(a∣s)=1−ε+∣A∣ε, 其余动作各为
∣A∣ε;
ε 随训练线性/指数退火 (如从
1.0 降到
0.01), 保证每个动作被无限次探索, 使 Q-Learning 等算法可收敛。更优的"乐观"策略 UCB1:
at=argmaxa[μ^a+na2lnt], 其中
μ^a 是动作
a 的经验平均奖励,
na 是
a 被选中的次数,
t 是总步数——置信上界随
na 增大而收缩, 以"乐观面对不确定性"自动平衡探索与利用, 多臂老虎机上后悔
RT=∑t=1T(μ∗−μat) 为
O(lnT)。