奖励设计分三类:稀疏奖励 (仅终止时给
±1,信号少但无偏,探索困难)、密集奖励 (每步有信号、学习快,但可能引入误导)、势函数 shaping (Potential-Based Reward Shaping)——在原奖励上加
F(s,a,s′)=γΦ(s′)−Φ(s)
其中
Φ(s) 为任意势函数 (如到目标距离的负值),
γ 为折扣因子。Ng et al. (1999) 定理:势函数 shaping 不改变最优策略——因为沿任意轨迹求和
∑tFt=γΦ(sT)−Φ(s0) (望远镜求和) 只差首尾常数,价值排序不变,故可放心用领域知识加速学习而不错导。