直接偏好优化 (Direct Preference Optimization, DPO) 封闭解析解与隐式奖励函数严格数学推导 (DPO Closed-Form Optimal Policy & Implicit Reward Derivation) 是研究科学家 (RS) 白板面试中最受关注的理论推导题目;推导第一步:在带 KL 散度约束的 RLHF 目标函数
maxπEx,y∼π[r(x,y)]−βDKL(π(y∣x)∥πref(y∣x)) 下,通过变分求导得出最优策略的玻尔兹曼分布闭式解:
π∗(y∣x)=Z(x)1πref(y∣x)exp(β1r(x,y));第二步:对闭式解两边取对数并整理,将显式奖励函数精确代数表达为策略与参考策略的对数几率比:
r(x,y)=βlnπref(y∣x)π∗(y∣x)+βlnZ(x);第三步:代入 Bradley-Terry 成对偏好概率模型
P(yw≻yl∣x)=σ(r(x,yw)−r(x,yl)),归一化常数
βlnZ(x) 在差值中精确对消,最终导出完全无需显式奖励模型的参数化闭式交叉熵损失函数。