多模态 DPO (Multimodal DPO, MMDPO) 把 DPO 从纯文本偏好对齐扩展到 (图像, 文本) 联合输入: 同一图像
v 下, 忠实回答
yw (与图一致) 对幻觉回答
yl (与图矛盾) 构成偏好对, 用隐式奖励直接优化策略:
LDPO=−E(v,t,yw,yl)∼D[logσ(βlogπref(yw∣v,t)πθ(yw∣v,t)−βlogπref(yl∣v,t)πθ(yl∣v,t))]
t 为问题文本,
πref 为冻结的参考策略 (SFT 模型),
β 为奖励尺度 (常 0.1–0.5)。隐式奖励
rθ(v,t,y)=βlogπref(y∣v,t)πθ(y∣v,t) 由策略与参考策略的对数比给出——无需训练奖励模型、无需在线采样与 PPO, 直接对离线偏好对做最大似然。
POPE 负采样机制 (RLHF-V 类方法): 先用 POPE 探测出模型高频“凭空生成”的物体集合
Ohall (对不存在物体回答 Yes 的候选), 用这些物体构造幻觉句段作为负例
yl, 与忠实回答
yw 配对; 负样本分 random / popular / adversarial 三档, adversarial (用模型自己最易幻觉的物体) 构成的硬负例对齐最有效——针对性压制模型最常犯的幻觉, 而非随机噪声。