返回 多模态 思维导图
中文·English
👁️ 多模态ID: multimodal-dpo

多模态偏好对齐

Multimodal DPO / RLHF-V
🎯核心定义
多模态 DPO (Multimodal DPO, MMDPO) 把 DPO 从纯文本偏好对齐扩展到 (图像, 文本) 联合输入: 同一图像 vv 下, 忠实回答 ywy_w (与图一致) 对幻觉回答 yly_l (与图矛盾) 构成偏好对, 用隐式奖励直接优化策略: LDPO=E(v,t,yw,yl)D[logσ(βlogπθ(ywv,t)πref(ywv,t)βlogπθ(ylv,t)πref(ylv,t))]\mathcal{L}_{DPO} = -\mathbb{E}_{(v,t,y_w,y_l) \sim \mathcal{D}} \left[ \log \sigma\left( \beta \log \frac{\pi_\theta(y_w \mid v, t)}{\pi_{ref}(y_w \mid v, t)} - \beta \log \frac{\pi_\theta(y_l \mid v, t)}{\pi_{ref}(y_l \mid v, t)} \right) \right] tt 为问题文本, πref\pi_{ref} 为冻结的参考策略 (SFT 模型), β\beta 为奖励尺度 (常 0.1–0.5)。隐式奖励 rθ(v,t,y)=βlogπθ(yv,t)πref(yv,t)r_\theta(v, t, y) = \beta \log \frac{\pi_\theta(y \mid v,t)}{\pi_{ref}(y \mid v,t)} 由策略与参考策略的对数比给出——无需训练奖励模型、无需在线采样与 PPO, 直接对离线偏好对做最大似然。 POPE 负采样机制 (RLHF-V 类方法): 先用 POPE 探测出模型高频“凭空生成”的物体集合 Ohall\mathcal{O}_{\text{hall}} (对不存在物体回答 Yes 的候选), 用这些物体构造幻觉句段作为负例 yly_l, 与忠实回答 ywy_w 配对; 负样本分 random / popular / adversarial 三档, adversarial (用模型自己最易幻觉的物体) 构成的硬负例对齐最有效——针对性压制模型最常犯的幻觉, 而非随机噪声。
💡使用场景
离线偏好对齐抑制物体幻觉、提升忠实性 (数据一次性构造, 无在线采样成本); 面试对比“多模态对齐为什么选 DPO 而不是 RLHF/GRPO”; RLHF-V 的幻觉感知 (hallucination-aware) 变体适合幻觉重灾场景。
解决的核心痛点
文本 DPO 直接迁移到多模态会受制于弱负例 (随机采样负例大多明显错误、学不到边界) 与奖励模型幻觉 (奖励模型本身会幻觉, 给幻觉回答高分); POPE 负采样把负例对准模型真实缺陷 (adversarial 硬负例使幻觉率显著下降), 隐式奖励免去奖励模型这一幻觉源头, 相比 RLHF/GRPO 需要在线采样+验证器, MMDPO 离线即可用静态图文偏好数据完成对齐, 成本与稳定性大幅改善。
🎯5 个高频面试考点 (Exam Points)
1
写出多模态 DPO 的损失公式, 与文本 DPO 的差异在哪?
2
DPO 为什么不需要奖励模型和在线采样?隐式奖励如何推导?
3
POPE 负采样如何为 DPO 构造偏好对 (random/popular/adversarial)?
4
MMDPO 与 RLHF-V 的关系与区别?
5
多模态对齐选 DPO 还是 RLHF/GRPO?适用场景对比?
📖 关联深度指南:📄 vision-language-models
更新于 2026-08-12
🎯
检验攻克程度:针对「多模态偏好对齐」专属刷题排雷
做单选排雷题、推导选项机制,答错自动收录进专属错题本。
🚀 开始本考点专项刷题
上一个知识点Masked Cross-Entropy下一个知识点DDPM 前向/反向过程

🔗 更多 多模态 知识点卡片

语音识别 ASR音频表示Classifier-Free Guidance (CFG)CLIP 应用