返回 大语言模型 思维导图
中文·English
大语言模型ID: simpo-orpo-kto

无参考对齐 SimPO/ORPO/KTO

Reference-Free Alignment SimPO/ORPO/KTO
🎯核心定义
无参考对齐方法指不再依赖参考策略 (reference policy) 或独立 SFT 阶段的一代偏好优化方法:① SimPO (Simple Preference Optimization) 完全去掉参考模型,直接用序列平均对数概率 1ytlogπθ(yty<t,x)\frac{1}{|y|}\sum_t \log \pi_\theta(y_t|y_{<t}, x)作为隐式奖励(对比 DPO 需同规模参考模型、β 常用 0.1),免参考约省 50% 显存与训练时间;② ORPO (Odds Ratio Preference Optimization) 在 SFT 交叉熵上叠加偏好项,一步同时完成 SFT 与对齐;③ KTO (Kahneman-Tversky Optimization) 基于前景理论,用单个回答的得/失 (desirable/undesirable) 信号训练,支持非配对数据。
💡使用场景
开源社区低成本微调与对齐(7B 级单卡训练)、只有点赞/点踩等非成对反馈的场景、需要快速迭代对齐实验的团队。
解决的核心痛点
DPO 仍需与策略同规模的参考模型,显存与内存翻倍,且要求成对偏好数据。SimPO 免参考省 50% 显存,ORPO 把 SFT+对齐合并为一步,KTO 突破配对数据限制,三者共同降低对齐的工程门槛。
🎯5 个高频面试考点 (Exam Points)
1
SimPO 如何去掉参考模型?其隐式奖励的定义和优点?
2
ORPO 的损失构成?为什么能一步完成 SFT 与对齐?
3
KTO 与 DPO 的核心差异?KTO 损失基于什么行为经济学理论?
4
SimPO/ORPO/KTO 与 DPO 在显存、数据要求、训练稳定性上的对比?
5
无参考对齐的共同风险?失去 KL 锚点可能带来什么问题?
📖 关联深度指南:📄 alignment-and-rlhf-dpo
更新于 2026-08-12
🎯
检验攻克程度:针对「无参考对齐 SimPO/ORPO/KTO」专属刷题排雷
做单选排雷题、推导选项机制,答错自动收录进专属错题本。
🚀 开始本考点专项刷题
上一个知识点DPO 直接偏好优化下一个知识点GRPO 相对策略优化

🔗 更多 大语言模型 知识点卡片

Agent 与工具调用对齐税与偏好数据缩放点积注意力注意力变体 MHA/MQA/GQA