无参考对齐方法指不再依赖参考策略 (reference policy) 或独立 SFT 阶段的一代偏好优化方法:① SimPO (Simple Preference Optimization) 完全去掉参考模型,直接用序列平均对数概率
∣y∣1∑tlogπθ(yt∣y<t,x)作为隐式奖励(对比 DPO 需同规模参考模型、β 常用 0.1),免参考约省 50% 显存与训练时间;② ORPO (Odds Ratio Preference Optimization) 在 SFT 交叉熵上叠加偏好项,一步同时完成 SFT 与对齐;③ KTO (Kahneman-Tversky Optimization) 基于前景理论,用单个回答的得/失 (desirable/undesirable) 信号训练,支持非配对数据。