DPO/IPO/SimPO offline preference optimization, Constitutional AI, PPO online RL, DeepSeek-R1 GRPO group relative sampling, and rule-based verifiable rewards (RLVR).
DPO closed-form optimization bypassing separate reward models, IPO/KTO/SimPO variants, Constitutional AI, preference dataset curation, and out-of-distribution (OOD) degeneration mitigation.
PPO online policy gradient with Actor-Critic/Reward models, DeepSeek-R1 GRPO group relative reward sampling (bypassing separate Critic networks), rule-based verifiable rewards (RLVR) for math/code reasoning, and Process Reward Models (PRM).