返回 强化学习 思维导图
中文·English
🎮 强化学习ID: offline-to-online

离线到在线微调

Offline-to-Online Fine-Tuning
🎯核心定义
离线到在线微调 (Offline-to-Online RL) 指先用固定离线数据训练保守策略,再与环境交互继续优化;两大关键机制: (1) 保守惩罚退火 (Conservatism Annealing)——逐步降低离线阶段的保守系数 (如 CQL 的 α\alpha 退火到 0),避免『保守惯性』压住在线探索; (2) 回放混合 (Replay Mixing)——在线新数据与离线旧数据按比例混合采样回放,以旧数据为锚,防止分布偏移回潮、保持训练稳定。
💡使用场景
先冷启动后可持续交互的系统——推荐/广告先用日志预训练再上线自适应、机器人先仿真或历史轨迹再真机部署、LLM 对齐流水线。
解决的核心痛点
解决纯离线策略直接上线的两大问题——保守正则残留导致的次优 (需在环境信号下逐步松绑) 与探索初期策略崩溃风险 (旧数据回放做安全锚点);并天然衔接 RLHF: RLHF 第一步收集的 SFT/偏好数据就是离线数据集,PPO/GRPO 从参考策略出发、用 KL 约束锚定分布,正是『从离线数据出发到在线优化』在 LLM 中的体现。
🎯5 个高频面试考点 (Exam Points)
1
为什么 offline-to-online 需要保守惩罚退火?带着过大的保守系数直接上线会怎样?
2
回放混合 (Replay Mixing) 的作用?新/旧数据采样比例如何影响训练稳定性?
3
CQL 与 IQL 谁更适合 offline-to-online?为什么 IQL 常表现更稳?
4
RLHF 与 offline-to-online 的联系?参考策略的 KL 约束如何充当『保守惩罚』?
5
如何设计从保守到纯在线的退火判据?何时可以停止回放旧数据?
更新于 2026-08-12
🎯
检验攻克程度:针对「离线到在线微调」专属刷题排雷
做单选排雷题、推导选项机制,答错自动收录进专属错题本。
🚀 开始本考点专项刷题
上一个知识点IQL expectile 回归下一个知识点世界模型学习 (World Model)

🔗 更多 强化学习 知识点卡片

Actor-Critic 框架行为克隆 BC上下文老虎机思维链与推理强化