TalentMe
How To
🗺️
AI Industry Map
NEW
Knowledge ▾
Intro & Usage
Machine Learning Repo
Data Science Repo
Resources ▾
Intro & Usage
AI Tech Vault (Tech Wiki)
Industry News
Tech Blogs
Research Papers
Open Source Projects
Tools Hub ▾
🛠️ Tools & Skills Overview
🌐 Interactive Web Tools
🗺️ AI Industry & Career Map
🧭 AI Career Transition Navigator & Roadmap
📚 AI Multi-Module Practice Hub
🎯 AI Skill Assessment
🧠 AI Skills Library
AI Skills & Prompts Overview
Local Agent Guide
Cloud Skills Templates
⚡ MCP Tools Suite
TalentMe MCP Guide
CLI Tools & Commands
Services ▾
🚀 Services & Plans Suite
🧭 1v1 Coaching & Services
💎 Plans & Pricing
💬 Contact & Consultation
Contact Us
💬 Discord
🌐
中
☀️
🔑
Login / Register
☰
技术知识库
›
复习路线图
›
强化学习 思维导图
›
离线到在线微调
← 返回 强化学习 思维导图
中文
·
English
🎮 强化学习
ID:
offline-to-online
离线到在线微调
Offline-to-Online Fine-Tuning
🎯
核心定义
离线到在线微调 (Offline-to-Online RL) 指先用固定离线数据训练保守策略,再与环境交互继续优化;两大关键机制: (1) 保守惩罚退火 (Conservatism Annealing)——逐步降低离线阶段的保守系数 (如 CQL 的
α
\alpha
α
退火到 0),避免『保守惯性』压住在线探索; (2) 回放混合 (Replay Mixing)——在线新数据与离线旧数据按比例混合采样回放,以旧数据为锚,防止分布偏移回潮、保持训练稳定。
💡
使用场景
先冷启动后可持续交互的系统——推荐/广告先用日志预训练再上线自适应、机器人先仿真或历史轨迹再真机部署、LLM 对齐流水线。
⚡
解决的核心痛点
解决纯离线策略直接上线的两大问题——保守正则残留导致的次优 (需在环境信号下逐步松绑) 与探索初期策略崩溃风险 (旧数据回放做安全锚点);并天然衔接 RLHF: RLHF 第一步收集的 SFT/偏好数据就是离线数据集,PPO/GRPO 从参考策略出发、用 KL 约束锚定分布,正是『从离线数据出发到在线优化』在 LLM 中的体现。
🎯
5 个高频面试考点 (Exam Points)
1
为什么 offline-to-online 需要保守惩罚退火?带着过大的保守系数直接上线会怎样?
2
回放混合 (Replay Mixing) 的作用?新/旧数据采样比例如何影响训练稳定性?
3
CQL 与 IQL 谁更适合 offline-to-online?为什么 IQL 常表现更稳?
4
RLHF 与 offline-to-online 的联系?参考策略的 KL 约束如何充当『保守惩罚』?
5
如何设计从保守到纯在线的退火判据?何时可以停止回放旧数据?
📖 关联深度指南:
📄 offline-rl-and-imitation-learning →
更新于 2026-08-12
🎯
检验攻克程度:针对「离线到在线微调」专属刷题排雷
做单选排雷题、推导选项机制,答错自动收录进专属错题本。
🚀 开始本考点专项刷题 ➔
← 上一个知识点
IQL expectile 回归
下一个知识点 →
世界模型学习 (World Model)
🔗 更多 强化学习 知识点卡片
Actor-Critic 框架
行为克隆 BC
上下文老虎机
思维链与推理强化