M5-028M5: NLP & Large Language ModelsInstruction Tuning & Supervised Fine-TuningHard
Mastery:
Instruction Tuning & Supervised Fine-Tuning: 解释拒绝采样微调(RFT / STaR)的机制与作用。
📐 Mathematical Definition
⚡ Executive Summary
Core Concept: 用模型自己生成多个答案,按正确性/奖励筛选后做 SFT;迭代进行可自我提升,是可验证任务的标准做法。
📌 Key Takeaways
- •采样多个答案 → 筛选正确/高奖励 → SFT → 迭代
- •对可验证任务(数学/代码)质量可控
- •与 CoT 蒸馏、RLVR 同属'自提升'范式
📐 Mathematical Derivations
数学机理:<strong>RFT(Rejection sampling Fine-Tuning)</strong> 又名 <strong>STaR(Self-Taught Reasoner)</strong>、<strong>RAFT</strong> 等,流程为:(1) <strong>采样</strong>——用当前模型对每个问题生成多个回答(如 16~64 个,含 CoT 步骤);(2) <strong>筛选(rejection)</strong>——按<strong>验证器</strong>(对可验证任务:答案是否与标准答案一致;或单元测试是否通过)或<strong>奖励模型</strong>打分,只保留<strong>正确/高奖励</strong>的样本;(3) <strong>SFT</strong>——用筛选后的样本微调模型;(4) <strong>迭代</strong>——用新模型重新采样,重复 (1)~(3)。<strong>为什么有效</strong>:(a) <strong>扩大有效训练集</strong>——把'模型能解出但采样才得到'的问题变成训练数据(把'偶尔成功'转化为'稳定成功');(b) <strong>过滤错误</strong>——只学正确轨迹,避免继承错误(这是相对 CoT 蒸馏的优势);(c) <strong>自我提升</strong>——模型在自己能解的问题上变得更强,从而能解更多问题(迭代扩展能力边界);(d) <strong>无需外部强教师</strong>(自蒸馏)。<strong>与 RLVR 的关系</strong>——RFT 用<strong>二值筛选</strong>(正确/错误)做<strong>监督学习</strong>(模仿正确轨迹);RLVR(GRPO 等)用<strong>连续奖励</strong>做<strong>策略梯度</strong>(奖励越高概率越大)。RFT 更简单稳定(像监督学习),RLVR 能利用'部分正确'的信号且可优化未通过验证的样本。<strong>实践中两者常组合</strong>——RFT 做冷启动(拿到第一批正确轨迹),RLVR 做后续优化。<strong>局限</strong>——(a) <strong>只学'已能解出'的</strong>(无法超越当前能力边界,除非有更强的验证器或教师);(b) <strong>多样性下降</strong>(反复筛选正确轨迹会使输出趋同);(c) 依赖<strong>可靠的验证器</strong>(对开放任务不可用)。
🏭 Production Trade-offs
深度剖析与工程权衡:① <strong>'把偶尔成功变成稳定成功'是关键机制</strong>——采样 64 次可能得到几个正确答案,这些样本正是'模型能力边界附近'的宝贵监督信号(pass@64 高但 pass@1 低的问题);RFT 把它们转化为训练数据,直接提升 pass@1。② <strong>RFT vs RLVR 的选择</strong>——RFT 更简单(监督学习、稳定、无需策略梯度);RLVR 更强(能优化未通过验证的样本、利用部分奖励)但更复杂(需处理 KL、方差、不稳定)。实践中常'RFT 冷启动 + RLVR 精调'。③ <strong>'验证器'是前提</strong>——RFT/RLVR 都依赖可靠验证;对数学(对答案)、代码(跑测试)可行;对写作、开放推理不可行(需奖励模型,可靠性下降)。④ <strong>迭代次数的收益递减</strong>——每次迭代都提升,但提升幅度递减(因为容易的问题已被'消化');且过度迭代会导致多样性崩塌(输出趋同)。⑤ <strong>与'蒸馏'的关系</strong>——RFT 是'自蒸馏'(用自己筛选的样本);若有强教师,则用教师的正确轨迹(CoT 蒸馏)——两者可结合(先用教师数据冷启动,再用 RFT 迭代)。⑥ <strong>面试要点</strong>——被问'如何让模型自己变强',应给出'<strong>RFT/STaR:采样 → 筛选 → SFT → 迭代</strong>'与'<strong>把偶尔成功转化为稳定成功</strong>'这一机制,并区分'RFT(监督、二值筛选)vs RLVR(策略梯度、连续奖励)';能指出'RFT 无法超越验证器/教师的上限'是深度理解的标志。
⚠️ Common Interview Pitfalls
- ✕以为 RFT 能突破当前能力上限(需更强验证器/教师)
- ✕无限迭代导致输出多样性崩塌
🎯 Interviewer Follow-ups
- ?RFT 与 RLVR 的区别?
- ?为什么 RFT 需要迭代?
📚
Associated Knowledge Base Guides & Mindmaps
Explore the comprehensive technical article, exam cards, and global architecture tree.