M5-063M5: NLP & Large Language ModelsGRPO & Reasoning ModelsHard
Mastery:

GRPO & Reasoning Models: 解释推理模型的蒸馏(把长 CoT 能力蒸馏到小模型)。

📐 Mathematical Definition
distill: SFT on DteacherCoT;cheaper than RL, but capped by teacher\text{distill}:\ \text{SFT on } \mathcal{D}_{\text{teacher}}^{\text{CoT}};\qquad \text{cheaper than RL},\ \text{but capped by teacher}
⚡ Executive Summary
Core Concept: 用大模型生成的高质量 CoT 数据做 SFT 蒸馏到小模型;比直接在小模型上做 RL 更高效,但上限受教师限制。

📌 Key Takeaways

  • •
    做法:用大模型的 CoT 输出做 SFT,训练小模型
  • •
    比'小模型直接 RL'更高效(省算力、更稳定)
  • •
    上限受教师限制(无法超越教师)

📐 Mathematical Derivations

数学机理:<strong>蒸馏推理能力的做法</strong>——(1) <strong>生成数据</strong>——用<strong>大推理模型</strong>(如 R1)对大量问题生成<strong>含长 CoT 的回答</strong>;(2) <strong>筛选</strong>——只保留<strong>答案正确</strong>的轨迹(用验证器过滤);(3) <strong>SFT</strong>——用这些轨迹做监督微调,训练小模型(如 1.5B~70B)。<strong>为什么比直接 RL 更高效</strong>:(a) <strong>省算力</strong>——RL 需要大量采样与迭代(昂贵);SFT 只需一次前向训练;(b) <strong>更稳定</strong>——SFT 是监督学习(稳定),RL 不稳定(奖励黑客、长度失控);(c) <strong>小模型适合</strong>——小模型的 RL 效果常较差(容量不足、探索效率低),而蒸馏能'直接吸收'大模型的推理模式。<strong>实证</strong>——DeepSeek-R1 蒸馏到 Qwen/Llama 系列(1.5B~70B)显示:<strong>蒸馏的小模型显著优于'在小模型上直接 RL'</strong>;且蒸馏模型在推理基准上大幅超越同规模的非推理模型。<strong>上限限制</strong>——(a) 学生<strong>无法超越教师</strong>(因为只模仿教师的分布);(b) 学生的推理长度与风格被教师'锁定'(可能学不到更适合自己的策略);(c) 对<strong>分布外</strong>问题(教师也没见过的)泛化受限。<strong>与 RL 的组合</strong>——实践常'<strong>先蒸馏(冷启动)+ 再 RL(提升)</strong>':(a) 蒸馏提供'会推理的格式'(冷启动,等价于 cold-start SFT);(b) 再在小模型上做 RLVR 优化真实正确率(可能超越教师的某些能力,因为 RL 在'学生自己的能力空间'上优化)。<strong>另一条路</strong>——'<strong>纯 RL 的小模型</strong>'也可行,但需更多算力与更好的基础设施;对资源有限的团队,蒸馏是更务实的选择。<strong>蒸馏的数据量</strong>——通常数十万到数百万条 CoT 轨迹(比普通 SFT 数据多,因为推理任务需要大量样本覆盖题型)。

🏭 Production Trade-offs

深度剖析与工程权衡:① <strong>'蒸馏 vs 直接 RL'是资源与上限的权衡</strong>——蒸馏便宜、稳定、但上限受教师限制;直接 RL 昂贵、不稳定、但可能超越教师(在自己的能力空间上优化)。故'先蒸馏再 RL'是兼顾两者的配方。② <strong>'筛选正确轨迹'是关键</strong>——只保留答案正确的轨迹,避免学生继承教师的错误;这是蒸馏质量的前提(与 RFT 的思想一致)。③ <strong>'长度与风格锁定'</strong>——学生模仿教师的推理长度与风格,可能'过度思考'(如果教师长)或风格不匹配;故可 (a) 用不同长度的教师数据、(b) 在蒸馏后做长度控制的 RL。④ <strong>'教师的选择'</strong>——不同教师(不同模型、不同规模)的推理风格与能力不同;多教师混合可提升学生的泛化(避免单一风格)。⑤ <strong>与'能力迁移'的边界</strong>——蒸馏主要迁移'推理模式'(格式、步骤、验证习惯),而非'知识'(知识来自学生的预训练);故学生的知识上限由其预训练决定。⑥ <strong>面试要点</strong>——被问'如何得到小推理模型',应给出'<strong>用大模型 CoT 数据筛选后 SFT 蒸馏</strong>'与'<strong>比直接 RL 更高效、但上限受教师限制</strong>',并说明'<strong>先蒸馏冷启动 + 再 RL 提升</strong>'的组合;能指出'蒸馏迁移的是推理模式而非知识'是深度理解的标志。
⚠️ Common Interview Pitfalls
  • ✕
    用教师的全部轨迹(含错误)做蒸馏
  • ✕
    期望蒸馏的学生超越教师
🎯 Interviewer Follow-ups
  • ?
    为什么蒸馏比直接 RL 更高效?
  • ?
    蒸馏与 RL 能否组合?
📚

Associated Knowledge Base Guides & Mindmaps

Explore the comprehensive technical article, exam cards, and global architecture tree.

← PreviousM5-062: GRPO & Reasoning Models: 解释长 CoT 的长度控制与长度惩罚。📋Back to BankNext →M5-064: GRPO & Reasoning Models: 解释过程奖励模型(PRM)在 RL 中的使用与标注成本。