M5-061M5: NLP & Large Language ModelsGRPO & Reasoning ModelsHard
Mastery:

GRPO & Reasoning Models: 解释零 RL / RLVR 的 cold start 问题。

📐 Mathematical Definition
cold start: base model→RL ⇒ format collapse, language mixing;fix: SFT warmup\text{cold start}:\ \text{base model}\to\text{RL}\ \Rightarrow\ \text{format collapse},\ \text{language mixing};\qquad \text{fix}:\ \text{SFT warmup}
⚡ Executive Summary
Core Concept: 从纯基座做 RL 可能输出格式混乱、语言混杂、可读性差;冷启动 SFT 或格式奖励可稳定起始阶段。

📌 Key Takeaways

  • •
    纯 RL 从基座开始:输出格式混乱、语言混杂、可读性差
  • •
    冷启动 SFT(少量长 CoT 数据)可稳定起始阶段
  • •
    或加'格式奖励'(要求特定输出格式)

📐 Mathematical Derivations

数学机理:<strong>cold start 问题</strong>——若直接从<strong>纯基座模型</strong>(未经 SFT)开始 RLVR,会观察到若干退化现象:(a) <strong>格式混乱</strong>——输出没有清晰结构(不分步骤、不区分思考与答案);(b) <strong>语言混杂</strong>——中英文夹杂(因为基座模型的多语言能力未被约束);(c) <strong>可读性差</strong>——推理过程难以理解(跳跃、省略);(d) <strong>奖励提取困难</strong>——因为答案没有明确标记,验证器难以提取答案(导致奖励信号错误)。<strong>成因</strong>——基座模型只学过'续写',没有'按指令组织回答'的能力;RL 虽有正确性奖励,但<strong>格式与可读性没有奖励信号</strong>(除非显式设计),故模型会'用最省力的方式'追求正确性(可能输出混乱但答案对)。<strong>解决方案</strong>:(1) <strong>冷启动 SFT(cold-start SFT)</strong>——用<strong>少量</strong>(数百到数千条)高质量的<strong>长 CoT 数据</strong>做 SFT,教模型'如何组织推理'(格式、步骤、语言);这为 RL 提供了'格式正确的起点'(DeepSeek-R1 用了约数千条冷启动数据)。(2) <strong>格式奖励</strong>——在奖励中加入'是否遵循格式'(如'把答案放在 oxed{} 中'、'用与问题相同的语言');这使 RL 能自己学会格式。(3) <strong>混合奖励</strong>——正确性奖励 + 格式奖励 + 语言一致性奖励。<strong>实证</strong>——DeepSeek-R1 报告:<strong>纯 RL(无冷启动)</strong> 也能提升推理能力,但输出<strong>可读性差、语言混杂</strong>;加冷启动 SFT 后(R1 的正式版本)输出<strong>清晰可读</strong>且性能更好。故'冷启动 + RL'是推荐配方。<strong>与'涌现'的关系</strong>——cold start 的存在不否定'长 CoT 可涌现'(纯 RL 也能学到推理),而是说明'<strong>可读性与格式需要额外引导</strong>'。<strong>冷启动数据量</strong>——通常很少(数千条);关键是<strong>格式示范</strong>而非知识注入。

🏭 Production Trade-offs

深度剖析与工程权衡:① <strong>'冷启动只需少量数据'是关键</strong>——它的作用是'示范格式'而非'教推理'(推理由 RL 学);故数千条足够。这与'SFT 数据要少而精'的原则一致。② <strong>'格式奖励'的工程价值</strong>——它是'让 RL 自己学会格式'的替代方案(无需 SFT);但对复杂格式(多步骤、结构化输出)可能不如 SFT 示范有效。③ <strong>'语言一致性'的实际问题</strong>——多语言模型在 RL 后可能出现'语言混杂'(中英夹杂),影响用户体验;故常加'语言一致性奖励'(要求用 prompt 的语言回答)。④ <strong>'奖励提取'的工程细节</strong>——若输出格式不固定,验证器难以可靠提取答案(可能把'思考中的中间结果'当成答案);故<strong>格式约束(如 oxed{})是 RLVR 的工程前提</strong>(与约束解码相关)。⑤ <strong>与'蒸馏'的关系</strong>——冷启动数据常来自'更强的模型'(如用 R1 的输出去教小模型);故冷启动与蒸馏在数据层面相通。⑥ <strong>面试要点</strong>——被问'纯 RL 从基座开始行不行',应给出'<strong>能提升推理但输出可读性差、语言混杂 → 需冷启动 SFT 或格式奖励</strong>',并说明'<strong>冷启动只需少量数据(教格式而非教推理)</strong>'与'<strong>格式约束是奖励提取的前提</strong>';能指出'纯 RL 不否定涌现、只说明格式需引导'是深度理解的标志。
⚠️ Common Interview Pitfalls
  • ✕
    以为纯 RL 从基座开始就能得到可读的输出
  • ✕
    冷启动用大量数据(应少量精标)
🎯 Interviewer Follow-ups
  • ?
    为什么纯 RL 会出现'语言混杂'?
  • ?
    冷启动 SFT 数据需要多少?
📚

Associated Knowledge Base Guides & Mindmaps

Explore the comprehensive technical article, exam cards, and global architecture tree.

← PreviousM5-060: GRPO & Reasoning Models: 解释 GRPO 的 group size 与采样效率。📋Back to BankNext →M5-062: GRPO & Reasoning Models: 解释长 CoT 的长度控制与长度惩罚。