DeepSeek-R1 零前置 SFT 冷启动纯强化学习 (Pure RL Zero-Shot / R1-Zero) 下长思维链自发涌现与自我纠错机理 (DeepSeek-R1 Pure RL Reasoning & Self-Correction Emergence Paradigm) 是近年来大模型推理领域最重大的科研突破之一;核心发现与技术链路:1) R1-Zero 范式:完全不使用任何人工编写的思维链 SFT 数据进行冷启动,直接在预训练基模型(DeepSeek-V3-Base)上启动大规模纯强化学习(基于 GRPO 算法),仅依靠
基于规则的客观确定性奖励(数学题答案匹配、编程单元测试编译器通过率、XML 格式标签约束);2) 智能涌现现象 (Emergence of Self-Correction): 随着 RL 训练步数推进,模型自发学会生成数千 Token 的长思考链(Thinking Tokens),自发涌现出“顿悟时刻 (Aha Moment)”——即模型在遇到死胡同时,自发生成“Wait, let me re-check this calculation...”进行主动回溯与纠错;3) 工业两阶段流水线:为解决语言混杂问题,以微量冷启动 SFT 数据对齐初始格式
→ 大规模推理 RL
→ 拒绝采样生成高质量数据
→ 蒸馏小模型(1.5B/7B/14B/32B)。