返回 强化学习 思维导图
中文·English
🎮 强化学习ID: cot-reasoning

思维链与推理强化

CoT & Reasoning RL
🎯核心定义
CoT (Chain-of-Thought, 思维链) 通过显式中间推理步骤把复杂问题分解为逐步求解,是推理时的提示/解码方法;RL 强化推理 (RLVR+GRPO) 则是训练时把长链推理能力刻进参数——CoT 正是这类推理模型在解码时表现出的外显行为,两者互补。
💡使用场景
数学/逻辑/代码等多步推理任务;与 RL 结合时,CoT 是策略的生成形态,RL 负责优化其分布与推理时扩展。
解决的核心痛点
单步大 O 推理错误率高且不可定位;CoT 分解配合 RL 的结果/过程奖励共同缓解错误传播与 credit assignment。详见 LLM 模块: 完整内容见 LLM 模块 cot 卡 (指南 reasoning-and-cot)。
🎯5 个高频面试考点 (Exam Points)
1
CoT 与 RL 强化推理 (RLVR+GRPO) 的关系:推理时方法与训练时方法的区别?
2
为什么 RL 推理模型需要显式推理链?CoT 在策略中的角色?
3
CoT 的涌现性与参数量关系?小模型为何收益有限?
4
Self-consistency 如何与 CoT/RL 结合提升推理准确率?
5
CoT 的局限:何时无效甚至有害?推理时扩展如何补足?
📖 关联深度指南:📄 reasoning-and-cot
更新于 2026-08-12
🎯
检验攻克程度:针对「思维链与推理强化」专属刷题排雷
做单选排雷题、推导选项机制,答错自动收录进专属错题本。
🚀 开始本考点专项刷题
上一个知识点DPO 直接偏好优化

🔗 更多 强化学习 知识点卡片

Actor-Critic 框架行为克隆 BC上下文老虎机CQL 保守 Q 学习