🎯核心定义
CoT (Chain-of-Thought, 思维链) 通过显式中间推理步骤把复杂问题分解为逐步求解,是推理时的提示/解码方法;RL 强化推理 (RLVR+GRPO) 则是训练时把长链推理能力刻进参数——CoT 正是这类推理模型在解码时表现出的外显行为,两者互补。
💡使用场景
数学/逻辑/代码等多步推理任务;与 RL 结合时,CoT 是策略的生成形态,RL 负责优化其分布与推理时扩展。
⚡解决的核心痛点
单步大 O 推理错误率高且不可定位;CoT 分解配合 RL 的结果/过程奖励共同缓解错误传播与 credit assignment。详见 LLM 模块: 完整内容见 LLM 模块 cot 卡 (指南 reasoning-and-cot)。