M5-066M5: NLP & Large Language ModelsPrompting & Reasoning TechniquesEasy
Mastery:
Prompting & Reasoning Techniques: 解释 Chain-of-Thought 为什么有效。
📐 Mathematical Definition
⚡ Executive Summary
Core Concept: CoT 让模型生成中间步骤,把串行计算从'网络深度'搬到'序列长度',从而突破常数深度的表达力限制。
📌 Key Takeaways
- •把推理外化为 token,提供'外部工作记忆'
- •突破常数深度 Transformer 的表达力限制(序列长度换深度)
- •对多步任务(算术/逻辑)收益最大
📐 Mathematical Derivations
数学机理:<strong>CoT 的有效性有两层解释</strong>。<strong>(1) 计算视角(最重要)</strong>——Transformer 是<strong>常数深度</strong>的网络(层数固定),故它能执行的'串行计算步数'受限于深度 L(见 M4 的'表达力与理论限制'题:常数深度 + 有限精度的 Transformer 属于 TC⁰,无法解某些问题)。<strong>CoT 通过生成中间 token 把'串行计算'从网络深度搬到序列长度</strong>:每个生成的 token 都经过一次完整的前向(即 L 层计算),故生成 k 个 token 相当于做了 k·L 层的串行计算。这<strong>根本性地扩展了可表达的计算类</strong>(Merrill & Sabharwal 证明 CoT 可把表达力从 TC⁰ 提升到 P 甚至更高)。<strong>(2) 分解视角</strong>——CoT 把'难问题'分解为'多个易子问题':p(y|x)=Σ_z p(z|x)p(y|z,x),其中 z 是中间推理步骤;这使每一步都是'模型能可靠完成的简单推理',从而整体正确率提升。<strong>为什么对多步任务收益最大</strong>——(a) <strong>算术</strong>(需数位对齐与进位)、(b) <strong>多跳逻辑</strong>(需组合多个事实)、(c) <strong>符号操作</strong>(需按规则逐步变换);这些任务的正确率随'所需步数'指数衰减(每步 ε 的错误率累积),CoT 通过'每步只做小推理'把指数衰减转为线性衰减。<strong>为什么对'单步任务'无效</strong>——如事实问答、情感分类,答案不需要多步推理,故 CoT 只增加成本无收益(甚至可能引入噪声)。<strong>zero-shot CoT 也有效</strong>——'Let's think step by step' 之所以有效,是因为它<strong>激活了预训练中学到的推理模式</strong>(预训练语料含大量'逐步推理'的文本);这说明推理能力已存在于参数中,prompt 只是'触发'它。
🏭 Production Trade-offs
深度剖析与工程权衡:① <strong>'序列长度换计算深度'是核心机制</strong>——它把 CoT 从'提示技巧'提升为'计算模型的能力扩展';面试中能给出这一解释(而非'因为模型需要思考')是深度理解的标志。② <strong>'每步错误率累积'的量化</strong>——若单步正确率 p,n 步任务的正确率约 p^n(指数衰减);CoT 把'一步完成 n 步推理'(p^n)改为'n 步各做一步'(约 p^n 但每步更简单、p 更高)……更准确的表述是:CoT 让每步的 p 接近 1(因为每步简单),故整体正确率大幅提升。③ <strong>与'推理时计算'的关系</strong>——CoT 是<strong>顺序型</strong>的 test-time compute(生成更多 token);另有<strong>并行型</strong>(多次采样 + 投票/验证,见 Self-Consistency)。两者可组合。④ <strong>CoT 的可靠性问题</strong>——生成的推理步骤<strong>未必反映模型真实的计算过程</strong>(可能是'事后编造的理由');且推理错误但答案正确(蒙对)与推理正确但答案错都可能发生。故'CoT 的可解释性'有限。⑤ <strong>与 RL 训练的关系</strong>——RLVR 能让模型<strong>自发</strong>产生更长的 CoT(见推理模型题),说明 CoT 的'长度与质量'可通过训练优化,而非仅靠 prompt。⑥ <strong>面试要点</strong>——被问'CoT 为什么有效',应给出'<strong>把串行计算从深度搬到序列长度(突破常数深度限制)+ 分解为易子问题</strong>'两层,并说明'<strong>对多步任务收益最大、单步任务无效</strong>';能指出'zero-shot CoT 激活了预训练的推理模式'是深度理解的标志。
⚠️ Common Interview Pitfalls
- ✕以为 CoT 对所有任务都有效(单步任务无效)
- ✕把 CoT 生成的推理当作模型真实的计算过程
🎯 Interviewer Follow-ups
- ?CoT 对哪些任务无效?
- ?zero-shot CoT 为什么也有效?
📚
Associated Knowledge Base Guides & Mindmaps
Explore the comprehensive technical article, exam cards, and global architecture tree.