M5-067M5: NLP & Large Language ModelsPrompting & Reasoning TechniquesEasy
Mastery:
Prompting & Reasoning Techniques: 解释 Self-Consistency 与多数投票。
📐 Mathematical Definition
⚡ Executive Summary
Core Concept: 对同一问题采样多条 CoT 路径,取答案的多数投票;利用'正确路径多样、错误路径分散'提升准确率。
📌 Key Takeaways
- •采样多条 CoT(用较高温度)→ 对最终答案投票
- •原理:正确路径彼此一致、错误路径分散
- •收益随采样数 N 增长但边际递减(成本 ∝N)
📐 Mathematical Derivations
数学机理:<strong>Self-Consistency(Wang 等 2022)</strong> 的做法——(1) 用<strong>较高温度</strong>(如 0.7)对同一问题采样 <strong>N 条</strong>不同的 CoT 路径(得到不同的推理过程与答案);(2) 对所有路径的<strong>最终答案</strong>做<strong>多数投票</strong>,取出现最多的答案作为输出。<strong>为什么有效</strong>——关键假设:<strong>正确的推理路径倾向于'殊途同归'(得到相同答案),而错误的路径各有各的错法(答案分散)</strong>。形式化地,若正确答案在单次采样中的概率为 p(如 0.6),且错误答案分散在多个不同值上,则多数投票的准确率随 N 提升(可证明在'错误答案分散'的假设下,投票准确率 → 1)。<strong>实证</strong>——在 GSM8K 等数学任务上,Self-Consistency 把 CoT 的准确率从约 56% 提升到约 74%(N=40),且收益随 N 增长(边际递减)。<strong>与 best-of-N 的差异</strong>——(a) <strong>Self-Consistency</strong> 只看<strong>最终答案的分布</strong>(多数投票),<strong>无需验证器/奖励模型</strong>(无监督);(b) <strong>best-of-N</strong> 用<strong>验证器/奖励模型打分</strong>选最优(需要打分器)。故 Self-Consistency 更简单(无需额外模型),但只在'答案可投票'(离散、可比较)时适用;对开放式生成(如写作)无法投票(答案各不相同),此时需 best-of-N + 验证器。<strong>成本</strong>——采样 N 条 CoT 的成本 ∝N(token 数与延迟);故需在'准确率 vs 成本'间权衡(N 常取 5~40)。<strong>变体</strong>——(a) <strong>加权投票</strong>(按 CoT 长度或置信度加权);(b) <strong>Universal Self-Consistency</strong>(用 LLM 自己判断哪些答案等价,适用于开放式输出);(c) 与 <strong>best-of-N + PRM</strong> 组合(先投票再验证)。<strong>与'推理时计算'的关系</strong>——Self-Consistency 是<strong>并行型</strong>的 test-time compute(同时采样多条路径),与 CoT(顺序型)互补。
🏭 Production Trade-offs
深度剖析与工程权衡:① <strong>'无需验证器'是最大优势</strong>——在缺乏可靠验证器的场景(开放推理、常识),Self-Consistency 仍可用(只需答案可比较);这使它比 best-of-N 更通用。② <strong>'答案可比性'的边界</strong>——(a) 数值答案(可直接比对);(b) 短文本答案(需归一化);(c) 长文本/开放式(需 LLM 判断等价,引入成本与噪声)。故 Self-Consistency 的适用性取决于任务。③ <strong>温度的设置</strong>——温度太低则 N 条路径几乎相同(投票无意义);太高则推理质量下降。常用 0.5~0.8;需在'多样性'与'质量'间平衡。④ <strong>收益的边际递减</strong>——准确率随 N 提升但递减;且当 N 很大时,成本(∝N)可能超过收益。故需按任务设 N(数学竞赛可用 N=40+,日常问答应 N=1~5)。⑤ <strong>与'蒸馏'的关系</strong>——Self-Consistency 的多数投票结果可作为'更好的监督信号'(用于蒸馏或 RFT:把投票后的答案当作伪标签);这是'用推理时算力换训练数据'的思路。⑥ <strong>面试要点</strong>——被问'Self-Consistency 为什么有效',应给出'<strong>正确路径殊途同归、错误路径分散 → 多数投票收敛到正确答案</strong>',并对比 best-of-N(需验证器);能指出'答案可比性'是适用边界、'温度需适中'是深度理解的标志。
⚠️ Common Interview Pitfalls
- ✕用低温采样(路径相同,投票无效)
- ✕在开放式生成任务上用多数投票
🎯 Interviewer Follow-ups
- ?为什么'正确路径更一致'?
- ?Self-Consistency 与 best-of-N 的差异?
📚
Associated Knowledge Base Guides & Mindmaps
Explore the comprehensive technical article, exam cards, and global architecture tree.