M5-068M5: NLP & Large Language ModelsPrompting & Reasoning TechniquesMedium
Mastery:
Prompting & Reasoning Techniques: 解释 Tree-of-Thought 与 ReAct 的差异。
📐 Mathematical Definition
⚡ Executive Summary
Core Concept: ToT 在推理空间做树搜索(探索+回溯,无外部动作);ReAct 交替推理与外部工具调用(有外部动作与观察)。
📌 Key Takeaways
- •ToT:把推理组织为树,用搜索(BFS/DFS/beam)+ 评估器选分支
- •ReAct:推理与外部动作(工具/检索)交替,用观察更新
- •ToT 是'内部探索',ReAct 是'外部交互'
📐 Mathematical Derivations
数学机理:<strong>Tree-of-Thought(ToT,Yao 等 2023)</strong>——把推理过程组织为<strong>树结构</strong>:每个节点是一个'思维状态'(部分推理),从节点可生成<strong>多个候选下一步</strong>(分支);用<strong>评估器</strong>(模型自评或投票)给各分支打分,再用<strong>搜索算法</strong>(BFS/DFS/beam search)探索,必要时<strong>回溯</strong>(放弃差的分支)。<strong>特点</strong>:(a) <strong>内部探索</strong>(在语言空间搜索,不涉及外部世界);(b) 支持<strong>前瞻与回溯</strong>(可放弃错误路径);(c) 适用于需要'试错与规划'的任务(如 24 点游戏、创意写作、复杂规划)。<strong>代价</strong>:需要多次模型调用(每个节点一次生成 + 一次评估),成本高。<strong>ReAct(Yao 等 2022)</strong>——交替进行<strong>推理(thought)</strong> 与<strong>动作(action)</strong>:模型先'思考'(我该做什么),然后调用<strong>外部工具</strong>(搜索、计算器、API),得到<strong>观察(observation)</strong>,再基于观察继续思考……循环直到完成。<strong>特点</strong>:(a) <strong>外部交互</strong>(与真实世界/工具交互);(b) <strong>用观察修正推理</strong>(解决'模型不知道的事实');(c) 是 Agent 的基础范式。<strong>核心差异</strong>——(a) <strong>作用域</strong>:ToT 在<strong>内部</strong>探索(不改外部状态);ReAct 与<strong>外部</strong>交互(改外部状态、获取新信息);(b) <strong>解决的问题</strong>:ToT 解决'推理路径的选择与回溯';ReAct 解决'信息不足与动作执行';(c) <strong>成本结构</strong>:ToT 的成本在'搜索宽度×深度';ReAct 的成本在'工具调用的轮数'。<strong>能否结合</strong>——可以:在 ReAct 的每个'思考'步骤内部用 ToT 做规划,或在 ToT 的每个节点用工具获取信息(如'搜索+推理'交替);实践中'规划 + 工具 + 回溯'的组合是 Agent 的高级形态。<strong>其他相关</strong>——(a) <strong>Self-Consistency</strong>(并行采样 + 投票,无搜索);(b) <strong>LATS</strong>(Language Agent Tree Search,把 ToT 的搜索与 ReAct 的动作结合 + 蒙特卡洛树搜索);(c) <strong>Reflexion</strong>(用失败经验反思并重试)。
🏭 Production Trade-offs
深度剖析与工程权衡:① <strong>'内部探索 vs 外部交互'是核心区分</strong>——面试中一句话点出即可;进一步说明'ToT 不能获取新信息、ReAct 能'会更完整。② <strong>ToT 的成本与适用性</strong>——ToT 的成本 ∝ 搜索宽度 × 深度 × 评估次数,非常昂贵;故只适合'需要规划与试错'且'值得多花算力'的任务(竞赛题、复杂规划);对简单问答是浪费。③ <strong>ReAct 的关键是'工具质量'</strong>——ReAct 的效果高度依赖 (a) 工具的设计(接口清晰、返回有用)、(b) 模型调用工具的能力(function calling 的准确率);故 Agent 工程的重点在'工具生态'而非 prompt。④ <strong>'评估器'是 ToT 的瓶颈</strong>——ToT 需要评估'部分推理状态'的好坏,这很难(比评估最终答案难);故常用'模型自评'(不可靠)或'投票'(需多次生成)。⑤ <strong>与'推理模型'的关系</strong>——现代推理模型(经 RLVR 训练)<strong>内化了</strong>部分'回溯与自我验证'能力(长 CoT 中的'等一下,我错了'),故对 ToT 的显式搜索依赖降低;但对'需要外部信息'的任务,ReAct 仍必需。⑥ <strong>面试要点</strong>——被问'ToT 与 ReAct 的差异',应给出'<strong>内部探索(搜索+回溯)vs 外部交互(动作+观察)</strong>'与'解决的问题不同(推理路径 vs 信息获取)',并说明'可结合(规划 + 工具)';能提到 LATS/Reflexion 是深度理解的标志。
⚠️ Common Interview Pitfalls
- ✕把 ToT 与 ReAct 混为一谈(内部探索 vs 外部交互)
- ✕在简单任务上用 ToT(成本浪费)
🎯 Interviewer Follow-ups
- ?ToT 的评估器怎么来?
- ?两者能否结合?
📚
Associated Knowledge Base Guides & Mindmaps
Explore the comprehensive technical article, exam cards, and global architecture tree.