返回 大语言模型 思维导图
中文·English
大语言模型ID: mcts-search

MCTS 推理搜索

MCTS Reasoning Search
🎯核心定义
MCTS (Monte Carlo Tree Search, 蒙特卡洛树搜索) 把推理期生成过程组织为树搜索:节点 = 推理状态(已生成的中间步骤),边 = 下一步动作。循环四步:选择(按 UCT 公式 UCT=vˉ+clnNnUCT = \bar{v} + c\sqrt{\frac{\ln N}{n}} 选节点,平衡探索与利用)、扩展(生成新分支)、模拟(rollout 到叶子)、回溯(把叶子价值沿路径回传)。与 LLM 结合时,节点价值 vv 由过程奖励模型 (PRM) 的逐步评分提供,构成 Test-Time Search——AlphaGo 思路向 LLM 推理的迁移。
💡使用场景
数学/博弈等可验证任务的推理增强、推理模型训练时搜索高质量轨迹(作为 RL 训练数据)、与过程奖励模型 (PRM) 结合做推理期树搜索。
解决的核心痛点
自回归生成“一条路走到黑”,一步出错即无法回溯且错误会传播;MCTS 通过多路径探索 + 价值引导剪枝,在推理期寻找更优路径,显著提升困难任务的解出率。
🎯5 个高频面试考点 (Exam Points)
1
MCTS 四步(选择/扩展/模拟/回溯)分别做什么?
2
写出 UCT 公式并解释各符号?如何平衡探索与利用?
3
MCTS 如何与 LLM 结合?节点、动作、价值分别如何定义?
4
过程奖励模型 (PRM) 在 MCTS 中的作用?为什么逐步奖励优于结果奖励?
5
MCTS vs 简单多次采样 (best-of-N):计算复杂度与收益的对比?
📖 关联深度指南:📄 reasoning-and-cot
更新于 2026-08-12
🎯
检验攻克程度:针对「MCTS 推理搜索」专属刷题排雷
做单选排雷题、推导选项机制,答错自动收录进专属错题本。
🚀 开始本考点专项刷题
上一个知识点推理时扩展下一个知识点PRM 与 RLVR

🔗 更多 大语言模型 知识点卡片

Agent 与工具调用对齐税与偏好数据缩放点积注意力注意力变体 MHA/MQA/GQA