返回 大语言模型 思维导图
中文·English
大语言模型ID: test-time-compute

推理时扩展

Test-Time Compute Scaling
🎯核心定义
推理时扩展 (Test-Time Compute Scaling) 指在生成阶段用更多计算换取更高准确率,与训练期扩展 (scaling laws) 正交。主要形式:① 思考预算 (thinking budget):o1 式慢思考,显式生成 long CoT,允许的 token 预算越多准确率越高(形成推理时 scaling law);② 多次采样选优:Best-of-N 用奖励模型挑选,或 majority voting 直接投票;③ 并行搜索:MCTS + 过程奖励做树搜索。预算通过 reasoning effort(轻/中/重)或 max_tokens 控制。
💡使用场景
数学、代码等可验证或可打分任务;对延迟不敏感、追求极致准确率的场景;API 用户用 effort 参数调节性价比;也可把推理时搜索出的高质量轨迹自博弈蒸馏回小模型。
解决的核心痛点
模型在困难任务上“一步作答”准确率低;推理时扩展把算力从训练期转移到推理期,无需重新训练即可显著提升困难任务表现,形成 compute-time tradeoff:错误率随推理计算量按幂律下降 L(T)TαL(T) \propto T^{-\alpha}(边际收益递减)。
🎯5 个高频面试考点 (Exam Points)
1
推理时扩展有哪些主要形式?与训练时扩展 (scaling laws) 的区别?
2
思考预算 (thinking budget) 是什么?o1 如何用 reasoning effort 控制?
3
Best-of-N 与 majority voting 的区别?各需要什么信号?
4
推理时扩展的收益曲线:边际收益递减体现在哪?什么任务收益最大?
5
如何把推理时扩展蒸馏回小模型(自博弈/蒸馏路线)?
📖 关联深度指南:📄 reasoning-and-cot
更新于 2026-08-12
🎯
检验攻克程度:针对「推理时扩展」专属刷题排雷
做单选排雷题、推导选项机制,答错自动收录进专属错题本。
🚀 开始本考点专项刷题
上一个知识点思维链 CoT下一个知识点MCTS 推理搜索

🔗 更多 大语言模型 知识点卡片

Agent 与工具调用对齐税与偏好数据缩放点积注意力注意力变体 MHA/MQA/GQA