返回 RS 算法研究员 思维导图
中文·English
🎓 RS 算法研究员ID: rs-inference-time-compute-scaling

Inference-time Compute 缩放定律

Inference-Time Compute & Search Scaling
🎯核心定义
推理期算力缩放定律与测试期树搜索演进 (Inference-Time Compute Scaling Laws & Test-Time Search Paradigm / OpenAI o1, DeepSeek-R1 理论基础) 标志着大模型从“单向纯预训练 Scaling”迈向“预训练 + 推理期自适应思考 Scaling”的双引擎全新时代;核心理论:传统 LLM 在推理时对每个 Token 仅分配恒定的前向计算量;推理期 Scaling 允许模型在面对高难度数学、代码与科学推理时,通过投入更多的测试期计算量 (Test-time FLOPs) 实现性能的对数/幂律持续攀升;三大核心推理期搜索机制:1) 最佳采样搜索 (Best-of-NN Sampling with Verifier / PRM): 并行采样 NN 条候选解答,利用过程奖励模型打分选优;2) 束搜索与蒙特卡洛树搜索 (Beam Search & MCTS over Thought Tokens): 在思考 Token 空间进行树状前瞻展开与分支剪枝;3) 自回归长链自我纠错 (Long Chain-of-Thought with Backtracking): 允许模型生成“Wait, let me re-evaluate...”长反思 Token,动态拓展思考深度。
💡使用场景
复杂数学奥赛题求解 (AIME, IMO)、高难度算法竞赛代码合成 (Codeforces)、前沿科学假设推导。
解决的核心痛点
复杂长链逻辑问题无法在单一的前向直觉中一次性答对;推理期算力扩展将 System-1 快思考升华至具备搜索、反思与回溯能力的 System-2 深度思考。
🎯5 个高频面试考点 (Exam Points)
1
详细对比 Best-of-NN 拒绝采样、Beam Search 与 MCTS 在测试期算力消耗 (FLOPs) 与最终求解成功率 (Pass@1) 上的缩放曲线?
2
过程奖励模型 (Process Reward Model, PRM) 相比结果奖励模型 (Outcome Reward Model, ORM) 在树搜索中提供单步细粒度打分 (Step-level Credit Assignment) 的数学优势?
3
自回归长思维链 (Thinking Tokens) 中的自我纠错与回溯 (Self-Correction & Backtracking) 是如何通过纯强化学习在无人工标注监督下自发涌现的?
4
推理期算力与预训练算力的等价置换模型:一个经过大量推理思考的小模型(如 1.5B R1-Distill)在数学能力上为什么能超越单向前向的 70B/400B 巨型模型?
5
测试期搜索遭遇的“奖励黑客 (Reward Hacking)”与“过拟合验证器 (Overfitting the Verifier)”的防御策略?
🔗核心前置底层技术卡片 (点击穿透复习)
📖 关联深度指南:📄 rs-core-cheatsheet
更新于 2026-08-14
🎯
检验攻克程度:针对「Inference-time Compute 缩放定律」专属刷题排雷
做单选排雷题、推导选项机制,答错自动收录进专属错题本。
🚀 开始本考点专项刷题
上一个知识点Chinchilla 算力最优定律与比率下一个知识点Transformer 表达能力与图灵完备界

🔗 更多 RS 算法研究员 知识点卡片

DPO 闭式最优策略与隐式奖励推导PPO 剪切代理目标函数下界证明RoPE 旋转位置编码复数内积证明扩散模型 SDE 连续随机微分推导