推理期算力缩放定律与测试期树搜索演进 (Inference-Time Compute Scaling Laws & Test-Time Search Paradigm / OpenAI o1, DeepSeek-R1 理论基础) 标志着大模型从“单向纯预训练 Scaling”迈向“预训练 + 推理期自适应思考 Scaling”的双引擎全新时代;核心理论:传统 LLM 在推理时对每个 Token 仅分配恒定的前向计算量;推理期 Scaling 允许模型在面对高难度数学、代码与科学推理时,通过投入更多的
测试期计算量 (Test-time FLOPs) 实现性能的对数/幂律持续攀升;三大核心推理期搜索机制:1) 最佳采样搜索 (Best-of-
N Sampling with Verifier / PRM): 并行采样
N 条候选解答,利用过程奖励模型打分选优;2) 束搜索与蒙特卡洛树搜索 (Beam Search & MCTS over Thought Tokens): 在思考 Token 空间进行树状前瞻展开与分支剪枝;3) 自回归长链自我纠错 (Long Chain-of-Thought with Backtracking): 允许模型生成“Wait, let me re-evaluate...”长反思 Token,动态拓展思考深度。