🎯核心定义
推理时扩展 (Test-Time Compute Scaling) 指在生成阶段用更多计算换取更高准确率,与训练期扩展 (scaling laws) 正交。主要形式:① 思考预算 (thinking budget):o1 式慢思考,显式生成 long CoT,允许的 token 预算越多准确率越高(形成推理时 scaling law);② 多次采样选优:Best-of-N 用奖励模型挑选,或 majority voting 直接投票;③ 并行搜索:MCTS + 过程奖励做树搜索。预算通过 reasoning effort(轻/中/重)或 max_tokens 控制。