M5-019M5: NLP & Large Language ModelsScaling Laws & Compute AllocationHard
Mastery:

Scaling Laws & Compute Allocation: 解释后训练阶段的 scaling(RL/推理算力)与预训练 scaling 的差异。

📐 Mathematical Definition
Lpretrain smooth power law;RL: task-dependent, less predictable\mathcal{L}_{\text{pretrain}}\ \text{smooth power law};\qquad \text{RL}:\ \text{task-dependent},\ \text{less predictable}
⚡ Executive Summary
Core Concept: 预训练 scaling 平滑可预测;RL/后训练的 scaling 更不稳定、更依赖任务与数据,且常呈'先快后慢'。

📌 Key Takeaways

  • •
    预训练:平滑幂律、可跨规模外推
  • •
    RL/后训练:曲线不规则、依赖任务与奖励设计
  • •
    推理时算力(test-time)是第三条 scaling 轴

📐 Mathematical Derivations

数学机理:<strong>三条 scaling 轴</strong>。<strong>(1) 预训练 scaling(参数 × 数据 × 训练算力)</strong>——平滑幂律、跨规模可外推(见前述)。<strong>(2) 后训练/RL scaling(RL 算力)</strong>——用强化学习(RLHF/RLVR)提升能力时,性能随 RL 算力提升,但<strong>曲线更不规则</strong>:(a) <strong>依赖任务与奖励设计</strong>(不同任务的曲线差异大);(b) <strong>常呈'先快后慢'</strong>(早期快速提升、后期平台或退化);(c) <strong>不稳定</strong>(奖励黑客、KL 漂移、崩溃);(d) <strong>难以跨规模外推</strong>(RL 的超参与数据依赖强)。原因:RL 优化的是<strong>非平稳目标</strong>(策略变化 → 数据分布变化 → 奖励估计变化),且<strong>奖励是代理</strong>(proxy)而非真实目标。<strong>(3) 推理时算力 scaling(test-time compute)</strong>——在推理时投入更多计算(长 CoT、多次采样、搜索、验证器)可提升表现;研究表明其效果可<strong>与模型规模互补</strong>(某些任务上'小模型 + 更多推理算力'可匹配'大模型')。<strong>三条轴的差异与配合</strong>——(a) <strong>可预测性</strong>:预训练 >> 推理时 >> RL;(b) <strong>成本结构</strong>:预训练是一次性、推理时是持续的、RL 介于两者;(c) <strong>能力类型</strong>:预训练提供'知识与基础能力'、RL 提供'对齐与推理习惯'、推理时提供'按需的深度思考'。<strong>实践</strong>——(i) 先用预训练 scaling 达到基础能力;(ii) 用 SFT + RLHF/RLVR 对齐与提升推理;(iii) 用推理时算力按需增强(如难题用长 CoT)。三者<strong>互补而非替代</strong>。

🏭 Production Trade-offs

深度剖析与工程权衡:① <strong>'RL scaling 更难'的根源是'非平稳性'</strong>——RL 的优化目标随策略变化(数据分布由当前策略产生),故不像监督学习那样有稳定的损失曲线;这使'预测与调参'更难。② <strong>奖励设计的杠杆作用</strong>——RL 的收益高度依赖奖励是否'与真实目标对齐';若奖励可被钻空子(reward hacking),算力越多反而越差。故 RL scaling 的前提是<strong>可靠的奖励</strong>(可验证任务天然满足)。③ <strong>推理时算力的经济性</strong>——推理时算力是<strong>持续成本</strong>(每次请求都付费),而预训练是一次性成本;故需按'推理量'权衡(类似 over-training 的经济学)。对高频服务,'小模型 + 少量推理算力'可能比'大模型'更经济。④ <strong>'推理算力与模型规模的等价性'</strong>——有研究(如'Scaling LLM Test-Time Compute')表明:在某些任务上,用更多推理算力的小模型可匹配更大模型;但<strong>不是所有任务</strong>都如此(依赖任务是否可分解为可验证的步骤)。⑤ <strong>与'能力上限'的关系</strong>——推理时算力无法突破模型的<strong>知识上限</strong>(不知道的事实无法通过多想获得);故它主要提升'推理/组合'能力,而非'知识'。⑥ <strong>面试要点</strong>——被问'后训练 scaling 与预训练 scaling 有何不同',应给出'<strong>可预测性(预训练平滑、RL 不规则)+ 非平稳性(RL 目标随策略变化)+ 三条轴的互补配合</strong>';能指出'RL scaling 的前提是可靠奖励'与'推理算力无法突破知识上限'是深度理解的标志。
⚠️ Common Interview Pitfalls
  • ✕
    假设 RL 性能随算力平滑可预测地提升
  • ✕
    认为推理时算力可替代知识学习
🎯 Interviewer Follow-ups
  • ?
    为什么 RL 的 scaling 更难预测?
  • ?
    三条 scaling 轴如何配合?
📚

Associated Knowledge Base Guides & Mindmaps

Explore the comprehensive technical article, exam cards, and global architecture tree.

← PreviousM5-018: Scaling Laws & Compute Allocation: 解释 scaling law 对超参与架构选择的指导意义。📋Back to BankNext →M5-020: Instruction Tuning & Supervised Fine-Tuning: 解释 SFT 的目标与数据构造要点。