返回 AI 基础设施 思维导图
中文·English
🖥️ AI 基础设施ID: rl-serving

RL 训练与推理服务(跨模块)

RL Training/Serving (cross-module)
🎯核心定义
RL 训练与推理服务是 RLVR (RL with Verifiable Rewards) 的采样/验证基础设施: 训练侧为每个 prompt 采样 NN 条 rollout 轨迹并经验证器评分/过滤, 推理侧承载推理时扩展 (test-time scaling) 的延长生成服务。
💡使用场景
数学/代码等可验证奖励任务的训练与推理时扩展 (如 o1 类推理模型); RL 工程化面试常问 rollout 集群、验证器与推理时计算扩展。
解决的核心痛点
人工奖励标注难以规模化时, RLVR 用可验证奖励 + 大规模并行采样获得训练信号, 验证器自动过滤低质量轨迹; 推理时通过延长思考/多次采样换取准确率提升。详见 RL 模块: 算法与训练细节见 RL 模块 (指南 agentic-rl-and-reasoning-search)。
🎯5 个高频面试考点 (Exam Points)
1
RLVR 与 RLHF 的差异 (可验证奖励 vs 奖励模型), 采样-验证管线如何设计?
2
大规模 rollout 的基础设施: 训练/推理混部、采样吞吐、验证器计算如何调度?
3
验证器 (verifier) 如何构造并过滤轨迹 (答案比对、单测执行)?
4
推理时扩展 (test-time scaling): 延长生成/多次采样如何提升准确率, 成本如何控制?
5
rollout 数据如何回放给策略更新 (GRPO/PPO), 采样并行度如何影响奖励分布?
更新于 2026-08-12
🎯
检验攻克程度:针对「RL 训练与推理服务(跨模块)」专属刷题排雷
做单选排雷题、推导选项机制,答错自动收录进专属错题本。
🚀 开始本考点专项刷题
上一个知识点上下文缓存与记忆服务

🔗 更多 AI 基础设施 知识点卡片

激活显存估算Agent 运行时(跨模块)弹性伸缩与成本优化检查点与故障恢复