M5-095M5: NLP & Large Language ModelsAgents & Tool UseHard
Mastery:

Agents & Tool Use: 解释 Agent 的强化学习训练(agentic RL)。

📐 Mathematical Definition
agentic RL: max⁡θE[R(τ)], τ=(thought,action,obs)∗;sparse, long-horizon\text{agentic RL}:\ \max_\theta\mathbb{E}[R(\tau)],\ \tau=(\text{thought},\text{action},\text{obs})^*;\qquad \text{sparse},\ \text{long-horizon}
⚡ Executive Summary
Core Concept: 用 RL 训练 Agent 的多步决策(工具选择/调用),奖励为任务成功;难点是稀疏奖励、长轨迹与信用分配。

📌 Key Takeaways

  • •
    用 RL 训练多步决策(而非仅 prompt),奖励=任务成功
  • •
    难点:奖励稀疏(只在末尾)、轨迹长、信用分配难
  • •
    方法:轨迹采样 + 结果奖励 + 中间验证/PRM;或用 SFT 冷启动

📐 Mathematical Derivations

数学机理:<strong>agentic RL 的设定</strong>——把 Agent 的交互过程建模为 MDP:状态=上下文(历史 + 观察)、动作=(思考 token + 工具调用)、奖励=<strong>任务成功与否</strong>(通常在轨迹末尾)。目标是最大化期望回报 max_θ E[R(τ)],其中 τ=(thought, action, observation)* 是完整轨迹。<strong>与 RLHF 的差异</strong>——(a) <strong>轨迹更长</strong>(RLHF 是单轮生成,agentic 是多轮交互);(b) <strong>动作空间更复杂</strong>(含离散的工具选择 + 连续/结构化的参数 + 自然语言思考);(c) <strong>环境交互</strong>(工具调用有真实副作用与延迟);(d) <strong>奖励更稀疏</strong>(RLHF 对整个回答打分,agentic 只在任务完成时给奖励)。<strong>核心难点</strong>:(1) <strong>奖励稀疏(sparse reward)</strong>——只在轨迹末尾有信号,中间步骤无反馈;导致信用分配困难('哪一步做对了?')。(2) <strong>轨迹长(long horizon)</strong>——多步累积使梯度方差大、训练不稳。(3) <strong>环境不可微且慢</strong>——工具调用是黑盒(不可反传),且每次采样需真实执行(慢、可能失败)。(4) <strong>探索困难</strong>——动作空间大(选哪个工具、什么参数),随机探索效率低。(5) <strong>样本效率低</strong>——每条轨迹都需完整交互(成本高)。<strong>方法</strong>:(1) <strong>SFT 冷启动</strong>——先用专家轨迹(人工或强模型)做 SFT,得到'会基本操作'的起点;这大幅降低 RL 的探索难度(与推理模型的 cold start 同理)。(2) <strong>结果奖励(outcome reward)</strong>——用'任务是否完成'(可程序验证的任务最好,如代码通过测试)作为奖励;配合 GRPO 等算法。(3) <strong>过程奖励(PRM)</strong>——对中间步骤打分(如'这一步是否合理'),缓解稀疏奖励;但标注贵。(4) <strong>密集奖励设计</strong>——(a) <strong>子目标奖励</strong>(完成子任务给奖励);(b) <strong>格式奖励</strong>(正确调用工具给奖励);(c) <strong>进度奖励</strong>。(5) <strong>拒绝采样微调(RFT)</strong>——采样多条轨迹、保留成功的做 SFT(简单有效,无需 RL 循环)。(6) <strong>课程学习</strong>——从简单任务开始(成功率高、信号密集),逐步增加难度。(7) <strong>环境模拟</strong>——用模拟环境(快速、可复现)替代真实环境训练(降低采样成本与风险)。<strong>实证</strong>——近年的 agentic RL 工作(如用 SWE-bench 训练代码 Agent)显示:SFT 冷启动 + 结果奖励的 RL 能显著提升任务成功率;但成本高(需大量真实交互)。

🏭 Production Trade-offs

深度剖析与工程权衡:① <strong>'稀疏奖励 + 长轨迹'是核心难点</strong>——它使 agentic RL 比 RLHF 难得多;缓解靠'冷启动 + 课程学习 + 过程奖励 + 环境模拟'的组合。② <strong>'可程序验证的任务最适合 agentic RL'</strong>——如代码(跑测试)、数据操作(检查结果);因为奖励可靠且自动。对'开放任务'(如'写一份报告')则需人工/LLM 评判(成本高、噪声大)。③ <strong>'SFT 冷启动'几乎是必需的</strong>——纯 RL 从零探索多步任务极难(动作空间大、奖励稀疏);故先用专家轨迹 SFT(教'基本操作'),再用 RL 优化。④ <strong>'环境模拟'的价值</strong>——真实工具调用慢且有副作用;用模拟环境(如模拟的文件系统、模拟的 API)可快速采样、可复现、无风险;但需注意<strong>模拟-真实差距</strong>(sim-to-real gap)。⑤ <strong>'过程奖励'的取舍</strong>——它缓解稀疏奖励但需标注(贵);实践中常用'自动过程奖励'(如'是否调用了正确的工具'这种规则化信号)。⑥ <strong>面试要点</strong>——被问'Agent 怎么用 RL 训练',应给出'<strong>MDP 设定(状态=上下文、动作=思考+工具调用、奖励=任务成功)+ 难点(稀疏奖励/长轨迹/不可微环境/探索难)+ 方法(SFT 冷启动 + 结果奖励 + 过程奖励 + 课程学习 + 环境模拟)</strong>';能指出'可程序验证的任务最适合'是深度理解的标志。
⚠️ Common Interview Pitfalls
  • ✕
    纯 RL 从零训练 Agent(探索困难)
  • ✕
    用真实环境做大规模 RL(慢且有副作用)
🎯 Interviewer Follow-ups
  • ?
    为什么 agentic RL 比 RLHF 更难?
  • ?
    如何缓解稀疏奖励?
📚

Associated Knowledge Base Guides & Mindmaps

Explore the comprehensive technical article, exam cards, and global architecture tree.

← PreviousM5-094: Agents & Tool Use: 解释 Agent 的失败模式与恢复。📋Back to BankNext →M5-096: Agents & Tool Use: 解释计算机使用 Agent(computer use)的挑战。