返回 强化学习 思维导图
中文·English
🎮 强化学习ID: long-term-retention

长效留存延迟奖励

Long-Term Retention RL
🎯核心定义
长效留存 RL 把次留/7 日留存/LTV 建模为延迟奖励 (delayed reward):当轮动作(如推荐某个内容)的真实回报要几天甚至几周后才能观测,于是引入折扣因子 γ\gamma 建模跨期收益,长期目标 J=E[tγtrt]J = \mathbb{E}[\sum_{t} \gamma^t r_t],γ\gamma 越小越看重近期、越大越看重远期,与短期指标(如即时 CTR)形成权衡。延迟奖励带来 credit assignment 困难:回报难以归因到具体轮次/动作,常用解法是时序分解、代理奖励 (surrogate reward) 与序贯决策框架结合。
💡使用场景
短视频/社交/游戏 App 的留存优化、订阅与广告的 LTV 建模、推荐系统"CTR 提升但留存下降"悖论的修正;面试常问"为什么只看 CTR 会伤害长期体验,折扣与延迟奖励如何修正"。
解决的核心痛点
纯短期目标(CTR)会被点击诱饵/标题党利用,损害长期留存;把留存作为延迟奖励并用 γ\gamma 折现后,策略学会牺牲部分即时指标换取更高长期价值,并用时序差分(自举)或蒙特卡洛归因缓解延迟反馈的方差,实现短期与长期指标的一致性。
🎯5 个高频面试考点 (Exam Points)
1
为什么延迟奖励会造成 credit assignment 困难?折扣因子 γ\gamma 的作用是什么?
2
公式题: J=E[tγtrt]J = \mathbb{E}[\sum_t \gamma^t r_t], 解释 γ0\gamma \to 0γ1\gamma \to 1 分别对应什么业务目标?
3
为什么只看 CTR 会伤害留存?如何设计兼顾短期与长期的奖励?
4
延迟反馈的归因方法: TD 自举 vs MC, 代理奖励 (surrogate) 如何加速学习?
5
如何把次留作为延迟反馈接入 MAB/在线学习 (延迟奖励 bandit) 或 RL?
📖 关联深度指南:📄 bandits-and-online-decision
更新于 2026-08-12
🎯
检验攻克程度:针对「长效留存延迟奖励」专属刷题排雷
做单选排雷题、推导选项机制,答错自动收录进专属错题本。
🚀 开始本考点专项刷题
上一个知识点Slate/组合老虎机下一个知识点RLVR 可验证奖励

🔗 更多 强化学习 知识点卡片

Actor-Critic 框架行为克隆 BC上下文老虎机思维链与推理强化