返回 强化学习 思维导图
中文·English
🎮 强化学习ID: slate-bandit

Slate/组合老虎机

Slate / Combinatorial Bandit
🎯核心定义
Slate Bandit (组合老虎机) 把动作从单个 item 扩展到整页推荐列表:每轮从 NN 个候选中选出 KK 个组成 slate SS,要求 S=K|S| = K,共 (NK)\binom{N}{K} 种组合;奖励既可以是 item 级(逐条点击),也可以是 slate 级(如"至少一次点击"、页面停留时长)。典型解法是 Top-K 组合探索:把 UCB/TS 的置信公式作用到 item 级别——按 μ^a+2lntna\hat{\mu}_a + \sqrt{\frac{2\ln t}{n_a}} 排序取前 KK,保证每个候选都有被探索的机会,再结合位置/多样性修正。
💡使用场景
首页信息流、搜索结果页、邮件推荐、广告组合样式;面试从"一个动作 vs 一组动作"的维度对比 MAB,引出组合复杂度 (NK)\binom{N}{K} 与贪心近似。
解决的核心痛点
直接枚举 (NK)\binom{N}{K} 个超臂 (super-arm) 会组合爆炸、无法逐一估计;slate bandit 利用组合结构(每个 item 的独立贡献 + 位置效应)把估计维度从组合级降到 item 级,在大候选池下保持 O(lnT)O(\ln T) 量级的 regret,同时能显式建模 item 间依赖(多样性惩罚、互斥内容)。
🎯5 个高频面试考点 (Exam Points)
1
组合复杂度: N=10,K=3N=10, K=3 时有多少种 slate?为什么不能逐一估计每个超臂?
2
Top-K 组合探索的公式: 如何在 item 级做 UCB/TS 并取前 K, 探索如何保证?
3
item 级奖励与 slate 级奖励建模的差别?各自适用场景?
4
位置偏差 (position bias) 如何影响估计?如何修正?
5
slate 内 item 间的依赖如何建模: 多样性/互斥/协同点击的约束?
📖 关联深度指南:📄 bandits-and-online-decision
更新于 2026-08-12
🎯
检验攻克程度:针对「Slate/组合老虎机」专属刷题排雷
做单选排雷题、推导选项机制,答错自动收录进专属错题本。
🚀 开始本考点专项刷题
上一个知识点上下文老虎机下一个知识点长效留存延迟奖励

🔗 更多 强化学习 知识点卡片

Actor-Critic 框架行为克隆 BC思维链与推理强化CQL 保守 Q 学习