TalentMe
How To
🗺️
AI Industry Map
NEW
Knowledge ▾
Intro & Usage
Machine Learning Repo
Data Science Repo
Resources ▾
Intro & Usage
AI Tech Vault (Tech Wiki)
Industry News
Tech Blogs
Research Papers
Open Source Projects
Tools Hub ▾
🛠️ Tools & Skills Overview
🌐 Interactive Web Tools
🗺️ AI Industry & Career Map
🧭 AI Career Transition Navigator & Roadmap
📚 AI Multi-Module Practice Hub
🎯 AI Skill Assessment
🧠 AI Skills Library
AI Skills & Prompts Overview
Local Agent Guide
Cloud Skills Templates
⚡ MCP Tools Suite
TalentMe MCP Guide
CLI Tools & Commands
Services ▾
🚀 Services & Plans Suite
🧭 1v1 Coaching & Services
💎 Plans & Pricing
💬 Contact & Consultation
Contact Us
💬 Discord
🌐
中
☀️
🔑
Login / Register
☰
技术知识库
›
复习路线图
›
强化学习 思维导图
›
Slate/组合老虎机
← 返回 强化学习 思维导图
中文
·
English
🎮 强化学习
ID:
slate-bandit
Slate/组合老虎机
Slate / Combinatorial Bandit
🎯
核心定义
Slate Bandit (组合老虎机) 把动作从单个 item 扩展到整页推荐列表:每轮从
N
N
N
个候选中选出
K
K
K
个组成 slate
S
S
S
,要求
∣
S
∣
=
K
|S| = K
∣
S
∣
=
K
,共
(
N
K
)
\binom{N}{K}
(
K
N
)
种组合;奖励既可以是 item 级(逐条点击),也可以是 slate 级(如"至少一次点击"、页面停留时长)。典型解法是 Top-K 组合探索:把 UCB/TS 的置信公式作用到 item 级别——按
μ
^
a
+
2
ln
t
n
a
\hat{\mu}_a + \sqrt{\frac{2\ln t}{n_a}}
μ
^
a
+
n
a
2
l
n
t
排序取前
K
K
K
,保证每个候选都有被探索的机会,再结合位置/多样性修正。
💡
使用场景
首页信息流、搜索结果页、邮件推荐、广告组合样式;面试从"一个动作 vs 一组动作"的维度对比 MAB,引出组合复杂度
(
N
K
)
\binom{N}{K}
(
K
N
)
与贪心近似。
⚡
解决的核心痛点
直接枚举
(
N
K
)
\binom{N}{K}
(
K
N
)
个超臂 (super-arm) 会组合爆炸、无法逐一估计;slate bandit 利用组合结构(每个 item 的独立贡献 + 位置效应)把估计维度从组合级降到 item 级,在大候选池下保持
O
(
ln
T
)
O(\ln T)
O
(
ln
T
)
量级的 regret,同时能显式建模 item 间依赖(多样性惩罚、互斥内容)。
🎯
5 个高频面试考点 (Exam Points)
1
组合复杂度:
N
=
10
,
K
=
3
N=10, K=3
N
=
10
,
K
=
3
时有多少种 slate?为什么不能逐一估计每个超臂?
2
Top-K 组合探索的公式: 如何在 item 级做 UCB/TS 并取前 K, 探索如何保证?
3
item 级奖励与 slate 级奖励建模的差别?各自适用场景?
4
位置偏差 (position bias) 如何影响估计?如何修正?
5
slate 内 item 间的依赖如何建模: 多样性/互斥/协同点击的约束?
📖 关联深度指南:
📄 bandits-and-online-decision →
更新于 2026-08-12
🎯
检验攻克程度:针对「Slate/组合老虎机」专属刷题排雷
做单选排雷题、推导选项机制,答错自动收录进专属错题本。
🚀 开始本考点专项刷题 ➔
← 上一个知识点
上下文老虎机
下一个知识点 →
长效留存延迟奖励
🔗 更多 强化学习 知识点卡片
Actor-Critic 框架
行为克隆 BC
思维链与推理强化
CQL 保守 Q 学习