TalentMe
How To
🗺️
AI Industry Map
NEW
Knowledge ▾
Intro & Usage
Machine Learning Repo
Data Science Repo
Resources ▾
Intro & Usage
AI Tech Vault (Tech Wiki)
Industry News
Tech Blogs
Research Papers
Open Source Projects
Tools Hub ▾
🛠️ Tools & Skills Overview
🌐 Interactive Web Tools
🗺️ AI Industry & Career Map
🧭 AI Career Transition Navigator & Roadmap
📚 AI Multi-Module Practice Hub
🎯 AI Skill Assessment
🧠 AI Skills Library
AI Skills & Prompts Overview
Local Agent Guide
Cloud Skills Templates
⚡ MCP Tools Suite
TalentMe MCP Guide
CLI Tools & Commands
Services ▾
🚀 Services & Plans Suite
🧭 1v1 Coaching & Services
💎 Plans & Pricing
💬 Contact & Consultation
Contact Us
💬 Discord
🌐
中
☀️
🔑
Login / Register
☰
技术知识库
›
复习路线图
›
强化学习 思维导图
›
多臂老虎机 MAB
← 返回 强化学习 思维导图
中文
·
English
🎮 强化学习
ID:
mab
多臂老虎机 MAB
Multi-Armed Bandit (MAB)
🎯
核心定义
多臂老虎机 (Multi-Armed Bandit, MAB) 是单状态、无状态转移的在线决策问题:每轮从
K
K
K
个臂中选择一个动作
a
t
a_t
a
t
,获得随机奖励
r
t
r_t
r
t
(如 Bernoulli 点击
r
t
∼
Bernoulli
(
μ
a
t
)
r_t \sim \text{Bernoulli}(\mu_{a_t})
r
t
∼
Bernoulli
(
μ
a
t
)
)。核心指标是 regret(遗憾):
R
T
=
T
μ
∗
−
E
[
∑
t
=
1
T
μ
a
t
]
R_T = T\mu^* - \mathbb{E}[\sum_{t=1}^T \mu_{a_t}]
R
T
=
T
μ
∗
−
E
[
∑
t
=
1
T
μ
a
t
]
,其中
μ
∗
=
max
a
μ
a
\mu^* = \max_a \mu_a
μ
∗
=
max
a
μ
a
是最优臂的期望奖励,即累计奖励相比"每轮都玩最优臂"的期望差距。
💡
使用场景
推荐/广告的流量分配与物料冷启动、A/B 测试的在线替代、AutoML 超参搜索、临床试验;面试中常作为"单状态 RL"对比 Q-Learning 的切入点,引出探索-利用权衡 (exploration-exploitation)。
⚡
解决的核心痛点
静态 A/B 测试按固定比例分配流量,劣方案浪费大量样本;MAB 根据实时反馈动态调整选择概率,以接近最优臂的频率玩好臂,UCB/Thompson 采样可达最优的
O
(
ln
T
)
O(\ln T)
O
(
ln
T
)
regret(一般算法为
O
(
T
)
O(\sqrt{T})
O
(
T
)
量级),相同预算下累计收益显著高于均匀/随机分配。
🎯
5 个高频面试考点 (Exam Points)
1
写出 regret 定义并解释每一项:为何用最优臂期望
μ
∗
\mu^*
μ
∗
而非实际收益?
2
数值题:3 臂
μ
=
(
0.8
,
0.5
,
0.3
)
\mu=(0.8, 0.5, 0.3)
μ
=
(
0.8
,
0.5
,
0.3
)
, 玩 100 轮, 臂1 被选 60 次、臂2/3 各 20 次, 计算 regret?
3
MAB 与完整 RL (MDP) 的差别?MAB 如何从 MDP 退化而来?
4
ε-greedy、UCB、Thompson 采样各自的核心思想与 regret 量级?
5
regret 下界:为什么任何算法的 worst-case regret 至少是
Ω
(
K
T
)
\Omega(\sqrt{KT})
Ω
(
K
T
)
?
📖 关联深度指南:
📄 bandits-and-online-decision →
更新于 2026-08-12
🎯
检验攻克程度:针对「多臂老虎机 MAB」专属刷题排雷
做单选排雷题、推导选项机制,答错自动收录进专属错题本。
🚀 开始本考点专项刷题 ➔
← 上一个知识点
多智能体 CTDE/MAPPO
下一个知识点 →
UCB1 乐观估计
🔗 更多 强化学习 知识点卡片
Actor-Critic 框架
行为克隆 BC
上下文老虎机
思维链与推理强化