TalentMe
How To
🗺️
AI Industry Map
NEW
Knowledge ▾
Intro & Usage
Machine Learning Repo
Data Science Repo
Resources ▾
Intro & Usage
AI Tech Vault (Tech Wiki)
Industry News
Tech Blogs
Research Papers
Open Source Projects
Tools Hub ▾
🛠️ Tools & Skills Overview
🌐 Interactive Web Tools
🗺️ AI Industry & Career Map
🧭 AI Career Transition Navigator & Roadmap
📚 AI Multi-Module Practice Hub
🎯 AI Skill Assessment
🧠 AI Skills Library
AI Skills & Prompts Overview
Local Agent Guide
Cloud Skills Templates
⚡ MCP Tools Suite
TalentMe MCP Guide
CLI Tools & Commands
Services ▾
🚀 Services & Plans Suite
🧭 1v1 Coaching & Services
💎 Plans & Pricing
💬 Contact & Consultation
Contact Us
💬 Discord
🌐
中
☀️
🔑
Login / Register
☰
技术知识库
›
复习路线图
›
强化学习 思维导图
›
Thompson 采样
← 返回 强化学习 思维导图
中文
·
English
🎮 强化学习
ID:
thompson-sampling
Thompson 采样
Thompson Sampling
🎯
核心定义
Thompson 采样 (TS, 概率匹配) 是贝叶斯探索算法:为每个臂维护奖励的后验分布,每轮从后验中采样
θ
a
∼
Beta
(
α
a
+
w
a
,
β
a
+
l
a
)
\theta_a \sim \text{Beta}(\alpha_a + w_a, \beta_a + l_a)
θ
a
∼
Beta
(
α
a
+
w
a
,
β
a
+
l
a
)
(Bernoulli 奖励下 Beta 先验是共轭先验,
w
a
w_a
w
a
/
l
a
l_a
l
a
为臂
a
a
a
的累计胜/负次数),然后选择采样值最大的臂。以"当前后验下该臂是最优"的概率选臂 (probability matching):后验越宽(越不确定)的臂越可能被选,天然实现探索-利用权衡。
💡
使用场景
工业界在线决策的默认算法之一(广告、推荐、实验平台),因为实现简单、样本效率高、实际表现常优于 UCB;面试常考 Beta 后验更新公式与共轭原理。
⚡
解决的核心痛点
UCB 的置信上界是频率派构造,对先验知识/奖励分布利用不足;TS 通过后验采样把不确定性直接编码进选择概率,regret 可达
O
(
ln
T
)
O(\ln T)
O
(
ln
T
)
(最坏情形亦有良好保证),对非平稳奖励 (drifting) 更鲁棒,且能自然扩展到上下文特征 (Linear/Logistic TS)。
🎯
5 个高频面试考点 (Exam Points)
1
推导 Beta 后验:先验
Beta
(
α
,
β
)
\text{Beta}(\alpha, \beta)
Beta
(
α
,
β
)
+ Bernoulli 观察 → 后验
Beta
(
α
+
w
,
β
+
l
)
\text{Beta}(\alpha + w, \beta + l)
Beta
(
α
+
w
,
β
+
l
)
?
2
数值题:先验
Beta
(
1
,
1
)
\text{Beta}(1,1)
Beta
(
1
,
1
)
, 臂1 赢 8 输 2、臂2 赢 3 输 7, 写出两个后验并说明下一次采样更可能选哪个臂?
3
TS 与 UCB 的 regret 对比?为什么工业界 TS 实际表现常更好?
4
非平稳环境 (奖励漂移) 下 TS 如何退化?有哪些修正?
5
probability matching 性质:选臂概率 = 该臂为最优的后验概率, 这对探索意味着什么?
📖 关联深度指南:
📄 bandits-and-online-decision →
更新于 2026-08-12
🎯
检验攻克程度:针对「Thompson 采样」专属刷题排雷
做单选排雷题、推导选项机制,答错自动收录进专属错题本。
🚀 开始本考点专项刷题 ➔
← 上一个知识点
UCB1 乐观估计
下一个知识点 →
上下文老虎机
🔗 更多 强化学习 知识点卡片
Actor-Critic 框架
行为克隆 BC
思维链与推理强化
CQL 保守 Q 学习