返回 强化学习 思维导图
中文·English
🎮 强化学习ID: thompson-sampling

Thompson 采样

Thompson Sampling
🎯核心定义
Thompson 采样 (TS, 概率匹配) 是贝叶斯探索算法:为每个臂维护奖励的后验分布,每轮从后验中采样 θaBeta(αa+wa,βa+la)\theta_a \sim \text{Beta}(\alpha_a + w_a, \beta_a + l_a)(Bernoulli 奖励下 Beta 先验是共轭先验,waw_a/lal_a 为臂 aa 的累计胜/负次数),然后选择采样值最大的臂。以"当前后验下该臂是最优"的概率选臂 (probability matching):后验越宽(越不确定)的臂越可能被选,天然实现探索-利用权衡。
💡使用场景
工业界在线决策的默认算法之一(广告、推荐、实验平台),因为实现简单、样本效率高、实际表现常优于 UCB;面试常考 Beta 后验更新公式与共轭原理。
解决的核心痛点
UCB 的置信上界是频率派构造,对先验知识/奖励分布利用不足;TS 通过后验采样把不确定性直接编码进选择概率,regret 可达 O(lnT)O(\ln T)(最坏情形亦有良好保证),对非平稳奖励 (drifting) 更鲁棒,且能自然扩展到上下文特征 (Linear/Logistic TS)。
🎯5 个高频面试考点 (Exam Points)
1
推导 Beta 后验:先验 Beta(α,β)\text{Beta}(\alpha, \beta) + Bernoulli 观察 → 后验 Beta(α+w,β+l)\text{Beta}(\alpha + w, \beta + l)?
2
数值题:先验 Beta(1,1)\text{Beta}(1,1), 臂1 赢 8 输 2、臂2 赢 3 输 7, 写出两个后验并说明下一次采样更可能选哪个臂?
3
TS 与 UCB 的 regret 对比?为什么工业界 TS 实际表现常更好?
4
非平稳环境 (奖励漂移) 下 TS 如何退化?有哪些修正?
5
probability matching 性质:选臂概率 = 该臂为最优的后验概率, 这对探索意味着什么?
📖 关联深度指南:📄 bandits-and-online-decision
更新于 2026-08-12
🎯
检验攻克程度:针对「Thompson 采样」专属刷题排雷
做单选排雷题、推导选项机制,答错自动收录进专属错题本。
🚀 开始本考点专项刷题
上一个知识点UCB1 乐观估计下一个知识点上下文老虎机

🔗 更多 强化学习 知识点卡片

Actor-Critic 框架行为克隆 BC思维链与推理强化CQL 保守 Q 学习