返回 强化学习 思维导图
中文·English
🎮 强化学习ID: contextual-bandit

上下文老虎机

Contextual Bandit
🎯核心定义
上下文老虎机 (Contextual Bandit) 在 MAB 基础上引入每轮可观测的上下文特征 xtRdx_t \in \mathbb{R}^d,策略 π(x)\pi(x) 根据特征选动作,目标是最大化条件期望奖励 E[rx,a]\mathbb{E}[r \mid x, a]。代表算法 LinUCB:假设奖励关于特征线性 rt,a=θaTxt,a+ϵr_{t,a} = \theta_a^T x_{t,a} + \epsilon,对每个臂用岭回归估计 θ^a=(XaTXa+λI)1XaTya\hat{\theta}_a = (X_a^T X_a + \lambda I)^{-1} X_a^T y_a(XaX_a/yay_a 是该臂的历史特征矩阵与奖励向量,λI\lambda I 为正则化),并构造置信区间 pt,a=θ^aTxt,a+αxt,aT(XaTXa+λI)1xt,ap_{t,a} = \hat{\theta}_a^T x_{t,a} + \alpha \sqrt{x_{t,a}^T (X_a^T X_a + \lambda I)^{-1} x_{t,a}},每轮选择上界最大的臂。
💡使用场景
个性化推荐(用户特征+候选特征)、广告竞价、动态定价、新闻/短视频排序;面试中强调与 RecSys 的衔接:上下文即特征工程,模型即在线学习的奖励预测器。
解决的核心痛点
无上下文 MAB 对所有用户一视同仁,冷启动与个性化能力弱;contextual bandit 借助特征跨上下文共享样本,冷启动更快、收益提升显著,是"纯探索"与"完整 RL/监督学习"之间的务实折中——只需实时反馈,不需要离线数据集或模拟环境。
🎯5 个高频面试考点 (Exam Points)
1
写出 LinUCB 的岭回归解与置信项, 解释 (XaTXa+λI)1(X_a^T X_a + \lambda I)^{-1} 的含义与 λI\lambda I 的作用?
2
数值/推导题: dd 维特征下估计 θ^a\hat{\theta}_a 的复杂度?为什么逆协方差矩阵随样本增加而收缩?
3
contextual bandit 与完整 RL、监督学习 (offline ML) 的本质区别?
4
在推荐系统中如何构造上下文特征?如何缓解冷启动?
5
LinUCB vs 在线逻辑回归/GBDT: 线性假设不成立时怎么办 (kernel/neural contextual bandit)?
📖 关联深度指南:📄 bandits-and-online-decision
更新于 2026-08-12
🎯
检验攻克程度:针对「上下文老虎机」专属刷题排雷
做单选排雷题、推导选项机制,答错自动收录进专属错题本。
🚀 开始本考点专项刷题
上一个知识点Thompson 采样下一个知识点Slate/组合老虎机

🔗 更多 强化学习 知识点卡片

Actor-Critic 框架行为克隆 BC思维链与推理强化CQL 保守 Q 学习