TalentMe
How To
🗺️
AI Industry Map
NEW
Knowledge ▾
Intro & Usage
Machine Learning Repo
Data Science Repo
Resources ▾
Intro & Usage
AI Tech Vault (Tech Wiki)
Industry News
Tech Blogs
Research Papers
Open Source Projects
Tools Hub ▾
🛠️ Tools & Skills Overview
🌐 Interactive Web Tools
🗺️ AI Industry & Career Map
🧭 AI Career Transition Navigator & Roadmap
📚 AI Multi-Module Practice Hub
🎯 AI Skill Assessment
🧠 AI Skills Library
AI Skills & Prompts Overview
Local Agent Guide
Cloud Skills Templates
⚡ MCP Tools Suite
TalentMe MCP Guide
CLI Tools & Commands
Services ▾
🚀 Services & Plans Suite
🧭 1v1 Coaching & Services
💎 Plans & Pricing
💬 Contact & Consultation
Contact Us
💬 Discord
🌐
中
☀️
🔑
Login / Register
☰
技术知识库
›
复习路线图
›
强化学习 思维导图
›
上下文老虎机
← 返回 强化学习 思维导图
中文
·
English
🎮 强化学习
ID:
contextual-bandit
上下文老虎机
Contextual Bandit
🎯
核心定义
上下文老虎机 (Contextual Bandit) 在 MAB 基础上引入每轮可观测的上下文特征
x
t
∈
R
d
x_t \in \mathbb{R}^d
x
t
∈
R
d
,策略
π
(
x
)
\pi(x)
π
(
x
)
根据特征选动作,目标是最大化条件期望奖励
E
[
r
∣
x
,
a
]
\mathbb{E}[r \mid x, a]
E
[
r
∣
x
,
a
]
。代表算法 LinUCB:假设奖励关于特征线性
r
t
,
a
=
θ
a
T
x
t
,
a
+
ϵ
r_{t,a} = \theta_a^T x_{t,a} + \epsilon
r
t
,
a
=
θ
a
T
x
t
,
a
+
ϵ
,对每个臂用岭回归估计
θ
^
a
=
(
X
a
T
X
a
+
λ
I
)
−
1
X
a
T
y
a
\hat{\theta}_a = (X_a^T X_a + \lambda I)^{-1} X_a^T y_a
θ
^
a
=
(
X
a
T
X
a
+
λ
I
)
−
1
X
a
T
y
a
(
X
a
X_a
X
a
/
y
a
y_a
y
a
是该臂的历史特征矩阵与奖励向量,
λ
I
\lambda I
λ
I
为正则化),并构造置信区间
p
t
,
a
=
θ
^
a
T
x
t
,
a
+
α
x
t
,
a
T
(
X
a
T
X
a
+
λ
I
)
−
1
x
t
,
a
p_{t,a} = \hat{\theta}_a^T x_{t,a} + \alpha \sqrt{x_{t,a}^T (X_a^T X_a + \lambda I)^{-1} x_{t,a}}
p
t
,
a
=
θ
^
a
T
x
t
,
a
+
α
x
t
,
a
T
(
X
a
T
X
a
+
λ
I
)
−
1
x
t
,
a
,每轮选择上界最大的臂。
💡
使用场景
个性化推荐(用户特征+候选特征)、广告竞价、动态定价、新闻/短视频排序;面试中强调与 RecSys 的衔接:上下文即特征工程,模型即在线学习的奖励预测器。
⚡
解决的核心痛点
无上下文 MAB 对所有用户一视同仁,冷启动与个性化能力弱;contextual bandit 借助特征跨上下文共享样本,冷启动更快、收益提升显著,是"纯探索"与"完整 RL/监督学习"之间的务实折中——只需实时反馈,不需要离线数据集或模拟环境。
🎯
5 个高频面试考点 (Exam Points)
1
写出 LinUCB 的岭回归解与置信项, 解释
(
X
a
T
X
a
+
λ
I
)
−
1
(X_a^T X_a + \lambda I)^{-1}
(
X
a
T
X
a
+
λ
I
)
−
1
的含义与
λ
I
\lambda I
λ
I
的作用?
2
数值/推导题:
d
d
d
维特征下估计
θ
^
a
\hat{\theta}_a
θ
^
a
的复杂度?为什么逆协方差矩阵随样本增加而收缩?
3
contextual bandit 与完整 RL、监督学习 (offline ML) 的本质区别?
4
在推荐系统中如何构造上下文特征?如何缓解冷启动?
5
LinUCB vs 在线逻辑回归/GBDT: 线性假设不成立时怎么办 (kernel/neural contextual bandit)?
📖 关联深度指南:
📄 bandits-and-online-decision →
更新于 2026-08-12
🎯
检验攻克程度:针对「上下文老虎机」专属刷题排雷
做单选排雷题、推导选项机制,答错自动收录进专属错题本。
🚀 开始本考点专项刷题 ➔
← 上一个知识点
Thompson 采样
下一个知识点 →
Slate/组合老虎机
🔗 更多 强化学习 知识点卡片
Actor-Critic 框架
行为克隆 BC
思维链与推理强化
CQL 保守 Q 学习