返回 数理基础 思维导图
中文·English
📐 数理基础ID: bootstrap

Bootstrap

🎯核心定义
Bootstrap (自助法) 用有放回重采样估计统计量 θ^=g(x1,,xn)\hat\theta = g(x_1, \dots, x_n) 的抽样分布:独立重复 BB 次,每次从原始 nn 个观测中有放回抽取 nn 个,并算出对应的 θ^b\hat\theta^{*b}(b=1,,Bb = 1, \dots, B),用这 BB 个重采样估计的经验分布近似 θ^\hat\theta 的分布。方差与标准误估计:
📌核心概述
Var^(θ^)=1B1b=1B(θ^bθˉ)2,\widehat{\mathrm{Var}}(\hat\theta) = \frac{1}{B-1} \sum_{b=1}^{B} \bigl(\hat\theta^{*b} - \bar{\theta}^{*}\bigr)^2,
📌核心概述
百分位区间取重采样分布的分位数 [θ^(α/2),  θ^(1α/2)]\bigl[\hat\theta^{*}_{(\alpha/2)},\; \hat\theta^{*}_{(1-\alpha/2)}\bigr]。统计依据:把样本经验分布 F^n\hat F_n 当作真实分布 FF 的近似,重采样即在 F^n\hat F_n 上“重复实验”。
💡使用场景
中位数、相关系数等无解析标准误的统计量,小样本置信区间,以及模型评估指标(如 AUC、RMSE)的不确定性估计;面试常考“bootstrap 为什么有效”与 CLT 的关系。
解决的核心痛点
解析标准误依赖 CLT 与大样本、要求统计量可微,bootstrap 对任意统计量、任意分布(只需 i.i.d.)给出近似抽样分布,实现仅需 O(Bn)O(B n) 次重采样运算;局限是重采样集不引入样本外信息,对相关数据(时间序列)失效,需用 block bootstrap 等变体。
🎯5 个高频面试考点 (Exam Points)
1
bootstrap 重采样估计 Var(θ^)\mathrm{Var}(\hat\theta) 的完整步骤与公式?为什么说它是“用经验分布近似真实分布”?
2
百分位置信区间如何构造?与正态近似区间 θ^±zα/2SE^\hat\theta \pm z_{\alpha/2} \widehat{\mathrm{SE}} 有何区别?
3
bootstrap 与 CLT 的关系:何时两者等价?bootstrap 何时更优?
4
参数化 bootstrap 与非参数 bootstrap 的区别?
5
bootstrap 的假设与失效场景(独立性、重采样集的信息上限、时间序列)?
📖 关联深度指南:📄 sampling-and-monte-carlo
更新于 2026-08-12
🎯
检验攻克程度:针对「Bootstrap」专属刷题排雷
做单选排雷题、推导选项机制,答错自动收录进专属错题本。
🚀 开始本考点专项刷题
上一个知识点MCMC 与细致平衡下一个知识点梯度下降

🔗 更多 数理基础 知识点卡片

Adam/AdamW 偏差修正推导贝叶斯推断偏差方差分解因果推断与 Rubin 框架