返回 数理基础 思维导图
中文·English
📐 数理基础ID: inductive-bias

归纳偏置

Inductive Bias
🎯核心定义
归纳偏置(Inductive Bias)是模型/算法内建的一组先验假设,使学习器在有限数据上偏向某类假设而非其他,从而能够泛化到未见数据。典型架构偏置: CNN 的卷积 + 权值共享 → 平移等变性(同一组卷积核扫描全图,输出随输入平移而平移)与局部性(感受野)→ 相比同规模 MLP 参数少几个数量级、样本效率更高;池化 → 对微小平移近似不变;RNN/LSTM → 天然建模时序依赖;Transformer 的注意力本身是排列等变的(对输入顺序不敏感: 置换输入 token 只置换输出位置、值不变),因此必须显式注入位置编码(如 RoPE 的相对位置编码)才能利用序列顺序信息。
💡使用场景
面试问“为什么 CNN 比 MLP 数据效率高”“Transformer 为什么需要位置编码”“正则化为什么能提升泛化”时的统一答案框架;模型选择本质上就是在选择一组偏置。
解决的核心痛点
无免费午餐定理说明,没有任何偏置的算法在所有问题上的平均表现不优于随机猜测——偏置是样本效率的来源,但偏置错了就是系统性错误(对应偏差-方差中的高偏差)。正则化也是注入偏置: 权重衰减 → 小范数(平滑)先验;early stopping → 低范数/平坦极小;数据增强 → 不变性先验(如翻转、裁剪);dropout → 冗余/集成先验。现代 LLM 走的是“最小化架构偏置 + 海量数据 + scaling law”路线,与经典模型“强偏置 + 小数据”形成鲜明对比。
🎯5 个高频面试考点 (Exam Points)
1
什么是归纳偏置?举例说明 CNN 的平移等变性与权值共享如何带来样本效率(与同规模 MLP 对比)。
2
为什么 Transformer 必须加位置编码?写出注意力对输入置换的等变性(置换输入只置换输出位置)。
3
为什么权重衰减 / early stopping / 数据增强 / dropout 也都算归纳偏置?各注入什么先验?
4
强偏置的优点与风险: 什么时候偏置是“错的”?它与偏差-方差权衡如何关联?
5
现代 LLM 如何用“弱架构偏置 + 大数据”路线替代经典模型的强偏置?代价与收益是什么?
📖 关联深度指南:📄 learning-paradigms-and-bias
更新于 2026-08-12
🎯
检验攻克程度:针对「归纳偏置」专属刷题排雷
做单选排雷题、推导选项机制,答错自动收录进专属错题本。
🚀 开始本考点专项刷题
上一个知识点Double Descent

🔗 更多 数理基础 知识点卡片

Adam/AdamW 偏差修正推导贝叶斯推断偏差方差分解Bootstrap