🎯核心定义
归纳偏置(Inductive Bias)是模型/算法内建的一组先验假设,使学习器在有限数据上偏向某类假设而非其他,从而能够泛化到未见数据。典型架构偏置: CNN 的卷积 + 权值共享 → 平移等变性(同一组卷积核扫描全图,输出随输入平移而平移)与局部性(感受野)→ 相比同规模 MLP 参数少几个数量级、样本效率更高;池化 → 对微小平移近似不变;RNN/LSTM → 天然建模时序依赖;Transformer 的注意力本身是排列等变的(对输入顺序不敏感: 置换输入 token 只置换输出位置、值不变),因此必须显式注入位置编码(如 RoPE 的相对位置编码)才能利用序列顺序信息。
💡使用场景
面试问“为什么 CNN 比 MLP 数据效率高”“Transformer 为什么需要位置编码”“正则化为什么能提升泛化”时的统一答案框架;模型选择本质上就是在选择一组偏置。
⚡解决的核心痛点
无免费午餐定理说明,没有任何偏置的算法在所有问题上的平均表现不优于随机猜测——偏置是样本效率的来源,但偏置错了就是系统性错误(对应偏差-方差中的高偏差)。正则化也是注入偏置: 权重衰减 → 小范数(平滑)先验;early stopping → 低范数/平坦极小;数据增强 → 不变性先验(如翻转、裁剪);dropout → 冗余/集成先验。现代 LLM 走的是“最小化架构偏置 + 海量数据 + scaling law”路线,与经典模型“强偏置 + 小数据”形成鲜明对比。