M1-018M1: Mathematics & Statistics FundamentalsLinear AlgebraMedium
Mastery:

Linear Algebra: 什么是病态矩阵与条件数?它如何影响数值求解与训练?

📐 Mathematical Definition
κ(A)=σmaxσmin\kappa(A)=\frac{\sigma_{max}}{\sigma_{min}}
⚡ Executive Summary
Core Concept: 条件数大 → 输入微小扰动导致解剧烈变化;求解与优化都不稳定。

📌 Key Takeaways

  • •
    正规方程 (XᵀX)⁻¹ 的条件数是 κ(X)²,故不推荐直接求逆
  • •
    用 QR/SVD/pinv 替代
  • •
    优化中病态导致学习率难调(可用归一化改善)

📐 Mathematical Derivations

条件数 κ(A)=σ_max/σ_min 度量'相对误差的放大倍数':若输入有相对扰动 ε,则解的相对误差最多放大 κ(A) 倍(更精确地,(‖δx‖/‖x‖) ≤ κ(A)·(‖δb‖/‖b‖))。推导来自 SVD:x=A⁻¹b=VΣ⁻¹Uᵀb,误差在最小奇异值 σ_min 方向上被放大 1/σ_min 倍,而 b 的尺度由 σ_max 决定,故比值为 κ。几何上,条件数大意味着矩阵把单位球压成极端扁的椭球——某些方向几乎被压平,逆变换就会把噪声放大到失控。κ=1 是完美条件(正交阵),κ=10ᵏ 意味着损失 k 位有效数字。

🏭 Production Trade-offs

实践中的三个关键点:① <strong>永远不要显式求逆或用正规方程</strong>——κ(AᵀA)=κ(A)²,用正规方程会损失一半精度;应使用 QR 分解(κ 不变)或 SVD(最稳,可截断小奇异值);② <strong>正则化即改善条件数</strong>——岭回归把 σᵢ 换成 σᵢ/(σᵢ²+λ),等价于把条件数从 σ_max/σ_min 压到 (σ_max²+λ)/(σ_min²+λ),λ 越大条件数越小;③ <strong>深度学习中的病态</strong>——损失的海森条件数决定收敛速度,病态导致不同方向需要不同学习率(这是 Adam 自适应学习率与归一化层(BN/LN)有效的原因之一:它们把激活的尺度归一化,间接改善条件数)。特征标准化是线性模型中最简单的预条件手段。
⚠️ Common Interview Pitfalls
  • ✕
    直接对 XᵀX 求逆(条件数平方,精度损失)
  • ✕
    把条件数与行列式混淆(行列式小不代表病态,如 0.1·I)
🎯 Interviewer Follow-ups
  • ?
    为什么 (XᵀX) 的条件数会被平方?
  • ?
    如何改善病态?(正则化/预条件)
📚

Associated Knowledge Base Guides & Mindmaps

Explore the comprehensive technical article, exam cards, and global architecture tree.

← PreviousM1-017: Linear Algebra: 解释矩阵的秩、零空间、列空间,以及秩与可解性的关系。📋Back to BankNext →M1-019: Linear Algebra: 解释 Moore-Penrose 伪逆,以及它如何给出最小二乘解。