SVD 奇异值分解:线代的瑞士军刀
本文基于模型知识整理(生成时未联网核对),关键结论建议对照 Strang §7.2 / Trefethen & Bau Lecture 4–5 复核。
一句话定义
任何(哪怕长方的)矩阵都可分解为 $A = U\Sigma V^\top$:旋转 $V^\top$ → 沿正交轴缩放 $\Sigma$ → 再旋转 $U$;奇异值 $\sigma_1\ge\sigma_2\ge\dots$ 是缩放幅度,前 r 个"大奇异值"给出最优低秩近似(Eckart-Young 定理)——SVD 同时给出四个子空间的正交基、伪逆、PCA 与最佳压缩。
为什么重要
SVD 是线代 ultimate tool:特征分解只能处理方阵,SVD 处理一切矩阵且数值稳定。推荐系统(低秩填分)、图像压缩(截断 SVD)、PCA(kp-020 就是 SVD 换装)、伪逆(kp-019)、潜在语义分析、噪声滤除——一条分解贯穿数据科学半壁江山。Eckart-Young 给它的"最优性"盖了数学公章。
前置知识
核心概念
- 分解:$A = U\Sigma V^\top$——$U$(m×正交,左奇异向量=列空间基)、$\Sigma$(对角 $\sigma_1\ge\dots\ge\sigma_r>0$)、$V$(右奇异向量=行空间基)。
- 与特征分解的桥:$A^\top A = V\Sigma^2V^\top$——右奇异向量是 $A^\top A$ 的特征向量,奇异值平方=特征值(对称谱定理的到场,kp-015);同理 $AA^\top=U\Sigma^2U^\top$。
- 几何读法:任意线性变换 = 旋转 ∘ 坐标轴缩放 ∘ 旋转(无剪切)——单位球 → 椭球,半轴即奇异值。
- 四子空间的赠礼:$V$ 的前 r 列/后 n−r 列 = 行空间/零空间的正交基;$U$ 的前 r 列/后 m−r 列 = 列空间/左零空间(kp-008 的地图被一次填色)。
- Eckart-Young 定理:秩 k 最优近似 $A_k = U_k\Sigma_kV_k^\top$(截断 SVD);误差 $=\sigma_{k+1}$——不是"还不错",是 Frobenius 范数下最优。
原理与机制
为什么 $A^\top A$ 是入口:想把 A 的动作解耦,需要"输入侧一组正交方向、各自被独立缩放"——即 $Av_i=\sigma_iu_i$。凑两组正交基不好直接求,但 $A^\top A$ 对称半正定(kp-016),谱定理保证其正交特征系,代回去即得右奇异向量,再由 $u_i=Av_i/\sigma_i$ 得左奇异向量——SVD 的存在性证明就是把谱定理用在 $A^\top A$ 上。
为什么截断是"最优压缩":$\|A-A_k\|_F^2=\sum_{i>k}\sigma_i^2$——丢掉的能量清清楚楚是尾部奇异值平方和。图像/推荐/去噪的"保留前 k 个奇异值"都是该定理的工程化:误差有保证、大小可控。
数值优势:SVD/QR 类正交算法的误差只被 $\kappa(A)=\sigma_1/\sigma_n$ 放大一次;而特征分解对非对称矩阵可能病态(kp-017 警告的实践出口)——"算不动特征值就算 SVD"是数值经验法则。
图示
A = U Σ Vᵀ (任意 m×n)
x ─Vᵀ(旋转)→ ─Σ(轴缩放 σᵢ)→ ─U(旋转)→ Ax
AᵀA = VΣ²Vᵀ ← 谱定理保证存在
截断: Aₖ = UₖΣₖVₖᵀ, ‖A−Aₖ‖_F = √(Σᵢ>ₖ σᵢ²) 最优!
四子空间: U 前 r 列=C(A), 后=左零; V 前 r=行空间, 后=零
直观类比
SVD 像"万能翻译器":不管原动作多别扭,总能讲成"先转正、沿主轴各拉各的、再转回去"。前几个大 σ 是"主情节",尾部小 σ 是"细节噪点"——砍掉尾部(截断 SVD)就是有质量保证的摘要。
实例或案例
- 图像压缩:512×512 图矩阵保留前 50 个奇异值,存储降 90% 视觉几乎无损。
- 推荐系统:评分矩阵截断 SVD → 用户/物品隐向量(隐语义模型,kp-030 的矩阵分解回归变体)。
- 数据科学:
np.linalg.svd后按能量截断做降噪与降维(与 kp-020 的 PCA 等价实现)。
常见误区
- 误区一:"SVD 与特征分解同物"。特征分解限方阵且无正交保证(kp-017);SVD 全矩阵、两端正交、σ 非负——只有对称半正定方阵两者重合(λ=σ)。
- 误区二:"奇异值越大贡献越大所以扔小的一定无损"。Eckart-Young 给出的是"秩 k 中最优",仍有误差 $\sigma_{k+1}$——压缩永远有损,只是最优有损。
- 误区三:"SVD 只用于方阵/只能压缩图像"。它对任意矩阵定义;本质是"任意线性映射的最优正交描述",用途远超压缩。
与其他知识点的关系
- kp-015:存在性的引擎($A^\top A$ 谱定理)。
- kp-008/019/020:四子空间、伪逆、PCA 的统一供给者。
- kp-023:$\kappa=\sigma_1/\sigma_n$ 的定义出处。
- kp-031:词向量/注意力低秩近似的理论家底。
自测题
- 4×7 矩阵秩 3:U、Σ、V 的形状与 σ 个数?
答:U 是 4×4、V 是 7×7(完全 SVD);Σ 形状 4×7 对角 3 个正值;共 3 个非零奇异值。
- 如何从 A 求 V 与 σ(不用黑盒)?
答:谱分解 $A^\top A=V\Sigma^2V^\top$ 得 V 与 $\sigma_i=\sqrt{\lambda_i}$;再 $u_i=Av_i/\sigma_i$。
- 保留前 k 个奇异值的压缩误差是多少(F 范数)?
答:$\sqrt{\sigma_{k+1}^2+\dots+\sigma_r^2}$——尾部平方和开根,且该误差在所有秩 k 近似中最小。
延伸阅读
- Strang《Introduction to Linear Algebra》§7.2–7.3。
- Trefethen & Bau《Numerical Linear Algebra》Lecture 4–5、11(SVD 与最优性)。
- Minka 的经典讲义 "Old and new matrix algebra useful for statistics"(SVD 与统计的联结)。