深度学习中的线性代数:从嵌入到注意力
本文基于模型知识整理(生成时未联网核对),架构细节建议对照 Goodfellow《Deep Learning》与 Transformer 原论文复核。
一句话定义
深度学习的骨架就是线代:词/图/用户都是嵌入向量(点在空间中的语义坐标),每层网络是"矩阵乘 + 非线性逐元修正",注意力是"两组向量间的点积相似度 → 加权平均",低秩结构(SVD/LoRA)则是压缩与微调的通用杠杆——读模型论文实质上是在读线代结构。
为什么重要
把模型组件全部翻译回线代,黑盒就变成可推理的几何:词向量能"国王−男人+女人≈女王"是因为语义方向在线性空间里近似可加;注意力可解释为"可微分的字典查询";LoRA 微调有效因为更新矩阵近似低秩(kp-018 的现实红利)。本条把整库串成"现代 AI 的线代读法"。
前置知识
kp-007(乘法)、kp-022(梯度)、kp-027(张量)、基础神经网络概念(层/激活)。
核心概念
- 嵌入(embedding):离散对象 → $\mathbb{R}^d$ 向量;语义关系 ≈ 线性关系(word2vec 的加减、推荐的双塔内积)。"关系可加"是线代假设的赌注,也是嵌入方法的全部力量来源(kp-003 的组合思想)。
- 线性层:$y=Wx+b$(W∈$\mathbb{R}^{m\times n}$)——一次"动作"(kp-006);MLP = 线性层与非线性的交替堆叠;无非线性则多层塌缩为单矩阵乘(kp-007 的推论)。
- 注意力:$\text{Attn}(Q,K,V)=\text{softmax}(QK^\top/\sqrt d)V$——Q、K 行内积=查询与键的相似度(kp-005 点积),softmax 变权重,V 加权平均;多头=多组正交子空间的平行查询(张量语言 kp-027)。
- 梯度流:反向传播 = 各层 Jacobian 转置的连乘(kp-022);权重梯度=上游梯度与输入的外积($\delta x^\top$)——"梯度形状=参数形状"检查法。
- 低秩杠杆:权重更新近似低秩 ⇒ LoRA($\Delta W=BA$,B m×r、A r×n,r≪min(m,n));模型压缩/知识蒸馏的谱视角(kp-018 截断)。
原理与机制
为什么嵌入加减能表示语义:训练把共现语境编码为几何邻近与方向;Word2Vec 的损失设计直接鼓励"king−man≈queen−woman"这类平行四边形结构——语义的"方向化"是优化目标的产物,不是语言的天然属性(理解边界:类比会失效于反义/量级)。
为什么注意力用点积而非距离:点积=未归一化余弦(kp-005),可微、可批量、CUDA 友好;$\frac{1}{\sqrt d}$ 缩放防止维度增大时点积方差爆炸(softmax 饱和、梯度消失——kp-023 的变体)。
为什么线性层"有形状语义":$W$ 的行=输出空间的基、列=输入方向到输出的映射列(kp-006 列即像);权重矩阵秩=该层的表达瓶颈(秩亏层=信息瓶颈,kp-018)。
图示
嵌入: king − man + woman ≈ queen (语义 = 线性方向)
线性层: h = σ(Wx + b) (动作 + 逐元非线性)
注意力: QKᵀ/√d → softmax → ·V (点积相似 → 加权平均)
BP: ∂L/∂W = δ · hᵀ (外积; 形状=参数形状)
LoRA: ΔW = B·A (r ≪ min(m,n)) (低秩微调, kp-018)
直观类比
深度模型像"流水线翻译官":每个线性层是"换一种空间表达"(旋转拉伸 kp-006),非线性是"每次翻译后休息定个调"。注意力是"会议纪要":每个位置拿自己的问题(Q)去和所有人的名片(K)比对相关度,按相关度抄录大家的发言(V)——抄录权重由点积决定。
实例或案例
- 词向量算术:word2vec/GloVe 的经典演示;现代 LLM 的嵌入仍是同一几何赌注。
- LoRA 微调:7B 模型更新只训练 r=8 的低秩旁路——数百万级参数 vs 数十亿,效果保留大半。
- 模型压缩:权重 SVD 截断/蒸馏的谱剪枝——kp-018 的工程变现。
常见误区
- 误区一:"线性层就是查表"。查表(嵌入层)是"取行",线性层是"矩阵乘"——两者常连用(embedding→projection)但语义不同。
- 误区二:"注意力矩阵是对称的"。$QK^\top$ 一般非对称——"A 注意 B" ≠ "B 注意 A"(有向相似)。
- 误区三:"梯度形状检查可以省"。形状不匹配=转置/顺序错误(kp-022 的头号事故源);每写一层都核对形状是工程铁律。
与其他知识点的关系
自测题
- 为什么两层无非线性网络等价于一层?
答:$W_2(W_1x)=(W_2W_1)x$——矩阵乘封闭(kp-007),非线性是深度意义的来源。
- 注意力为什么除以 $\sqrt d$?
答:d 维点积方差随 d 增大,大值使 softmax 饱和、梯度近零;缩放维持分布宽度,保梯度健康。
- LoRA 为什么能以极少参数近似全参微调?
答:经验上微调更新 ΔW 接近低秩(kp-018 的截断思想)——用 $BA$(秩 r)参数化即可捕捉主要更新方向。
延伸阅读
- Goodfellow 等《Deep Learning》第 2、6 章(线代与前馈网络)。
- Vaswani 等, "Attention Is All You Need"(2017,注意力原文)。
- Hu 等, "LoRA: Low-Rank Adaptation of Large Language Models"(2021)。
- 3Blue1Brown 的 Transformer 系列视频(注意力的几何动画)。