深度学习中的线性代数:从嵌入到注意力

06-计算实践与脉络 核心 约 25 分钟 #深度学习#嵌入#注意力#低秩 更新 2026-10-02
当前状态:未学
本文基于模型知识整理(生成时未联网核对),架构细节建议对照 Goodfellow《Deep Learning》与 Transformer 原论文复核。

一句话定义

深度学习的骨架就是线代:词/图/用户都是嵌入向量(点在空间中的语义坐标),每层网络是"矩阵乘 + 非线性逐元修正",注意力是"两组向量间的点积相似度 → 加权平均",低秩结构(SVD/LoRA)则是压缩与微调的通用杠杆——读模型论文实质上是在读线代结构。

为什么重要

把模型组件全部翻译回线代,黑盒就变成可推理的几何:词向量能"国王−男人+女人≈女王"是因为语义方向在线性空间里近似可加;注意力可解释为"可微分的字典查询";LoRA 微调有效因为更新矩阵近似低秩(kp-018 的现实红利)。本条把整库串成"现代 AI 的线代读法"。

前置知识

kp-007(乘法)、kp-022(梯度)、kp-027(张量)、基础神经网络概念(层/激活)。

核心概念

  • 嵌入(embedding):离散对象 → $\mathbb{R}^d$ 向量;语义关系 ≈ 线性关系(word2vec 的加减、推荐的双塔内积)。"关系可加"是线代假设的赌注,也是嵌入方法的全部力量来源(kp-003 的组合思想)。
  • 线性层:$y=Wx+b$(W∈$\mathbb{R}^{m\times n}$)——一次"动作"(kp-006);MLP = 线性层与非线性的交替堆叠;无非线性则多层塌缩为单矩阵乘(kp-007 的推论)。
  • 注意力:$\text{Attn}(Q,K,V)=\text{softmax}(QK^\top/\sqrt d)V$——Q、K 行内积=查询与键的相似度(kp-005 点积),softmax 变权重,V 加权平均;多头=多组正交子空间的平行查询(张量语言 kp-027)。
  • 梯度流:反向传播 = 各层 Jacobian 转置的连乘(kp-022);权重梯度=上游梯度与输入的外积($\delta x^\top$)——"梯度形状=参数形状"检查法。
  • 低秩杠杆:权重更新近似低秩 ⇒ LoRA($\Delta W=BA$,B m×r、A r×n,r≪min(m,n));模型压缩/知识蒸馏的谱视角(kp-018 截断)。

原理与机制

为什么嵌入加减能表示语义:训练把共现语境编码为几何邻近与方向;Word2Vec 的损失设计直接鼓励"king−man≈queen−woman"这类平行四边形结构——语义的"方向化"是优化目标的产物,不是语言的天然属性(理解边界:类比会失效于反义/量级)。

为什么注意力用点积而非距离:点积=未归一化余弦(kp-005),可微、可批量、CUDA 友好;$\frac{1}{\sqrt d}$ 缩放防止维度增大时点积方差爆炸(softmax 饱和、梯度消失——kp-023 的变体)。

为什么线性层"有形状语义":$W$ 的行=输出空间的基、列=输入方向到输出的映射列(kp-006 列即像);权重矩阵秩=该层的表达瓶颈(秩亏层=信息瓶颈,kp-018)。

图示

嵌入:    king − man + woman ≈ queen   (语义 = 线性方向)
线性层:  h = σ(Wx + b)                (动作 + 逐元非线性)
注意力:  QKᵀ/√d → softmax → ·V        (点积相似 → 加权平均)
BP:      ∂L/∂W = δ · hᵀ              (外积; 形状=参数形状)
LoRA:    ΔW = B·A  (r ≪ min(m,n))    (低秩微调, kp-018)

直观类比

深度模型像"流水线翻译官":每个线性层是"换一种空间表达"(旋转拉伸 kp-006),非线性是"每次翻译后休息定个调"。注意力是"会议纪要":每个位置拿自己的问题(Q)去和所有人的名片(K)比对相关度,按相关度抄录大家的发言(V)——抄录权重由点积决定。

实例或案例

  • 词向量算术:word2vec/GloVe 的经典演示;现代 LLM 的嵌入仍是同一几何赌注。
  • LoRA 微调:7B 模型更新只训练 r=8 的低秩旁路——数百万级参数 vs 数十亿,效果保留大半。
  • 模型压缩:权重 SVD 截断/蒸馏的谱剪枝——kp-018 的工程变现。

常见误区

  • 误区一:"线性层就是查表"。查表(嵌入层)是"取行",线性层是"矩阵乘"——两者常连用(embedding→projection)但语义不同。
  • 误区二:"注意力矩阵是对称的"。$QK^\top$ 一般非对称——"A 注意 B" ≠ "B 注意 A"(有向相似)。
  • 误区三:"梯度形状检查可以省"。形状不匹配=转置/顺序错误(kp-022 的头号事故源);每写一层都核对形状是工程铁律。

与其他知识点的关系

  • kp-005/006/007/022:嵌入、动作、复合、梯度——全部组件。
  • kp-018/027:低秩与张量的工程变现。
  • kp-023:大规模矩阵乘的精度与混合精度训练边界。

自测题

  1. 为什么两层无非线性网络等价于一层?

答:$W_2(W_1x)=(W_2W_1)x$——矩阵乘封闭(kp-007),非线性是深度意义的来源。

  1. 注意力为什么除以 $\sqrt d$?

答:d 维点积方差随 d 增大,大值使 softmax 饱和、梯度近零;缩放维持分布宽度,保梯度健康。

  1. LoRA 为什么能以极少参数近似全参微调?

答:经验上微调更新 ΔW 接近低秩(kp-018 的截断思想)——用 $BA$(秩 r)参数化即可捕捉主要更新方向。

延伸阅读

  • Goodfellow 等《Deep Learning》第 2、6 章(线代与前馈网络)。
  • Vaswani 等, "Attention Is All You Need"(2017,注意力原文)。
  • Hu 等, "LoRA: Low-Rank Adaptation of Large Language Models"(2021)。
  • 3Blue1Brown 的 Transformer 系列视频(注意力的几何动画)。