Machine Learning: A Probabilistic Perspective

第4章 · 高斯模型

多元高斯、LDA/QDA、因子分析与卡尔曼滤波——连续变量的概率建模主干。 共 12 个 Manim 动画,点击缩略图可全屏播放。

12
知识点
12
动画视频
§04
教材章节
知识脉络
01多元高斯分布
→
02多元高斯 M
→
03线性判别分析
→
04二次判别分析
→
05联合高斯条件
→
06边缘与条件分
→
07数据插补
→
08线性高斯系统
→
09信息形式高斯
→
10因子分析直觉
→
11独立成分分析
→
12卡尔曼滤波直

场景 01–02

01 – 02
draft

多元高斯分布

多元高斯 = 椭圆等高线云:均值定中心,协方差定形状与朝向。
$Σ = UΛUᵀ,U 正交,Λ 对角$ 马氏距离:$$(\mathbf{x}-\mu)ᵀΣ^{-1}(\mathbf{x}-\mu) = \sum_i y_i^2/\lambda_i,y_i=u_iᵀ(\mathbf{x}-\mu)$
D 维多元正态分布的概率密度函数定义如下……指数中的表达式是数据向量 x 与均值向量 μ 之间的马氏距离。(§4.1.2,p.85)
多元高斯MVN马氏距离
draft

多元高斯 MLE

对高斯数据,MLE 就是样本均值 +(中心化)样本协方差——但 μ 与 Σ 必须一起估。
$(1/N)\sum \mathbf{x}_i = \bar{x}$$(1/N)\sum(\mathbf{x}_i-\bar{x})(\mathbf{x}_i-\bar{x})^\top$
因此,μ 的最大似然估计就是样本均值……协方差矩阵的标准极大似然估计公式。(§4.1.3,p.85–87)
MLE样本均值协方差矩阵

场景 03–04

03 – 04
draft

线性判别分析 LDA

各类共享一个 Σ 时,后验比值的决策边界是直线——这就是 LDA。
$p(\mathbf{x} \mid \mathbf{y}=c)=\mathcal{N}(\mu_c,\sum)$$wᵀx+b=0,\mathbf{w}\propto\sum^{-1}(\mu_1-\mu_0)$
由于各类协方差矩阵相同……任意两个类别之间的决策边界将是一条直线。因此,这种技术被称为线性判别分析(LDA)。(§4.2.2,p.89–91)
LDA线性决策边界高斯判别分析
draft

二次判别分析 QDA

每类有自己的椭圆云团形状时,分界线不再是直线,而是二次曲线——这就是 QDA。
$p(\mathbf{x} \mid \mathbf{y}=c)=\mathcal{N}(\mathbf{x}|\mu_c,\sum_{c})$$\mathcal{O}(CD^2) vs LDA 的 \mathcal{O}(D^2)$
如果允许每个类有自己的协方差矩阵,决策边界将变成二次的。(§4.2.1,p.89)
QDA二次边界GDA

场景 05–06

05 – 06
draft

联合高斯条件分布

联合高斯里,「知道一部分坐标」后,剩下部分仍是高斯——均值线性依赖已知值。
$p(x_1)=\mathcal{N}(\mu_1,Σ_{11})$
如果 x₁ 和 x₂ 是联合高斯,那么条件分布 $p(x_2 \mid x_1)$ 也是高斯分布。(§4.3,p.95–99)
条件分布边缘分布分块高斯
draft

边缘与条件分布(二维)

二维椭圆投影:边缘化 = 压扁一个方向;条件化 = 沿另一方向切一片高斯。
$\sum = [[\sigma_1^2,\rho\sigma_1\sigma_2],[\rho\sigma_1\sigma_2,\sigma_2^2]]$$Var(x_1)=\sigma_1^2,与 \rho 无关$
图4.3 展示了二维高斯分布的边缘分布和条件分布。(§4.3.2.1,p.97)
二维高斯边缘化条件化

场景 07–08

07 – 08
draft

数据插补

缺了数据?在联合高斯假设下,用条件期望填回去就是最优(L2 意义下)。
$\mathbf{x}̂_{miss} = E[x_{miss} \mid x_{obs}] = \mu_{miss} + Σ_{miss,obs} Σ_{obs,obs}^{-1}(x_{obs}-\mu_{obs})$
一种合理的插补方法是使用条件期望。(§4.3.2.3,p.99)
数据插补缺失值条件期望
draft

线性高斯系统

变量连成链:每个节点是高斯,父节点线性影响均值——整条链的联合分布仍有闭式。
$p(\mathbf{x}_i \mid pa_i)=\mathcal{N}(\mathbf{x}_i \mid W_i pa_i, \sum_i)$$仍为 MVN(可递归求 \mu,\sum)$
线性高斯模型定义了一种重要的图结构,其中每个节点的条件分布是高斯分布。(§4.4,p.103)
线性高斯贝叶斯网络消息传递

场景 09–10

09 – 10
draft

信息形式高斯

把高斯从「均值+协方差」改写成「精度矩阵+自然参数」——条件化和乘法变超简单。
$p(\mathbf{x}) \propto \exp[-½xᵀΛx + \etaᵀx + c]$
在信息形式下也可以推导出边缘化和条件化公式……在矩形式下进行边缘化更为简便,而在信息形式下进行条件化更为容易。(§4.3.3,p.99–100)
信息形式精度矩阵自然参数
draft

因子分析直觉

高维观测 = 低维「因子」线性生成 + 噪声——在噪声里找潜在结构。
$z\simN(0,I),\mathbf{x}=Wz+\mu+\varepsilon,\varepsilon\simN(0,Ψ)$$p(\mathbf{x})=\mathcal{N}(\mu, WWᵀ+Ψ)$
因子分析是一种构建高维观测变量联合概率模型的技术,它使用少量连续隐变量。(§4.5,p.105)
因子分析隐变量降维

场景 11–12

11 – 12
draft

独立成分分析 ICA

混合信号里拆出独立源——关键不在高斯,而在「非高斯 + 统计独立」。
$\mathbf{x} = As,s 独立,E[s]=0$$求 \mathbf{W} 使 \mathbf{y}=Wx 分量尽可能独立$
独立成分分析(ICA)是一种估计线性变换的技术,使得输出分量统计独立。(§4.6,p.107)
ICA盲源分离非高斯
draft

卡尔曼滤波直觉

带噪声的动态系统:预测一步 → 看新观测 → 修正——循环往复,全程闭式高斯。
$z_t = \mathbf{A} z_{t-1} + \varepsilon_t,\varepsilon\simN(0,Q)$$\mu_t \mid t-1,\sum_{t} \mid t-1$
卡尔曼滤波是一种在线算法,用于对线性高斯状态空间模型的后验进行递推估计。(§4.7,p.109)
卡尔曼滤波状态空间递推推断
← 上一章 第3章 · 离散生成式模型 下一章 → 第5章 · 贝叶斯统计学