ML
MLAPP Viz
Chapter 04
总览
高斯模型
▾
01
引言
02
概率
03
离散生成式模型
04
高斯模型
05
贝叶斯统计学
08
逻辑斯谛回归
Machine Learning: A Probabilistic Perspective
第4章 ·
高斯模型
多元高斯、LDA/QDA、因子分析与卡尔曼滤波——连续变量的概率建模主干。 共 12 个 Manim 动画,点击缩略图可全屏播放。
12
知识点
12
动画视频
§04
教材章节
知识脉络
01
多元高斯分布
→
02
多元高斯 M
→
03
线性判别分析
→
04
二次判别分析
→
05
联合高斯条件
→
06
边缘与条件分
→
07
数据插补
→
08
线性高斯系统
→
09
信息形式高斯
→
10
因子分析直觉
→
11
独立成分分析
→
12
卡尔曼滤波直
场景 01–02
01 – 02
§4.1.2
draft
多元高斯分布
多元高斯 = 椭圆等高线云:均值定中心,协方差定形状与朝向。
$Σ = UΛUᵀ,U 正交,Λ 对角$ 马氏距离:$
$(\mathbf{x}-\mu)ᵀΣ^{-1}(\mathbf{x}-\mu) = \sum_i y_i^2/\lambda_i,y_i=u_iᵀ(\mathbf{x}-\mu)$
D 维多元正态分布的概率密度函数定义如下……指数中的表达式是数据向量 x 与均值向量 μ 之间的马氏距离。(§4.1.2,p.85)
多元高斯
MVN
马氏距离
§4.1.3
draft
多元高斯 MLE
对高斯数据,MLE 就是样本均值 +(中心化)样本协方差——但 μ 与 Σ 必须一起估。
$(1/N)\sum \mathbf{x}_i = \bar{x}$
$(1/N)\sum(\mathbf{x}_i-\bar{x})(\mathbf{x}_i-\bar{x})^\top$
因此,μ 的最大似然估计就是样本均值……协方差矩阵的标准极大似然估计公式。(§4.1.3,p.85–87)
MLE
样本均值
协方差矩阵
场景 03–04
03 – 04
§4.2.2-4.2.3
draft
线性判别分析 LDA
各类共享一个 Σ 时,后验比值的决策边界是直线——这就是 LDA。
$p(\mathbf{x} \mid \mathbf{y}=c)=\mathcal{N}(\mu_c,\sum)$
$wᵀx+b=0,\mathbf{w}\propto\sum^{-1}(\mu_1-\mu_0)$
由于各类协方差矩阵相同……任意两个类别之间的决策边界将是一条直线。因此,这种技术被称为线性判别分析(LDA)。(§4.2.2,p.89–91)
LDA
线性决策边界
高斯判别分析
§4.2.1
draft
二次判别分析 QDA
每类有自己的椭圆云团形状时,分界线不再是直线,而是二次曲线——这就是 QDA。
$p(\mathbf{x} \mid \mathbf{y}=c)=\mathcal{N}(\mathbf{x}|\mu_c,\sum_{c})$
$\mathcal{O}(CD^2) vs LDA 的 \mathcal{O}(D^2)$
如果允许每个类有自己的协方差矩阵,决策边界将变成二次的。(§4.2.1,p.89)
QDA
二次边界
GDA
场景 05–06
05 – 06
§4.3
draft
联合高斯条件分布
联合高斯里,「知道一部分坐标」后,剩下部分仍是高斯——均值线性依赖已知值。
$p(x_1)=\mathcal{N}(\mu_1,Σ_{11})$
如果 x₁ 和 x₂ 是联合高斯,那么条件分布 $p(x_2 \mid x_1)$ 也是高斯分布。(§4.3,p.95–99)
条件分布
边缘分布
分块高斯
§4.3.2.1
draft
边缘与条件分布(二维)
二维椭圆投影:边缘化 = 压扁一个方向;条件化 = 沿另一方向切一片高斯。
$\sum = [[\sigma_1^2,\rho\sigma_1\sigma_2],[\rho\sigma_1\sigma_2,\sigma_2^2]]$
$Var(x_1)=\sigma_1^2,与 \rho 无关$
图4.3 展示了二维高斯分布的边缘分布和条件分布。(§4.3.2.1,p.97)
二维高斯
边缘化
条件化
场景 07–08
07 – 08
§4.3.2.3
draft
数据插补
缺了数据?在联合高斯假设下,用条件期望填回去就是最优(L2 意义下)。
$\mathbf{x}̂_{miss} = E[x_{miss} \mid x_{obs}] = \mu_{miss} + Σ_{miss,obs} Σ_{obs,obs}^{-1}(x_{obs}-\mu_{obs})$
一种合理的插补方法是使用条件期望。(§4.3.2.3,p.99)
数据插补
缺失值
条件期望
§4.4
draft
线性高斯系统
变量连成链:每个节点是高斯,父节点线性影响均值——整条链的联合分布仍有闭式。
$p(\mathbf{x}_i \mid pa_i)=\mathcal{N}(\mathbf{x}_i \mid W_i pa_i, \sum_i)$
$仍为 MVN(可递归求 \mu,\sum)$
线性高斯模型定义了一种重要的图结构,其中每个节点的条件分布是高斯分布。(§4.4,p.103)
线性高斯
贝叶斯网络
消息传递
场景 09–10
09 – 10
§4.3.3
draft
信息形式高斯
把高斯从「均值+协方差」改写成「精度矩阵+自然参数」——条件化和乘法变超简单。
$p(\mathbf{x}) \propto \exp[-½xᵀΛx + \etaᵀx + c]$
在信息形式下也可以推导出边缘化和条件化公式……在矩形式下进行边缘化更为简便,而在信息形式下进行条件化更为容易。(§4.3.3,p.99–100)
信息形式
精度矩阵
自然参数
§4.5
draft
因子分析直觉
高维观测 = 低维「因子」线性生成 + 噪声——在噪声里找潜在结构。
$z\simN(0,I),\mathbf{x}=Wz+\mu+\varepsilon,\varepsilon\simN(0,Ψ)$
$p(\mathbf{x})=\mathcal{N}(\mu, WWᵀ+Ψ)$
因子分析是一种构建高维观测变量联合概率模型的技术,它使用少量连续隐变量。(§4.5,p.105)
因子分析
隐变量
降维
场景 11–12
11 – 12
§4.6
draft
独立成分分析 ICA
混合信号里拆出独立源——关键不在高斯,而在「非高斯 + 统计独立」。
$\mathbf{x} = As,s 独立,E[s]=0$
$求 \mathbf{W} 使 \mathbf{y}=Wx 分量尽可能独立$
独立成分分析(ICA)是一种估计线性变换的技术,使得输出分量统计独立。(§4.6,p.107)
ICA
盲源分离
非高斯
§4.7
draft
卡尔曼滤波直觉
带噪声的动态系统:预测一步 → 看新观测 → 修正——循环往复,全程闭式高斯。
$z_t = \mathbf{A} z_{t-1} + \varepsilon_t,\varepsilon\simN(0,Q)$
$\mu_t \mid t-1,\sum_{t} \mid t-1$
卡尔曼滤波是一种在线算法,用于对线性高斯状态空间模型的后验进行递推估计。(§4.7,p.109)
卡尔曼滤波
状态空间
递推推断
← 上一章
第3章 · 离散生成式模型
下一章 →
第5章 · 贝叶斯统计学