Machine Learning: A Probabilistic Perspective

第2章 · 概率

频率派与贝叶斯派、贝叶斯法则、MLE 与信息论——概率论如何支撑机器学习。 共 12 个 Manim 动画,点击缩略图可全屏播放。

12
知识点
12
动画视频
§02
教材章节
知识脉络
01频率派与贝叶
→
02贝叶斯法则与
→
03生成式分类器
→
04条件独立性
→
05高斯分布
→
06链式法则与联
→
07蒙特卡洛采样
→
08中心极限定理
→
09信息熵与 K
→
10最大似然估计
→
11协方差与相关
→
12变换变量的分

场景 01–02

01 – 02
draft

频率派与贝叶斯派

同一枚硬币:频率派说『长期正面比例』,贝叶斯派说『下一次正面有多不确定』。
$P(\mathbf{A}) = lim_{n\to\infty} n_A / n$$P(\mathbf{A}) = 对事件 \mathbf{A} 发生不确定性的量化(0–1)$
贝叶斯派解释的一大优势在于,它能对无法长期重复的事件进行不确定性建模。(§2.1,p.1)
贝叶斯频率派概率解释
draft

贝叶斯法则与医学诊断

检测阳性不代表得病——用先验×似然÷证据,把『罕见病+阳性』的后验拉回现实。
$p(H \mid D) = \frac{p(D \mid H) p(H)}{p(D)}$$p(D) = \sum_{H} p(D \mid H) p(H)$
假设某种疾病在人群中的患病率为 1%,检测准确率 99%……即使检测为阳性,真正患病的后验概率仍然可能远低于 99%。(§2.2.3.1,p.25)
贝叶斯法则医学诊断后验

场景 03–04

03 – 04
draft

生成式分类器直觉

先学每类长什么样 $p(\mathbf{x} \mid \mathbf{y})$,再用贝叶斯翻成『看到 x 属于哪类』——倒着建模也能分类。
$p(\mathbf{y} \mid \mathbf{x}) = \frac{p(\mathbf{x} \mid \mathbf{y}) p(\mathbf{y})}{p(\mathbf{x})}$$p(\mathbf{x}, \mathbf{y}) = p(\mathbf{x} \mid \mathbf{y}) p(\mathbf{y})$
将贝叶斯准则应用到生成式分类器:$p(\mathbf{y} \mid \mathbf{x}) \propto p(\mathbf{x} \mid \mathbf{y}) p(\mathbf{y})$。(§2.2.3.2,p.25)
生成式贝叶斯分类类条件
draft

条件独立性

知道 Y 后 X 与 Z 无关——这条假设让高维联合分布分解成小块乘积。
$p(\mathbf{x} \mid \mathbf{y}) = \prod_{j=1}^D p(x_j \mid \mathbf{y})$$\mathbf{X} \perp Z | \mathbf{Y} \Leftrightarrow p(\mathbf{x},z \mid \mathbf{y}) = p(\mathbf{x} \mid \mathbf{y}) p(z \mid \mathbf{y})$
如果 X 和 Z 在给定 Y 的条件下独立,则称 X 和 Z 条件独立。(§2.2.4,p.27)
条件独立朴素贝叶斯图模型

场景 05–06

05 – 06
draft

高斯分布

拖 μ 和 σ,看钟形曲线平移和变胖变瘦——自然界最常见的连续分布。
$\mathcal{N}(\mathbf{x}|\mu,\sigma^2) = (2\pi\sigma^2)^{-1/2} \exp(-(\mathbf{x}-\mu)^2/(2\sigma^2))$$E[\mathbf{x}] = \mu$
高斯分布(Gaussian)或正态分布(Normal)是连续变量中最常用的概率分布。(§2.4.1,p.31)
高斯正态分布连续
draft

链式法则与联合分布

联合概率拆成条件概率连乘——从第一个变量开始,一步步『追问在后面』。
$p(x_{1:D}) = \prod_{i=1}^D p(\mathbf{x}_i \mid x_{1:i-1})$ 全概率:$$p(\mathbf{A}) = \sum_{B} p(\mathbf{A} \mid \mathbf{B}) p(\mathbf{B})$
反复运用乘法法则即可推导出概率的链式法则(chain rule)。(§2.2.2,p.23)
链式法则联合概率乘法法则

场景 07–08

07 – 08
draft

蒙特卡洛采样

抛大量随机点进复杂分布,样本堆起来的形状就是目标分布——算期望就靠这招。
$E_p[f(\mathbf{X})] \approx (1/S) \sum_{s=1}^S f(x_s),x_s \sim p$
蒙特卡洛方法通过从分布中采样来近似难以计算的积分与期望。(§2.7.1,p.39)
蒙特卡洛采样期望估计
draft

中心极限定理

从任意分布反复抽 n 个求平均,n 越大,平均值的分布越收成漂亮的高斯钟形。
$(\mathbf{X}̄_n - \mu) / (\sigma/\sqrtn) \xrightarrow{d} \mathcal{N}(0,1)$$Var(\mathbf{X}̄_n) = \sigma^2/n$
从任意分布反复抽取 n 个样本并求平均,当 n 足够大时,样本均值的分布近似高斯。(§2.7.3,p.41)
中心极限定理高斯样本均值

场景 09–10

09 – 10
draft

信息熵与 KL 散度

拖预测分布,看熵衡量不确定性、交叉熵衡量预测代价、KL 衡量两分布差多远。
$H(p) = -\sum_{x} p(\mathbf{x}) \log p(\mathbf{x})$$H(p,q) = -\sum_{x} p(\mathbf{x}) \log q(\mathbf{x})$
熵度量分布的不确定性;KL 散度度量两个分布之间的差异。(§2.8,p.42)
熵KL散度交叉熵
draft

最大似然估计

调参数让观测数据出现的可能性最大——似然山坡往上爬,山顶就是 MLE。
$\hat{\theta}_MLE = argmax_\theta p(D \mid \theta)$$\ell(\theta) = \sum_i \log p(\mathbf{x}_i \mid \theta)$
最大似然估计选择使观测数据出现概率最大的参数值。(§2.9,p.43)
MLE似然参数估计

场景 11–12

11 – 12
draft

协方差与相关

看两变量一起变大还是反向——协方差捕捉线性关联,相关系数归一化到 [-1,1]。
$E[XY] - E[\mathbf{X}]E[\mathbf{Y}]$$Cov(\mathbf{X},\mathbf{Y}) / (\sigma_X \sigma_Y)$
协方差度量两个随机变量线性相关的程度。(§2.5,p.37)
协方差相关联合分布
draft

变换变量的分布

X 经过函数 g 变成 Y,概率质量要按 Jacobian 伸缩——挤过窄管道密度变大。
$\mathbf{Y} = AX \Rightarrow p_Y(\mathbf{y}) = p_X(\mathbf{A}^{-1}\mathbf{y}) / |\det \mathbf{A}|$$p_Y(\mathbf{y}) = p_X(g^{-1}(\mathbf{y})) |dg^{-1}/dy|$
若已知 X 的分布且 Y = g(X),可以通过变量变换公式求得 Y 的分布。(§2.6,p.38)
变量变换Jacobian概率密度
← 上一章 第1章 · 引言 下一章 → 第3章 · 离散生成式模型