Machine Learning: A Probabilistic Perspective

第5章 · 贝叶斯统计学

MAP 的局限、模型选择、贝叶斯奥卡姆剃刀与决策理论——贝叶斯推断的系统图景。 共 10 个 Manim 动画,点击缩略图可全屏播放。

10
知识点
10
动画视频
§05
教材章节
知识脉络
01MAP 估计
→
02后验可信区间
→
03贝叶斯模型选
→
04贝叶斯奥卡姆
→
05边缘似然与
→
06贝叶斯因子
→
07无信息先验与
→
08层次贝叶斯直
→
09决策理论与损
→
10经验贝叶斯

场景 01–02

01 – 02
draft

MAP 估计的局限

MAP 只是一个点——它不说自己有多靠谱,还可能过度自信、甚至换参数化就变答案。
$后验众数$ 平方损失最优:$E[\theta \mid D](后验均值)$ 重参数化:$$argmax_y p(\mathbf{y} \mid D) \neq f(argmax_x p(\mathbf{x} \mid D)) 一般$
MAP 估计以及其他任何点估计最明显的缺点是,其无法提供任何不确定性的度量。(§5.2.1.1,p.130)
MAP点估计不确定性
draft

后验可信区间

贝叶斯可信区间:给定数据后,参数有 95% 概率落在这个区间里——和频率派 CI 含义不同。
$p(δ \mid D),δ=\theta_1-\theta_2,\mathrm{MC} 近似 HPD$
如果后验分布是多峰的,HDI 可能不是一个连通区域。(§5.2.2.1,p.133)
可信区间HPD贝叶斯推断

场景 03–04

03 – 04
draft

贝叶斯模型选择

不只看谁拟合训练集最好——给模型算后验概率,自动惩罚「太复杂」。
Scene 03
这称为贝叶斯模型选择(Bayesian model selection)。(§5.3,p.135)
模型选择后验模型概率边缘似然
draft

贝叶斯奥卡姆剃刀

复杂模型能解释一切,却把概率摊得太薄——简单模型反而对真实数据赋更高证据。
$\sum_{D'} p(D' \mid m)=1,复杂模型分布更分散$$\lambda*=\arg\max p(\lambda \mid D) 高效选复杂度(§5.6)$
这被称为贝叶斯奥卡姆剃刀效应……复杂模型能够预测很多种情况,就必须将其概率质量分散得很薄。(§5.3.1,p.135–137)
奥卡姆剃刀边缘似然概率质量守恒

场景 05–06

05 – 06
draft

边缘似然与 BIC

边缘似然难算时,BIC 给了一个便宜的近似——惩罚项就是「模型别太复杂」。
$p(D)=\mathbf{B}(a+N_1,b+N_0)/\mathbf{B}(a,b)$$p(D)=\mathbf{B}(\alpha+N)/\mathbf{B}(\alpha)$
图5.9(b)显示了 BIC 近似值……曲线与精确的对数边缘似然具有大致相同的形状。(§5.3.2.4,p.139)
边缘似然BIC模型证据
draft

贝叶斯因子

两模型谁更好?看边缘似然比值——贝叶斯版的「显著性检验」。
$BF_{10} = \frac{p(D \mid M_1)}{p(D \mid M_0)}$
贝叶斯因子定义为边缘似然的比率……这类似于似然比,只是对参数进行了积分。(§5.3.3,p.141)
贝叶斯因子假设检验模型比较

场景 07–08

07 – 08
draft

无信息先验与 Jeffreys 先验

「尽量不让先验说话」——均匀先验看似公平,换参数化就不公平了;Jeffreys 先验追求重参数化不变。
$lim_{c\to0} \mathrm{Beta}(c,c),不当先验$$\mathrm{Beta}(½,½)$
杰弗里斯设计了一种创建无信息先验的通用技术……如果 $p(\phi)$ 是无信息的,那么先验的任何重新参数化结果也应该是无信息的。(§5.4.2,p.143–145)
无信息先验Jeffreys先验Haldane先验
draft

层次贝叶斯直觉

参数不再各自为战——共享超先验把同类参数「拉向彼此」,小样本也能借力。
$小 n_i 组 \hat{\theta}_i 向 \alpha 估计收缩$
在层次贝叶斯模型中,先验本身由更高层的先验(超先验)控制。(§5.5,p.147)
层次贝叶斯超先验部分池化

场景 09–10

09 – 10
draft

决策理论与损失函数

选哪个估计量,取决于你怕什么错——损失函数替你回答「后验该怎么总结」。
$L=(\theta-\hat{\theta})^2 \to \hat{\theta}=E[\theta \mid D]$ 0-1 损失:$$L=I(\theta\neq\hat{\theta}) \to \hat{\theta}=\operatorname{mode}(\theta \mid D)$
基本思想是指定一个损失函数……相应的最优估计就是后验均值,正如5.7 节所展示的那样。(§5.2.1.3 引至 §5.7,p.130–153)
决策理论损失函数后验均值
draft

经验贝叶斯

超参数自己也让数据说了算——经验贝叶斯用 MLE 估 α,在严格贝叶斯与实用之间取平衡。
Scene 10
这种技术称为经验贝叶斯(Empirical Bayes,EB)或Ⅱ型最大似然法(type II maximum likelihood)。(§5.3.1 引 §5.6,p.137/149)
经验贝叶斯II型MLE超参数估计
← 上一章 第4章 · 高斯模型 下一章 → 第8章 · 逻辑斯谛回归