Machine Learning: A Probabilistic Perspective

第1章 · 引言

从监督学习到无免费午餐定理——直观理解机器学习的基本概念与核心权衡。 共 10 个 Manim 动画,点击缩略图可全屏播放。

10
知识点
10
动画视频
§01
教材章节
知识脉络
01监督学习分类
→
02设计矩阵与特
→
03K最近邻分类
→
04维度灾难
→
05线性回归拟合
→
06过拟合与模型
→
07正则化与偏差
→
08Logist
→
09模型选择与交
→
10无免费午餐定

基础概念

01 – 02
draft

监督学习分类与回归

给一堆带标签的训练样本,看模型在平面上画分界线(分类)或拟合趋势线(回归),并对没见过的点做预测。
$D = \{(\mathbf{x}_i, y_i)\}_{i=1}^N$$y \in \mathbb{R}$
我们的主要目标是对在未见过的新输入上进行预测,这一能力称为泛化(generalization)。(§1.2,p.2)
监督学习分类回归
draft

设计矩阵与特征表示

把每个样本变成一行 D 维特征向量,N 个样本堆成 $N \times D$ 矩阵——机器学习的数据「表格」就这样搭起来。
$\mathbf{X} \in \mathbb{R}^{N \times D},第 i 行 \mathbf{x}_i^\top$$\mathbf{y} \in \mathbb{R}^N 或 \{1, \ldots, C\}^N$
它们通常被存储在一个 $N \times D$ 的设计矩阵(design matrix)X 中,如图1.1(b)所示。(§1.2.1.1,p.3)
设计矩阵特征数据表示

非参数方法

03 – 04
draft

K最近邻分类

调节 K,看邻域圆与分类投票——K 小→高方差;K 大→高偏差。
$\hat{y} = \operatorname{mode}({y_i : \mathbf{x}_i \in NN_K(x)})$
一个最简单的非参数分类器是 K 最近邻分类器(KNN)。它的做法很简单:对于测试点,找到训练集中距离它最近的 K 个点,然后采用多数投票。(§1.4.2,p.14)
KNN非参数分类
draft

维度灾难

维度 D 升高,邻域体积指数坍缩,最近邻失去区分力。
Scene 04
KNN 的一个主要问题在于它在高维输入数据下表现不佳,其性能退化的原因被称为维度灾难(curse of dimensionality)。(§1.4.3,p.15)
维度灾难高维距离

线性模型与过拟合

05 – 07
ready

线性回归拟合与损失

均方误差 MSE 衡量残差平方和,OLS 找到让损失最小的斜率与截距。
$L(\mathbf{w}) = \frac{1}{N} \sum_i (y_i - \mathbf{w}^\top \mathbf{x}_i - b)^2$$y = \mathbf{w}^\top \mathbf{x} + b + \varepsilon,\varepsilon \sim \mathcal{N}(0, \sigma^2)$
线性回归(linear regression)是最广泛使用的回归模型之一。该模型假设响应变量是输入特征的线性组合加上高斯噪声。(§1.4.5,p.17)
线性回归MSE最小二乘
ready

过拟合与模型复杂度

偏差² + 方差 + 噪声分解;模型太简单学不到规律,太复杂则追逐噪声。
Scene 06
当我们拟合高度灵活的模型时,需要特别注意避免过拟合(overfitting),也就是说,我们在训练集上表现很好,但在新数据上表现很差。(§1.4.7,p.19)
过拟合模型复杂度泛化
ready

正则化与偏差方差权衡

岭回归在 MSE 上加入 ‖w‖² 惩罚,λ 越大权重越收缩,拟合越平滑。
$L(w) = \mathrm{MSE} + \lambda \|\mathbf{w}\|_2^2$$L(w) = \mathrm{MSE} + \lambda \|\mathbf{w}\|_1$
正则化可以看作是对模型复杂度施加惩罚,从而防止过拟合。(§1.4.7–1.4.8,p.19)
正则化偏差方差岭回归

分类与模型选择

08 – 09
draft

Logistic回归直觉

σ(η) 把线性分数压到 (0,1);决策边界仍在 w·x+b=0(σ=0.5)。
$\eta = \mathbf{w}^\top \mathbf{x} + b$$\sigma(\eta) = 1 / (1 + \exp(-\eta))$
我们可以将线性回归推广到二分类任务中……该模型被称为 logistic 回归,是由于其结构上与线性回归相似。(§1.4.6,p.17)
Logisticsigmoid分类
draft

模型选择与交叉验证

把数据折成 K 份轮流当验证集,画误差随复杂度变化的曲线,在谷底选模型。
$CV(K) = (1/K) \sum_{k=1}^K Err_k^{val}$$argmin_m CV(m) 或 argmin_m \mathrm{BIC}(m)$
当我们面对一系列复杂度不同的模型时,如何选择最合适的模型?一个自然的方法是计算每种模型在训练集上的误差——但这会导致过拟合。(§1.4.8,p.19)
模型选择交叉验证泛化

理论局限

10 – 10
draft

无免费午餐定理

没有放之四海而皆准的万能模型——平均而言,任何算法在所有问题上都不比随机好。
$E_D[Err(\mathbf{A})] 对所有算法 \mathbf{A} 相同(在均匀先验下)$
不存在一种在所有问题上都最优的学习算法——这就是无免费午餐定理的核心含义。(§1.4.9,p.20)
无免费午餐模型选择先验
← 返回 总览首页 下一章 → 第2章 · 概率