§8.5
draft
在线学习与随机梯度下降
数据像水龙头一样来——不必等全量算完梯度,每来一个(或小批)样本就挪一步,噪声反而帮你逃出浅坑。
$f(\boldsymbol\{\theta\}) = \frac{1}{N}\sum_i f_i(\boldsymbol{\theta}, \mathbf{z}_i), \quad f_i = -\log p(y_i\mid\mathbf{x}_i, \boldsymbol{\theta})$$\boldsymbol\{\theta\}_{k+1} = \mathrm{proj}_\Theta(\boldsymbol{\theta}_k - \eta_k \nabla f(\boldsymbol{\theta}_k, \mathbf{z}_k))$
传统机器学习是离线(offline)进行的,即基于批量(batch)数据……然而,对于流式数据(streaming data),需进行在线学习(online learning),以便在每个新数据点到达时更新估计值。(§8.5,p.15–16)
在线学习SGDmini-batchRobbins-Monro