动手学深度学习 7.7 AdaDelta算法

前言

从零开始学习ai文章系列计划是个人在《动手学深度学习》和《磨菇书》两本书的学习中的个人笔记,文章也会以课本中的章节分开,即每个章节一片笔记。我会尽量的把主要内容以及遇到的难点进行记录与解决,如果哪里有错误的欢迎指正。或者不清晰的可以直接查看原文部分。

《动手学深度学习》原文(课本):https://tangshusen.me/Dive-into-DL-PyTorch/#/

《动手学深度学习》代码:https://github.com/ShusenTang/Dive-into-DL-PyTorch

(由于有时候公式太多,可能会直接贴图片)


除了RMSProp算法以外,另一个常用优化算法AdaDelta算法也针对AdaGrad算法在迭代后期可能较难找到有用解的问题做了改进 。有意思的是,AdaDelta算法没有学习率这一超参数。

#1. 算法

AdaDelta算法也像RMSProp算法一样,使用了小批量随机梯度gt按元素平方的指数加权移动平均变量 \(s_t\)

在时间步0,它的所有元素被初始化为0。给定超参数 \(0≤ρ<1\) (对应RMSProp算法中的γ),

在时间步 \(t>0\) ,同RMSProp算法一样计算

与RMSProp算法不同的是,AdaDelta算法还维护一个额外的状态变量 \(Δx_t\)

其元素同样在时间步0时被初始化为0。我们使用 \(Δx_{t−1}\) 来计算自变量的变化量

其中ϵ是为了维持数值稳定性而添加的常数,如 \(10^{-5}\)

接着更新自变量:

最后,我们使用 \(Δx_t\) 来记录自变量变化量 \(g^′_t\) 按元素平方的指数加权移动平均:

可以看到,如不考虑ϵ的影响,AdaDelta算法跟RMSProp算法的不同之处在于使用 \(\sqrt{\triangle x_{t-1}}\) 来替代学习率 \(η\)

中我们能看出,\(g'_t\)\(x\) 的更新量。

\(Δx_t\) 则是 \(x\) 更新量的加权平均。

使用 \(Δx_t\) 作为梯度更新的分子。使得“更新量该有多大”不是绝对的,是“相对参数尺度”的。即上一次更新量 \(g'_{t-1}\) 相比以前更大的话,那么此时更新后的 \(Δx_t\) 相比以前更大,所以 带入以下公式中,此时的学习率的分子也相比以前更大。(这里是指数滑动平均,单次大更新 不会 让 Δx 突然变大,必须 持续很多步都大,只有持续可控的变化才能积累。对于更新量越大, \(Δx_t\) 更大可以通俗的理解为:我已经反复这样走过,而且没出事,所以我要加快进度。)

2. 从零开始实现

AdaDelta算法需要对每个自变量维护两个状态变量,即 \(s_t\)\(Δx_t\) 。我们按AdaDelta算法中的公式实现该算法。

1
2
3
4
5
6
7
8
9
10
11
12
def init_adadelta_states():
s_w, s_b = torch.zeros((features.shape[1], 1), dtype=torch.float32), torch.zeros(1, dtype=torch.float32)
delta_w, delta_b = torch.zeros((features.shape[1], 1), dtype=torch.float32), torch.zeros(1, dtype=torch.float32)
return ((s_w, delta_w), (s_b, delta_b))

def adadelta(params, states, hyperparams):
rho, eps = hyperparams['rho'], 1e-5
for p, (s, delta) in zip(params, states):
s[:] = rho * s + (1 - rho) * (p.grad.data**2)
g = p.grad.data * torch.sqrt((delta + eps) / (s + eps))
p.data -= g
delta[:] = rho * delta + (1 - rho) * g * g

使用超参数 ρ=0.9 来训练模型。

1
d2l.train_ch7(adadelta, init_adadelta_states(), {'rho': 0.9}, features, labels)

3. 简洁实现

通过名称为Adadelta的优化器方法,我们便可使用PyTorch提供的AdaDelta算法。它的超参数可以通过rho来指定。(rho 也就是 \(\rho\) ,即我们的指数加权移动平均的衰减系数,算法中的 \(s和Δx_t\) 共用同一个 rho )

1
d2l.train_pytorch_ch7(torch.optim.Adadelta, {'rho': 0.9}, features, labels)