动手学深度学习 5.1 二维卷积层
前言
从零开始学习ai文章系列计划是个人在《动手学深度学习》和《磨菇书》两本书的学习中的个人笔记,文章也会以课本中的章节分开,即每个章节一片笔记。我会尽量的把主要内容以及遇到的难点进行记录与解决,如果哪里有错误的欢迎指正。或者不清晰的可以直接查看原文部分。
《动手学深度学习》原文(课本):https://tangshusen.me/Dive-into-DL-PyTorch/#/
《动手学深度学习》代码:https://github.com/ShusenTang/Dive-into-DL-PyTorch
(由于有时候公式太多,可能会直接贴图片)
卷积神经网络(convolutional neural network)是含有卷积层(convolutional layer)的神经网络。本章中介绍的卷积神经网络均使用最常见的二维卷积层。它有高和宽两个空间维度,常用来处理图像数据。
1. 二维互相关运算
举例说明,输入是一个高和宽均为3的二维数组,也就是我们的图像。卷积核窗口是2×2的二维数组。

0×0 + 1×1 + 3×2 + 4×3 = 19
往右移动一步

1×0 + 2×1 + 4×2 + 5×3 = 25
第二行开始(初始位置往下移动一步)

3×0 + 4×1 + 6×2 + 7×3 = 37
同理继续往右移动一步

4×0 + 5×1 + 7×2 + 8×3 = 43
下面我们将上述过程实现在corr2d函数里。它接受输入数组X与核数组K,并输出数组Y。
1 | def corr2d(X, K): |
同大小的二维数组相乘,则结果是每个对应的数相乘结果组成的新的同大小二维数组,和我们之前的输入与核的计算一样,最后通过sum()函数将改二维数组每个数相加得到我们的最终结果。
构造之前图中的输入数组X、核数组K来验证二维互相关运算的输出。
1 | X = torch.tensor([[0, 1, 2], [3, 4, 5], [6, 7, 8]]) |

2. 二维卷积层
二维卷积层将输入和卷积核做互相关运算,并加上一个标量偏差来得到输出。
卷积层的模型参数包括了卷积核和标量偏差。在训练模型的时候,通常我们先对卷积核随机初始化,然后不断迭代卷积核和偏差。
下面基于corr2d函数来实现一个自定义的二维卷积层。(能看到偏差是最终结果的二维数组所有数都加上的同一数字)
1 | class Conv2D(nn.Module): |
3. 图像中物体边缘检测
下面我们来看一个卷积层的简单应用:检测图像中物体的边缘,即找到像素变化的位置。
首先我们构造一张6×8 的图像(即高和宽分别为6像素和8像素的图像)。它中间4列为黑(0),其余为白(1)。
1 | X = torch.ones(6, 8) |

然后我们构造一个高和宽分别为1和2的卷积核K。当它与输入做互相关运算时,如果横向相邻元素相同,输出为0;否则输出为非0。
1 | K = torch.tensor([[1, -1]]) |
下面将输入X和我们设计的卷积核K做互相关运算。可以看出,我们将从白到黑的边缘和从黑到白的边缘分别检测成了1和-1。其余部分的输出全是0。
1 | Y = corr2d(X, K) |

由此,我们可以看出,卷积层可通过重复使用卷积核有效地表征局部空间。
4. 通过数据学习核数组
最后我们来看一个例子,它使用物体边缘检测中的输入数据X和输出数据Y来学习我们构造的核数组K。
我们首先构造一个卷积层,其卷积核将被初始化成随机数组。
接下来在每一次迭代中,我们使用平方误差来比较Y和卷积层的输出,然后计算梯度来更新权重。
1 | # 构造一个核数组形状是(1, 2)的二维卷积层 |

可以看到,20次迭代后误差已经降到了一个比较小的值。现在来看一下学习到的卷积核的参数。
1 | print("weight: ", conv2d.weight.data) |

可以看到,学到的卷积核的权重参数与我们之前定义的核数组K较接近,而偏置参数接近0。
5. 互相关运算和卷积运算
假设有两个离散信号(或函数):
• 输入信号 f(n)
• 核(滤波器)g(n)
互相关 f ⋆ g
是滑动匹配计算,不翻转核。(就是我们之前滑动窗口进行的计算)
卷积 f ∗ g
需要先翻转核再计算,因此结果可能不同。(翻转核指上下左右反转后的核)
在深度学习(CNN)中,通常用互相关(没有翻转),但仍然称其为“卷积”。
那么,你也许会好奇卷积层为何能使用互相关运算替代卷积运算。其实,在深度学习中核数组都是学出来的:卷积层无论使用互相关运算或卷积运算都不影响模型预测时的输出。
在深度学习中,无论使用互相关运算还是标准的数学卷积运算,神经网络都能通过学习调整核数组,使得预测结果保持一致。因此,这两种操作不会影响最终的模型输出。
(意思就是,如果你实际使用互相关运算得出Y,那么利用该运算中的输入X、输出Y,神经网络还是能拟合出实际利用的核K。而如果你实际使用数学卷积运算得出Y,同理神经网络还是能拟合出实际运算中使用的翻转核K。从而达到实际运算结果与神经网络输出的结果一致)
因此,为了与大多数深度学习文献一致,如无特别说明,本书中提到的卷积运算均指互相关运算。
6. 特征图和感受野
二维卷积层输出的二维数组可以看作是输入在空间维度(宽和高)上某一级的表征,也叫特征图(feature map)。
影响特征图元素x的前向计算的所有可能输入区域(可能大于输入的实际尺寸)叫做x的感受野(receptive
field)。
以图5.1为例,输入中阴影部分的四个元素是输出中阴影部分元素的感受野。

我们将图5.1中形状为2×2的输出记为Y,并考虑一个更深的卷积神经网络:将Y与另一个形状为2×2的核数组做互相关运算,输出单个元素z。
那么,z在Y上的感受野包括Y的全部四个元素,在输入上的感受野包括其中全部9个元素。
可见,我们可以通过更深的卷积神经网络使特征图中单个元素的感受野变得更加广阔,从而捕捉输入上更大尺寸的特征。