动手学深度学习 5.7 使用重复元素的网络(VGG)
前言
从零开始学习ai文章系列计划是个人在《动手学深度学习》和《磨菇书》两本书的学习中的个人笔记,文章也会以课本中的章节分开,即每个章节一片笔记。我会尽量的把主要内容以及遇到的难点进行记录与解决,如果哪里有错误的欢迎指正。或者不清晰的可以直接查看原文部分。
《动手学深度学习》原文(课本):https://tangshusen.me/Dive-into-DL-PyTorch/#/
《动手学深度学习》代码:https://github.com/ShusenTang/Dive-into-DL-PyTorch
(由于有时候公式太多,可能会直接贴图片)
AlexNet在LeNet的基础上增加了3个卷积层。但AlexNet作者对它们的卷积窗口、输出通道数和构造顺序均做了大量的调整。虽然AlexNet指明了深度卷积神经网络可以取得出色的结果,但并没有提供简单的规则以指导后来的研究者如何设计新的网络。
我们将在本章的后续几节里介绍几种不同的深度网络设计思路。
本节介绍VGG,它的名字来源于论文作者所在的实验室Visual Geometry Group [1]。VGG提出了可以通过重复使用简单的基础块来构建深度模型的思路。
1. VGG块
VGG块的组成规律是:连续使用数个相同的填充为1、窗口形状为3×3的卷积层后接上一个步幅为2、窗口形状为2×2的最大池化层。
简单来说,VGG块结构如下
- n个卷积层:保持输入的高和宽不变
- 池化层:对其输出减半。
对于给定的感受野(与输出有关的输入图片的局部大小),采用堆积的小卷积核优于采用大的卷积核,因为可以增加网络深度来保证学习更复杂的模式,而且代价还比较小(参数更少)。
在VGG中
- 使用了
3个3x3卷积核来代替7x7卷积核, - 使用了
2个3x3卷积核来代替5x5卷积核,
举例如下图,2个3x3实现1个5x5图上的感受野

在VGG网络中,3x3卷积层的堆叠确实能逐层扩大感受野,但它的作用不仅仅局限于此。每一层卷积后的通道数(特征图数量)的变化,实际上意味着网络在该层对输入数据的特征表达能力发生了变化。
• 通道数的增加:表示网络希望在该层提取更多维度、更复杂的特征。
• 通道数的减少(虽然VGG中减少较少见):通常是为了压缩特征维度,减少计算量或提炼关键信息。
以下代码实现了VGG块,简单来说就是: n个
(3x3卷积层+relu激活) +
最后一个maxPool池化层
1 | def vgg_block(num_convs, in_channels, out_channels): |
2. VGG网络
与AlexNet和LeNet一样,VGG网络由卷积层模块后接全连接层模块构成。
卷积层模块串联数个vgg_block,其超参数由变量conv_arch定义。该变量指定了每个VGG块里卷积层个数和输入输出通道数。即 ( 卷积层数, 输入channel数, 输出channel数)
1 | conv_arch = ((1, 1, 64), (1, 64, 128), (2, 128, 256), (2, 256, 512), (2, 512, 512)) |
下面我们实现VGG-11。
(我们能发现我们已经学习的3种网络,其全连接层都是由3层组成的,这是一个标准的带隐藏层的全连接层)
1 | def vgg(conv_arch, fc_features, fc_hidden_units=4096): |
下面构造一个高和宽均为224的单通道数据样本来观察每一层的输出形状。
1 | net = vgg(conv_arch, fc_features, fc_hidden_units) |

可以看到,每次我们将输入的高和宽减半,直到最终高和宽变成7后传入全连接层。与此同时,输出通道数每次翻倍,直到变成512。
VGG这种高和宽减半以及通道翻倍的设计使得多数卷积层都有相同的模型参数尺寸和计算复杂度。
3. 获取数据和训练模型
因为VGG-11计算上比AlexNet更加复杂,出于测试的目的我们构造一个通道数更小,或者说更窄的网络在Fashion-MNIST数据集上进行训练。
1 | ratio = 8 |
模型训练过程与上一节的AlexNet中的类似。
1 | batch_size = 64 |

我们通过vgg的卷积块实现的网络,效果和之前的AlexNet相近。
VGG-11通过5个可以重复使用的卷积块来构造网络。根据每块里卷积层个数和输出通道数的不同可以定义出不同的VGG模型。
4. summary工具包观察参数变换
我们可以用summary工具观察我们pytorch网络的参数结构变换。
pip install torchsummary
1 | from torchsummary import summary |
用法很简单,summary(模型, 输入) 即可。
输出中,每行的内容如列标所示,对应的Layer有着对应的Output Shape,即经过该层Layer后的输出形状
第一个参数-1不用管。指batch_size
