轻量化网络(三)Squeezenet: Alexnet-Level Accuracy With 50x Fewer Parameters And 0.5mb Model Size

本文主要是介绍轻量化网络(三)Squeezenet: Alexnet-Level Accuracy With 50x Fewer Parameters And 0.5mb Model Size,希望对大家解决编程问题提供一定的参考价值,需要的开发者们随着小编来一起学习吧!

论文链接
Caffe实现
Pytorch实现
Tensorflow实现
轻量化网络有至少以下三个优点:1、更小的网络在服务器上训练需要更少的计算量。2、更小的模型需要更少的带宽从云端下载到自动驾驶汽车上。3、更小的模型可以更灵活得部署在FPGAs和其他有限内存的硬件上。本文基于以上优点提出了SqueezeNet,保持模型性能不变的情况下,使得AlexNet模型减少了50倍的参数量。

一、网络设计策略
作者基于三个策略来设计网络结构。
1.使用 1 × 1 1 \times 1 1×1卷积核代替 3 × 3 3 \times 3 3×3卷积核,模型参数可以变为原来的 1 9 \frac{1}{9} 91
2.减少输入 3 × 3 3 \times 3 3×3卷积核的特征通道。考虑卷积核的参数量为 3 × 3 × C i n × C o u t 3 \times 3 \times C_{in} \times C_{out} 3×3×Cin×Cout,减少输入特征的通道,就会减少 C i n C_{in} Cin,从而减少卷积核参数量。在论文中模型使用 squeeze layers来减少输入特征的通道数。
3.在整个网络中延迟降采样的时机。如果在网络初期就开始降采样,后期网络都将只有较小分辨率的输入的特征,这会影响网络精度。He & Sun, 2015的一篇文章也提到了这点。

策略1和2是为了减少网络参数同时尽量保持精度,策略3是在有限参数的情况下最大化网络精度。
二、Fire Module
基于以上三个原则,作者设计了Fire Module。首先使用一个 1 × 1 1 \times 1 1×1卷积核来降维,之后分别使用一个 1 × 1 1 \times 1 1×1卷积核和 3 × 3 3 \times 3 3×3卷积核进行卷积,输出后的特征进行concat。

class Fire(nn.Module):def __init__(self, inplanes, squeeze_planes,expand1x1_planes, expand3x3_planes):super(Fire, self).__init__()self.inplanes = inplanesself.squeeze = nn.Conv2d(inplanes, squeeze_planes, kernel_size=1)self.squeeze_activation = nn.ReLU(inplace=True)self.expand1x1 = nn.Conv2d(squeeze_planes, expand1x1_planes,kernel_size=1)self.expand1x1_activation = nn.ReLU(inplace=True)self.expand3x3 = nn.Conv2d(squeeze_planes, expand3x3_planes,kernel_size=3, padding=1)self.expand3x3_activation = nn.ReLU(inplace=True)   def forward(self, x):x = self.squeeze_activation(self.squeeze(x))return torch.cat([self.expand1x1_activation(self.expand1x1(x)),self.expand3x3_activation(self.expand3x3(x))], 1)

三、网络结构
Figure2中左图是标准的SqueezeNet,网络首先是一个标准卷积,之后是8个 Fire modules,最后是一个卷积层和softmax。从网络的开始到最后,逐渐增加Fire modules中卷积核的数量,即逐渐增加特征通道。
在这里插入图片描述
四、实验结果
在这里插入图片描述
Table 2中的第2行到第5行是对比的压缩模型方法,第6行是提出的SqueezeNet。从结果可以看到,模型参数减少了50倍,但是精度保持不变。引出一个新的问题,SqueezeNet在更小的数据类型中表型如何,从数据类型为8-bit和6-bit可以看出,SqueezeNet经得起继续压缩。
五、两个实验
作者设计了两个实验来总结网络模型中的两个参数对模型大小和精度的影响。
在这里插入图片描述
Figure 3(a)中 squeeze ratio (SR) 定义是压缩层中卷积核的数量和拓展层中卷积核的数量之比。从图中可知,随着压缩层卷积核的数量提升,模型大小逐渐增加,模型精度提升先增加后增加逐渐逐趋于缓和。
Figure 3(b)中 的实验是是针对策略1的,即使用 3 × 3 3 \times 3 3×3卷积核来代替 1 × 1 1 \times 1 1×1卷积核。实验逐渐增加 3 × 3 3 \times 3 3×3卷积核,模型大小逐渐增加,模型的精度先增加后增加逐趋于缓和。
从以上两个实验可以看出,压缩层和减少 3 × 3 3 \times 3 3×3卷积核的确有助于模型压缩,可见可以使用以上策略来压缩模型。
六、两个变体网络的实验
在这里插入图片描述
Figure 2中有两个变体的网络,在其中加入残差思想,Table 3中展示这这两个网络的性能和模型大小。

这篇关于轻量化网络(三)Squeezenet: Alexnet-Level Accuracy With 50x Fewer Parameters And 0.5mb Model Size的文章就介绍到这儿,希望我们推荐的文章对编程师们有所帮助!



http://www.chinasem.cn/article/441916

相关文章

python中os.stat().st_size、os.path.getsize()获取文件大小

《python中os.stat().st_size、os.path.getsize()获取文件大小》本文介绍了使用os.stat()和os.path.getsize()函数获取文件大小,文中通过示例代... 目录一、os.stat().st_size二、os.path.getsize()三、函数封装一、os

SSID究竟是什么? WiFi网络名称及工作方式解析

《SSID究竟是什么?WiFi网络名称及工作方式解析》SID可以看作是无线网络的名称,类似于有线网络中的网络名称或者路由器的名称,在无线网络中,设备通过SSID来识别和连接到特定的无线网络... 当提到 Wi-Fi 网络时,就避不开「SSID」这个术语。简单来说,SSID 就是 Wi-Fi 网络的名称。比如

Java实现任务管理器性能网络监控数据的方法详解

《Java实现任务管理器性能网络监控数据的方法详解》在现代操作系统中,任务管理器是一个非常重要的工具,用于监控和管理计算机的运行状态,包括CPU使用率、内存占用等,对于开发者和系统管理员来说,了解这些... 目录引言一、背景知识二、准备工作1. Maven依赖2. Gradle依赖三、代码实现四、代码详解五

Linux 网络编程 --- 应用层

一、自定义协议和序列化反序列化 代码: 序列化反序列化实现网络版本计算器 二、HTTP协议 1、谈两个简单的预备知识 https://www.baidu.com/ --- 域名 --- 域名解析 --- IP地址 http的端口号为80端口,https的端口号为443 url为统一资源定位符。CSDNhttps://mp.csdn.net/mp_blog/creation/editor

ASIO网络调试助手之一:简介

多年前,写过几篇《Boost.Asio C++网络编程》的学习文章,一直没机会实践。最近项目中用到了Asio,于是抽空写了个网络调试助手。 开发环境: Win10 Qt5.12.6 + Asio(standalone) + spdlog 支持协议: UDP + TCP Client + TCP Server 独立的Asio(http://www.think-async.com)只包含了头文件,不依

poj 3181 网络流,建图。

题意: 农夫约翰为他的牛准备了F种食物和D种饮料。 每头牛都有各自喜欢的食物和饮料,而每种食物和饮料都只能分配给一头牛。 问最多能有多少头牛可以同时得到喜欢的食物和饮料。 解析: 由于要同时得到喜欢的食物和饮料,所以网络流建图的时候要把牛拆点了。 如下建图: s -> 食物 -> 牛1 -> 牛2 -> 饮料 -> t 所以分配一下点: s  =  0, 牛1= 1~

poj 3068 有流量限制的最小费用网络流

题意: m条有向边连接了n个仓库,每条边都有一定费用。 将两种危险品从0运到n-1,除了起点和终点外,危险品不能放在一起,也不能走相同的路径。 求最小的费用是多少。 解析: 抽象出一个源点s一个汇点t,源点与0相连,费用为0,容量为2。 汇点与n - 1相连,费用为0,容量为2。 每条边之间也相连,费用为每条边的费用,容量为1。 建图完毕之后,求一条流量为2的最小费用流就行了

poj 2112 网络流+二分

题意: k台挤奶机,c头牛,每台挤奶机可以挤m头牛。 现在给出每只牛到挤奶机的距离矩阵,求最小化牛的最大路程。 解析: 最大值最小化,最小值最大化,用二分来做。 先求出两点之间的最短距离。 然后二分匹配牛到挤奶机的最大路程,匹配中的判断是在这个最大路程下,是否牛的数量达到c只。 如何求牛的数量呢,用网络流来做。 从源点到牛引一条容量为1的边,然后挤奶机到汇点引一条容量为m的边

配置InfiniBand (IB) 和 RDMA over Converged Ethernet (RoCE) 网络

配置InfiniBand (IB) 和 RDMA over Converged Ethernet (RoCE) 网络 服务器端配置 在服务器端,你需要确保安装了必要的驱动程序和软件包,并且正确配置了网络接口。 安装 OFED 首先,安装 Open Fabrics Enterprise Distribution (OFED),它包含了 InfiniBand 所需的驱动程序和库。 sudo

【机器学习】高斯网络的基本概念和应用领域

引言 高斯网络(Gaussian Network)通常指的是一个概率图模型,其中所有的随机变量(或节点)都遵循高斯分布 文章目录 引言一、高斯网络(Gaussian Network)1.1 高斯过程(Gaussian Process)1.2 高斯混合模型(Gaussian Mixture Model)1.3 应用1.4 总结 二、高斯网络的应用2.1 机器学习2.2 统计学2.3