直觉化深度学习教程——偏置与激活函数之间的关系

2024-01-23 21:18

本文主要是介绍直觉化深度学习教程——偏置与激活函数之间的关系,希望对大家解决编程问题提供一定的参考价值,需要的开发者们随着小编来一起学习吧!

我们看到成熟的神经网络时,往往能看到偏置 b b b与激活函数Sigmoid或ReLU,但是它们是从何而来的呢?

通过探究,我们将获得更深刻的认识。

文章目录

    • @[toc]
  • 偏置的前世今生
    • 偏置的由来
    • 偏置有什么意义
  • 激活函数的放飞自我
    • 激活函数有什么意义
    • 为什么要用激活函数

偏置的前世今生

偏置的由来

用一张图就能说明白。来吧,少年,接图!
在这里插入图片描述

图1.偏置的前世今生

如果我的图做的有点杂乱,那咱们就稍微用用公式。

回忆一下我们之前讨论过的M-P模型,我们的激活函数 f ( z ) f(z) f(z)是一个以 h h h为阈值的阶跃函数,如公式(1)所示。
f ( z ) = { 1 z ≥ h 0 z < h f(z)=\begin{cases} 1&{z \ge h}\\ 0&{z < h} \end{cases} f(z)={10zhz<h
我们现在对它进行一点小小的变换,如公式(2)。
f ( z − h ) = { 1 z − h ≥ 0 0 z − h < 0 f(z-h)=\begin{cases} 1&{z-h \ge 0}\\ 0&{z-h < 0} \end{cases} f(zh)={10zh0zh<0
这样,我们可以用之前的加权和减去阈值的结果,令 Z Z Z表示新的加权和,代替 z − h z-h zh,则有:
f ( Z ) = { 1 Z ≥ 0 0 Z < 0 f(Z)=\begin{cases} 1&{Z \ge 0}\\ 0&{Z < 0} \end{cases} f(Z)={10Z0Z<0
我们回忆一下,
z = w 1 x 1 + w 2 x 2 + w 3 x 3 z=w_1x_1+w_2x_2+w_3x_3 z=w1x1+w2x2+w3x3
推导,由于 Z = z − h Z=z-h Z=zh,则有 z = Z + h z=Z+h z=Z+h,即新的加权和公式为
Z = w 1 x 1 + w 2 x 2 + w 3 x 3 − h Z=w_1x_1+w_2x_2+w_3x_3-h Z=w1x1+w2x2+w3x3h
由于我们习惯用小写 z z z表示带权和,因此我们就把小写 z z z代替大写 Z Z Z,符号而已,你懂的;另外,由于公式(6)是一个典型的线性变换(严格地说是仿射变换),我们习惯把常数项 h h h叫偏置,且习惯用 b b b表示,我们令 b = − h b=-h b=h。总之,我们把公式(3)和公式(6),放到一起,呈现如下:
z = w 1 x 1 + w 2 x 2 + w 3 x 3 + b f ( z ) = { 1 z ≥ 0 0 z < 0 z=w_1x_1+w_2x_2+w_3x_3+b\\ \\ f(z)=\begin{cases} 1&{z \ge 0}\\ 0&{z < 0} \end{cases} z=w1x1+w2x2+w3x3+bf(z)={10z0z<0
哦了。此时,相当于加权和里多了一个偏置 b b b,可以把它看做是一个恒为常数1的输入上的权重。这时,你再看看图1,是不是豁然开朗?

偏置有什么意义

我们可以总结一下:前世里,那个阈值称为 h h h,归属激活函数,决定了激活函数输出跳变的那个位置;今生里,它换了个反转(即取了个负号)马甲,称为 b b b,投奔到了带权和的麾下,但意义没变

至少有以下三条解读:

  • 偏置表示激活函数被激活的难易程度,偏置越小,带权和z中的 w i x i w_ix_i wixi项的求和结果必须变得非常大,才能使得激活函数输出为1(假设仍为阶跃激活函数),或者被激活(假设为别的激活函数,见后文)。
  • 也可以把偏置是理解为 w 0 w_0 w0,则偏置是最重要的权重!其他权重调得再好,没有好的偏置,都白搭。

激活函数的放飞自我

正是因为有了上面的过程,阈值没了,激活函数可以专注于进行非线性了,而不用再考虑阈值 h h h了。

但是,前面的激活函数 f ( x ) f(x) f(x)是一个阶跃函数,有两个问题:

  • 加权和的强度信息无法传递到下一层
  • 导数为0,反向传播时权重无法更新(个别点不能求导问题不大,只需要给个缺省导数值即可)

所以人们想出了sigmoid函数来近似阶跃函数,后来又发展出tanh函数,ReLU函数。如下面几个图所示。
在这里插入图片描述

图2.sigmoid函数

在这里插入图片描述

图3.tanh函数

在这里插入图片描述

图4.ReLU函数

这些函数的曲线一目了然,网上的公式很多,就不再罗列了。

sigmoid和tanh都会面临在输入加权和非常大、非常小时(即横坐标轴的两端),导数非常小,导致反向传播时的梯度消失问题;而ReLu克服了这一点,它的导数要么为1,不会出现梯度衰减,因此近些年ReLU几乎已经在隐层中全面取代了它的两个前辈。这部分我会在反向传播中详细解释。

看起来:所有的激活函数都是以0点为中心。事实是:在整个训练过程中,一直在随着偏置左右移动,直到训练结束才固定下来,最终也几乎不可能在0点处。

激活函数有什么意义

激活函数相当于对加权和输入的一种选择性投票,例如:

  • Sigmoid

    对所有带权h和,都投支持票。带权和越小,支持力度越小;带权h和越大,支持力度大。

  • Tanh

    对大于0的带权和,投支持票;对小于0的带权和,投反对票。

  • ReLU

    对大于0的带权和,投支持票;对小于0的带权和,弃权。

为什么要用激活函数

提供非线性,这是神经网络可以逼近任意函数的关键!

至于非线性的“扭曲形状”不必care,因为通过充分地训练,损失函数会用"梯度"这个指挥棒,将隐层的权重和输出层的权重”调教“到一组合适的数值,这些权重的组合效应,将会把这个扭曲的超平面,逼近到数据的分类面

这篇关于直觉化深度学习教程——偏置与激活函数之间的关系的文章就介绍到这儿,希望我们推荐的文章对编程师们有所帮助!



http://www.chinasem.cn/article/637555

相关文章

电脑没有仿宋GB2312字体怎么办? 仿宋GB2312字体下载安装及调出来的教程

《电脑没有仿宋GB2312字体怎么办?仿宋GB2312字体下载安装及调出来的教程》仿宋字体gb2312作为一种经典且常用的字体,广泛应用于各种场合,如何在计算机中调出仿宋字体gb2312?本文将为您... 仿宋_GB2312是公文标准字体之一,仿China编程宋是字体名称,GB2312是字php符编码标准名称(简

VScode连接远程Linux服务器环境配置图文教程

《VScode连接远程Linux服务器环境配置图文教程》:本文主要介绍如何安装和配置VSCode,包括安装步骤、环境配置(如汉化包、远程SSH连接)、语言包安装(如C/C++插件)等,文中给出了详... 目录一、安装vscode二、环境配置1.中文汉化包2.安装remote-ssh,用于远程连接2.1安装2

vscode保存代码时自动eslint格式化图文教程

《vscode保存代码时自动eslint格式化图文教程》:本文主要介绍vscode保存代码时自动eslint格式化的相关资料,包括打开设置文件并复制特定内容,文中通过代码介绍的非常详细,需要的朋友... 目录1、点击设置2、选择远程--->点击右上角打开设置3、会弹出settings.json文件,将以下内

Go中sync.Once源码的深度讲解

《Go中sync.Once源码的深度讲解》sync.Once是Go语言标准库中的一个同步原语,用于确保某个操作只执行一次,本文将从源码出发为大家详细介绍一下sync.Once的具体使用,x希望对大家有... 目录概念简单示例源码解读总结概念sync.Once是Go语言标准库中的一个同步原语,用于确保某个操

Window Server创建2台服务器的故障转移群集的图文教程

《WindowServer创建2台服务器的故障转移群集的图文教程》本文主要介绍了在WindowsServer系统上创建一个包含两台成员服务器的故障转移群集,文中通过图文示例介绍的非常详细,对大家的... 目录一、 准备条件二、在ServerB安装故障转移群集三、在ServerC安装故障转移群集,操作与Ser

windos server2022的配置故障转移服务的图文教程

《windosserver2022的配置故障转移服务的图文教程》本文主要介绍了windosserver2022的配置故障转移服务的图文教程,以确保服务和应用程序的连续性和可用性,文中通过图文介绍的非... 目录准备环境:步骤故障转移群集是 Windows Server 2022 中提供的一种功能,用于在多个

龙蜥操作系统Anolis OS-23.x安装配置图解教程(保姆级)

《龙蜥操作系统AnolisOS-23.x安装配置图解教程(保姆级)》:本文主要介绍了安装和配置AnolisOS23.2系统,包括分区、软件选择、设置root密码、网络配置、主机名设置和禁用SELinux的步骤,详细内容请阅读本文,希望能对你有所帮助... ‌AnolisOS‌是由阿里云推出的开源操作系统,旨

PyTorch使用教程之Tensor包详解

《PyTorch使用教程之Tensor包详解》这篇文章介绍了PyTorch中的张量(Tensor)数据结构,包括张量的数据类型、初始化、常用操作、属性等,张量是PyTorch框架中的核心数据结构,支持... 目录1、张量Tensor2、数据类型3、初始化(构造张量)4、常用操作5、常用属性5.1 存储(st

Java操作PDF文件实现签订电子合同详细教程

《Java操作PDF文件实现签订电子合同详细教程》:本文主要介绍如何在PDF中加入电子签章与电子签名的过程,包括编写Word文件、生成PDF、为PDF格式做表单、为表单赋值、生成文档以及上传到OB... 目录前言:先看效果:1.编写word文件1.2然后生成PDF格式进行保存1.3我这里是将文件保存到本地后

windows系统下shutdown重启关机命令超详细教程

《windows系统下shutdown重启关机命令超详细教程》shutdown命令是一个强大的工具,允许你通过命令行快速完成关机、重启或注销操作,本文将为你详细解析shutdown命令的使用方法,并提... 目录一、shutdown 命令简介二、shutdown 命令的基本用法三、远程关机与重启四、实际应用