直觉化深度学习教程——偏置与激活函数之间的关系

2024-01-23 21:18

本文主要是介绍直觉化深度学习教程——偏置与激活函数之间的关系,希望对大家解决编程问题提供一定的参考价值,需要的开发者们随着小编来一起学习吧!

我们看到成熟的神经网络时,往往能看到偏置 b b b与激活函数Sigmoid或ReLU,但是它们是从何而来的呢?

通过探究,我们将获得更深刻的认识。

文章目录

    • @[toc]
  • 偏置的前世今生
    • 偏置的由来
    • 偏置有什么意义
  • 激活函数的放飞自我
    • 激活函数有什么意义
    • 为什么要用激活函数

偏置的前世今生

偏置的由来

用一张图就能说明白。来吧,少年,接图!
在这里插入图片描述

图1.偏置的前世今生

如果我的图做的有点杂乱,那咱们就稍微用用公式。

回忆一下我们之前讨论过的M-P模型,我们的激活函数 f ( z ) f(z) f(z)是一个以 h h h为阈值的阶跃函数,如公式(1)所示。
f ( z ) = { 1 z ≥ h 0 z < h f(z)=\begin{cases} 1&{z \ge h}\\ 0&{z < h} \end{cases} f(z)={10zhz<h
我们现在对它进行一点小小的变换,如公式(2)。
f ( z − h ) = { 1 z − h ≥ 0 0 z − h < 0 f(z-h)=\begin{cases} 1&{z-h \ge 0}\\ 0&{z-h < 0} \end{cases} f(zh)={10zh0zh<0
这样,我们可以用之前的加权和减去阈值的结果,令 Z Z Z表示新的加权和,代替 z − h z-h zh,则有:
f ( Z ) = { 1 Z ≥ 0 0 Z < 0 f(Z)=\begin{cases} 1&{Z \ge 0}\\ 0&{Z < 0} \end{cases} f(Z)={10Z0Z<0
我们回忆一下,
z = w 1 x 1 + w 2 x 2 + w 3 x 3 z=w_1x_1+w_2x_2+w_3x_3 z=w1x1+w2x2+w3x3
推导,由于 Z = z − h Z=z-h Z=zh,则有 z = Z + h z=Z+h z=Z+h,即新的加权和公式为
Z = w 1 x 1 + w 2 x 2 + w 3 x 3 − h Z=w_1x_1+w_2x_2+w_3x_3-h Z=w1x1+w2x2+w3x3h
由于我们习惯用小写 z z z表示带权和,因此我们就把小写 z z z代替大写 Z Z Z,符号而已,你懂的;另外,由于公式(6)是一个典型的线性变换(严格地说是仿射变换),我们习惯把常数项 h h h叫偏置,且习惯用 b b b表示,我们令 b = − h b=-h b=h。总之,我们把公式(3)和公式(6),放到一起,呈现如下:
z = w 1 x 1 + w 2 x 2 + w 3 x 3 + b f ( z ) = { 1 z ≥ 0 0 z < 0 z=w_1x_1+w_2x_2+w_3x_3+b\\ \\ f(z)=\begin{cases} 1&{z \ge 0}\\ 0&{z < 0} \end{cases} z=w1x1+w2x2+w3x3+bf(z)={10z0z<0
哦了。此时,相当于加权和里多了一个偏置 b b b,可以把它看做是一个恒为常数1的输入上的权重。这时,你再看看图1,是不是豁然开朗?

偏置有什么意义

我们可以总结一下:前世里,那个阈值称为 h h h,归属激活函数,决定了激活函数输出跳变的那个位置;今生里,它换了个反转(即取了个负号)马甲,称为 b b b,投奔到了带权和的麾下,但意义没变

至少有以下三条解读:

  • 偏置表示激活函数被激活的难易程度,偏置越小,带权和z中的 w i x i w_ix_i wixi项的求和结果必须变得非常大,才能使得激活函数输出为1(假设仍为阶跃激活函数),或者被激活(假设为别的激活函数,见后文)。
  • 也可以把偏置是理解为 w 0 w_0 w0,则偏置是最重要的权重!其他权重调得再好,没有好的偏置,都白搭。

激活函数的放飞自我

正是因为有了上面的过程,阈值没了,激活函数可以专注于进行非线性了,而不用再考虑阈值 h h h了。

但是,前面的激活函数 f ( x ) f(x) f(x)是一个阶跃函数,有两个问题:

  • 加权和的强度信息无法传递到下一层
  • 导数为0,反向传播时权重无法更新(个别点不能求导问题不大,只需要给个缺省导数值即可)

所以人们想出了sigmoid函数来近似阶跃函数,后来又发展出tanh函数,ReLU函数。如下面几个图所示。
在这里插入图片描述

图2.sigmoid函数

在这里插入图片描述

图3.tanh函数

在这里插入图片描述

图4.ReLU函数

这些函数的曲线一目了然,网上的公式很多,就不再罗列了。

sigmoid和tanh都会面临在输入加权和非常大、非常小时(即横坐标轴的两端),导数非常小,导致反向传播时的梯度消失问题;而ReLu克服了这一点,它的导数要么为1,不会出现梯度衰减,因此近些年ReLU几乎已经在隐层中全面取代了它的两个前辈。这部分我会在反向传播中详细解释。

看起来:所有的激活函数都是以0点为中心。事实是:在整个训练过程中,一直在随着偏置左右移动,直到训练结束才固定下来,最终也几乎不可能在0点处。

激活函数有什么意义

激活函数相当于对加权和输入的一种选择性投票,例如:

  • Sigmoid

    对所有带权h和,都投支持票。带权和越小,支持力度越小;带权h和越大,支持力度大。

  • Tanh

    对大于0的带权和,投支持票;对小于0的带权和,投反对票。

  • ReLU

    对大于0的带权和,投支持票;对小于0的带权和,弃权。

为什么要用激活函数

提供非线性,这是神经网络可以逼近任意函数的关键!

至于非线性的“扭曲形状”不必care,因为通过充分地训练,损失函数会用"梯度"这个指挥棒,将隐层的权重和输出层的权重”调教“到一组合适的数值,这些权重的组合效应,将会把这个扭曲的超平面,逼近到数据的分类面

这篇关于直觉化深度学习教程——偏置与激活函数之间的关系的文章就介绍到这儿,希望我们推荐的文章对编程师们有所帮助!



http://www.chinasem.cn/article/637555

相关文章

深度解析Java DTO(最新推荐)

《深度解析JavaDTO(最新推荐)》DTO(DataTransferObject)是一种用于在不同层(如Controller层、Service层)之间传输数据的对象设计模式,其核心目的是封装数据,... 目录一、什么是DTO?DTO的核心特点:二、为什么需要DTO?(对比Entity)三、实际应用场景解析

深度解析Java项目中包和包之间的联系

《深度解析Java项目中包和包之间的联系》文章浏览阅读850次,点赞13次,收藏8次。本文详细介绍了Java分层架构中的几个关键包:DTO、Controller、Service和Mapper。_jav... 目录前言一、各大包1.DTO1.1、DTO的核心用途1.2. DTO与实体类(Entity)的区别1

MySQL count()聚合函数详解

《MySQLcount()聚合函数详解》MySQL中的COUNT()函数,它是SQL中最常用的聚合函数之一,用于计算表中符合特定条件的行数,本文给大家介绍MySQLcount()聚合函数,感兴趣的朋... 目录核心功能语法形式重要特性与行为如何选择使用哪种形式?总结深入剖析一下 mysql 中的 COUNT

MySQL 中 ROW_NUMBER() 函数最佳实践

《MySQL中ROW_NUMBER()函数最佳实践》MySQL中ROW_NUMBER()函数,作为窗口函数为每行分配唯一连续序号,区别于RANK()和DENSE_RANK(),特别适合分页、去重... 目录mysql 中 ROW_NUMBER() 函数详解一、基础语法二、核心特点三、典型应用场景1. 数据分

深度解析Python装饰器常见用法与进阶技巧

《深度解析Python装饰器常见用法与进阶技巧》Python装饰器(Decorator)是提升代码可读性与复用性的强大工具,本文将深入解析Python装饰器的原理,常见用法,进阶技巧与最佳实践,希望可... 目录装饰器的基本原理函数装饰器的常见用法带参数的装饰器类装饰器与方法装饰器装饰器的嵌套与组合进阶技巧

深度解析Spring Boot拦截器Interceptor与过滤器Filter的区别与实战指南

《深度解析SpringBoot拦截器Interceptor与过滤器Filter的区别与实战指南》本文深度解析SpringBoot中拦截器与过滤器的区别,涵盖执行顺序、依赖关系、异常处理等核心差异,并... 目录Spring Boot拦截器(Interceptor)与过滤器(Filter)深度解析:区别、实现

MySQL数据库的内嵌函数和联合查询实例代码

《MySQL数据库的内嵌函数和联合查询实例代码》联合查询是一种将多个查询结果组合在一起的方法,通常使用UNION、UNIONALL、INTERSECT和EXCEPT关键字,下面:本文主要介绍MyS... 目录一.数据库的内嵌函数1.1聚合函数COUNT([DISTINCT] expr)SUM([DISTIN

深度解析Spring AOP @Aspect 原理、实战与最佳实践教程

《深度解析SpringAOP@Aspect原理、实战与最佳实践教程》文章系统讲解了SpringAOP核心概念、实现方式及原理,涵盖横切关注点分离、代理机制(JDK/CGLIB)、切入点类型、性能... 目录1. @ASPect 核心概念1.1 AOP 编程范式1.2 @Aspect 关键特性2. 完整代码实

Python get()函数用法案例详解

《Pythonget()函数用法案例详解》在Python中,get()是字典(dict)类型的内置方法,用于安全地获取字典中指定键对应的值,它的核心作用是避免因访问不存在的键而引发KeyError错... 目录简介基本语法一、用法二、案例:安全访问未知键三、案例:配置参数默认值简介python是一种高级编

python 常见数学公式函数使用详解(最新推荐)

《python常见数学公式函数使用详解(最新推荐)》文章介绍了Python的数学计算工具,涵盖内置函数、math/cmath标准库及numpy/scipy/sympy第三方库,支持从基础算术到复杂数... 目录python 数学公式与函数大全1. 基本数学运算1.1 算术运算1.2 分数与小数2. 数学函数