sigmoid、 tanh、 tanh、 tanh比较

2024-03-29 19:58
文章标签 比较 sigmoid tanh

本文主要是介绍sigmoid、 tanh、 tanh、 tanh比较,希望对大家解决编程问题提供一定的参考价值,需要的开发者们随着小编来一起学习吧!

由上篇文章,我们知道逻辑回归是怎么过渡到神经网络的了

总的来说就一句话——多个逻辑回归模型,前后堆积形成了神经网络!

我引用吴恩达中的一张图,稍微的回顾以下这个过程
在这里插入图片描述
对于这张图,它的过程是这样的:

  1. 输入1个样本(含3个特征),分别到4个逻辑回归中(中间那一列的4个圈圈)
  2. 对于样本的输入,逻辑回归模型分别通过y = wx + b后将y值通过Sigmoid函数映射到01区间内,那么这里就有4个输出的01概率
  3. 对于上面输出的4个概率再输入到最后一个逻辑回归模型中,再通过y = wx + b后将y值通过Sigmoid函数映射到01区间内,得到最后的结果

对于中间那层,我们称为隐藏层,如果隐藏层多了,输入特征也多了的话,就会形成下面这样的图象

在这里插入图片描述
但是这里有个问题,对于逻辑回归使用的是Sigmoid激活函数,但是对于深度学习中继续使用Sigmoid函数是否合理?

答案是不合理的,所以在这基础上,分别提出了以下多种激活函数:

  1. sigmoid 激活函数
  2. tanh 函数(效果优于 sigmoid 函数)
  3. 修正线性单元的函数( tanh)(默认)
  4. tanh

首先让我们看看sigmoid 激活函数
在这里插入图片描述
在这里插入图片描述
然后再看看tanh 函数
在这里插入图片描述
在这里插入图片描述
紧接着看看修正线性单元的函数(ReLu)

在这里插入图片描述
在这里插入图片描述
最后再看看Leaky Relu激活函数
在这里插入图片描述
在这里插入图片描述
这里主要解决以下几个问题:
问题一:tanh 函数为什么效果优于 sigmoid 函数?

优于sigmoid的原因:因为函数值域在-1 和+1 的激活函数,其均值是更接近零均值的。在训练一个算法模型时,如果使用 tanh函数代替 sigmoid 函数中心化数据,使得数据的平均值更接近 0 而不是 0.5。

问题二:深度学习中一般使用——修正线性单元的函数(ReLu),它的好处?

Relu 的优点是:当𝑧是负值的时候,导数等于 0。
从实际上来说,当使用𝑧的导数时,𝑧=0的导数是没有定义的。但是当编程实现的时候,𝑧的取值刚好等于0.00000001,这个值相当小,所以,在实践中,不需要担心这个值,𝑧是等于 0 的时候,假设一个导数是 1 或者 0 效果都可以。

问题三:sigmoid 函数与tanh 函数的对比!

共同的缺点——在𝑧特别大或者特别小的情况下,导数的梯度或者函数的斜率会变得特别小,最后就会接近于 0,导致降低梯度下降的速度

问题四:ReLu与Leaky Relu的比较

第一,在𝑧的区间变动很大的情况下,激活函数的导数或者激活函数的斜率都会远大于0。使用 ReLu 激活函数神经网络通常会比使用
sigmoid 或者 tanh 激活函数学习的更快。

第二,sigmoid 和 tanh 函数的导数在正负饱和区的梯度都会接近于 0,这会造成梯度弥散,而 Relu 和 Leaky ReLu函数大于 0 部分都为常数,不会产生梯度弥散现象。(同时应该注意到的是,Relu 进入负半区的时候,梯度为 0,神经元此时不会训练,产生所谓的稀疏性,而 Leaky ReLu 不会有这问题)𝑧在 ReLu 的梯度一半都是0,但是,有足够的隐藏层使得 z 值大于 0,所以对大多数的 训练数据来说学习过程仍然可以很快。

这篇关于sigmoid、 tanh、 tanh、 tanh比较的文章就介绍到这儿,希望我们推荐的文章对编程师们有所帮助!



http://www.chinasem.cn/article/859500

相关文章

百度/小米/滴滴/京东,中台架构比较

小米中台建设实践 01 小米的三大中台建设:业务+数据+技术 业务中台--从业务说起 在中台建设中,需要规范化的服务接口、一致整合化的数据、容器化的技术组件以及弹性的基础设施。并结合业务情况,判定是否真的需要中台。 小米参考了业界优秀的案例包括移动中台、数据中台、业务中台、技术中台等,再结合其业务发展历程及业务现状,整理了中台架构的核心方法论,一是企业如何共享服务,二是如何为业务提供便利。

关键字synchronized、volatile的比较

关键字volatile是线程同步的轻量级实现,所以volatile性能肯定比synchronized要好,并且volatile只能修饰于变量,而synchronized可以修饰方法,以及代码块。随着JDK新版本的发布,synchronized关键字的执行效率上得到很大提升,在开发中使用synchronized关键字的比率还是比较大的。多线程访问volatile不会发生阻塞,而synchronize

SigLIP——采用sigmoid损失的图文预训练方式

SigLIP——采用sigmoid损失的图文预训练方式 FesianXu 20240825 at Wechat Search Team 前言 CLIP中的infoNCE损失是一种对比性损失,在SigLIP这个工作中,作者提出采用非对比性的sigmoid损失,能够更高效地进行图文预训练,本文进行介绍。如有谬误请见谅并联系指出,本文遵守CC 4.0 BY-SA版权协议,转载请联系作者并注

stl的sort和手写快排的运行效率哪个比较高?

STL的sort必然要比你自己写的快排要快,因为你自己手写一个这么复杂的sort,那就太闲了。STL的sort是尽量让复杂度维持在O(N log N)的,因此就有了各种的Hybrid sort algorithm。 题主你提到的先quicksort到一定深度之后就转为heapsort,这种是introsort。 每种STL实现使用的算法各有不同,GNU Standard C++ Lib

研究生生涯中一些比较重要的网址

Mali GPU相关: 1.http://malideveloper.arm.com/resources/sdks/opengl-es-sdk-for-linux/ 2.http://malideveloper.arm.com/resources/tools/arm-development-studio-5/ 3.https://www.khronos.org/opengles/sdk/do

性能测试工具 wrk,ab,locust,Jmeter 压测结果比较

前言 在开发服务端软件时,经常需要进行性能测试,一般我采用手写性能测试代码的方式进行测试,那有什么现成的好的性能测试工具吗? 性能测试工具 wrk,ab,locust,Jmeter 压测结果比较 详见: 性能测试工具 wrk,ab,locust,Jmeter 压测结果比较 Jmeter性能测试 入门

MongoDB学习—(6)MongoDB的find查询比较符

首先,先通过以下函数向BookList集合中插入10000条数据 function insertN(obj,n){var i=0;while(i<n){obj.insert({id:i,name:"bookNumber"+i,publishTime:i+2000})i++;}}var BookList=db.getCollection("BookList")调用函数,这样,BookList

超声波清洗机哪个品牌比较好一点的?清洁力强的超声波清洗机品牌

随着生活水平的不断提升和幸福感的增强,珠宝、饰品和眼镜等物品已成为许多家庭的常备之物。然而,这些贵重细小的物件易于积聚微尘与隐形细菌,长此以往可能悄悄影响家人的健康,毕竟细菌是肉眼难以察觉的隐患。超声波清洗机应运而生,它以高科技手段有效地解决了这一隐忧,深层清洁,守护家人免受微小污染物的潜在威胁。不过现在市面上超声波清洗机品牌挺多的,究竟有哪些品牌的超声波清洗机比较好一点呢?接下来就为大家带来四款

【JavaScript】版本号和日期时间的比较

JS使用 ‘>’ 运算符比较两个字符串大小时,会把字符串转换为ASCII码依次比较。 比较标准时间格式可以直接使用 ’ > ’ 比较; (2018-07-20格式)

俩个float数之间比较大小

需求:俩个标识金额的浮点数比较大小。 问题:相等无法成立。经过var_dump()打印,俩个浮点数数值 一样大。 解决:把标识金额的浮点数乘以100,抓换成整形,在做比较。即可使相等成立