Transformer模型-Normalization归一化的简明介绍

2024-04-06 09:20

本文主要是介绍Transformer模型-Normalization归一化的简明介绍,希望对大家解决编程问题提供一定的参考价值,需要的开发者们随着小编来一起学习吧!

 背景

一般而言,Normalization归一化是将特征转换为可比较尺度的过程。有许多方法可以对特征进行归一化

例如:最小-最大特征缩放

最小-最大特征缩放将值转换到[0,1]的范围内。这也被称为基于单位的归一化。可以使用以下方程进行计算:

该方程的顶部将每个值减去X_min;当X等于X_min时,分子变为0。当分子被分母除时,输出为0。

同样,当分子为X_max — X_min时,新的最大值出现。当这个值被X_max — X_min除时,它变为1。这就是范围如何被调整到0和1之间的。

例如:标准分数

在标准化过程中,每个值都被转换为它的标准分数。标准分数也被称为z分数。这是通过从每个值中减去均值,然后除以标准差来实现的。

μ 代表数据的均值或平均数。

σ 代表数据的标准差,即各数值与均值之间的平均离散程度。如果一个数据集的标准差较低,那么数值可能更接近均值。如果标准差较高,则可能意味着数值分布在一个较大的范围内。可以用以下公式来计算标准差。

为什么要进行归一化normalization?

在机器学习中,对特征进行归一化是因为具有不同尺度的特征的模型需要更长的训练时间;这是因为梯度下降需要更多时间来收敛。

根据Pinecone的说法,不进行归一化可能导致大的误差梯度最终爆炸,从而使模型不稳定。

因此,在许多情况下,在将数据插入模型之前应该进行归一化。

为什么要进行 层的归一化 layer normalization?

根据Pinecone的说法,层归一化确保“对于给定的输入,特定层中的所有神经元在所有特征上都具有相同的分布。”

归一化是在最后的D个维度上进行的;D是将要进行归一化的维度数。例如,如果目标是归一化一个具有10个元素的一维向量,那么D就是1。如果目标是归一化一个形状为(2,3)的矩阵,那么D就是2。同样地,如果目标是归一化一个形状为(2,5,3)的张量,那么D就是3。

训练最先进的深度神经网络在计算上非常昂贵。减少训练时间的一种方法是对神经元的活动进行归一化。最近引入的一种技术,称为批量归一化batch normalization ,它使用神经元在小型训练案例批次上的输入总和的分布来计算均值和方差,然后使用这些均值和方差来归一化每个训练案例上该神经元的输入总和。这显著减少了前馈神经网络中的训练时间。然而,批量归一化的效果取决于小型批次的大小,并且如何将其应用于循环神经网络并不明显。在本文中,我们通过从单个训练案例的某一层中所有神经元的输入总和来计算用于归一化的均值和方差,从而将批量归一化转换为层归一化。与批量归一化一样,我们还为每个神经元提供了自己的自适应偏置和增益,这些偏置和增益在归一化之后但在非线性之前应用。与批量归一化不同,层归一化layer normalization在训练和测试时执行完全相同的计算。通过在每个时间步上单独计算归一化统计量,也可以轻松地将层归一化应用于循环神经网络。层归一化在稳定循环网络中的隐藏状态动力学方面非常有效。从经验上看,我们表明与先前发表的技术相比,层归一化可以大大减少训练时间。

https://arxiv.org/abs/1607.06450

层的归一化方程layer normalization Equation

对于每个输入x,层的归一化可以使用经过修改的z分数方程来计算:

μ 代表最后D个维度的均值
σ² 代表最后D个维度的方差
ε 是一个极小的值,当σ²较小时有助于计算
γ 和 β 是可学习的参数。

根据Pinecone的说法,使用γ和β是因为“将所有预激活值强制设为零和单位标准差……可能过于严格。某些情况下,波动的分布可能是网络更好地学习某些类别的必要条件。”

它们与要归一化的给定张量具有相同的形状。
γ 初始化为全1,β 初始化为全0。

LayerNorm — PyTorch 2.2 documentationicon-default.png?t=N7T8https://pytorch.org/docs/stable/generated/torch.nn.LayerNorm.html

Transformers中的层归一化

transformer模型中使用了层的归一化。
 

 原文链接:

https://medium.com/@hunter-j-phillips/layer-normalization-e9ae93eb3c9c

这篇关于Transformer模型-Normalization归一化的简明介绍的文章就介绍到这儿,希望我们推荐的文章对编程师们有所帮助!



http://www.chinasem.cn/article/879574

相关文章

Java的IO模型、Netty原理解析

《Java的IO模型、Netty原理解析》Java的I/O是以流的方式进行数据输入输出的,Java的类库涉及很多领域的IO内容:标准的输入输出,文件的操作、网络上的数据传输流、字符串流、对象流等,这篇... 目录1.什么是IO2.同步与异步、阻塞与非阻塞3.三种IO模型BIO(blocking I/O)NI

基于Flask框架添加多个AI模型的API并进行交互

《基于Flask框架添加多个AI模型的API并进行交互》:本文主要介绍如何基于Flask框架开发AI模型API管理系统,允许用户添加、删除不同AI模型的API密钥,感兴趣的可以了解下... 目录1. 概述2. 后端代码说明2.1 依赖库导入2.2 应用初始化2.3 API 存储字典2.4 路由函数2.5 应

MySQL中慢SQL优化的不同方式介绍

《MySQL中慢SQL优化的不同方式介绍》慢SQL的优化,主要从两个方面考虑,SQL语句本身的优化,以及数据库设计的优化,下面小编就来给大家介绍一下有哪些方式可以优化慢SQL吧... 目录避免不必要的列分页优化索引优化JOIN 的优化排序优化UNION 优化慢 SQL 的优化,主要从两个方面考虑,SQL 语

C++中函数模板与类模板的简单使用及区别介绍

《C++中函数模板与类模板的简单使用及区别介绍》这篇文章介绍了C++中的模板机制,包括函数模板和类模板的概念、语法和实际应用,函数模板通过类型参数实现泛型操作,而类模板允许创建可处理多种数据类型的类,... 目录一、函数模板定义语法真实示例二、类模板三、关键区别四、注意事项 ‌在C++中,模板是实现泛型编程

Python实现html转png的完美方案介绍

《Python实现html转png的完美方案介绍》这篇文章主要为大家详细介绍了如何使用Python实现html转png功能,文中的示例代码讲解详细,感兴趣的小伙伴可以跟随小编一起学习一下... 1.增强稳定性与错误处理建议使用三层异常捕获结构:try: with sync_playwright(

Java使用多线程处理未知任务数的方案介绍

《Java使用多线程处理未知任务数的方案介绍》这篇文章主要为大家详细介绍了Java如何使用多线程实现处理未知任务数,文中的示例代码讲解详细,感兴趣的小伙伴可以跟随小编一起学习一下... 知道任务个数,你可以定义好线程数规则,生成线程数去跑代码说明:1.虚拟线程池:使用 Executors.newVir

JAVA SE包装类和泛型详细介绍及说明方法

《JAVASE包装类和泛型详细介绍及说明方法》:本文主要介绍JAVASE包装类和泛型的相关资料,包括基本数据类型与包装类的对应关系,以及装箱和拆箱的概念,并重点讲解了自动装箱和自动拆箱的机制,文... 目录1. 包装类1.1 基本数据类型和对应的包装类1.2 装箱和拆箱1.3 自动装箱和自动拆箱2. 泛型2

C#集成DeepSeek模型实现AI私有化的流程步骤(本地部署与API调用教程)

《C#集成DeepSeek模型实现AI私有化的流程步骤(本地部署与API调用教程)》本文主要介绍了C#集成DeepSeek模型实现AI私有化的方法,包括搭建基础环境,如安装Ollama和下载DeepS... 目录前言搭建基础环境1、安装 Ollama2、下载 DeepSeek R1 模型客户端 ChatBo

SpringBoot快速接入OpenAI大模型的方法(JDK8)

《SpringBoot快速接入OpenAI大模型的方法(JDK8)》本文介绍了如何使用AI4J快速接入OpenAI大模型,并展示了如何实现流式与非流式的输出,以及对函数调用的使用,AI4J支持JDK8... 目录使用AI4J快速接入OpenAI大模型介绍AI4J-github快速使用创建SpringBoot

0基础租个硬件玩deepseek,蓝耘元生代智算云|本地部署DeepSeek R1模型的操作流程

《0基础租个硬件玩deepseek,蓝耘元生代智算云|本地部署DeepSeekR1模型的操作流程》DeepSeekR1模型凭借其强大的自然语言处理能力,在未来具有广阔的应用前景,有望在多个领域发... 目录0基础租个硬件玩deepseek,蓝耘元生代智算云|本地部署DeepSeek R1模型,3步搞定一个应