VECO:对于语言的理解和生成的灵活多变跨语言模型的预训练

2024-06-21 07:48

本文主要是介绍VECO:对于语言的理解和生成的灵活多变跨语言模型的预训练,希望对大家解决编程问题提供一定的参考价值,需要的开发者们随着小编来一起学习吧!

VECO:对于语言的理解和生成的灵活多变跨语言模型的预训练

本文包括

1.为什么提出VECO
2.怎么训练VECO
3.VECO的结果
4.结论

为什么提出VECO
跨语言训练的背景

从预训练任务的角度
在这里插入图片描述
VECO预训练的任务
我们建议将交叉注意模块(query!=key/value)插入Transformer编码器和设计一个交叉注意的MLM任务,“明确地”捕捉语言之间的相互依赖。
在这里插入图片描述

背景:预训练的跨语言模型
从模型体系结构的角度看:

在这里插入图片描述
VECO微调:灵活的NLU和NLG任务
在这里插入图片描述
怎样去训练VECO
encoder-decoder VECO:变量
VECO为每个token构建两种类型的表示:

一套上下文表示记为H,表示因为绿色方块和黄色方块只建立在自注意模块上(即plug-in the

cross-attention module)。

另一套情境表示S,表示为混合颜色块,构建在自注意和交叉注意模块(即plug-in the

cross-attention module)。
在这里插入图片描述

预训练任务:自注意的预训练
目标:根据单语语境预测隐藏的单词

在这里插入图片描述
预训练任务:自注意+交叉注意的预训练
目标:根据双语语境预测隐藏的单词

在这里插入图片描述

VECO的结果
实验装置

在这里插入图片描述
NLU任务——XTREME排行榜
在这里插入图片描述
NLG 任务— 在 WMT 数据集上的机器翻译
在这里插入图片描述
总结
结论

•VECO是一种可变且灵活的跨语言预训练模型,目标是“明确”捕捉语言之间的相互依赖,通过交叉注意模块实现。

•基于灵活的特性,VECO可以初始化两个NLU首选编码器transformer和NLG专用编码器-解码器transformer。

•此外,我们还引入了一个插件微调方法,以鼓励两者之间的融合结合VECO和跨语言下游任务的特点。

•VECO在各种跨语言NLU和NLG任务上实现了持续的改进,拓宽了对预训练的骨干结构和微调在跨语言情景下的方法。

AliceMind:阿里巴巴头脑实验室的编码器-解码器集合
在这里插入图片描述

这篇关于VECO:对于语言的理解和生成的灵活多变跨语言模型的预训练的文章就介绍到这儿,希望我们推荐的文章对编程师们有所帮助!



http://www.chinasem.cn/article/1080622

相关文章

C语言中联合体union的使用

本文编辑整理自: http://bbs.chinaunix.net/forum.php?mod=viewthread&tid=179471 一、前言 “联合体”(union)与“结构体”(struct)有一些相似之处。但两者有本质上的不同。在结构体中,各成员有各自的内存空间, 一个结构变量的总长度是各成员长度之和。而在“联合”中,各成员共享一段内存空间, 一个联合变量

一份LLM资源清单围观技术大佬的日常;手把手教你在美国搭建「百万卡」AI数据中心;为啥大模型做不好简单的数学计算? | ShowMeAI日报

👀日报&周刊合集 | 🎡ShowMeAI官网 | 🧡 点赞关注评论拜托啦! 1. 为啥大模型做不好简单的数学计算?从大模型高考数学成绩不及格说起 司南评测体系 OpenCompass 选取 7 个大模型 (6 个开源模型+ GPT-4o),组织参与了 2024 年高考「新课标I卷」的语文、数学、英语考试,然后由经验丰富的判卷老师评判得分。 结果如上图所

大语言模型(LLMs)能够进行推理和规划吗?

大语言模型(LLMs),基本上是经过强化训练的 n-gram 模型,它们在网络规模的语言语料库(实际上,可以说是我们文明的知识库)上进行了训练,展现出了一种超乎预期的语言行为,引发了我们的广泛关注。从训练和操作的角度来看,LLMs 可以被认为是一种巨大的、非真实的记忆库,相当于为我们所有人提供了一个外部的系统 1(见图 1)。然而,它们表面上的多功能性让许多研究者好奇,这些模型是否也能在通常需要系

android 带与不带logo的二维码生成

该代码基于ZXing项目,这个网上能下载得到。 定义的控件以及属性: public static final int SCAN_CODE = 1;private ImageView iv;private EditText et;private Button qr_btn,add_logo;private Bitmap logo,bitmap,bmp; //logo图标private st

回调的简单理解

之前一直不太明白回调的用法,现在简单的理解下 就按这张slidingmenu来说,主界面为Activity界面,而旁边的菜单为fragment界面。1.现在通过主界面的slidingmenu按钮来点开旁边的菜单功能并且选中”区县“选项(到这里就可以理解为A类调用B类里面的c方法)。2.通过触发“区县”的选项使得主界面跳转到“区县”相关的新闻列表界面中(到这里就可以理解为B类调用A类中的d方法

人工和AI大语言模型成本对比 ai语音模型

这里既有AI,又有生活大道理,无数渺小的思考填满了一生。 上一专题搭建了一套GMM-HMM系统,来识别连续0123456789的英文语音。 但若不是仅针对数字,而是所有普通词汇,可能达到十几万个词,解码过程将非常复杂,识别结果组合太多,识别结果不会理想。因此只有声学模型是完全不够的,需要引入语言模型来约束识别结果。让“今天天气很好”的概率高于“今天天汽很好”的概率,得到声学模型概率高,又符合表达

智能客服到个人助理,国内AI大模型如何改变我们的生活?

引言 随着人工智能(AI)技术的高速发展,AI大模型越来越多地出现在我们的日常生活和工作中。国内的AI大模型在过去几年里取得了显著的进展,不少独创的技术点和实际应用令人瞩目。 那么,国内的AI大模型有哪些独创的技术点?它们在实际应用中又有哪些出色表现呢?此外,普通人又该如何利用这些大模型提升工作和生活的质量和效率呢?本文将为你一一解析。 一、国内AI大模型的独创技术点 多模态学习 多

C语言 将“China”译成密码

将“China”译成密码,密码规律是:用原来的字母后面的第4个字母代替原来的字母。例如,字母“A”后面的第4个字母是“E”,用“E”代替“A”。因此,“China”应译为“Glmre”。编译程序用付赋初值的方法使c1,c2,c3,c4,c5这五个变量的值分别为“C”,“h”,“i”,“n”,“a”,经过运算,使c1,c2,c3,c4,c5分别变成“G”,“l”,“m”,“r”,“e”。分别用put

YOLO v3 训练速度慢的问题

一天一夜出了两个模型,仅仅迭代了200次   原因:编译之前没有将Makefile 文件里的GPU设置为1,编译的是CPU版本,必须训练慢   解决方案: make clean  vim Makefile make   再次训练 速度快了,5分钟迭代了500次

OpenCompass:大模型测评工具

大模型相关目录 大模型,包括部署微调prompt/Agent应用开发、知识库增强、数据库增强、知识图谱增强、自然语言处理、多模态等大模型应用开发内容 从0起步,扬帆起航。 大模型应用向开发路径:AI代理工作流大模型应用开发实用开源项目汇总大模型问答项目问答性能评估方法大模型数据侧总结大模型token等基本概念及参数和内存的关系大模型应用开发-华为大模型生态规划从零开始的LLaMA-Factor