B站视频“多模态大模型,科大讯飞前NLP专家串讲”记录

2023-10-14 01:21

本文主要是介绍B站视频“多模态大模型,科大讯飞前NLP专家串讲”记录,希望对大家解决编程问题提供一定的参考价值,需要的开发者们随着小编来一起学习吧!

文章目录

  • 多模态:
  • 对齐 -- align
  • 迁移学习和zero-shot
  • Clip
  • Blip

多模态:

图片、文字、视频、语音等不同的表征。
表示信息的方式有多种,但是不同的表示方式携带的信息不完全相同。
在这里插入图片描述

对齐 – align

如第一个图中,文字内容的描述和图片内容对应。
在这里插入图片描述
用不同单模态的模型将四种不同形式的”dog“表征成一个空间向量,可以发现虽然内容是同一个但是距离很远,所以想要用某种方式让四个点靠近一个点去,如果能变成一个点最好。

迁移学习和zero-shot

迁移学习:机器学习 – 首先在一个大数据集中跑模型,然后将预训练模型在自己的小数据集上进行微调。
在这里插入图片描述
zero-shot:通过学习类别之间的关系和属性,使得模型能够在没有见过的类别上进行准确的分类。
解决了传统机器学习中的一个重要问题,即在没有足够标记样本的情况下,如何对新类别的样本进行分类。传统的监督学习算法需要大量标记样本来训练模型,但在现实世界中,获取大量标记样本可能是困难、耗时和昂贵的。这种能力对于处理大规模、多类别的问题非常有用,可以扩展模型的应用范围和适应性。

Clip

在这里插入图片描述
左侧训练时,通过一个对角为1的标签方阵,在大量正向传播和反向传播时逼着image encoding和text encoding优化,使两个编码后的向量对齐。有两个问题:

  • 数据是没有经过处理的,可能有噪声,弱对齐
  • 比如文本描述的是dog,但是可能不只有一个图片含有dog,按理来说标签矩阵不应该只是对角线有1
    所以需要很大的数据集和很大的批次加速模型收敛。(该模型使用批次30000)

右侧使用时,对于 zero-shot 预测时,在分类中添加所有可能的类别,使用训练好的两个编码器,进行编码,计算相似度,即可预测出图像。

相对于以往模型的优点

  • 训练完之后不需要微调,直接使用两个编码器
  • 分类的类别加多少都可以,不像以往的分类只能在预测前确定好

作用:可以用文本推理图片,或者图片推理文本,图片搜图片,文本匹配文本
例如:1. 输入图片,匹配文字
在这里插入图片描述
2.文本匹配文本
在这里插入图片描述

Blip

既能完成图文匹配,又能完成文本生成。
在这里插入图片描述
第一个:图片编码后输入,经过类似于transform编码器结构输出词向量 --》相对齐的文本编码后经过类似于bert的双向编码注意力机制,经过feed forward (也是类似于transform的encoder)得到文本向量 --》 二者做对比学习,使两个编码器得到的向量对齐

第二个:与第一个相同的模块,中间加了一个 transform解码器中与编码器输出共同做注意力的模块,融合文本和图像的特征 --》 最后做二分类任务,此处的二分类需要输入的负样本较难(即与正样本难以区分),所以此处的负样本是在第一个中对比学习中分类分错的。输入到第二个中判断文本和图像是不是说的同一件事(二分类)。相对于第一个更细粒度。

第三个:掩码输入,结合图像特征生成下一个对于图像的描述的词。causal self-att 是一个单向的,类似于GPT。

在这里插入图片描述
可以对数据进行清洗, I I I代表图像, T T T代表文本, w w w表示在网上爬下来的数据,若监督的, h h h表示人工标注好的,正确匹配的, T s T_s Ts表示生成的文本。
弱监督和强监督传入模型进行训练,然后分为两个模型:
对于图文匹配的模型,将正对的文本对传入再进行训练,使模型更正确,然后将弱监督对传入,判断是不是匹配,如果不匹配,则抛弃。
对于文本生成模型,也将正确的样本传入进行再训练,然后对未知文本的图像进行生成文本,然后扔到匹配模型里判断是否匹配,如果不匹配则扔掉,最后的数据集里包括的则是原来的正确数据集和预测后的匹配图像文本对。
得到的就是清洗后的图像文本对。
在这里插入图片描述

这篇关于B站视频“多模态大模型,科大讯飞前NLP专家串讲”记录的文章就介绍到这儿,希望我们推荐的文章对编程师们有所帮助!



http://www.chinasem.cn/article/207164

相关文章

Python Transformers库(NLP处理库)案例代码讲解

《PythonTransformers库(NLP处理库)案例代码讲解》本文介绍transformers库的全面讲解,包含基础知识、高级用法、案例代码及学习路径,内容经过组织,适合不同阶段的学习者,对... 目录一、基础知识1. Transformers 库简介2. 安装与环境配置3. 快速上手示例二、核心模

Java使用SLF4J记录不同级别日志的示例详解

《Java使用SLF4J记录不同级别日志的示例详解》SLF4J是一个简单的日志门面,它允许在运行时选择不同的日志实现,这篇文章主要为大家详细介绍了如何使用SLF4J记录不同级别日志,感兴趣的可以了解下... 目录一、SLF4J简介二、添加依赖三、配置Logback四、记录不同级别的日志五、总结一、SLF4J

在Spring Boot中浅尝内存泄漏的实战记录

《在SpringBoot中浅尝内存泄漏的实战记录》本文给大家分享在SpringBoot中浅尝内存泄漏的实战记录,结合实例代码给大家介绍的非常详细,感兴趣的朋友一起看看吧... 目录使用静态集合持有对象引用,阻止GC回收关键点:可执行代码:验证:1,运行程序(启动时添加JVM参数限制堆大小):2,访问 htt

MySQL 中查询 VARCHAR 类型 JSON 数据的问题记录

《MySQL中查询VARCHAR类型JSON数据的问题记录》在数据库设计中,有时我们会将JSON数据存储在VARCHAR或TEXT类型字段中,本文将详细介绍如何在MySQL中有效查询存储为V... 目录一、问题背景二、mysql jsON 函数2.1 常用 JSON 函数三、查询示例3.1 基本查询3.2

基于Python和MoviePy实现照片管理和视频合成工具

《基于Python和MoviePy实现照片管理和视频合成工具》在这篇博客中,我们将详细剖析一个基于Python的图形界面应用程序,该程序使用wxPython构建用户界面,并结合MoviePy、Pill... 目录引言项目概述代码结构分析1. 导入和依赖2. 主类:PhotoManager初始化方法:__in

Spring Security基于数据库的ABAC属性权限模型实战开发教程

《SpringSecurity基于数据库的ABAC属性权限模型实战开发教程》:本文主要介绍SpringSecurity基于数据库的ABAC属性权限模型实战开发教程,本文给大家介绍的非常详细,对大... 目录1. 前言2. 权限决策依据RBACABAC综合对比3. 数据库表结构说明4. 实战开始5. MyBA

Python获取中国节假日数据记录入JSON文件

《Python获取中国节假日数据记录入JSON文件》项目系统内置的日历应用为了提升用户体验,特别设置了在调休日期显示“休”的UI图标功能,那么问题是这些调休数据从哪里来呢?我尝试一种更为智能的方法:P... 目录节假日数据获取存入jsON文件节假日数据读取封装完整代码项目系统内置的日历应用为了提升用户体验,

用js控制视频播放进度基本示例代码

《用js控制视频播放进度基本示例代码》写前端的时候,很多的时候是需要支持要网页视频播放的功能,下面这篇文章主要给大家介绍了关于用js控制视频播放进度的相关资料,文中通过代码介绍的非常详细,需要的朋友可... 目录前言html部分:JavaScript部分:注意:总结前言在javascript中控制视频播放

Spring Boot 配置文件之类型、加载顺序与最佳实践记录

《SpringBoot配置文件之类型、加载顺序与最佳实践记录》SpringBoot的配置文件是灵活且强大的工具,通过合理的配置管理,可以让应用开发和部署更加高效,无论是简单的属性配置,还是复杂... 目录Spring Boot 配置文件详解一、Spring Boot 配置文件类型1.1 applicatio

Python基于wxPython和FFmpeg开发一个视频标签工具

《Python基于wxPython和FFmpeg开发一个视频标签工具》在当今数字媒体时代,视频内容的管理和标记变得越来越重要,无论是研究人员需要对实验视频进行时间点标记,还是个人用户希望对家庭视频进行... 目录引言1. 应用概述2. 技术栈分析2.1 核心库和模块2.2 wxpython作为GUI选择的优