学术分享|无惧数据匮乏!上海交大博士后周子宜详解蛋白质语言模型的小样本学习方法 FSFP

本文主要是介绍学术分享|无惧数据匮乏!上海交大博士后周子宜详解蛋白质语言模型的小样本学习方法 FSFP,希望对大家解决编程问题提供一定的参考价值,需要的开发者们随着小编来一起学习吧!

预训练蛋白质语言模型 (PLMs) 能够以无监督的方式学习数百万蛋白质中氨基酸序列的分布特征,在揭示蛋白质序列与其功能之间的隐含关系方面显示出了巨大的潜力。

在此背景下,上海交通大学自然科学研究院/物理天文学院/张江高研院/药学院洪亮教授课题组,联合上海人工智能实验室青年研究员谈攀,开发了一种针对蛋白质语言模型的小样本学习方法,能够在使用极少数湿实验数据的情况下大幅提升传统蛋白质语言模型的突变效果预测性能, 在实际应用中显示出了巨大的潜力。

在「Meet AI4S」系列直播第三期中,HyperAI超神经有幸邀请到了该研究成果的论文第一作者——上海交通大学自然科学研究院 & 上海国家应用数学中心博士后周子宜。9 月 25 日,周子宜博士将以线上直播的形式进一步为大家分享蛋白质语言模型的小样本学习方法,探讨 AI 辅助下定向进化的新思路。

点击预约直播:

https://hdxu.cn/6Bjom

扫码备注「AI4S」加入讨论群↓

在这里插入图片描述

活动详情

在这里插入图片描述

分享主题

蛋白质语言模型的小样本学习方法

内容简介

蛋白质语言模型 (PLM) 在蛋白质功能预测方面取得了突破,然而其往往需要大量实验数据微调才能达到较高的精度。本次介绍一种针对 PLM 的小样本学习方法,能在只使用数十个训练样本的情况下显著提升 PLM 的突变效果预测性能。

论文回顾

HyperAI超神经此前曾解读分享了周子宜博士为第一作者的研究论文「Enhancing efficiency of protein language models with minimal wet-lab data through few-shot learning」。

点击查看详细报道:20个实验数据创造AI蛋白质里程碑!上海交大联合上海AI Lab发布FSFP,有效优化蛋白质预训练模型

FSFP 方法包含 3 个阶段

为元学习构建辅助任务 (Build auxiliary tasks for meta-training)、在辅助任务上训练 PLMs (Meta-train PLMs on the auxiliary tasks)、以及将 PLMs 转移到目标任务 (Transfer PLMs to the target task via LTR)。

其中,FSFP 使用 ListMLE 损失来学习对突变适应度进行排名。在每次训练迭代中,把 PLM 对训练样本的预测排列向它们的真实排列修正。该排序学习方法被同时应用于元训练阶段的内部优化和迁移学习阶段。

数据集的获取

该研究选择蛋白质突变数据集 (ProteinGym) 作为基准测试数据集。数据集共包含来自 87 个 DMS 测序实验的大约 150 万个错义变体。

ProteinGym 蛋白质突变数据集下载地址:
https://go.hyper.ai/6GvFD

FSFP 方法评估

  • 在平均性能方面,通过 FSFP 训练的 PLMs 在所有训练数据规模上始终优于其他基线。

  • 在外推性能评估方面,FSFP 训练 PLMs 的 Spearman 相关性评估更优。

  • FSFP 被成功应用于 Phi29 DNA 聚合酶的工程改造,显著提升了阳性率。

观众收益:

  1. 了解 PLM 的基本原理以及在蛋白质工程中的应用

  2. 了解 PLM 的基本原理以及在蛋白质工程中的应用

  3. 探讨 AI 辅助下定向进化的新思路

上海交通大学洪亮课题组

在这里插入图片描述

上海交通大学洪亮课题组隶属于上海交通大学自然科学研究院。课题组研究方向主要为 AI 蛋白和药物设计、分子生物物理,具体包括:

  • 基于人工智能技术的蛋白质定向改造、酶工程定向进化、和辅助药物设计;

  • 中子散射,同步辐射国家大科学装置,单分子荧光,分子动力学模拟和人工智能算法等,研究生物大分子的动力学、生物大分子低温保存技术及原理。

该课题组研究成果颇丰,截止目前共发表研究论文 77 篇,其中多篇登顶 Nature 期刊。

Meet AI4S 系列直播

HyperAI超神经 (hyper.ai) 是中国最⼤的数据科学领域搜索引擎,聚焦 AI for Science 的最新科研成果,实时追踪 Nature、Science 等顶级刊物的学术论文,至今已完成百余篇 AI for Science 论文的解读。

此外,我们还运营了国内唯一 AI for Science 开源项目 awesome-ai4s。

项目地址:

https://github.com/hyperai/awesome-ai4s

为了进一步推进 AI4S 的普适化,将学术机构的科研成果进一步降低传播壁垒,分享给更广泛的行业学者、科技爱好者及产业单位,HyperAI超神经策划了「Meet AI4S」视频栏目,邀请深耕 AI for Science 领域的科研人员或相关单位,以视频的形式分享研究成果、方法思路,共同探讨 AI for Science 在科研进展及推进落地过程中面临的机遇和挑战,促进 AI for Science 的科学普及和传播。

欢迎高效课题组及研究机构共同参与到我们的直播活动中!扫描二维码添加「神经星星」微信,了解详情↓

在这里插入图片描述

这篇关于学术分享|无惧数据匮乏!上海交大博士后周子宜详解蛋白质语言模型的小样本学习方法 FSFP的文章就介绍到这儿,希望我们推荐的文章对编程师们有所帮助!



http://www.chinasem.cn/article/1141730

相关文章

Rust 数据类型详解

《Rust数据类型详解》本文介绍了Rust编程语言中的标量类型和复合类型,标量类型包括整数、浮点数、布尔和字符,而复合类型则包括元组和数组,标量类型用于表示单个值,具有不同的表示和范围,本文介绍的非... 目录一、标量类型(Scalar Types)1. 整数类型(Integer Types)1.1 整数字

使用Python进行文件读写操作的基本方法

《使用Python进行文件读写操作的基本方法》今天的内容来介绍Python中进行文件读写操作的方法,这在学习Python时是必不可少的技术点,希望可以帮助到正在学习python的小伙伴,以下是Pyth... 目录一、文件读取:二、文件写入:三、文件追加:四、文件读写的二进制模式:五、使用 json 模块读写

Java操作ElasticSearch的实例详解

《Java操作ElasticSearch的实例详解》Elasticsearch是一个分布式的搜索和分析引擎,广泛用于全文搜索、日志分析等场景,本文将介绍如何在Java应用中使用Elastics... 目录简介环境准备1. 安装 Elasticsearch2. 添加依赖连接 Elasticsearch1. 创

Oracle数据库使用 listagg去重删除重复数据的方法汇总

《Oracle数据库使用listagg去重删除重复数据的方法汇总》文章介绍了在Oracle数据库中使用LISTAGG和XMLAGG函数进行字符串聚合并去重的方法,包括去重聚合、使用XML解析和CLO... 目录案例表第一种:使用wm_concat() + distinct去重聚合第二种:使用listagg,

Go语言使用Buffer实现高性能处理字节和字符

《Go语言使用Buffer实现高性能处理字节和字符》在Go中,bytes.Buffer是一个非常高效的类型,用于处理字节数据的读写操作,本文将详细介绍一下如何使用Buffer实现高性能处理字节和... 目录1. bytes.Buffer 的基本用法1.1. 创建和初始化 Buffer1.2. 使用 Writ

深入理解C语言的void*

《深入理解C语言的void*》本文主要介绍了C语言的void*,包括它的任意性、编译器对void*的类型检查以及需要显式类型转换的规则,具有一定的参考价值,感兴趣的可以了解一下... 目录一、void* 的类型任意性二、编译器对 void* 的类型检查三、需要显式类型转换占用的字节四、总结一、void* 的

Java后端接口中提取请求头中的Cookie和Token的方法

《Java后端接口中提取请求头中的Cookie和Token的方法》在现代Web开发中,HTTP请求头(Header)是客户端与服务器之间传递信息的重要方式之一,本文将详细介绍如何在Java后端(以Sp... 目录引言1. 背景1.1 什么是 HTTP 请求头?1.2 为什么需要提取请求头?2. 使用 Spr

Redis缓存问题与缓存更新机制详解

《Redis缓存问题与缓存更新机制详解》本文主要介绍了缓存问题及其解决方案,包括缓存穿透、缓存击穿、缓存雪崩等问题的成因以及相应的预防和解决方法,同时,还详细探讨了缓存更新机制,包括不同情况下的缓存更... 目录一、缓存问题1.1 缓存穿透1.1.1 问题来源1.1.2 解决方案1.2 缓存击穿1.2.1

PyTorch使用教程之Tensor包详解

《PyTorch使用教程之Tensor包详解》这篇文章介绍了PyTorch中的张量(Tensor)数据结构,包括张量的数据类型、初始化、常用操作、属性等,张量是PyTorch框架中的核心数据结构,支持... 目录1、张量Tensor2、数据类型3、初始化(构造张量)4、常用操作5、常用属性5.1 存储(st

Java如何通过反射机制获取数据类对象的属性及方法

《Java如何通过反射机制获取数据类对象的属性及方法》文章介绍了如何使用Java反射机制获取类对象的所有属性及其对应的get、set方法,以及如何通过反射机制实现类对象的实例化,感兴趣的朋友跟随小编一... 目录一、通过反射机制获取类对象的所有属性以及相应的get、set方法1.遍历类对象的所有属性2.获取