如何只用bert夺冠之对比学习代码解读

2024-03-19 17:50

本文主要是介绍如何只用bert夺冠之对比学习代码解读,希望对大家解决编程问题提供一定的参考价值,需要的开发者们随着小编来一起学习吧!

有监督对比学习:Supervised Contrastive Learning:
https://zhuanlan.zhihu.com/p/136332151

1. 自监督对比学习

一句话总结:不使用label数据,通过数据增强构造样本,使特征提取器提取的特征在增强样本和原始样本的距离更近,其他数据特征与原始样本的更远来训练特征提取器的方法。
关键思想:一个batch=n的数据,增强一次变成2n的数据,loss函数如下:
在这里插入图片描述

2. 监督对比学习

把标签数据加进来,但是计算loss还是以一个batch=n,自监督计算loss的思想来做。
在这里插入图片描述

问:真的有用吗?

3. 代码实现

  • 核心代码总结
    • 将label作为输入,当然结合了bert的原始输入,另外预测的时候,还是通过嫁接一个最基础的分类model来进行预测和输出。
      训练的时候,没有指定loss函数,只是在train_model中以监督对比loss和交叉熵loss最为输出,并继承与Loss类并指定了add_metric(loss),这样可能就可以了,反正也是给定一个数据,使loss最小
    • 优缺点分析:
      一个batch里面,正负样本就那么点,并且正样本之间的相似度不一定要高啊,在这个任务场景下,所以对比训练这个方式提升不大吧。
      可能在语义相似度计算任务上,真正的语义相似度计算而不是问答任务上,效果可能会好点吧。
    • 代码链接:https://github.com/xv44586/ccf_2020_qa_match/blob/main/pair-supervised-contrastive-learning.py
class SupervisedContrastiveLearning(Loss):"""https://arxiv.org/pdf/2011.01403.pdf"""def __init__(self, alpha=1., T=1., **kwargs):super(SupervisedContrastiveLearning, self).__init__(**kwargs)self.alpha = alpha  # loss weightself.T = T  # Temperaturedef compute_loss(self, inputs, mask=None):loss = self.compute_loss_of_scl(inputs)loss = loss * self.alphaself.add_metric(loss, name='scl_loss')return lossdef get_label_mask(self, y_true):"""获取batch内相同label样本"""label = K.cast(y_true, 'int32') # 转换数据类型label_2 = K.reshape(label, (1, -1)) # reshape成一行mask = K.equal(label_2, label) # 这两个shape都不一样,出来的是啥?知道了,应该原来是一列,现在换成一行,所以可以比较每个位置的label是否一样了mask = K.cast(mask, K.floatx()) # 又把它转成float类型,这样lable相等的位置为1.0,不相等的时候为0.0mask = mask * (1 - K.eye(K.shape(y_true)[0]))  # 排除对角线,即 i == j,对角线的位置的值全设置为0return maskdef compute_loss_of_scl(self, inputs, mask=None):y_pred, y_true = inputslabel_mask = self.get_label_mask(y_true) # mask是个二维矩阵,告诉i,j位置的lable是否一样y_pred = K.l2_normalize(y_pred, axis=1)  # 特征向量归一化similarities = K.dot(y_pred, K.transpose(y_pred))  # 相似矩阵,相当于是点乘similarities = similarities - K.eye(K.shape(y_pred)[0]) * 1e12  # 排除对角线,即 i == j,点乘然后排出对角线的位置similarities = similarities / self.T  # Temperature scalesimilarities = K.exp(similarities)  # expsum_similarities = K.sum(similarities, axis=-1, keepdims=True)  # sum i != k, 求和得到的应该是分母scl = similarities / sum_similarities # 这里算的还是全部的作为分子,但是我们只要把i和j位置label相同的作为分子,所以还要乘以maskscl = K.log((scl + K.epsilon()))  # sum log,取logscl = -K.sum(scl * label_mask, axis=1, keepdims=True) / (K.sum(label_mask, axis=1, keepdims=True) + K.epsilon()) # 乘以maskreturn K.mean(scl)class CrossEntropy(Loss):def compute_loss(self, inputs, mask=None):pred, ytrue = inputsytrue = K.cast(ytrue, K.floatx())loss = K.binary_crossentropy(ytrue, pred)loss = K.mean(loss)self.add_metric(loss, name='clf_loss')return loss# 加载预训练模型
bert = build_transformer_model(config_path=config_path,checkpoint_path=checkpoint_path,model='nezha',keep_tokens=keep_tokens,num_hidden_layers=12,
)# 将label作为输入
y_in = Input(shape=(None,))output = Lambda(lambda x: x[:, 0])(bert.output)
# output相当于是特征,监督对比函数相当于是利用了label类别信息求了个loss
scl_output = SupervisedContrastiveLearning(alpha=0.1, T=0.2, output_idx=0)([output, y_in])
# scl_output是监督对比函数的loss
output = Dropout(0.1)(output)
# 这个是分类的概率
clf_output = Dense(1, activation='sigmoid')(output)
# 这个是分类的loss
clf = CrossEntropy(0)([clf_output, y_in])
# clf是分类的loss
# model模型还是以bert作为输入,分类的概率clf_output作为输出
model = keras.models.Model(bert.input, clf_output)
model.summary()
# train_model模型是用于训练的模型,bert+label作为输入,scl_output是监督对比函数的loss与clf是分类的loss作为输出
# 将loss函数作为输出,后面complile就不用指定loss函数了吗?还有这种操作,那为啥要两个loss函数啊?
train_model = keras.models.Model(bert.input + [y_in], [scl_output, clf])optimizer = extend_with_weight_decay(Adam)
optimizer = extend_with_piecewise_linear_lr(optimizer)
opt = optimizer(learning_rate=1e-5, weight_decay_rate=0.1, exclude_from_weight_decay=['Norm', 'bias'],lr_schedule={int(len(train_generator) * 0.1 * epochs): 1, len(train_generator) * epochs: 0})train_model.compile(optimizer=opt,# 但是这里没有指定loss啊,所以loss是啥,所以
)# 正常的分类模型是这么做的,在compile里面指定了loss函数
"""
model = keras.models.Model(bert.input, output)
model.summary()model.compile(# 指定了loss函数loss=K.binary_crossentropy,optimizer=Adam(2e-5),  # 用足够小的学习率metrics=['accuracy'],
)class Evaluator(keras.callbacks.Callback):"""评估与保存"""def __init__(self):self.best_val_f1 = 0.def on_epoch_end(self, epoch, logs=None):val_f1 = evaluate(valid_generator)if val_f1 > self.best_val_f1:self.best_val_f1 = val_f1model.save_weights('best_parimatch_model.weights')print(u'val_f1: %.5f, best_val_f1: %.5f\n' %(val_f1, self.best_val_f1))evaluator = Evaluator()
model.fit_generator(train_generator.generator(),steps_per_epoch=len(train_generator),epochs=5,callbacks=[evaluator],)"""def evaluate(data):P, R, TP = 0., 0., 0.for x, _ in tqdm(data):x_true = x[:2]y_true = x[-1]y_pred = model.predict(x_true)[:, 0]y_pred = np.round(y_pred)y_true = y_true[:, 0]R += y_pred.sum()P += y_true.sum()TP += ((y_pred + y_true) > 1).sum()print(P, R, TP)pre = TP / Rrec = TP / Preturn 2 * (pre * rec) / (pre + rec)class Evaluator(keras.callbacks.Callback):"""评估与保存"""def __init__(self, save_path):self.best_val_f1 = 0.self.save_path = save_pathdef on_epoch_end(self, epoch, logs=None):val_f1 = evaluate(valid_generator)if val_f1 > self.best_val_f1:self.best_val_f1 = val_f1model.save_weights(self.save_path)print(u'val_f1: %.5f, best_val_f1: %.5f\n' %(val_f1, self.best_val_f1))def predict_to_file(path='pair_submission.tsv'):preds = []for x, _ in tqdm(test_generator):x = x[:2]pred = model.predict(x).argmax(axis=1)#         pred = np.round(pred)pred = pred.astype(int)preds.append(pred)preds = np.concatenate(preds)ret = []for d, p in zip(test_data, preds):q_id, _, r_id, _, _ = dret.append([str(q_id), str(r_id), str(p)])with open(path, 'w', encoding='utf8') as f:for l in ret:f.write('\t'.join(l) + '\n')if __name__ == '__main__':save_path = 'best_pair_scl_model.weights'evaluator = Evaluator(save_path)train_model.fit_generator(train_generator.generator(),steps_per_epoch=len(train_generator),epochs=epochs,callbacks=[evaluator],)model.load_weights(save_path)predict_to_file('pair_scl.tsv')

这篇关于如何只用bert夺冠之对比学习代码解读的文章就介绍到这儿,希望我们推荐的文章对编程师们有所帮助!



http://www.chinasem.cn/article/826787

相关文章

C++使用栈实现括号匹配的代码详解

《C++使用栈实现括号匹配的代码详解》在编程中,括号匹配是一个常见问题,尤其是在处理数学表达式、编译器解析等任务时,栈是一种非常适合处理此类问题的数据结构,能够精确地管理括号的匹配问题,本文将通过C+... 目录引言问题描述代码讲解代码解析栈的状态表示测试总结引言在编程中,括号匹配是一个常见问题,尤其是在

Java调用DeepSeek API的最佳实践及详细代码示例

《Java调用DeepSeekAPI的最佳实践及详细代码示例》:本文主要介绍如何使用Java调用DeepSeekAPI,包括获取API密钥、添加HTTP客户端依赖、创建HTTP请求、处理响应、... 目录1. 获取API密钥2. 添加HTTP客户端依赖3. 创建HTTP请求4. 处理响应5. 错误处理6.

使用 sql-research-assistant进行 SQL 数据库研究的实战指南(代码实现演示)

《使用sql-research-assistant进行SQL数据库研究的实战指南(代码实现演示)》本文介绍了sql-research-assistant工具,该工具基于LangChain框架,集... 目录技术背景介绍核心原理解析代码实现演示安装和配置项目集成LangSmith 配置(可选)启动服务应用场景

Python中顺序结构和循环结构示例代码

《Python中顺序结构和循环结构示例代码》:本文主要介绍Python中的条件语句和循环语句,条件语句用于根据条件执行不同的代码块,循环语句用于重复执行一段代码,文章还详细说明了range函数的使... 目录一、条件语句(1)条件语句的定义(2)条件语句的语法(a)单分支 if(b)双分支 if-else(

Java深度学习库DJL实现Python的NumPy方式

《Java深度学习库DJL实现Python的NumPy方式》本文介绍了DJL库的背景和基本功能,包括NDArray的创建、数学运算、数据获取和设置等,同时,还展示了如何使用NDArray进行数据预处理... 目录1 NDArray 的背景介绍1.1 架构2 JavaDJL使用2.1 安装DJL2.2 基本操

MySQL数据库函数之JSON_EXTRACT示例代码

《MySQL数据库函数之JSON_EXTRACT示例代码》:本文主要介绍MySQL数据库函数之JSON_EXTRACT的相关资料,JSON_EXTRACT()函数用于从JSON文档中提取值,支持对... 目录前言基本语法路径表达式示例示例 1: 提取简单值示例 2: 提取嵌套值示例 3: 提取数组中的值注意

CSS3中使用flex和grid实现等高元素布局的示例代码

《CSS3中使用flex和grid实现等高元素布局的示例代码》:本文主要介绍了使用CSS3中的Flexbox和Grid布局实现等高元素布局的方法,通过简单的两列实现、每行放置3列以及全部代码的展示,展示了这两种布局方式的实现细节和效果,详细内容请阅读本文,希望能对你有所帮助... 过往的实现方法是使用浮动加

JAVA调用Deepseek的api完成基本对话简单代码示例

《JAVA调用Deepseek的api完成基本对话简单代码示例》:本文主要介绍JAVA调用Deepseek的api完成基本对话的相关资料,文中详细讲解了如何获取DeepSeekAPI密钥、添加H... 获取API密钥首先,从DeepSeek平台获取API密钥,用于身份验证。添加HTTP客户端依赖使用Jav

Java实现状态模式的示例代码

《Java实现状态模式的示例代码》状态模式是一种行为型设计模式,允许对象根据其内部状态改变行为,本文主要介绍了Java实现状态模式的示例代码,文中通过示例代码介绍的非常详细,需要的朋友们下面随着小编来... 目录一、简介1、定义2、状态模式的结构二、Java实现案例1、电灯开关状态案例2、番茄工作法状态案例

nginx-rtmp-module模块实现视频点播的示例代码

《nginx-rtmp-module模块实现视频点播的示例代码》本文主要介绍了nginx-rtmp-module模块实现视频点播,文中通过示例代码介绍的非常详细,对大家的学习或者工作具有一定的参考学习... 目录预置条件Nginx点播基本配置点播远程文件指定多个播放位置参考预置条件配置点播服务器 192.