【深度学习】sentencepiece工具之BPE训练使用

2023-11-23 15:40

本文主要是介绍【深度学习】sentencepiece工具之BPE训练使用,希望对大家解决编程问题提供一定的参考价值,需要的开发者们随着小编来一起学习吧!

为什么要使用BPE,BPE是什么

BPE:迭代的将字符串里出现频率最高的子串进行合并
训练过程
在这里插入图片描述
在这里插入图片描述

使用教程

代码使用的语料在这里

# -*- coding: utf-8 -*-
#/usr/bin/python3import os
import errno
import sentencepiece as spm
import re
import logginglogging.basicConfig(level=logging.INFO)def prepro(hp):print("# Check if raw files exist")train1 = "iwslt2016/de-en/train.tags.de-en.de"train2 = "iwslt2016/de-en/train.tags.de-en.en"eval1 = "iwslt2016/de-en/IWSLT16.TED.tst2013.de-en.de.xml"eval2 = "iwslt2016/de-en/IWSLT16.TED.tst2013.de-en.en.xml"test1 = "iwslt2016/de-en/IWSLT16.TED.tst2014.de-en.de.xml"test2 = "iwslt2016/de-en/IWSLT16.TED.tst2014.de-en.en.xml"for f in (train1, train2, eval1, eval2, test1, test2):if not os.path.isfile(f):raise FileNotFoundError(errno.ENOENT, os.strerror(errno.ENOENT), f)print("# Preprocessing")# train_prepro = lambda x:  [line.strip() for line in open(x, mode='r',encoding="utf-8").read().split("\n") \if not line.startswith("<")]prepro_train1, prepro_train2 = _prepro(train1), _prepro(train2)assert len(prepro_train1)==len(prepro_train2), "Check if train source and target files match."# eval_prepro = lambda x: [re.sub("<[^>]+>", "", line).strip() \for line in open(x, mode='r',encoding="utf-8").read().split("\n") \if line.startswith("<seg id")]prepro_eval1, prepro_eval2 = _prepro(eval1), _prepro(eval2)assert len(prepro_eval1) == len(prepro_eval2), "Check if eval source and target files match."# testprepro_test1, prepro_test2 = _prepro(test1), _prepro(test2)assert len(prepro_test1) == len(prepro_test2), "Check if test source and target files match."print("Let's see how preprocessed data look like")print("prepro_train1:", prepro_train1[0])print("prepro_train2:", prepro_train2[0])print("prepro_eval1:", prepro_eval1[0])print("prepro_eval2:", prepro_eval2[0])print("prepro_test1:", prepro_test1[0])print("prepro_test2:", prepro_test2[0])print("# write preprocessed files to disk")os.makedirs("iwslt2016/prepro", exist_ok=True)def _write(sents, fname):with open(fname, mode='w',encoding="utf-8") as fout:fout.write("\n".join(sents))_write(prepro_train1, "iwslt2016/prepro/train.de")_write(prepro_train2, "iwslt2016/prepro/train.en")_write(prepro_train1+prepro_train2, "iwslt2016/prepro/train")_write(prepro_eval1, "iwslt2016/prepro/eval.de")_write(prepro_eval2, "iwslt2016/prepro/eval.en")_write(prepro_test1, "iwslt2016/prepro/test.de")_write(prepro_test2, "iwslt2016/prepro/test.en")print("# Train a joint BPE model with sentencepiece")os.makedirs("iwslt2016/segmented", exist_ok=True)train = '--input=iwslt2016/prepro/train --pad_id=0 --unk_id=1 \--bos_id=2 --eos_id=3\--model_prefix=iwslt2016/segmented/bpe --vocab_size={} \--model_type=bpe'.format(hp.vocab_size)spm.SentencePieceTrainer.Train(train)print("# Load trained bpe model")sp = spm.SentencePieceProcessor()sp.Load("iwslt2016/segmented/bpe.model")print("# Segment")def _segment_and_write(sents, fname):with open(fname,mode= "w",encoding="utf-8") as fout:for sent in sents:pieces = sp.EncodeAsPieces(sent)fout.write(" ".join(pieces) + "\n")_segment_and_write(prepro_train1, "iwslt2016/segmented/train.de.bpe")_segment_and_write(prepro_train2, "iwslt2016/segmented/train.en.bpe")_segment_and_write(prepro_eval1, "iwslt2016/segmented/eval.de.bpe")_segment_and_write(prepro_eval2, "iwslt2016/segmented/eval.en.bpe")_segment_and_write(prepro_test1, "iwslt2016/segmented/test.de.bpe")print("Let's see how segmented data look like")print("train1:", open("iwslt2016/segmented/train.de.bpe",mode='r',encoding="utf-8").readline())print("train2:", open("iwslt2016/segmented/train.en.bpe", mode='r',encoding="utf-8").readline())print("eval1:", open("iwslt2016/segmented/eval.de.bpe", mode='r',encoding="utf-8").readline())print("eval2:", open("iwslt2016/segmented/eval.en.bpe", mode='r',encoding="utf-8").readline())print("test1:", open("iwslt2016/segmented/test.de.bpe", mode='r',encoding="utf-8").readline())if __name__ == '__main__':hparams = Hparams()parser = hparams.parserhp = parser.parse_args()prepro(hp)print("Done")

这篇关于【深度学习】sentencepiece工具之BPE训练使用的文章就介绍到这儿,希望我们推荐的文章对编程师们有所帮助!



http://www.chinasem.cn/article/418969

相关文章

HarmonyOS学习(七)——UI(五)常用布局总结

自适应布局 1.1、线性布局(LinearLayout) 通过线性容器Row和Column实现线性布局。Column容器内的子组件按照垂直方向排列,Row组件中的子组件按照水平方向排列。 属性说明space通过space参数设置主轴上子组件的间距,达到各子组件在排列上的等间距效果alignItems设置子组件在交叉轴上的对齐方式,且在各类尺寸屏幕上表现一致,其中交叉轴为垂直时,取值为Vert

Ilya-AI分享的他在OpenAI学习到的15个提示工程技巧

Ilya(不是本人,claude AI)在社交媒体上分享了他在OpenAI学习到的15个Prompt撰写技巧。 以下是详细的内容: 提示精确化:在编写提示时,力求表达清晰准确。清楚地阐述任务需求和概念定义至关重要。例:不用"分析文本",而用"判断这段话的情感倾向:积极、消极还是中性"。 快速迭代:善于快速连续调整提示。熟练的提示工程师能够灵活地进行多轮优化。例:从"总结文章"到"用

中文分词jieba库的使用与实景应用(一)

知识星球:https://articles.zsxq.com/id_fxvgc803qmr2.html 目录 一.定义: 精确模式(默认模式): 全模式: 搜索引擎模式: paddle 模式(基于深度学习的分词模式): 二 自定义词典 三.文本解析   调整词出现的频率 四. 关键词提取 A. 基于TF-IDF算法的关键词提取 B. 基于TextRank算法的关键词提取

使用SecondaryNameNode恢复NameNode的数据

1)需求: NameNode进程挂了并且存储的数据也丢失了,如何恢复NameNode 此种方式恢复的数据可能存在小部分数据的丢失。 2)故障模拟 (1)kill -9 NameNode进程 [lytfly@hadoop102 current]$ kill -9 19886 (2)删除NameNode存储的数据(/opt/module/hadoop-3.1.4/data/tmp/dfs/na

Hadoop数据压缩使用介绍

一、压缩原则 (1)运算密集型的Job,少用压缩 (2)IO密集型的Job,多用压缩 二、压缩算法比较 三、压缩位置选择 四、压缩参数配置 1)为了支持多种压缩/解压缩算法,Hadoop引入了编码/解码器 2)要在Hadoop中启用压缩,可以配置如下参数

【前端学习】AntV G6-08 深入图形与图形分组、自定义节点、节点动画(下)

【课程链接】 AntV G6:深入图形与图形分组、自定义节点、节点动画(下)_哔哩哔哩_bilibili 本章十吾老师讲解了一个复杂的自定义节点中,应该怎样去计算和绘制图形,如何给一个图形制作不间断的动画,以及在鼠标事件之后产生动画。(有点难,需要好好理解) <!DOCTYPE html><html><head><meta charset="UTF-8"><title>06

Makefile简明使用教程

文章目录 规则makefile文件的基本语法:加在命令前的特殊符号:.PHONY伪目标: Makefilev1 直观写法v2 加上中间过程v3 伪目标v4 变量 make 选项-f-n-C Make 是一种流行的构建工具,常用于将源代码转换成可执行文件或者其他形式的输出文件(如库文件、文档等)。Make 可以自动化地执行编译、链接等一系列操作。 规则 makefile文件

学习hash总结

2014/1/29/   最近刚开始学hash,名字很陌生,但是hash的思想却很熟悉,以前早就做过此类的题,但是不知道这就是hash思想而已,说白了hash就是一个映射,往往灵活利用数组的下标来实现算法,hash的作用:1、判重;2、统计次数;

使用opencv优化图片(画面变清晰)

文章目录 需求影响照片清晰度的因素 实现降噪测试代码 锐化空间锐化Unsharp Masking频率域锐化对比测试 对比度增强常用算法对比测试 需求 对图像进行优化,使其看起来更清晰,同时保持尺寸不变,通常涉及到图像处理技术如锐化、降噪、对比度增强等 影响照片清晰度的因素 影响照片清晰度的因素有很多,主要可以从以下几个方面来分析 1. 拍摄设备 相机传感器:相机传

高效录音转文字:2024年四大工具精选!

在快节奏的工作生活中,能够快速将录音转换成文字是一项非常实用的能力。特别是在需要记录会议纪要、讲座内容或者是采访素材的时候,一款优秀的在线录音转文字工具能派上大用场。以下推荐几个好用的录音转文字工具! 365在线转文字 直达链接:https://www.pdf365.cn/ 365在线转文字是一款提供在线录音转文字服务的工具,它以其高效、便捷的特点受到用户的青睐。用户无需下载安装任何软件,只