TTS | emotional-vits情绪语音合成的实现

2023-12-11 16:01

本文主要是介绍TTS | emotional-vits情绪语音合成的实现,希望对大家解决编程问题提供一定的参考价值,需要的开发者们随着小编来一起学习吧!

本文主要介绍了情绪语音合成项目训练自己的数据集的实现过程~

innnky/emotional-vits: 无需情感标注的情感可控语音合成模型,基于VITS (github.com)

目录

0.环境设置

 1.数据预处理

2..提取情绪

3.训练

4.推理

过程中遇到的问题与解决【PS】


0.环境设置

因为我用的是之前设置vits的虚拟环境,这里可能也有写不全的的地方~

git clone https://github.com/innnky/emotional-vits
cd emotional-vits
pip install -r requirements.txt# MAS 对印发音和文本:Cython-version Monotonoic Alignment Search
cd monotonic_align
python setup.py build_ext --inplace

 1.数据预处理

# 处理数据集
python preprocess.py --text_index 2 --filelists /jf-training-home/src/emotional-vits/filelists/bea_train.txt /jf-training-home/src/emotional-vits/filelists/val.txt --text_cleaners korean_cleaners

生成文本处理文件

对数据进行16000重采样:

import os
import librosa
import tqdm
import soundfile as sf
import timeif __name__ == '__main__':audioExt = 'WAV'input_sample = 22050output_sample = 16000audioDirectory = ['/jf-training-home/src/emotional-vits/dataset/bae_before']outputDirectory = ['/jf-training-home/src/emotional-vits/dataset/bae']start_time=time.time()for i, dire in enumerate(audioDirectory):clean_speech_paths = librosa.util.find_files(directory=dire,ext=audioExt,recurse=True, )for file in tqdm.tqdm(clean_speech_paths, desc='No.{} dataset resampling'.format(i)):fileName = os.path.basename(file)y, sr = librosa.load(file, sr=input_sample)y_16k = librosa.resample(y, orig_sr=sr, target_sr=output_sample)outputFileName = os.path.join(outputDirectory[i], fileName)sf.write(outputFileName, y_16k, output_sample)end_time=time.time()runTime=end_time - start_timeprint("Run Time: {} sec ~".format(runTime))

2..提取情绪

*注意:如果数据集是英文,可以默认提取情绪信息,如果是中文,需要更换预训练权重
!!

修改emotion_extract.py文件的第94行,改为自己的数据集路径

原代码rootpath = "dataset/nene"

改为自己的rootpath = "dataset/bae"

python emotion_extract.py --filelists src/emotional-vits/filelists/bae_train.txt src/emotional-vits/filelists/bae_val.txt

 如果出现问题参考【PS2】,运行时如图

文件内会生成

3.训练

#python train_ms.py -c configs/nene.json -m nene --ckptD /path/to/D_xxxx.pth --ckptG /path/to/G_xxxx.pthpython train_ms.py -c configs/bae.json -m emo_bae 

如果出现错误,参考【PS3】 

 开始训练

一共3000条数据,8个小时epoch410->step24000

4.推理

推理使用inference.ipynb,修改配置文件,以及权重文件路径

推理结果并不是完整的句子,可能是因为ser预训练加载的是英文的,而训练的数据集并非英文。

过程中遇到的问题与解决【PS】

【PS1】RuntimeError: Given groups=1, weight of size [512, 1, 10], expected input[1, 45140, 1] to have 1 channels, but got 45140 channels instead

 

 解决方案

pip install transformers==4.25.1#或者在emotion_extract.py文件77行增加一个维度
y = y.unsqueeze(0)

 然后就解决啦~

【PS2】安装setuptools出错

 删掉使用日语的库

【PS3】RuntimeError: stft requires the return_complex parameter be given for real inputs, and will further require that return_complex=True in a future PyTorch release.

打开emotional-vits/mel_processing.py, 111行

添加了 return_complex=True

然后出现RuntimeError: mat1 and mat2 shapes cannot be multiplied (80x513 and 32x513)

解决办法

pytorch包太新了导致的修改emotional-vits/mel_processing.py,

66行,67行【增加return_complex=False】

104行,105行【onesided=True后增加,return_complex=False】

其他

Q&A

怎么根据Ubuntu进程判断运行的程序?

第一步查询GPU进程

fuser使用

  • 安装: sudo apt-get update
  • sudo apt-get install psmisc
  • 查看显卡占用的进程: 
  • fuser -v /dev/nvidia*
  • 杀掉进程 kill -9 PID

后面都是python,说明都是python命令

通过名称查看进程

ps -ef | grep python

 

 对比删除自己不用的进程就可以啦~

这篇关于TTS | emotional-vits情绪语音合成的实现的文章就介绍到这儿,希望我们推荐的文章对编程师们有所帮助!



http://www.chinasem.cn/article/481252

相关文章

基于C++的UDP网络通信系统设计与实现详解

《基于C++的UDP网络通信系统设计与实现详解》在网络编程领域,UDP作为一种无连接的传输层协议,以其高效、低延迟的特性在实时性要求高的应用场景中占据重要地位,下面我们就来看看如何从零开始构建一个完整... 目录前言一、UDP服务器UdpServer.hpp1.1 基本框架设计1.2 初始化函数Init详解

Java中Map的五种遍历方式实现与对比

《Java中Map的五种遍历方式实现与对比》其实Map遍历藏着多种玩法,有的优雅简洁,有的性能拉满,今天咱们盘一盘这些进阶偏基础的遍历方式,告别重复又臃肿的代码,感兴趣的小伙伴可以了解下... 目录一、先搞懂:Map遍历的核心目标二、几种遍历方式的对比1. 传统EntrySet遍历(最通用)2. Lambd

springboot+redis实现订单过期(超时取消)功能的方法详解

《springboot+redis实现订单过期(超时取消)功能的方法详解》在SpringBoot中使用Redis实现订单过期(超时取消)功能,有多种成熟方案,本文为大家整理了几个详细方法,文中的示例代... 目录一、Redis键过期回调方案(推荐)1. 配置Redis监听器2. 监听键过期事件3. Redi

SpringBoot全局异常拦截与自定义错误页面实现过程解读

《SpringBoot全局异常拦截与自定义错误页面实现过程解读》本文介绍了SpringBoot中全局异常拦截与自定义错误页面的实现方法,包括异常的分类、SpringBoot默认异常处理机制、全局异常拦... 目录一、引言二、Spring Boot异常处理基础2.1 异常的分类2.2 Spring Boot默

基于SpringBoot实现分布式锁的三种方法

《基于SpringBoot实现分布式锁的三种方法》这篇文章主要为大家详细介绍了基于SpringBoot实现分布式锁的三种方法,文中的示例代码讲解详细,感兴趣的小伙伴可以跟随小编一起学习一下... 目录一、基于Redis原生命令实现分布式锁1. 基础版Redis分布式锁2. 可重入锁实现二、使用Redisso

SpringBoo WebFlux+MongoDB实现非阻塞API过程

《SpringBooWebFlux+MongoDB实现非阻塞API过程》本文介绍了如何使用SpringBootWebFlux和MongoDB实现非阻塞API,通过响应式编程提高系统的吞吐量和响应性能... 目录一、引言二、响应式编程基础2.1 响应式编程概念2.2 响应式编程的优势2.3 响应式编程相关技术

C#实现将XML数据自动化地写入Excel文件

《C#实现将XML数据自动化地写入Excel文件》在现代企业级应用中,数据处理与报表生成是核心环节,本文将深入探讨如何利用C#和一款优秀的库,将XML数据自动化地写入Excel文件,有需要的小伙伴可以... 目录理解XML数据结构与Excel的对应关系引入高效工具:使用Spire.XLS for .NETC

Nginx更新SSL证书的实现步骤

《Nginx更新SSL证书的实现步骤》本文主要介绍了Nginx更新SSL证书的实现步骤,包括下载新证书、备份旧证书、配置新证书、验证配置及遇到问题时的解决方法,感兴趣的了解一下... 目录1 下载最新的SSL证书文件2 备份旧的SSL证书文件3 配置新证书4 验证配置5 遇到的http://www.cppc

Nginx之https证书配置实现

《Nginx之https证书配置实现》本文主要介绍了Nginx之https证书配置的实现示例,文中通过示例代码介绍的非常详细,对大家的学习或者工作具有一定的参考学习价值,需要的朋友们下面随着小编来一起... 目录背景介绍为什么不能部署在 IIS 或 NAT 设备上?具体实现证书获取nginx配置扩展结果验证

SpringBoot整合 Quartz实现定时推送实战指南

《SpringBoot整合Quartz实现定时推送实战指南》文章介绍了SpringBoot中使用Quartz动态定时任务和任务持久化实现多条不确定结束时间并提前N分钟推送的方案,本文结合实例代码给大... 目录前言一、Quartz 是什么?1、核心定位:解决什么问题?2、Quartz 核心组件二、使用步骤1