ChatTTS增强版V2,批量导出srt,语速控制,情感控制,支持朗读数字,问题修复

本文主要是介绍ChatTTS增强版V2,批量导出srt,语速控制,情感控制,支持朗读数字,问题修复,希望对大家解决编程问题提供一定的参考价值,需要的开发者们随着小编来一起学习吧!

ChatTTS增强版最新版本已经发布,本次更新我主要增加了多文本批量、SRT导出、语速控制、情感控制、停顿控制等新功能,并针对上一版本中存在的数字读音异常、随机uv_break等问题进行了修复。

视频版本

【ChatTTS增强版V2,批量导出srt,语速控制,情感控制,支持朗读数字,问题修复】 https://www.bilibili.com/video/BV17T421e76w/?share_source=copy_web&vd_source=09316244e4ff3a9793930d67cf748288

37b5fdae63cc1122302a0aa6f1c114d4.png

更新内容

批量txt

新增支持多个txt文本批量导入,会针对每个txt文本进行处理。

3755762243cdb3ae1053b2ac86dd3daa.png

听取大家的建议,批量处理后的txt会按照文件名来保存。

导出路径为:output_audio/你的txt名/

d3cb5ee04d7e5aa30e909216a5fe9315.png

每个文件夹内分别存放着合并后的音频、音频切片、增强后的音频切片。

导出的完整的音频路径为:output_audio/你的txt名/合并/

导出的音频切片路径为:output_audio/你的txt名/切片/

导出的增强音频切片路径为:output_audio/你的txt名/增强切片/

9caf434bd66e3802bc51b2fd3414654a.png

SRT导出

批量模式下支持导出srt文件。会针对每个txt文本合成的音频生成对应的srt文件。

46d27627d1aba2bb7388b6ef3659aab5.png

srt会导出路径:output_audio/你的txt名/你的txt名.srt

6ac6912b18f43c4e3c2a6c4a8b60003a.png

srt文本内容

eda6f43f4900e757f7f8b6f324ae56e4.png

这里说下,srt某些情况下会有误差,需检查下时间戳。

数字转换

由于ChatTTS不能很好的去朗读数字,这里做了一个转换。

2ee1d08097e975e4760ea51c40e14376.png

比如这句话:我有10块4090显卡,今天出门丢了1块,很难受,今天是2024年。

34100bd6d6564ceaf5ff2c25eddfbc0d.png

读出来就是:

(音频)

开启数字转换后:

(音频)

这里还是把4090显卡型号以及年份读错了。因为数字转换在特殊情况下还是不能很好的去识别,这里最好的办法就是加空格

修改后的文字:我有10块4 0 9 0显卡,今天出门丢了1块,很难受,今天是2 0 2 4年。

e31a260ef666cea6b0963409aa53ef76.png

在你想要单独读的数字组合里添加空格隔开。再开启数字转换后的效果:

(音频)

语速调整

增加了语速调节。默认值为0。最高是10,建议调到5或者6,10的话会有奇怪的英文读音混进去。

cb774ec49bb8aa85f5b1bdcfbea73cd6.png

口语化调整

这里对这个参数的理解就是口语化,或者是说话的自然程度。

fe161160ac9cf686c4dd46c61641ebfc.png

比如还是刚才那句:我有10块4 0 9 0显卡,今天出门丢了1块,很难受,今天是2 0 2 4年。

其他参数相同,oral为0的效果:

(音频效果)

oral为5的效果:

(音频效果)

可以听到,在oral为5的情况下自动添加了:就、啊等语气或者连接词来让音频更加自然。

笑声调整

控制音频的笑声程度。

6c73ddd404f965947a2528b871b50608.png

当然你也可以在文字中输入[laugh]来手动添加笑声。

e831e777b4efe4db4be86457cb5221d2.png

生成的效果:

(音频效果)

停顿调整

ddf19404b6487e88bb45484ea91ade77.png

停顿为0

(音频效果)

停顿为4

(音频效果)

这个参数也可以在文本中输入[uv_break]来手动添加停顿。

08c71674f2b3f451bfab1f3ee818084e.png

(音频效果)

问题修复

uv_break问题

首先说下上次最大的问题,好多朋友反馈说会读u_break的问题。这里跟大家说声抱歉,那是个我漏掉的bug。

这个版本我针对这个问题做了调整,大家可以试下。

如果还有这个问题可以将break调整为0,关闭提炼文本尝试下。

f0867328fa9dd6edd45e2d41c1546a8f.png

380adda7307d14aba8fed7ae7c47936d.png

IP端口问题

V1版本的ip和端口号是固定的,有些朋友电脑上8080端口是禁用的,造成访问不了网页的问题,或者是开了代理进不去的问题。

这个版本默认ip是127.0.0.1,端口号是自动获取本机开放空闲的端口。

如果你想要自定义ip或端口号,可在整合包根目录下找到config.ini文件。

0ed4f6669d6bb5cf54e0635140e4b76f.png

修改custom_server的值为True表示开启自定义ip、端口号。False为关闭自定义ip、端口号。

ip和端口修改为你想要设定的值即可。

f869d07bf1220f35d8084a3809417183.png

实验性选项

51092df61729600d6a0d5ccdafd4f8bb.png

这里是开发中的一个测试选项,还不完善。可自行测试音色固定程度,如果开启后生成的结果无效果,或异常,关掉即可。

⚠️已知的是开启后会导致N卡用户音频增强过程变得极慢!!!慎重开启

配置要求

以下是整合包运行所需配置

WIN

  • Windwos10/11操作系统
  • 支持CPU/GPU

MAC

  • Apple Silicon M系列芯片、Intel 芯片
  • MacOS 10.13以上版本

云端版本

适用于机器配置低的朋友,云端镜像一键部署。

云端一键部署镜像

关于显存,最低4G显存(不开启音频增强的情况下)

Mac 由于cuda原因目前只支持cpu进行推理。

整合包获取

👇🏻👇🏻👇🏻下方下方下方👇🏻👇🏻👇🏻

关注公众号,发送【ChatTTSV2】关键字获取整合包。

c9d252d6c546419798a870adf532fec3.png

如果发了关键词没回复你!记得看下复制的时候是不是把空格给粘贴进去了!

写在最后

还有很多朋友的建议,比如增加标点符号分割、克隆用户音色等,这些想法都很不错,我也会在后续的版本中进行更新。

最后非常感谢大家对这个项目的支持。如果您有更多的想法或建议,欢迎通过私信或在评论区留下你们的意见。

制作不易,如果本文对您有帮助,还请点个免费的赞或在看!感谢您的阅读!

这篇关于ChatTTS增强版V2,批量导出srt,语速控制,情感控制,支持朗读数字,问题修复的文章就介绍到这儿,希望我们推荐的文章对编程师们有所帮助!



http://www.chinasem.cn/article/1044418

相关文章

Spring Security 基于表达式的权限控制

前言 spring security 3.0已经可以使用spring el表达式来控制授权,允许在表达式中使用复杂的布尔逻辑来控制访问的权限。 常见的表达式 Spring Security可用表达式对象的基类是SecurityExpressionRoot。 表达式描述hasRole([role])用户拥有制定的角色时返回true (Spring security默认会带有ROLE_前缀),去

从去中心化到智能化:Web3如何与AI共同塑造数字生态

在数字时代的演进中,Web3和人工智能(AI)正成为塑造未来互联网的两大核心力量。Web3的去中心化理念与AI的智能化技术,正相互交织,共同推动数字生态的变革。本文将探讨Web3与AI的融合如何改变数字世界,并展望这一新兴组合如何重塑我们的在线体验。 Web3的去中心化愿景 Web3代表了互联网的第三代发展,它基于去中心化的区块链技术,旨在创建一个开放、透明且用户主导的数字生态。不同于传统

好题——hdu2522(小数问题:求1/n的第一个循环节)

好喜欢这题,第一次做小数问题,一开始真心没思路,然后参考了网上的一些资料。 知识点***********************************无限不循环小数即无理数,不能写作两整数之比*****************************(一开始没想到,小学没学好) 此题1/n肯定是一个有限循环小数,了解这些后就能做此题了。 按照除法的机制,用一个函数表示出来就可以了,代码如下

hdu1043(八数码问题,广搜 + hash(实现状态压缩) )

利用康拓展开将一个排列映射成一个自然数,然后就变成了普通的广搜题。 #include<iostream>#include<algorithm>#include<string>#include<stack>#include<queue>#include<map>#include<stdio.h>#include<stdlib.h>#include<ctype.h>#inclu

usaco 1.2 Name That Number(数字字母转化)

巧妙的利用code[b[0]-'A'] 将字符ABC...Z转换为数字 需要注意的是重新开一个数组 c [ ] 存储字符串 应人为的在末尾附上 ‘ \ 0 ’ 详见代码: /*ID: who jayLANG: C++TASK: namenum*/#include<stdio.h>#include<string.h>int main(){FILE *fin = fopen (

购买磨轮平衡机时应该注意什么问题和技巧

在购买磨轮平衡机时,您应该注意以下几个关键点: 平衡精度 平衡精度是衡量平衡机性能的核心指标,直接影响到不平衡量的检测与校准的准确性,从而决定磨轮的振动和噪声水平。高精度的平衡机能显著减少振动和噪声,提高磨削加工的精度。 转速范围 宽广的转速范围意味着平衡机能够处理更多种类的磨轮,适应不同的工作条件和规格要求。 振动监测能力 振动监测能力是评估平衡机性能的重要因素。通过传感器实时监

缓存雪崩问题

缓存雪崩是缓存中大量key失效后当高并发到来时导致大量请求到数据库,瞬间耗尽数据库资源,导致数据库无法使用。 解决方案: 1、使用锁进行控制 2、对同一类型信息的key设置不同的过期时间 3、缓存预热 1. 什么是缓存雪崩 缓存雪崩是指在短时间内,大量缓存数据同时失效,导致所有请求直接涌向数据库,瞬间增加数据库的负载压力,可能导致数据库性能下降甚至崩溃。这种情况往往发生在缓存中大量 k

6.1.数据结构-c/c++堆详解下篇(堆排序,TopK问题)

上篇:6.1.数据结构-c/c++模拟实现堆上篇(向下,上调整算法,建堆,增删数据)-CSDN博客 本章重点 1.使用堆来完成堆排序 2.使用堆解决TopK问题 目录 一.堆排序 1.1 思路 1.2 代码 1.3 简单测试 二.TopK问题 2.1 思路(求最小): 2.2 C语言代码(手写堆) 2.3 C++代码(使用优先级队列 priority_queue)

基于51单片机的自动转向修复系统的设计与实现

文章目录 前言资料获取设计介绍功能介绍设计清单具体实现截图参考文献设计获取 前言 💗博主介绍:✌全网粉丝10W+,CSDN特邀作者、博客专家、CSDN新星计划导师,一名热衷于单片机技术探索与分享的博主、专注于 精通51/STM32/MSP430/AVR等单片机设计 主要对象是咱们电子相关专业的大学生,希望您们都共创辉煌!✌💗 👇🏻 精彩专栏 推荐订阅👇🏻 单片机

【VUE】跨域问题的概念,以及解决方法。

目录 1.跨域概念 2.解决方法 2.1 配置网络请求代理 2.2 使用@CrossOrigin 注解 2.3 通过配置文件实现跨域 2.4 添加 CorsWebFilter 来解决跨域问题 1.跨域概念 跨域问题是由于浏览器实施了同源策略,该策略要求请求的域名、协议和端口必须与提供资源的服务相同。如果不相同,则需要服务器显式地允许这种跨域请求。一般在springbo