GPT-SoVITS:免费开源的语音克隆工具,几分钟训练出媲美真人的AI配音

Hello 大家好,欢迎来到AI探索与发现。今天跟大家分享一款最新的语音克隆工具——GPT-SoVITS。先来听两段用这个AI合成的配音效果:

十年生死两茫茫,不思量自难忘。纵使相逢应不识,尘满面鬓如霜。欢迎来到我的频道,来了就不许走,不看完不许走,不点赞也不准走。哈哈哈。

这个AI完全开源免费,在这个网址就能下载。本期视频详细介绍如何用它来训练模型并克隆声音,目前支持中英日三种语言。Win10/Win11系统可以直接下载整合包,解压即用,也可以手动安装。

GPT-SoVITS 语音克隆

一、整合包安装与启动

先把整合包down下来,把它移到我D盘AI目录里,然后解压。解压好以后进来,双击这个文件就一键运行。启动成功会自动打开网页界面。

如果你机器上整合包启动不了,或者训练模型时出错,可能是整合包跟你机器环境冲突了,可以尝试手动来安装(视频后半部分有手动安装的详细演示)。

二、声音素材处理:四个环节

接下来我用上期视频的一个录音来演示它的基本使用流程。第一个环节主要是对声音素材进行处理,包括伴奏音分离、声音切片和声音标注

人声和背景音乐分离

这里它自带了一个分离工具。因为我的视频里都是干声,没有背景音乐,这一步就跳过了,下一个例子再详细讲这个工具怎么用。

声音文件切片

就是把一个几分钟的声音文件切成10秒以内的多个片段。这一步有两个参数要设置:

  • 第一个是声音素材的存放目录,后面也可以加上声音的文件名

  • 第二个参数是指定切完以后的声音文件存放路径,建议这个默认路径后面加个子目录,程序会在这个路径下自动创建子目录

剩下的参数主要是配置如何切,比如最小切成几秒、没有声音的部分如何切掉等等,基本上不用修改,全部默认就好。

语音切割,处理完成。在设置的输出目录下就能看到切好的声音片段。

对声音进行识别

第三步是对声音进行识别,生成对应的文本内容。这里要配置的参数就是我们刚才保存声音片段的路径,复制粘贴过来,然后点击开启按钮处理。这个处理过程要慢一些,在命令窗口可以看到处理的详细进度。

处理完成,在这个文件夹下就多了一个后缀为list的文件。用编辑器可以打开它,就能看到每段音频对应的一条文本内容。

打标注

最后一步打标注。这里要输入标注文件的路径和名称,把这个路径复制过来,加上标注文件名即可,然后勾选这里。稍等几秒就会自动打开一个新网页。

这个页面按钮和操作比较多,但常用的就几个。主要是大概看一下哪些文字内容不对——改正错别字;哪些声音片段较短——就进行合并,选中要合并的片段点击合并按钮。太短的片段可以删除。标注好以后点击这个按钮保存,然后关闭标注网页,取消这里的勾选,可以释放占用的内存。

三、训练数据格式化

声音素材处理好以后进入第二个环节:训练数据格式化

只需要在这里给我们训练的模型起个名字,指定标注文件,然后是声音切片的路径。没有多块显卡的话,下面的参数全部默认。然后依次点击这三个按钮,或者直接点击最下面的一键三连按钮,就开始处理了。

处理过程可以切回命令窗口,看看有没有报错。如果全部处理成功,在这个目录下会生成3个文件夹和两个文件,并且这三个文件夹里面都会有内容。如果某个文件夹是空的,说明数据格式化就失败了,可以换个声音素材重新尝试。如果还不行的话,可能就是整合包跟本地环境有冲突,程序执行报错了。

四、模型微调(训练模型)

一键三连处理好以后,来进行第三个环节的微调,也就是训练模型

参数不熟悉的话全部可以默认。如果要调整,通常是修改一下训练批次的大小,然后是训练多少轮,15就差不多了。声音素材比较少推荐就用默认。

然后点击开启训练,这两个训练先后可以随意。训练完成再点击第2个训练按钮。全部训练好以后,我们可以在这两个目录下看到保存的模型。

五、克隆声音:生成语音

最后一个环节,用训练好的模型克隆声音

先点这里刷新模型。GPT模型这里点击下拉,会看到有多个,选数字最大的一个;第二个同样也选择步数最多的一个。选好以后勾选下面的方框,稍等几秒就会打开新的网页。

在这个页面上进行声音克隆操作:

  • 首先要给他一段提示语音,可以挑一个切好的声音片段

  • 然后这里要填上这段语音对应的文本(这一步很重要,不填会报错,可以直接到标注文件里复制)

  • 参考音频这里默认是中文不用改

  • 这里就是输入生成语音的文字

我先随便复制一段,然后点击合成。处理完成,来听一下效果:

作者不对软件具备任何控制力,使用软件者、传播软件导出的声音者,自负全责。

再来一个绕口令试试:

800标兵奔北坡,炮兵并排北边跑,炮兵怕把标兵碰,标兵怕碰炮兵炮。

如果文本太长,可以用下面的工具切分。先把内容粘贴到这里,三种切分任选一种,一般就按句子切分。复制切好的内容粘贴过来,来试下长文本的效果:

播音和配音是两个方面,他们的不同体现在很多细微之处。但是通过两者的相互融合,经过一定程度配音锻炼的播音员,在播音时驾驭语言的能力更强了,并且能够自如的突破一些界限,去尝试创造更鲜明的东西。另一方面,播音时所掌握的语言基础、技巧以及对话筒的使用能力,也使得我们在配音时,不致因语速快音量大而混沌一片,不至于因为语义复杂而表述不清不准。播音训练出来的基本功,使声音更加持久耐用。

个人感觉几分钟的声音就能训练出这样的效果,已经非常不错了。

GPT-SoVITS 语言克隆训练视频教程

六、跨语言效果测试

再来试试跨语言的生成效果如何:

hello everyone,welcome to my channel,thank you for subscribing and supporting me.

Minasan Konichiwa,Watashino Chandlerwayo Kosu

和中文语音相比感觉差了一点,可能是我训练的素材是中文朗读。

七、用影视剧配音训练

下面来尝试下直接用影视剧里的配音来训练会是什么效果。比如这段西游记女儿国里的配音,先用剪映把视频稍作处理,把唐僧的配音片段全部删掉。处理好以后导出,去掉视频,只导出音频文件。

人声和背景音乐分离

第一步,我们要进入人声和背景音乐分离,勾选这个分离工具,稍等几秒就会打开新的页面。点击这里选择我们刚才导出的音频。先去除背景音,模型这里选第一个,下面输出路径都用默认,再选择WAV格式,点击转换。这个过程要几分钟到十几分钟不等,看声音素材的时长。

转换完成,在这个目录下就会生成两个文件,一个是背景音,另一个是人声文件。

接下来是去除混响和延时,这两步比较耗时,这里就快速跳过了。推荐去混响用第四个模型,去延时选第5个。到输出目录里复制最终的这个声音文件,放到声音素材目录里,再把名字改短一点。

后面的环节和步骤跟前面的演示就一样了:声音切片、打标注——建议打标注这里大家还是花点时间,确保文字内容没有错别字——然后是一键三连、模型训练,过程就跳过了。

影视配音效果测试

直接来最后测试模型效果,先来听一下这段经典台词生成的语音:

曾经有一份真诚的爱情放在我面前,我没有珍惜,当我失去的时候,我才后悔莫及,人世间最痛苦的事莫过于此。如果上天能够给我一个再来一次的机会,我会对玉帝哥哥说我爱你。如果非要在这份爱上加上一个期限,我希望是1万年。

八、个人使用评价

从刚才两个模型训练过程来看,个人觉得这个AI:

一是容易上手,对初学者友好。 二是虽然用到的所有技术不是最新的,但它开创性地加入了GPT模型的机制,并以参考语音作为提示,非常好的解决了语音克隆的声音泄露问题,生成的语音无论在音质还是真实度上,综合表现都非常不错。

这个AI也支持提示语音直接克隆,就是不需要训练模型,只要在这里选择两个基础模型就可以。不过我测试下来效果并不好,它在零样本上的合成效果没有我之前介绍过的VOEX强,感兴趣的可以去试一试。

不过瑕不掩瑜,在开源免费的语音克隆AI中,GPT-SoVITS目前确实是表现最好的。

最后这个例子是只用了20秒的电影配音训练的模型,来听听效果——娱乐一下:

哪里贵了?哪里贵了?说贵你们好好想想,这么多年有没有努力?工资涨没涨?

九、手动安装教程

最后来演示下这个AI的手动安装。如果下载的整合包使用不了,可以尝试这个方法。目前只在Win10英伟达显卡下做了测试,是可行的。

依赖软件

用到的依赖软件和版本分别是:

  • Python 3.10.6

  • Ffmpeg 6.0

  • CUDA 11.8

以上这些软件在FaceFusion那一期视频里有详细的下载安装演示,今天就不具体操作安装过程了。

安装步骤

以上依赖软件安装好以后,到我们要安装GPT-SoVITS的目录下,比如我准备下载安装到AI Tools目录,地址栏输入CMD,打开命令窗口。

  1. 先复制克隆指令,粘贴过来执行

  2. 然后复制切换目录指令,过来执行

  3. 复制创建虚拟环境的指令,粘贴过来执行

  4. 再复制激活虚拟环境

接下来先要执行安装显卡加速依赖包的指令,最后再执行安装程序依赖包的指令。到这里GPT-SoVITS程序就安装好了。

下载模型

接下来手动下载需要用到的模型。这个页面有全部的模型下载链接,以及下载后需要存放目录的说明。更简单的方法是直接从整合包里复制

现在屏幕左侧窗口是用整合包解压出来的目录,右侧是刚才手动下载安装的GPT-SoVITS:

  1. 先到整合包这个目录下,右侧窗口也进入对应的目录,复制整合包里的内容粘贴过来

  2. 然后是整合包里进入Tools目录,复制这个权重目录到右边窗口粘贴过来

  3. 最后是Models目录下的所有内容,右边窗口进入对应目录粘贴过来

创建运行脚本

这样手动安装就全部完成了。我们再来创建一个运行脚本:把这个文件复制一份,然后改名为run,鼠标右键选编辑,用这段指令替换原来的,然后保存。

现在双击run就能一键运行了。

十、完整卸载清理

如果手动安装失败,想彻底清除:

  1. 首先删除整个GPT-SoVITS目录

  2. 然后删除相应的依赖软件

    • 打开应用和功能,搜索Python然后点击卸载

    • 再依次搜索git卸载

    • CUDA不建议卸载了,也许玩游戏还能用上

  3. 最后是删除缓存到C盘

    • 进入用户→再进入你机器名目录

    • 找到AppData这个文件夹(如果看不到,点击查看,把“隐藏的项目”勾选上就能找到了)

    • 双击进入,再依次进入Local,在下面找到pip,进来以后就能看到名为cache的文件夹

    • 这里面存放的是所有依赖包的缓存文件,删除这个文件夹,缓存就彻底清除了

发表回复

您的邮箱地址不会被公开。 必填项已用 * 标注

本站所有资源版权均属于原作者所有,这里所提供资源均只能用于参考学习用,请勿直接商用。若由于商用引起版权纠纷,一切责任均由使用者承担。更多说明请参考 VIP介绍。

最常见的情况是下载不完整: 可对比下载完压缩包的与网盘上的容量,若小于网盘提示的容量则是这个原因。这是浏览器下载的bug,建议用百度网盘软件或迅雷下载。 若排除这种情况,可在对应资源底部留言,或联络我们。

对于会员专享、整站源码、程序插件、网站模板、网页模版等类型的素材,文章内用于介绍的图片通常并不包含在对应可供下载素材包内。这些相关商业图片需另外购买,且本站不负责(也没有办法)找到出处。 同样地一些字体文件也是这种情况,但部分素材会在素材包内有一份字体下载链接清单。

如果您已经成功付款但是网站没有弹出成功提示,请联系站长提供付款信息为您处理

源码素材属于虚拟商品,具有可复制性,可传播性,一旦授予,不接受任何形式的退款、换货要求。请您在购买获取之前确认好 是您所需要的资源