GPT-SoVITS:免费开源的语音克隆工具,几分钟训练出媲美真人的AI配音
Hello 大家好,欢迎来到AI探索与发现。今天跟大家分享一款最新的语音克隆工具——GPT-SoVITS。先来听两段用这个AI合成的配音效果:
十年生死两茫茫,不思量自难忘。纵使相逢应不识,尘满面鬓如霜。欢迎来到我的频道,来了就不许走,不看完不许走,不点赞也不准走。哈哈哈。
这个AI完全开源免费,在这个网址就能下载。本期视频详细介绍如何用它来训练模型并克隆声音,目前支持中英日三种语言。Win10/Win11系统可以直接下载整合包,解压即用,也可以手动安装。

一、整合包安装与启动
先把整合包down下来,把它移到我D盘AI目录里,然后解压。解压好以后进来,双击这个文件就一键运行。启动成功会自动打开网页界面。
如果你机器上整合包启动不了,或者训练模型时出错,可能是整合包跟你机器环境冲突了,可以尝试手动来安装(视频后半部分有手动安装的详细演示)。
二、声音素材处理:四个环节
接下来我用上期视频的一个录音来演示它的基本使用流程。第一个环节主要是对声音素材进行处理,包括伴奏音分离、声音切片和声音标注。
人声和背景音乐分离
这里它自带了一个分离工具。因为我的视频里都是干声,没有背景音乐,这一步就跳过了,下一个例子再详细讲这个工具怎么用。
声音文件切片
就是把一个几分钟的声音文件切成10秒以内的多个片段。这一步有两个参数要设置:
-
第一个是声音素材的存放目录,后面也可以加上声音的文件名
-
第二个参数是指定切完以后的声音文件存放路径,建议这个默认路径后面加个子目录,程序会在这个路径下自动创建子目录
剩下的参数主要是配置如何切,比如最小切成几秒、没有声音的部分如何切掉等等,基本上不用修改,全部默认就好。
点语音切割,处理完成。在设置的输出目录下就能看到切好的声音片段。
对声音进行识别
第三步是对声音进行识别,生成对应的文本内容。这里要配置的参数就是我们刚才保存声音片段的路径,复制粘贴过来,然后点击开启按钮处理。这个处理过程要慢一些,在命令窗口可以看到处理的详细进度。
处理完成,在这个文件夹下就多了一个后缀为list的文件。用编辑器可以打开它,就能看到每段音频对应的一条文本内容。
打标注
最后一步打标注。这里要输入标注文件的路径和名称,把这个路径复制过来,加上标注文件名即可,然后勾选这里。稍等几秒就会自动打开一个新网页。
这个页面按钮和操作比较多,但常用的就几个。主要是大概看一下哪些文字内容不对——改正错别字;哪些声音片段较短——就进行合并,选中要合并的片段点击合并按钮。太短的片段可以删除。标注好以后点击这个按钮保存,然后关闭标注网页,取消这里的勾选,可以释放占用的内存。
三、训练数据格式化
声音素材处理好以后进入第二个环节:训练数据格式化。
只需要在这里给我们训练的模型起个名字,指定标注文件,然后是声音切片的路径。没有多块显卡的话,下面的参数全部默认。然后依次点击这三个按钮,或者直接点击最下面的一键三连按钮,就开始处理了。
处理过程可以切回命令窗口,看看有没有报错。如果全部处理成功,在这个目录下会生成3个文件夹和两个文件,并且这三个文件夹里面都会有内容。如果某个文件夹是空的,说明数据格式化就失败了,可以换个声音素材重新尝试。如果还不行的话,可能就是整合包跟本地环境有冲突,程序执行报错了。
四、模型微调(训练模型)
一键三连处理好以后,来进行第三个环节的微调,也就是训练模型。
参数不熟悉的话全部可以默认。如果要调整,通常是修改一下训练批次的大小,然后是训练多少轮,15就差不多了。声音素材比较少推荐就用默认。
然后点击开启训练,这两个训练先后可以随意。训练完成再点击第2个训练按钮。全部训练好以后,我们可以在这两个目录下看到保存的模型。
五、克隆声音:生成语音
最后一个环节,用训练好的模型克隆声音。
先点这里刷新模型。GPT模型这里点击下拉,会看到有多个,选数字最大的一个;第二个同样也选择步数最多的一个。选好以后勾选下面的方框,稍等几秒就会打开新的网页。
在这个页面上进行声音克隆操作:
-
首先要给他一段提示语音,可以挑一个切好的声音片段
-
然后这里要填上这段语音对应的文本(这一步很重要,不填会报错,可以直接到标注文件里复制)
-
参考音频这里默认是中文不用改
-
这里就是输入生成语音的文字
我先随便复制一段,然后点击合成。处理完成,来听一下效果:
作者不对软件具备任何控制力,使用软件者、传播软件导出的声音者,自负全责。
再来一个绕口令试试:
800标兵奔北坡,炮兵并排北边跑,炮兵怕把标兵碰,标兵怕碰炮兵炮。
如果文本太长,可以用下面的工具切分。先把内容粘贴到这里,三种切分任选一种,一般就按句子切分。复制切好的内容粘贴过来,来试下长文本的效果:
播音和配音是两个方面,他们的不同体现在很多细微之处。但是通过两者的相互融合,经过一定程度配音锻炼的播音员,在播音时驾驭语言的能力更强了,并且能够自如的突破一些界限,去尝试创造更鲜明的东西。另一方面,播音时所掌握的语言基础、技巧以及对话筒的使用能力,也使得我们在配音时,不致因语速快音量大而混沌一片,不至于因为语义复杂而表述不清不准。播音训练出来的基本功,使声音更加持久耐用。
个人感觉几分钟的声音就能训练出这样的效果,已经非常不错了。

六、跨语言效果测试
再来试试跨语言的生成效果如何:
hello everyone,welcome to my channel,thank you for subscribing and supporting me.
Minasan Konichiwa,Watashino Chandlerwayo Kosu
和中文语音相比感觉差了一点,可能是我训练的素材是中文朗读。
七、用影视剧配音训练
下面来尝试下直接用影视剧里的配音来训练会是什么效果。比如这段西游记女儿国里的配音,先用剪映把视频稍作处理,把唐僧的配音片段全部删掉。处理好以后导出,去掉视频,只导出音频文件。
人声和背景音乐分离
第一步,我们要进入人声和背景音乐分离,勾选这个分离工具,稍等几秒就会打开新的页面。点击这里选择我们刚才导出的音频。先去除背景音,模型这里选第一个,下面输出路径都用默认,再选择WAV格式,点击转换。这个过程要几分钟到十几分钟不等,看声音素材的时长。
转换完成,在这个目录下就会生成两个文件,一个是背景音,另一个是人声文件。
接下来是去除混响和延时,这两步比较耗时,这里就快速跳过了。推荐去混响用第四个模型,去延时选第5个。到输出目录里复制最终的这个声音文件,放到声音素材目录里,再把名字改短一点。
后面的环节和步骤跟前面的演示就一样了:声音切片、打标注——建议打标注这里大家还是花点时间,确保文字内容没有错别字——然后是一键三连、模型训练,过程就跳过了。
影视配音效果测试
直接来最后测试模型效果,先来听一下这段经典台词生成的语音:
曾经有一份真诚的爱情放在我面前,我没有珍惜,当我失去的时候,我才后悔莫及,人世间最痛苦的事莫过于此。如果上天能够给我一个再来一次的机会,我会对玉帝哥哥说我爱你。如果非要在这份爱上加上一个期限,我希望是1万年。
八、个人使用评价
从刚才两个模型训练过程来看,个人觉得这个AI:
一是容易上手,对初学者友好。 二是虽然用到的所有技术不是最新的,但它开创性地加入了GPT模型的机制,并以参考语音作为提示,非常好的解决了语音克隆的声音泄露问题,生成的语音无论在音质还是真实度上,综合表现都非常不错。
这个AI也支持提示语音直接克隆,就是不需要训练模型,只要在这里选择两个基础模型就可以。不过我测试下来效果并不好,它在零样本上的合成效果没有我之前介绍过的VOEX强,感兴趣的可以去试一试。
不过瑕不掩瑜,在开源免费的语音克隆AI中,GPT-SoVITS目前确实是表现最好的。
最后这个例子是只用了20秒的电影配音训练的模型,来听听效果——娱乐一下:
哪里贵了?哪里贵了?说贵你们好好想想,这么多年有没有努力?工资涨没涨?
九、手动安装教程
最后来演示下这个AI的手动安装。如果下载的整合包使用不了,可以尝试这个方法。目前只在Win10英伟达显卡下做了测试,是可行的。
依赖软件
用到的依赖软件和版本分别是:
-
Python 3.10.6
-
Ffmpeg 6.0
-
CUDA 11.8
以上这些软件在FaceFusion那一期视频里有详细的下载安装演示,今天就不具体操作安装过程了。
安装步骤
以上依赖软件安装好以后,到我们要安装GPT-SoVITS的目录下,比如我准备下载安装到AI Tools目录,地址栏输入CMD,打开命令窗口。
-
先复制克隆指令,粘贴过来执行
-
然后复制切换目录指令,过来执行
-
复制创建虚拟环境的指令,粘贴过来执行
-
再复制激活虚拟环境
接下来先要执行安装显卡加速依赖包的指令,最后再执行安装程序依赖包的指令。到这里GPT-SoVITS程序就安装好了。
下载模型
接下来手动下载需要用到的模型。这个页面有全部的模型下载链接,以及下载后需要存放目录的说明。更简单的方法是直接从整合包里复制。
现在屏幕左侧窗口是用整合包解压出来的目录,右侧是刚才手动下载安装的GPT-SoVITS:
-
先到整合包这个目录下,右侧窗口也进入对应的目录,复制整合包里的内容粘贴过来
-
然后是整合包里进入Tools目录,复制这个权重目录到右边窗口粘贴过来
-
最后是Models目录下的所有内容,右边窗口进入对应目录粘贴过来
创建运行脚本
这样手动安装就全部完成了。我们再来创建一个运行脚本:把这个文件复制一份,然后改名为run,鼠标右键选编辑,用这段指令替换原来的,然后保存。
现在双击run就能一键运行了。
十、完整卸载清理
如果手动安装失败,想彻底清除:
-
首先删除整个GPT-SoVITS目录
-
然后删除相应的依赖软件:
-
打开应用和功能,搜索Python然后点击卸载
-
再依次搜索git卸载
-
CUDA不建议卸载了,也许玩游戏还能用上
-
-
最后是删除缓存到C盘:
-
进入用户→再进入你机器名目录
-
找到AppData这个文件夹(如果看不到,点击查看,把“隐藏的项目”勾选上就能找到了)
-
双击进入,再依次进入Local,在下面找到pip,进来以后就能看到名为cache的文件夹
-
这里面存放的是所有依赖包的缓存文件,删除这个文件夹,缓存就彻底清除了
-



