IndexTTS 2.5开源!附本地部署一键整合包下载
Index TTS 2.5开源文本转语音模型正式发布,这是继Index TTS 1.0和2.0之后最受期待的版本升级。相比前代,2.5版本在音质、生成速度和情感控制方面均有显著提升,作者还特别做了语速适配优化。本文提供了完整的整合包使用指南,演示了跨语种语音克隆(中文→中文、中文→英文)、情感权重调节(0.65→1梯度控制)、八维情感向量(愤怒、厌恶、害怕等)组合调节,以及语速控制等核心功能。实测表明,即便将所有情感向量拉满并将语速调至极慢,声音依然保持自然不走样,解决了2.0版本在高情感权重下声音失真的痛点。整合包解压即用,路径不含中文即可,所有依赖已预装。明天将推出Running Hub工作流集成教程,敬请期待。

一、开篇:过年了!Index TTS 2.5正式开源
哎呦喂!Index TTS 2.5开源了,这哈真过年了。提八那瓜娃子内测就在测试了,效果绝了,终于发正式版了,饭都没吃,就先给你们做整合包了,刷起刷起。这下真的是过节了。
视频刚刚发布了MiniMax H3,热度还没有下去。音频的项目Index TTS 2.5又发布了,那我内测也测试了,效果非常不错,还给大家做了整合包。大家好,我是提八。那如果说哪个音频项目最受期待的话,那肯定是Index TTS 2.5。从1到2啊,一直是我们最常用的一个项目之一。那目前呢,终于来到2.5的版本,而且呢,跟我们在内测时候测试不一样。作者在最近又做了语速的适配,所以说效果呢,比我们内测时候效果更加好。
那我在之前呢,已经给大家把这个整合包做好了。我先给大家看一下,因为我还在做这个节点。我问了一下Smart他们,最近都比较忙,那我就先给大家做节点。所以说今天呢,主要是给大家做整合包,我们来先来体验一下。明天呢,给大家详细的测试这个项目,包括它搭配我们现在的海螺MiniMax H3,看看它的效果。
二、整合包使用指南:解压即用,路径不能有中文
首先下载整合包以后呢,我们这边解压,解压以后呢,这里有个exe,我们把它双击打开。注意啊,路径千万不能有中文。然后呢,这里呢,我们可以选择一下我们的模型目录,因为我这边已经有了啊。模型的目录同样的,不要包含中文。
然后呢,这边呢会自动的给大家进行启动,里面所有的依赖Python啊,所有的东西都给大家装好了,全部都是自动的。启动以后呢,就是这样一个生成的界面。目前呢,它是支持主要的几个语言啊,特别效果好的,包括像中文、英文、日文啊,以及西班牙文等等。

三、跨语种语音克隆测试:中文、英文效果惊艳
那在这里呢,我们上传一个参考的音频,我们写一下目标的文本。那这个参考音频呢,也就是我们常听的,就是视频开头的音频,我们听一下:“哎呦喂,Index TTS 2.5开源了。”啊,在这里呢,它会自动的根据我们的跨语种的这样一个迁移。
比如说,我们先尝试下中文。好,我们这边中文、英文都是有的。我们来尝试下啊,先是最简单的,也就是我们的目标语言中文。然后呢,我们这边生成音色,针对等于就是语音的克隆。我们来点一下,速度还是非常快的。而且呢,这次架构也做了升级,所以说无论是音质质量啊,还是生成速度,都是有不错的提高。
我们来听一下:“你好呀,今天Index TTS 2.5开源了,你们快来玩,免费下载整合包。”可以看到从四川话变成这个普通话,但是你可以感觉真正这个说话的感情,或者说他语调中的这种感觉,基本上是完全包含着的。
那我们再来尝试一下,让它改成英文。下面我们把我们的目标语言改成英文,我们再来听一下:“Hello. Today, Index TTS 2.5 has been open sourced. Come and play, and download the integrated package for free.”可以看到,直接跨语种的迁移,无论是音色、感觉啊,整体的说话的节奏都非常的相似啊,整体的效果非常的棒。
四、情感控制测试:情感权重调节,声音不走样
那我们下面来看一下情感音频的参考。好,现在呢,我上传一个有点生气的音频,我们来听一下:“晚上我把望远镜带过来,我倒要看看到底是谁没眼光。”好,我们来看看生成的结果:“提八,你个瓜娃子,又趁我不在干什么坏事了?这是谁的袜子?你说。”
啊,现在呢是0.65的权重。如果你觉得它不够生气,我们把它拉到1,看一下。我们在2.0的时候,一旦情感的权重太高的情况下,这声音立刻就变掉了。我们来看看它最后的效果。生成完成,我们来听一下:“提八,你个瓜娃子,又趁我不在干什么坏事了?这是谁的袜子?你说。”可以看到,明显情感变强烈了。用我们参考的音频,它不算特别生气那种。但是呢,非常好的一点就是我们把情感权重拉到1以后,声音基本上没有走样,比2.0好太多了。

五、八维情感向量与语速控制:灵活调节,效果稳定
下面呢,我们来看一下八维情感向量。这里呢,我们可以去控制它,比如说啊,这里害怕啊、厌恶啊、低落,都给它加一点。好,然后呢,我们再加一点点愤怒。啊,同样的提示词,我们再来尝试一下,看看它最后的效果是什么样的。生成完成,我们来听一下:“提八,你个瓜娃子,又趁我不在干什么坏事了?这是谁的袜子?你说。”可以看到,我们现在加了非常多的情感向量,但是呢,声音还是没有变啊。所以说这次的效果基本上把2.0的时候的一些问题全部解决了,那肯定是目前最强的TTS无疑了。
然后同时呢,我们这边可以支持语速的控制,比如说你希望快一点或者慢一点都是可以的。那我们现在啊,把它调的让它语速更加慢一点,更加生气一点。我们把这个厌恶啊以及生气都把它拉高一点。看到现在有非常多的权重都是满的,再看看声音会不会走样。生成完成了,我们再听一下:“提八,你个瓜娃子,又趁我不在干什么坏事了?这是谁的袜子?你说。”没看到,声音还是比较自然。哪怕我们把它拉那么长,哪怕各种情感向量都给它加上去以后,依然效果是非常不错的,声音也没有走样。所以说啊,这次效果真的是非常的好。
六、情感描述文本测试:理解能力有待提升
那我们再看一下情感描述文本,我们尝试啊用这个描述一下,看他的一个理解能力。“提八,你个瓜娃子,又趁我不在干什么坏事了?这是谁的袜子?你说。”呃,可以看到他基本上有一定的理解,但是确实没有表达非常到位,就不像我们之前LTX 2.3啊,那个效果那么好。它没有这个情绪逐渐激动,但是呢,它是能理解到你要表达什么东西的。就是比如说情绪是激动的啊,崩溃大吼。所以说你没有办法去把它当一个LM去使用。但是如果是简单的,就是说情绪的激动啊,我们可以通过文字去表达啊,这是没有问题的。
七、后续计划与提醒
那今天呢,主要给大家发这个整合包啊,我已经把节点给大家做好了。那刚才呢,我把节点发给石子鱼他们了。明天呢,正式给大家测试它的一些详细的能力,包括一些刚才没有提到的一些功能。今天呢,主要给大家发整合包,我们就直接可以玩了。明天我们可以上Running Hub,包括把它连接到我们的工作流里。同时呢,可以接到我们的MiniMax H3,那才是真正的王炸。
那今天的分享就到这里了。我们在简介区以及评论区下载整合包,谢谢大家,记得给提八点个赞。
最后,郑重提醒大家:虽然AI必须学习,但是绝对不可用于生成违法违规的内容哦。网络不是法外之地,请自觉遵守。



