Audio CPP:让本地语音模型变成一套系统,8G显存就能跑

Audio CPP是一个让本地语音模型从“一地鸡毛”变成“一套系统”的开源工具,相当于语音领域的LLAMA CPP。它把TTS、ASR、音乐生成、声音转换等21个模型家族统一到同一套运行方式中,解决了过去每个语音模型都需要独立环境的痛点。本文全面演示了:一句话声音克隆(秒级生成)、1万字小说合成(29分钟 vs 官方110分钟,速度提升近4倍)、本地实时语音交互系统(1秒延迟,数据不出本机)、换词翻唱(ACE Step,8G显存可跑)、方言生成(VOX CPM2)和声音设计(基于文字描述生成声音)等核心功能。

Audio.CPP-整合包下载

整篇文章以一台8G显存的RTX 4060笔记本为演示设备,所有功能均离线运行,无需联网,无需云服务,是本地AI语音应用的一次完整落地展示。这一整套服务,全都跑在这台8G显存的笔记本上。不用云端语音平台,不需要联网语音服务。这个工具叫 Audio CPP。你可以把它理解成音乐领域的LLAMA CPP。它想解决的不是某一个语音功能,而是把本地音频模型统一到同一套运行方式里。


一、为什么需要Audio CPP?

以前我们想在本地部署语音模型,经常是一个模型一套环境。我自己这台机器上就装过声音克隆、长文本合成、AI翻唱、实时语音——好几套环境,每一套都有不同的Python版本、不同的CUDA依赖。最后不是模型跑不动,是环境先把人劝退了。

Audio CPP解决的就是这个问题。

它把TTS、ASR、音乐生成、声音转换都接进同一个后台,通过界面可以随时切换模型。就像你用Ollama在本地跑大语言模型一样,Audio CPP能让你更简单地在本机跑各种语音模型。

我这次演示的大部分核心功能,8G显存就能跑起来。有些小模型甚至不需要显卡,用CPU也能运行。它现在已经接入的模型家族有21个,可以直接下载使用,还有一批在测试当中。


二、统一底座带来的效率提升

统一底座带来的另一个直接好处是:运行效率更高

这是官方在RTX 5090上的速度对比,大部分模型在Audio CPP下运行,比他们用自己的推理框架快了1-3倍,有的甚至快了8-10倍。

我也在本地用RTX 4060做了测试。拿微软开源的WebVoice对比:

  • 用官方自己的程序合成1万字的小说朗读,耗时110分钟

  • 同样的文本拿到Audio CPP下合成,仅用了29分钟

只有原来的四分之一。


三、TTS文本转语音:声音克隆与方言生成

除了速度,这期还有我最想让你看的——他把一堆分散的语音能力,变成了一套本地系统。前面那个实时语音系统,等会我会完整演示。后面还有一个更好玩的音乐生成能力——歌曲旋律不变,直接换词翻唱。最后过一遍声音转换设计等扩展功能,以及整合包的下载和使用。

先看TTS,也就是文本转语音。

这里列的模型,整合包里自带了Pocket TTS千问3 TTS 0.6B,它们都支持参考音频,也就意味着可以做声音克隆。

基本用法非常简单:

  1. 选择模型

  2. 点击加载

  3. 加载完会有提示

  4. 选一段参考音频

  5. 输入合成文本

  6. 点击生成

这种一句话的声音克隆,基本上是秒生成:

OpenAI launched GPT-4o, a full-duplex voice system for ChatGPT.

不过要注意,Pocket TTS不支持中文。要生成中文语音,可以换成千问3 TTS 0.6B,它的参数虽然不大,但合成效果相当不错:

全双工语音系统,支持实时打断、联网搜索和视觉理解。

这两款模型显存占用都很小,非常适合低配显卡以及没有独显的机器。

刚上手,合成设置里的参数都可以不用管,保持默认。先把模型跑起来,听一下基础效果,熟悉之后再去调温度、采样这些参数。

两款特色模型

列表里还有两个模型比较有特点:

一个是VOX CPM2。它好玩的地方是能生成方言。给一段方言参考音频:

我哋每个人都喺度做紧小丑。

就可以合成相应的方言语音:

错咗你又唔认,认咗你又唔改。

它支持国内大部分方言,还能克隆语气。想深入了解这个模型的能力,可以翻一下我之前专门做的VOX CPM那期视频。

另一个有特点的是VibeVoice,就是开头速度对比的那个模型。那段近1万字的小说,合成期间显存占用没超过7G。生成出来的音频我全程听了一遍,没有明显的漏读和错读:

忽然山腰里传来群马奔驰之声,蹄声越来越响,不久四面黄布大旗从山崖边升起……

这里有个注意点:不管你用哪款模型,参考音频都不要太长,建议控制在10秒以内,否则会明显拖慢合成速度。

另外还有个小技巧:如果有些参考音频你经常用,可以把它们放到WebUI下的voice目录里,然后把文件名和对应的文本写到这个文件里,刷新列表就可以直接选了。

临时上传的参考音频,下面对应的文本也不用手动输入——可以先到ASR标签里,把音频内容转写出来。


四、ASR语音转文字

这就引出了Audio CPP的第二个核心能力:ASR语音转文字

我个人常用的模型是千问3 ASR。等会要演示的实时语音,我的声音转文本用的就是它,中英文都支持,速度也很快。

这段音频2分多钟,转录只用了21秒。

如果转录的是多人对话,要勾选对话模式,转出来的就是这种带说话人序列的文本。不过对话模式有长度限制,目前更适合较短的对话片段。单人语音转写没有长度限制,歌词也能识别——等下做AI翻唱要拉原曲歌词,就可以先到这里做一遍初步识别,再手动校对。


Audio.CPP-语音模型基座

五、本地实时语音系统

有了TTS和ASR,现在我们可以把它们拼起来用了。

这是我认为Audio CPP最有价值的地方:本地实时语音系统

我正在测试一个实时语音系统……

好的,我正在实时语音系统里和你对话。如果你想测试它的稳定性、延迟或其他功能,请随时提问或下达指令。

它的语音识别和合成都是跑在本地的。

明白了,本地运行意味着响应速度更快,同时数据也更安全,这是一个很注重隐私和效率的设计思路。

这是大语言模型在云端,你觉得这个架构是否合理?

这个架构是合理的。

从我说完话到它开始回答,中间大概1秒。如果是英文对话,这个延时会更低:

What can you do for me?

I can answer questions, summarize information…

整个流程就是:麦克风输入 → ASR转文本 → 大语言模型生成回答 → TTS朗读出来。这就是一个本地语音交互系统的基本形态。

设置里大语言模型这一步是“活的”——本地化的是语音这一层。你可以接本地Ollama跑的语言模型,也可以接自己订阅的API。Audio CPP负责的是音频这一层:听和说。

所以我说:它不是一个声音克隆玩具,而是消费级显卡上的本地AI语音底座。

而且它用的是OpenAI兼容接口。你本地的其他应用,只要支持这种接口形式,就能直接调用服务——就像设置里这样写TTS的地址、模型名称,ASR的地址、模型名称,朗读的声音也可以自定义。

比如我在这个OpenMagic AI应用里,直接调用Audio CPP的TTS服务,填写URL和模型名称。由于这个应用没法填参考音频,所以我后台单独起一个Audio CPP服务,启动时带上参考音频。回到OpenMagic测试:

你好,这是一段测试语音。

能正确返回语音,这样就接好了。这就是一个完全免费的本地TTS服务。

如果你在做本地Agent,或者想给自己的应用加上语音输入输出,Audio CPP提供的接口就非常有用。


六、音乐生成与换词翻唱

接下来我们看音乐生成。这部分也是我觉得Audio CPP很强的地方。它不只是把TTS和ASR放到一起,连音乐生成、换词翻唱这些原本比较重的模型,也开始接进同一个底座里。

这个ACE Step我之前介绍过。当时我在本地8G显存上跑不动翻唱,最后是在云端上演示的。现在用Audio CPP,本地就能跑起来:

这瓜保熟吗?

你是故意找茬?我开水果摊的,能卖你生瓜?

翻唱可以按下面步骤操作:

  1. 先上传要翻唱的歌曲

  2. 然后点分析——这个过程要等几十秒到几分钟,具体看歌曲长度

  3. 分析完成后,合成翻唱的时长改成-1

  4. 点开高级参数,操作类型选Remix

  5. 歌曲风格、曲谱信息分析完以后会自动填好,不用动

  6. 你只需要填上原曲歌词

  7. 提示词直接复制上面的原曲描述

  8. 最后填上你的翻唱歌词

可以看一下显存占用——虽然看上去超过8G,但不会爆显存,最后能顺利跑完。

换词翻唱的随机性比较大,需要多试几次:

  • 如果音质不好,可以适当增加生成步数

  • 要是新词唱不准或者唱不出来,可以调 Flow Edit 参数,从0.7到0.9去尝试

如果你只想生成背景音乐,我推荐用Stable Audio,比ACE Step更稳。


七、声音转换与音频分析

声音转换相当于音色迁移——保持说话内容不变、语气不变,只把音色换掉:

马匪,任何时候都要剿,不剿不行。

马匪,任何时候都要剿,不剿不行。

歌声转换也是类似逻辑。但我实测,如果你追求最终质量,我更推荐之前那套RVC流程。做歌声转换之前,最好先做人声分离——音频分离标签下就有相应的模型。

再往下是音频分析这一组,它们都是工具类模型:

  • 实时语音检测

  • 多人对话识别

最后一个是声音设计。这个挺有意思——它其实类似声音克隆,只是不需要参考音频。你直接用文字描述一个声音,比如“磁性的中年男声,语速偏慢,播音腔”,模型就会按描述生成:

八千里路云和月,白了少年头,空悲切。

这个功能做临时配音比较好用。


八、整合包与开源

最后说一下整合包。

Audio CPP本身是个C++项目,官方目前主要靠命令行来使用。对有经验的朋友来说问题不大,但对没技术基础的,这一步确实比较劝退。所以我做了带界面的整合包,解压就能用。

支持16至50系列的N卡。目前A卡以及没有独显的机器会自动走CPU模式,速度会慢一些,但跑几个轻量模型没问题。

整合包里:

  • run Web UI 是启动网页界面,想用哪个模型,界面里就能直接下载

  • 想体验实时语音,先在Web UI里加载模型,再启动ASR服务,最后运行 run real time

  • 配置里把接入的大模型改一下——如果你也用DeepSeek,API Key换成自己的就可以了

这一整套源代码我已经开源了,这是GitHub地址。

使用中如果遇到问题,或者希望增加功能,可以在评论区告诉我。我会收集整理,定期更新版本。


九、总结

总结一下,Audio CPP最大的意义,不是又多了一个声音克隆工具,而是本地语音模型开始变成一套统一的系统

  • 大语言模型有LLAMA CPP

  • 图片视频生成有ComfyUI

  • 语音模型现在也开始有了自己的本地运行中心

对于普通用户来说,使用门槛更低了。对开发者来说,本地语音服务接入更容易了。这也是我这期最想讲清楚的地方。

发表回复

您的邮箱地址不会被公开。 必填项已用 * 标注

本站所有资源版权均属于原作者所有,这里所提供资源均只能用于参考学习用,请勿直接商用。若由于商用引起版权纠纷,一切责任均由使用者承担。更多说明请参考 VIP介绍。

最常见的情况是下载不完整: 可对比下载完压缩包的与网盘上的容量,若小于网盘提示的容量则是这个原因。这是浏览器下载的bug,建议用百度网盘软件或迅雷下载。 若排除这种情况,可在对应资源底部留言,或联络我们。

对于会员专享、整站源码、程序插件、网站模板、网页模版等类型的素材,文章内用于介绍的图片通常并不包含在对应可供下载素材包内。这些相关商业图片需另外购买,且本站不负责(也没有办法)找到出处。 同样地一些字体文件也是这种情况,但部分素材会在素材包内有一份字体下载链接清单。

如果您已经成功付款但是网站没有弹出成功提示,请联系站长提供付款信息为您处理

源码素材属于虚拟商品,具有可复制性,可传播性,一旦授予,不接受任何形式的退款、换货要求。请您在购买获取之前确认好 是您所需要的资源