Audio CPP:让本地语音模型变成一套系统,8G显存就能跑
Audio CPP是一个让本地语音模型从“一地鸡毛”变成“一套系统”的开源工具,相当于语音领域的LLAMA CPP。它把TTS、ASR、音乐生成、声音转换等21个模型家族统一到同一套运行方式中,解决了过去每个语音模型都需要独立环境的痛点。本文全面演示了:一句话声音克隆(秒级生成)、1万字小说合成(29分钟 vs 官方110分钟,速度提升近4倍)、本地实时语音交互系统(1秒延迟,数据不出本机)、换词翻唱(ACE Step,8G显存可跑)、方言生成(VOX CPM2)和声音设计(基于文字描述生成声音)等核心功能。

整篇文章以一台8G显存的RTX 4060笔记本为演示设备,所有功能均离线运行,无需联网,无需云服务,是本地AI语音应用的一次完整落地展示。这一整套服务,全都跑在这台8G显存的笔记本上。不用云端语音平台,不需要联网语音服务。这个工具叫 Audio CPP。你可以把它理解成音乐领域的LLAMA CPP。它想解决的不是某一个语音功能,而是把本地音频模型统一到同一套运行方式里。
一、为什么需要Audio CPP?
以前我们想在本地部署语音模型,经常是一个模型一套环境。我自己这台机器上就装过声音克隆、长文本合成、AI翻唱、实时语音——好几套环境,每一套都有不同的Python版本、不同的CUDA依赖。最后不是模型跑不动,是环境先把人劝退了。
Audio CPP解决的就是这个问题。
它把TTS、ASR、音乐生成、声音转换都接进同一个后台,通过界面可以随时切换模型。就像你用Ollama在本地跑大语言模型一样,Audio CPP能让你更简单地在本机跑各种语音模型。
我这次演示的大部分核心功能,8G显存就能跑起来。有些小模型甚至不需要显卡,用CPU也能运行。它现在已经接入的模型家族有21个,可以直接下载使用,还有一批在测试当中。
二、统一底座带来的效率提升
统一底座带来的另一个直接好处是:运行效率更高。
这是官方在RTX 5090上的速度对比,大部分模型在Audio CPP下运行,比他们用自己的推理框架快了1-3倍,有的甚至快了8-10倍。
我也在本地用RTX 4060做了测试。拿微软开源的WebVoice对比:
-
用官方自己的程序合成1万字的小说朗读,耗时110分钟
-
同样的文本拿到Audio CPP下合成,仅用了29分钟
只有原来的四分之一。
三、TTS文本转语音:声音克隆与方言生成
除了速度,这期还有我最想让你看的——他把一堆分散的语音能力,变成了一套本地系统。前面那个实时语音系统,等会我会完整演示。后面还有一个更好玩的音乐生成能力——歌曲旋律不变,直接换词翻唱。最后过一遍声音转换设计等扩展功能,以及整合包的下载和使用。
先看TTS,也就是文本转语音。
这里列的模型,整合包里自带了Pocket TTS和千问3 TTS 0.6B,它们都支持参考音频,也就意味着可以做声音克隆。
基本用法非常简单:
-
选择模型
-
点击加载
-
加载完会有提示
-
选一段参考音频
-
输入合成文本
-
点击生成
这种一句话的声音克隆,基本上是秒生成:
OpenAI launched GPT-4o, a full-duplex voice system for ChatGPT.
不过要注意,Pocket TTS不支持中文。要生成中文语音,可以换成千问3 TTS 0.6B,它的参数虽然不大,但合成效果相当不错:
全双工语音系统,支持实时打断、联网搜索和视觉理解。
这两款模型显存占用都很小,非常适合低配显卡以及没有独显的机器。
刚上手,合成设置里的参数都可以不用管,保持默认。先把模型跑起来,听一下基础效果,熟悉之后再去调温度、采样这些参数。
两款特色模型
列表里还有两个模型比较有特点:
一个是VOX CPM2。它好玩的地方是能生成方言。给一段方言参考音频:
我哋每个人都喺度做紧小丑。
就可以合成相应的方言语音:
错咗你又唔认,认咗你又唔改。
它支持国内大部分方言,还能克隆语气。想深入了解这个模型的能力,可以翻一下我之前专门做的VOX CPM那期视频。
另一个有特点的是VibeVoice,就是开头速度对比的那个模型。那段近1万字的小说,合成期间显存占用没超过7G。生成出来的音频我全程听了一遍,没有明显的漏读和错读:
忽然山腰里传来群马奔驰之声,蹄声越来越响,不久四面黄布大旗从山崖边升起……
这里有个注意点:不管你用哪款模型,参考音频都不要太长,建议控制在10秒以内,否则会明显拖慢合成速度。
另外还有个小技巧:如果有些参考音频你经常用,可以把它们放到WebUI下的voice目录里,然后把文件名和对应的文本写到这个文件里,刷新列表就可以直接选了。
临时上传的参考音频,下面对应的文本也不用手动输入——可以先到ASR标签里,把音频内容转写出来。
四、ASR语音转文字
这就引出了Audio CPP的第二个核心能力:ASR语音转文字。
我个人常用的模型是千问3 ASR。等会要演示的实时语音,我的声音转文本用的就是它,中英文都支持,速度也很快。
这段音频2分多钟,转录只用了21秒。
如果转录的是多人对话,要勾选对话模式,转出来的就是这种带说话人序列的文本。不过对话模式有长度限制,目前更适合较短的对话片段。单人语音转写没有长度限制,歌词也能识别——等下做AI翻唱要拉原曲歌词,就可以先到这里做一遍初步识别,再手动校对。
五、本地实时语音系统
有了TTS和ASR,现在我们可以把它们拼起来用了。
这是我认为Audio CPP最有价值的地方:本地实时语音系统。
我正在测试一个实时语音系统……
好的,我正在实时语音系统里和你对话。如果你想测试它的稳定性、延迟或其他功能,请随时提问或下达指令。
它的语音识别和合成都是跑在本地的。
明白了,本地运行意味着响应速度更快,同时数据也更安全,这是一个很注重隐私和效率的设计思路。
这是大语言模型在云端,你觉得这个架构是否合理?
这个架构是合理的。
从我说完话到它开始回答,中间大概1秒。如果是英文对话,这个延时会更低:
What can you do for me?
I can answer questions, summarize information…
整个流程就是:麦克风输入 → ASR转文本 → 大语言模型生成回答 → TTS朗读出来。这就是一个本地语音交互系统的基本形态。
设置里大语言模型这一步是“活的”——本地化的是语音这一层。你可以接本地Ollama跑的语言模型,也可以接自己订阅的API。Audio CPP负责的是音频这一层:听和说。
所以我说:它不是一个声音克隆玩具,而是消费级显卡上的本地AI语音底座。
而且它用的是OpenAI兼容接口。你本地的其他应用,只要支持这种接口形式,就能直接调用服务——就像设置里这样写TTS的地址、模型名称,ASR的地址、模型名称,朗读的声音也可以自定义。
比如我在这个OpenMagic AI应用里,直接调用Audio CPP的TTS服务,填写URL和模型名称。由于这个应用没法填参考音频,所以我后台单独起一个Audio CPP服务,启动时带上参考音频。回到OpenMagic测试:
你好,这是一段测试语音。
能正确返回语音,这样就接好了。这就是一个完全免费的本地TTS服务。
如果你在做本地Agent,或者想给自己的应用加上语音输入输出,Audio CPP提供的接口就非常有用。
六、音乐生成与换词翻唱
接下来我们看音乐生成。这部分也是我觉得Audio CPP很强的地方。它不只是把TTS和ASR放到一起,连音乐生成、换词翻唱这些原本比较重的模型,也开始接进同一个底座里。
这个ACE Step我之前介绍过。当时我在本地8G显存上跑不动翻唱,最后是在云端上演示的。现在用Audio CPP,本地就能跑起来:
这瓜保熟吗?
你是故意找茬?我开水果摊的,能卖你生瓜?
翻唱可以按下面步骤操作:
-
先上传要翻唱的歌曲
-
然后点分析——这个过程要等几十秒到几分钟,具体看歌曲长度
-
分析完成后,合成翻唱的时长改成-1
-
点开高级参数,操作类型选Remix
-
歌曲风格、曲谱信息分析完以后会自动填好,不用动
-
你只需要填上原曲歌词
-
提示词直接复制上面的原曲描述
-
最后填上你的翻唱歌词
可以看一下显存占用——虽然看上去超过8G,但不会爆显存,最后能顺利跑完。
换词翻唱的随机性比较大,需要多试几次:
-
如果音质不好,可以适当增加生成步数
-
要是新词唱不准或者唱不出来,可以调 Flow Edit 参数,从0.7到0.9去尝试
如果你只想生成背景音乐,我推荐用Stable Audio,比ACE Step更稳。
七、声音转换与音频分析
声音转换相当于音色迁移——保持说话内容不变、语气不变,只把音色换掉:
马匪,任何时候都要剿,不剿不行。
马匪,任何时候都要剿,不剿不行。
歌声转换也是类似逻辑。但我实测,如果你追求最终质量,我更推荐之前那套RVC流程。做歌声转换之前,最好先做人声分离——音频分离标签下就有相应的模型。
再往下是音频分析这一组,它们都是工具类模型:
-
实时语音检测
-
多人对话识别
最后一个是声音设计。这个挺有意思——它其实类似声音克隆,只是不需要参考音频。你直接用文字描述一个声音,比如“磁性的中年男声,语速偏慢,播音腔”,模型就会按描述生成:
八千里路云和月,白了少年头,空悲切。
这个功能做临时配音比较好用。
八、整合包与开源
最后说一下整合包。
Audio CPP本身是个C++项目,官方目前主要靠命令行来使用。对有经验的朋友来说问题不大,但对没技术基础的,这一步确实比较劝退。所以我做了带界面的整合包,解压就能用。
支持16至50系列的N卡。目前A卡以及没有独显的机器会自动走CPU模式,速度会慢一些,但跑几个轻量模型没问题。
整合包里:
-
run Web UI 是启动网页界面,想用哪个模型,界面里就能直接下载
-
想体验实时语音,先在Web UI里加载模型,再启动ASR服务,最后运行 run real time
-
配置里把接入的大模型改一下——如果你也用DeepSeek,API Key换成自己的就可以了
这一整套源代码我已经开源了,这是GitHub地址。
使用中如果遇到问题,或者希望增加功能,可以在评论区告诉我。我会收集整理,定期更新版本。
九、总结
总结一下,Audio CPP最大的意义,不是又多了一个声音克隆工具,而是本地语音模型开始变成一套统一的系统。
-
大语言模型有LLAMA CPP
-
图片视频生成有ComfyUI
-
语音模型现在也开始有了自己的本地运行中心
对于普通用户来说,使用门槛更低了。对开发者来说,本地语音服务接入更容易了。这也是我这期最想讲清楚的地方。




