Qwen3 ASR开源语音识别转写模型本地部署教程

Qwen 3 ASR是阿里云最新开源的轻量级语音识别模型,提供1.7B和0.6B两个版本,支持30种语言和22种方言,且支持带背景音乐和歌唱场景的语音识别。其配套的千问三Force Aligner 0.6B强制对齐模型支持11种语言,在英文和中文识别上均优于Gemini系列、Whisper Large V3等主流方案,实现了开源SOTA。该模型的核心亮点在于逐字时间戳生成功能,通过可视化界面可精准标注每个字的发音时间,用户可将时间戳交由大模型自动生成带标点和分段的高质量字幕。本文提供了完整的本地部署指南,涵盖Windows和Mac方案,并对1.7B模型的内存需求进行了详细说明,推荐追求高精度语音识别和字幕制作的用户尝试使用。

Qwen3 ASR开源语音识别转写模型本地部署教程

一、开篇:轻量级ASR模型的突破

今天我将介绍一下千问最近开源的Qwen3 ASR。前段时间呢,我也介绍过WavVoice ASR。这个模型比较大,接近9B,所以它运行的时候占用的内存比较大,速度也是比较慢。而这次千问开源的1.7B和0.6B,还有一个非常好的创新的语音强制对齐模型。如果你只是使用1.7B或者是0.6B,不开后面的对齐模型的话,那对于你的电脑占用资源是比较少的。

千问三ASR 1.7B和0.6B呢,它是支持30种语言,还有22种方言,也是支持语音、歌唱、带BGM的。而它的对齐模型呢,是支持11种语言。

二、性能对比:开源SOTA,中文优势明显

随着千问三ASR的开源呢,还提供了非常全面的工具。这是模型架构图:Qwen3 ASR 1.7B,在多个维度上取得了开源SOTA,也就是开源最佳的。在英文方面,它优于Gemini系列和Whisper Large V3。当然,它对中文支持是非常好的。我们看这张图,这里的数值越低,说明它的质量越好。可以重点看一下中文这里,对比Gemini 2.5 Pro、豆包ASR还有Whisper Large V3,千问三ASR的优势还是非常明显。

它的0.6B模型呢,在高并发场景下可以有非常高的吞吐,处理速度特别快。

这次他们推出来的千问三Force Aligner 0.6B呢,支持11种语言的高精度强制对齐,整体超过WhisperX、NeMo Force Aligner等方案。同样在这个表格里,数值越低,它的性能越好。

官方博文里呢,有多个示例,比如说快的语速、口令、强的噪音,可以看到它的识别效果还是相当不错的。

Qwen3 ASR 1.7B-Gemini系列-Whisper Large V3-豆包ASR语音识别转写对比

三、使用方法:在线Demo与可视化时间戳

我们重点来看一下怎么使用它。在官方的博文里呢,这里有两个Demo,可以直接点开。然后上传音频,我这里呢有之前做的一些测试。上传音频之后,然后点击下方的转写,它会很快出来结果。右侧可以看到这样的时间戳,节省格式的,它是将每一个汉字都做了一个单独的时间戳。我们可以将这里的时间戳复制一下,发给比如说GPT模型,帮你生成非常精准的字幕文件。

而且它还有一点非常好玩:点下方的可视化时间戳,它会将每一个单词或者每一个汉字都完全展示出来。当我点击播放按钮,它就会展示原来音频里面对这个英文单词是怎么读的。

可以通过时间轴可视化结果。反过来看呢,Qwen3 ASR Force Aligner 0.6B模型是非常强的。这是一个中英文场景,那我们可以看到这里的每一个中文,还有每一个单词,它都是展示的非常好。

四、识别效果实测:标点准确,专有名词有待提升

我将同样的音频发给Qwen3 ASR,发现它在这里呢,对这个音频里面有一个“coon”的识别,那原文其实对应的是“千问”,所以在识别效果专有名词方面,在这一实例上是没有WavVoice ASR好的,但是它的运行速度是要比WavVoice ASR好非常多。

我在之前视频里呢,用千问三TTS合成的绕口令音频,让千问三ASR识别了一下,发现它这里的识别正确率是非常高的。

这是另一段音频,原始音频里是有非常明显的段落感。我看千问转录后的结果呢,这里的标点符号都是非常正确的。后来我又找了一个慢速中文的音频给它,这里非常有意思。它因为是慢速,所以基本上每一个字都是会比较清晰。从另一个角度来说的话,它也是一个非常好的认字的方案。

五、本地部署:Windows与Mac方案

关于千问三ASR在本地的运行呢,官方的GitHub仓库是写得非常详细的。如果你是用Windows电脑的话,直接看官方的教程就可以了。如果你是Mac电脑用户,可以用MLX Audio。

我在最近使用千问三TTS的时候,使用MLX Audio遇到了一些问题,所以这次呢,我还是自己改了一下方案,在Mac上运行。如果说你要运行1.7B,也将它的对齐模型打开,那建议的内存就达到32G左右了。如果不把它的对齐模型打开的话,16G左右也是可以的。

我这里呢是做了一个快速启动脚本,目前是用uv呢,先创建一个环境,然后呢,安装相关的依赖,之后启动一下Demo。在启动的时候呢,有一些参数呢,就是将它改成MPS。Type的话,我这里还是用的DeepL O P十六,注意力呢改成了SDPA。如果说你的电脑内存比较有限的话,批处理大小可以改一下,比如说改成一。最大生成token 256,可以改成128。这份文档呢,我会放在星球里,包括运行的脚本。大家也可以直接让AI帮你去进行调整。

Qwen3 ASR可视化时间戳与SRT字幕生成

六、实操演示:电竞音频识别与字幕生成

现在呢,我上传了一段电竞故事的音频。那我让它点击一下识别。大家看到的时候呢,应该是一点一倍的语速。可以看到呢,这个音频是41秒,也就几秒钟就转录成功了。它在这里转录的文本质量还是很不错的。

当我点击可视化时间戳的时候,在下方我们就会看到对应的每一个字的音频,点击就可以播放了。它这里生成的时间戳呢,都是一个字一个字的。那我可以点击一下复制,发给GPT,让他生成字幕格式。

我之前也尝试过写Python脚本,让他对这样的一个时间戳进行处理,发现无论是根据单词的量呢,还是字与字之间的一个时间间隔,那样的处理的效果都是没有大模型处理的效果好的。我们可以看到GPT呢,他对句子的理解还有标点符号的运用呢,都是非常好的。所以这里非常推荐大家就直接这样子来处理比较好。

有了千问三ASR非常精准的时间戳识别,那我们制作的字幕质量肯定会更好。

七、总结

以上呢,就是今天介绍的关于千问三ASR的所有情况。在我的简单体验里呢,它的生成效果还是相当不错的,推荐大家使用。

发表回复

您的邮箱地址不会被公开。 必填项已用 * 标注

本站所有资源版权均属于原作者所有,这里所提供资源均只能用于参考学习用,请勿直接商用。若由于商用引起版权纠纷,一切责任均由使用者承担。更多说明请参考 VIP介绍。

最常见的情况是下载不完整: 可对比下载完压缩包的与网盘上的容量,若小于网盘提示的容量则是这个原因。这是浏览器下载的bug,建议用百度网盘软件或迅雷下载。 若排除这种情况,可在对应资源底部留言,或联络我们。

对于会员专享、整站源码、程序插件、网站模板、网页模版等类型的素材,文章内用于介绍的图片通常并不包含在对应可供下载素材包内。这些相关商业图片需另外购买,且本站不负责(也没有办法)找到出处。 同样地一些字体文件也是这种情况,但部分素材会在素材包内有一份字体下载链接清单。

如果您已经成功付款但是网站没有弹出成功提示,请联系站长提供付款信息为您处理

源码素材属于虚拟商品,具有可复制性,可传播性,一旦授予,不接受任何形式的退款、换货要求。请您在购买获取之前确认好 是您所需要的资源