Qwen3 ASR开源语音识别转写模型本地部署教程
Qwen 3 ASR是阿里云最新开源的轻量级语音识别模型,提供1.7B和0.6B两个版本,支持30种语言和22种方言,且支持带背景音乐和歌唱场景的语音识别。其配套的千问三Force Aligner 0.6B强制对齐模型支持11种语言,在英文和中文识别上均优于Gemini系列、Whisper Large V3等主流方案,实现了开源SOTA。该模型的核心亮点在于逐字时间戳生成功能,通过可视化界面可精准标注每个字的发音时间,用户可将时间戳交由大模型自动生成带标点和分段的高质量字幕。本文提供了完整的本地部署指南,涵盖Windows和Mac方案,并对1.7B模型的内存需求进行了详细说明,推荐追求高精度语音识别和字幕制作的用户尝试使用。

一、开篇:轻量级ASR模型的突破
今天我将介绍一下千问最近开源的Qwen3 ASR。前段时间呢,我也介绍过WavVoice ASR。这个模型比较大,接近9B,所以它运行的时候占用的内存比较大,速度也是比较慢。而这次千问开源的1.7B和0.6B,还有一个非常好的创新的语音强制对齐模型。如果你只是使用1.7B或者是0.6B,不开后面的对齐模型的话,那对于你的电脑占用资源是比较少的。
千问三ASR 1.7B和0.6B呢,它是支持30种语言,还有22种方言,也是支持语音、歌唱、带BGM的。而它的对齐模型呢,是支持11种语言。
二、性能对比:开源SOTA,中文优势明显
随着千问三ASR的开源呢,还提供了非常全面的工具。这是模型架构图:Qwen3 ASR 1.7B,在多个维度上取得了开源SOTA,也就是开源最佳的。在英文方面,它优于Gemini系列和Whisper Large V3。当然,它对中文支持是非常好的。我们看这张图,这里的数值越低,说明它的质量越好。可以重点看一下中文这里,对比Gemini 2.5 Pro、豆包ASR还有Whisper Large V3,千问三ASR的优势还是非常明显。
它的0.6B模型呢,在高并发场景下可以有非常高的吞吐,处理速度特别快。
这次他们推出来的千问三Force Aligner 0.6B呢,支持11种语言的高精度强制对齐,整体超过WhisperX、NeMo Force Aligner等方案。同样在这个表格里,数值越低,它的性能越好。
官方博文里呢,有多个示例,比如说快的语速、口令、强的噪音,可以看到它的识别效果还是相当不错的。

三、使用方法:在线Demo与可视化时间戳
我们重点来看一下怎么使用它。在官方的博文里呢,这里有两个Demo,可以直接点开。然后上传音频,我这里呢有之前做的一些测试。上传音频之后,然后点击下方的转写,它会很快出来结果。右侧可以看到这样的时间戳,节省格式的,它是将每一个汉字都做了一个单独的时间戳。我们可以将这里的时间戳复制一下,发给比如说GPT模型,帮你生成非常精准的字幕文件。
而且它还有一点非常好玩:点下方的可视化时间戳,它会将每一个单词或者每一个汉字都完全展示出来。当我点击播放按钮,它就会展示原来音频里面对这个英文单词是怎么读的。
可以通过时间轴可视化结果。反过来看呢,Qwen3 ASR Force Aligner 0.6B模型是非常强的。这是一个中英文场景,那我们可以看到这里的每一个中文,还有每一个单词,它都是展示的非常好。
四、识别效果实测:标点准确,专有名词有待提升
我将同样的音频发给Qwen3 ASR,发现它在这里呢,对这个音频里面有一个“coon”的识别,那原文其实对应的是“千问”,所以在识别效果专有名词方面,在这一实例上是没有WavVoice ASR好的,但是它的运行速度是要比WavVoice ASR好非常多。
我在之前视频里呢,用千问三TTS合成的绕口令音频,让千问三ASR识别了一下,发现它这里的识别正确率是非常高的。
这是另一段音频,原始音频里是有非常明显的段落感。我看千问转录后的结果呢,这里的标点符号都是非常正确的。后来我又找了一个慢速中文的音频给它,这里非常有意思。它因为是慢速,所以基本上每一个字都是会比较清晰。从另一个角度来说的话,它也是一个非常好的认字的方案。
五、本地部署:Windows与Mac方案
关于千问三ASR在本地的运行呢,官方的GitHub仓库是写得非常详细的。如果你是用Windows电脑的话,直接看官方的教程就可以了。如果你是Mac电脑用户,可以用MLX Audio。
我在最近使用千问三TTS的时候,使用MLX Audio遇到了一些问题,所以这次呢,我还是自己改了一下方案,在Mac上运行。如果说你要运行1.7B,也将它的对齐模型打开,那建议的内存就达到32G左右了。如果不把它的对齐模型打开的话,16G左右也是可以的。
我这里呢是做了一个快速启动脚本,目前是用uv呢,先创建一个环境,然后呢,安装相关的依赖,之后启动一下Demo。在启动的时候呢,有一些参数呢,就是将它改成MPS。Type的话,我这里还是用的DeepL O P十六,注意力呢改成了SDPA。如果说你的电脑内存比较有限的话,批处理大小可以改一下,比如说改成一。最大生成token 256,可以改成128。这份文档呢,我会放在星球里,包括运行的脚本。大家也可以直接让AI帮你去进行调整。

六、实操演示:电竞音频识别与字幕生成
现在呢,我上传了一段电竞故事的音频。那我让它点击一下识别。大家看到的时候呢,应该是一点一倍的语速。可以看到呢,这个音频是41秒,也就几秒钟就转录成功了。它在这里转录的文本质量还是很不错的。
当我点击可视化时间戳的时候,在下方我们就会看到对应的每一个字的音频,点击就可以播放了。它这里生成的时间戳呢,都是一个字一个字的。那我可以点击一下复制,发给GPT,让他生成字幕格式。
我之前也尝试过写Python脚本,让他对这样的一个时间戳进行处理,发现无论是根据单词的量呢,还是字与字之间的一个时间间隔,那样的处理的效果都是没有大模型处理的效果好的。我们可以看到GPT呢,他对句子的理解还有标点符号的运用呢,都是非常好的。所以这里非常推荐大家就直接这样子来处理比较好。
有了千问三ASR非常精准的时间戳识别,那我们制作的字幕质量肯定会更好。
七、总结
以上呢,就是今天介绍的关于千问三ASR的所有情况。在我的简单体验里呢,它的生成效果还是相当不错的,推荐大家使用。



