想象一下,语音技术的世界就像一座繁忙的城市。多年来,“警察”(传统的语音识别系统)非常擅长在安静的房间里阅读清晰的标牌。但如果有人在拥挤的市场里大喊大叫、唱歌,或者带着浓重的口音说话,他们往往会感到困惑甚至束手无策。
Qwen3-ASR 团队刚刚发布了一组全新的“超级警察”和一个“计时员”,彻底改变了游戏规则。以下是他们的成果,用简单的语言为您解释:
1. 两名超级警察:Qwen3-ASR-1.7B 和 Qwen3-ASR-0.6B
可以将这两个模型看作是一对各具优势的侦探,他们都由一位理解世界的“超级导师”(一个名为 Qwen3-Omni 的基础模型)进行训练。
- 大侦探 (Qwen3-ASR-1.7B): 这是重型武器。它像是一位见多识广的老练资深警官。它能听懂嘈杂工厂里的对话,能理解背景音乐中伴随着全乐队演奏的歌曲,甚至能搞清楚那些说着稀有方言的人在说什么。它的表现如此出色,足以媲美那些由大型科技公司运营的最昂贵的闭源服务。
- 敏捷侦探 (Qвen3-ASR-0.6B): 这是轻量化、高机动性的搭档。它更小、更快。想象一位能在解决谜题的同时跑完马拉松的侦探。它的设计初衷是极高的效率。论文声称,在同时处理多项任务时,它可以在短短 1 秒钟内处理 2,000 秒的语音。它非常适合安装在手机或小型设备中,因为它不需要庞大的计算机也能运行。
它们的特别之处在于:
- “通用翻译官”帽: 它们不仅懂英语或中文,还能理解 52 种语言和方言。无论你是在说标准中文、特定的地域方言(如四川话),还是某种语言(如越南语),它们都能瞬间切换身份。
- “降噪”耳朵: 它们经过训练可以忽略混乱。如果有人一边唱歌一边伴随着鼓声,或者一个孩子在喧闹的街道上尖叫,这些模型依然能清晰地捕捉到词句。
- “语言识别”徽章: 在它们写下文字之前,它们就已经准确知道你在说什么语言。它们能高度准确地分辨出发音相似的语言(例如马来语和印尼语)。
2. 计时员:Qwen3-ForcedAligner-0.6B
在过去,如果你想知道一段录音中某个词确切的起始和结束时间(例如为了制作字幕),你必须使用一种缓慢、笨拙且容易出错的机器。
该团队推出了一种名为 Qwen3-ForcedAligner 的新工具。
- 类比: 假设你有一份转录文本(文字)和一段录音(声音)。旧工具就像是通过猜测来匹配文字与声音。而这个新模型就像是一个超快速、非自回归的计时员。
- 工作原理: 它不像传统方式那样一个词一个词地去猜(那样很慢),而是通过观察整个句子,瞬间为每一个单词或字符分配时间戳。
- 结果: 它极其准确且迅速。它可以处理 11 种语言,即使说话者在句子中间切换语言也能应对自如。它的速度之快,处理一小时的音频仅需几分钟。
3. 它们是如何学习的(训练过程)
你可能会好奇:“它们是怎么变得这么聪明的?”
- 基础: 它们始于一个已经理解音频、视觉和文本的模型 (Qwen3-Omni)。
- 练习: 它们在长达 4,000 万小时 的录制语音(主要是中文和英文)组成的庞大图书馆中进行了练习。
- “实战”演练: 它们不仅仅是在安静的工作室里练习。它们接受了以下测试:
- 老人与儿童: 不同的语音音调。
- 绕口令: 快速且困难的表达。
- 唱歌: 会拉长单词的旋律。
- 背景噪音: 响亮的音乐和人群。
- “强化”课程: 最后,它们使用了一种特殊的训练方法(强化学习),针对最难的错误进行纠正,使它们在现实生活的混乱环境中更加稳健。
4. 结果:为什么这很重要
论文将这些新模型与最优秀的竞争对手(包括免费的开源模型和付费的商业模型)进行了对比。
- 准确性: 大模型 (1.7B) 通常是目前最准确的开源模型,能够超越或匹配昂贵的付费服务。
- 速度: 小模型 (0.6B) 是最快的,提供了速度与智能之间的最佳平衡。
- 多样性: 它们是首个将高质量语音识别、语言识别以及唱歌识别结合在一起,并能处理数十种语言的综合包。
简而言之: Qwen3-ASR 系列是一个工具包,它让计算机能够像人类一样理解人类的语言,即使是在嘈杂、混乱或充满音乐的环境中,并且它能处理多种不同的语言。他们将这些工具免费开放给所有人使用,希望以此帮助研究人员和开发者构建更先进的语音技术,迎接未来。
技术摘要:Qwen3-ASR 技术报告
问题陈述
自动语音识别(ASR)领域已从传统的端到端范式(如 Transducer、AED)转向大语言音频模型(LALM)方法。虽然 LALM 在长文本转录、噪声鲁棒性和世界知识集成方面提供了卓越的能力,但现有解决方案在实际部署中仍面临诸多局限性:
- 基准测试饱和: 尽管在复杂、真实的场景(如方言、老年人语音、歌唱)中存在显著的质量差距,但开源 ASR 模型在标准公开基准测试上的表现往往差异微小。
- 工具链碎片化: 时间戳(强制对齐)通常是使用独立工具(如 CTC、CIF、MFA)进行的后处理步骤,这些工具缺乏多语言统一性和时间粒度的灵活性。
- 效率与准确率的权衡: 需要能够在低延迟(适用于端侧或高并发工业应用)与高准确率之间取得平衡的模型。
- 特定场景: 通用 ASR 系统在处理歌唱语音、带有背景音乐的歌曲以及多样化方言时的鲁棒识别仍具有挑战性。
方法论
1. 模型架构
Qwen3-ASR 系列基于 Qwen3-Omni 基础模型构建,利用了其强大的音频理解能力。该架构由以下部分组成:
- AuT 编码器: 一个基于注意力编码器-解码器(AED)的预训练编码器。它将 Fbank 特征(100Hz)下采样 8 倍以生成 12.5Hz 的 token。它利用动态闪速注意力窗口(1s–8s)来支持流式和离线推理。
- 投影器与 LLM: 投影器将编码器输出映射到 LLM 空间。
- Qwen3-ASR-1.7B: 基于 Qwen3-1.7B 构建,配备 300M 参数的 AuT 编码器(隐藏层大小 1024)。
- Qwen3-ASR-0.6B: 基于 Qwen3-0.6B 构建,配备 180M 参数的 AuT 编码器(隐藏层大小 896),针对效率进行了优化。
- Qwen3-ForcedAligner-0.6B: 一种新型非自回归(NAR)模型,将强制对齐重新定义为槽位填充任务。它使用预训练的 AuT 编码器和 Qwen3-0.6B LLM 来预测插入到转录文本中的特殊
[time] token 的离散时间戳索引。
2. 训练策略
训练流程包含四个不同的阶段:
- AuT 预训练: 在约 4000 万小时的伪标签 ASR 数据(主要是中文和英文)上进行训练,以建立通用的音频表示。
- Omni 预训练: 利用在 3 万亿 token 的多模态(音频、视觉、文本)数据上训练的 Qwen3-Omni 基础模型。
- ASR 有监督微调(SFT):
- 使用较小的、不相交的多语言数据集。
- 结合非语音数据、流式增强数据和上下文偏置。
- 指令缓解: 模型被训练为仅执行 ASR 任务,忽略提示词中的自然语言指令,以防止指令注入失败。
- 输出格式: 生成指示语言和文本的结构化输出(例如
language English<asr_text>...)或在未检测到语音时输出 None。
- ASR 强化学习(RL): 在约 5 万条语料(包括噪声、多语言和功能性数据)上采用组序列策略优化(GSPO),以增强噪声鲁棒性和转录稳定性。
3. 强制对齐训练
- 伪标签: 使用 Montreal Forced Aligner (MFA) 的输出作为伪标签,随后由模型进行蒸馏和平滑,以减少系统性偏移。
- 因果训练: 与标准的下一 token 预测不同,该模型使用不带序列偏移的因果训练,以显式识别并填充时间戳槽位。
- 动态槽位插入: 在训练期间随机插入起始/结束时间戳槽位,以提高泛化能力。
核心贡献
全能型 SOTA ASR:
- 支持 52 种语言和方言(30 种语言 + 22 种中文方言)。
- 在开源模型中达到 SOTA 性能,并能与顶尖的商业 API(如 GPT-4o, Gemini-2.5-Pro, Doubao-ASR)相媲美。
- 在复杂场景(歌唱语音、带背景音乐的歌曲、老年人/儿童语音以及极端噪声)中展现出极强的鲁棒性。
新型非自回归强制对齐:
- 引入了 Qwen3-ForcedAligner-0.6B,这是首个基于 LLM 的多语言强制对齐器。
- 支持跨 11 种语言 的灵活粒度(单词、句子、段落)。
- 以非自回归方式运行,同时预测所有时间戳,显著提高了推理速度。
效率与可扩展性:
- Qwen3-ASR-0.6B 的平均首字时间(TTFT)低至 92ms,在 128 并发下的吞吐量为 每秒 2,000 秒音频。
- 支持统一的离线和流式推理,最大单次推理时长为 1,200 秒(20 分钟)。
开源生态系统:
- 根据 Apache 2.0 许可证 发布了三个模型的权重。
- 提供了一个全面的推理和微调框架,支持多粒度对齐、流式处理和多语言处理。
实验结果
ASR 性能
- 公开基准测试: 在英文和中文基准测试(LibriSpeech, WenestSpeech, Fleurs 等)上,Qwen3-ASR-1.7B 持续优于开源基准模型(Whisper-large-v3, FunASR),并与商业 API 保持竞争力。
- 内部鲁棒性测试: 在涉及 16 种英文口音、22 种中文方言以及困难条件(老年人语音、绕口令、极端噪声)的压力测试中,Qwen3-ASR-1.7B 在所有子集上均实现了最低的词错误率(WER),超越了商业 API。
- 多语言与 LID: 模型在语言识别(LID)方面表现出高准确率(例如 1.7B 在 Fleurs 上为 98.7%),并在 30 种语言中保持强劲性能。
- 歌唱语音: Qwen3-ASR-1.7B 在纯歌唱基准测试(M4Singer, MIR-1k-vocal)上取得了最佳结果,并且在其他模型经常失败的长篇带背景音乐歌曲转录任务中,显著优于基准模型。
强制对齐性能
- 准确率: 与现有方法(Monotonic-Aligner, NFA, WhisperX)相比,Qwen3-ForcedAligner-0.6B 在人工标注数据集上降低了 67%–77% 的累积平均偏移(AAS)。
- 鲁棒性: 不同于在长文本中性能下降的基准模型,该模型即使在 300 秒的拼接片段和跨语言场景下也能保持较低的 AAS。
- 效率: 实现了接近 0.001 的实时因子(RTF),每秒可处理 1,000 秒音频。
重要性与主张
论文声称 Qwen3-ASR 系列代表了使高性能、多语言且鲁棒的语音识别技术面向社区开放的重要一步。通过利用 LALM 范式,这些模型解决了传统 ASR 难以应对的挑战,如长文本转录、方言变化和歌唱语音识别。
Qwen3-ForcedAligner-0.6B 的引入被强调为一个关键的功能组件,它通过提供一个统一、多语言且高效的时间戳解决方案,填补了语音技术栈中的空白,在准确性和通用性方面均优于专门的工具。作者强调,通过开源协议发布这些模型并附带可复现的框架,旨在加速自动语音识别和音频理解领域的研究与开发。
每周获取最佳 electrical engineering 论文。
受到斯坦福、剑桥和法国科学院研究人员的信赖。
请查收邮箱确认订阅。
出了点问题,再试一次?
无垃圾邮件,随时退订。