← 最新论文
⚡ electrical engineering

Qwen3-ASR Technical Report

本报告介绍了 Qwen3-ASR 系列,该系列包含两个高性能的全能语音识别模型(参数量分别为 0.6B 和 1.7B)以及一种新型的非自回归强制对齐模型,它们共同在 52 种语言中实现了最先进的准确率与效率,并以 Apache 2.0 协议开源。

原作者: Xian Shi, Xiong Wang, Zhifang Guo, Yongqi Wang, Pei Zhang, Xinyu Zhang, Zishan Guo, Hongkun Hao, Yu Xi, Baosong Yang, Jin Xu, Jingren Zhou, Junyang Lin

发布于 2026-02-02
📖 1 分钟阅读☕ 轻松阅读

原作者: Xian Shi, Xiong Wang, Zhifang Guo, Yongqi Wang, Pei Zhang, Xinyu Zhang, Zishan Guo, Hongkun Hao, Yu Xi, Baosong Yang, Jin Xu, Jingren Zhou, Junyang Lin

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,语音技术的世界就像一座繁忙的城市。多年来,“警察”(传统的语音识别系统)非常擅长在安静的房间里阅读清晰的标牌。但如果有人在拥挤的市场里大喊大叫、唱歌,或者带着浓重的口音说话,他们往往会感到困惑甚至束手无策。

Qwen3-ASR 团队刚刚发布了一组全新的“超级警察”和一个“计时员”,彻底改变了游戏规则。以下是他们的成果,用简单的语言为您解释:

1. 两名超级警察:Qwen3-ASR-1.7B 和 Qwen3-ASR-0.6B

可以将这两个模型看作是一对各具优势的侦探,他们都由一位理解世界的“超级导师”(一个名为 Qwen3-Omni 的基础模型)进行训练。

  • 大侦探 (Qwen3-ASR-1.7B): 这是重型武器。它像是一位见多识广的老练资深警官。它能听懂嘈杂工厂里的对话,能理解背景音乐中伴随着全乐队演奏的歌曲,甚至能搞清楚那些说着稀有方言的人在说什么。它的表现如此出色,足以媲美那些由大型科技公司运营的最昂贵的闭源服务。
  • 敏捷侦探 (Qвen3-ASR-0.6B): 这是轻量化、高机动性的搭档。它更小、更快。想象一位能在解决谜题的同时跑完马拉松的侦探。它的设计初衷是极高的效率。论文声称,在同时处理多项任务时,它可以在短短 1 秒钟内处理 2,000 秒的语音。它非常适合安装在手机或小型设备中,因为它不需要庞大的计算机也能运行。

它们的特别之处在于:

  • “通用翻译官”帽: 它们不仅懂英语或中文,还能理解 52 种语言和方言。无论你是在说标准中文、特定的地域方言(如四川话),还是某种语言(如越南语),它们都能瞬间切换身份。
  • “降噪”耳朵: 它们经过训练可以忽略混乱。如果有人一边唱歌一边伴随着鼓声,或者一个孩子在喧闹的街道上尖叫,这些模型依然能清晰地捕捉到词句。
  • “语言识别”徽章: 在它们写下文字之前,它们就已经准确知道你在说什么语言。它们能高度准确地分辨出发音相似的语言(例如马来语和印尼语)。

2. 计时员:Qwen3-ForcedAligner-0.6B

在过去,如果你想知道一段录音中某个词确切的起始和结束时间(例如为了制作字幕),你必须使用一种缓慢、笨拙且容易出错的机器。

该团队推出了一种名为 Qwen3-ForcedAligner 的新工具。

  • 类比: 假设你有一份转录文本(文字)和一段录音(声音)。旧工具就像是通过猜测来匹配文字与声音。而这个新模型就像是一个超快速、非自回归的计时员
  • 工作原理: 它不像传统方式那样一个词一个词地去猜(那样很慢),而是通过观察整个句子,瞬间为每一个单词或字符分配时间戳。
  • 结果: 它极其准确且迅速。它可以处理 11 种语言,即使说话者在句子中间切换语言也能应对自如。它的速度之快,处理一小时的音频仅需几分钟。

3. 它们是如何学习的(训练过程)

你可能会好奇:“它们是怎么变得这么聪明的?”

  • 基础: 它们始于一个已经理解音频、视觉和文本的模型 (Qwen3-Omni)。
  • 练习: 它们在长达 4,000 万小时 的录制语音(主要是中文和英文)组成的庞大图书馆中进行了练习。
  • “实战”演练: 它们不仅仅是在安静的工作室里练习。它们接受了以下测试:
    • 老人与儿童: 不同的语音音调。
    • 绕口令: 快速且困难的表达。
    • 唱歌: 会拉长单词的旋律。
    • 背景噪音: 响亮的音乐和人群。
  • “强化”课程: 最后,它们使用了一种特殊的训练方法(强化学习),针对最难的错误进行纠正,使它们在现实生活的混乱环境中更加稳健。

4. 结果:为什么这很重要

论文将这些新模型与最优秀的竞争对手(包括免费的开源模型和付费的商业模型)进行了对比。

  • 准确性: 大模型 (1.7B) 通常是目前最准确的开源模型,能够超越或匹配昂贵的付费服务。
  • 速度: 小模型 (0.6B) 是最快的,提供了速度与智能之间的最佳平衡。
  • 多样性: 它们是首个将高质量语音识别、语言识别以及唱歌识别结合在一起,并能处理数十种语言的综合包。

简而言之: Qwen3-ASR 系列是一个工具包,它让计算机能够像人类一样理解人类的语言,即使是在嘈杂、混乱或充满音乐的环境中,并且它能处理多种不同的语言。他们将这些工具免费开放给所有人使用,希望以此帮助研究人员和开发者构建更先进的语音技术,迎接未来。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →