← 最新の論文
⚡ electrical engineering

Qwen3-ASR Technical Report

本レポートは、52言語にわたって最先端の精度と効率性を達成し、Apache 2.0ライセンスの下でリリースされる、2つの高性能なオールインワン音声認識モデル(0.6Bおよび1.7Bパラメータ)と新しい非自己回帰型強制アライメントモデルからなるQwen3-ASRファミリーを紹介するものである。

原著者: Xian Shi, Xiong Wang, Zhifang Guo, Yongqi Wang, Pei Zhang, Xinyu Zhang, Zishan Guo, Hongkun Hao, Yu Xi, Baosong Yang, Jin Xu, Jingren Zhou, Junyang Lin

公開日 2026-02-02
📖 1 分で読めます☕ さくっと読める

原著者: Xian Shi, Xiong Wang, Zhifang Guo, Yongqi Wang, Pei Zhang, Xinyu Zhang, Zishan Guo, Hongkun Hao, Yu Xi, Baosong Yang, Jin Xu, Jingren Zhou, Junyang Lin

原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む

音声技術の世界を、活気ある街に例えてみましょう。長年、「警察官」(従来の音声認識システム)は、静かな部屋で書かれた明瞭な看板を読み取ることは非常に得意でした。しかし、混雑した市場で叫んだり、歌を歌ったり、あるいは強い訛りで話したりすると、彼らはしばしば混乱したり、諦めてしまったりしました。

Qwen3-ASRチームは、ゲームのルールを完全に変える新しい「スーパー警官」と「タイムキーパー」をリリースしました。彼らが作り上げたものを、分かりやすく解説します。

1. 二人のスーパー警官:Qwen3-ASR-1.7B と Qwen3-ASR-0.6B

これら2つのモデルを、異なる強みを持つ一対の探偵と考えてください。彼らはどちらも、世界を深く理解する「スーパーメンター」(Qwen3-Omniと呼ばれる基盤モデル)によって訓練されています。

  • 大型の探偵 (Qwen3-ASR-1.7B): これは重量級のヒットメーカーです。あらゆるものを聞き取ってきた熟練のベテランのようなものです。騒がしい工場の会話を聞き取ったり、フルバンドが演奏している背景の中で歌を理解したり、あるいは珍しい方言で話していても、何を言っているのかを解明したりできます。その能力は非常に高く、巨大テック企業が運営する最も高価でクローズドなサービスにも匹敵します。
  • スピード型の探偵 (Qwen3-ASR-0.6B): これは軽量で機敏なパートナーです。より小さく、より高速です。パズルを解きながらマラソンを走れる探偵を想像してください。これは驚異的な効率性を実現するように設計されています。論文によれば、多くのタスクを同時に実行する場合、1秒間に2,000秒分の音声を処理できるといいます。スマートフォンや小型デバイスに組み込むのに最適で、動作に巨大なコンピュータを必要としません。

何が特別なのか?

  • 「万能翻訳者」の帽子: 彼らは英語や中国語を話すだけではありません。52の言語と方言を理解します。標準的な中国語、四川弁のような特定の地域方言、あるいはベトナム語のような言語であっても、瞬時に帽子を掛け替えることができます。
  • 「ノイズキャンセリング」の耳: 彼らは混沌を無視するように訓練されました。ドラムが鳴り響く中で歌を歌っても、あるいは賑やかな通りで子供が叫んでいても、これらのモデルは言葉を鮮明に聞き取ることができます。
  • 「言語識別」のバッジ: 言葉を書き起こす前に、彼らは自分が何の言語を話しているかを正確に把握します。似たような響きの言語(マレー語とインドネシア語など)を高い精度で見分けることができます。

2. タイムキーパー:Qwen3-ForcedAligner-0.6B

昔は、録音の中で単語が正確にいつ始まり、いつ終わったかを知りたい場合(字幕作成などのため)、間違いが多くて動作も遅い機械を使う必要がありました。

チームは、Qwen3-ForcedAlignerと呼ばれる新しいツールを導入しました。

  • 比喩: あなたが書き起こし(言葉)と録音(音)を持っているとします。古いツールは、言葉を音に合わせようとして推測しているようなものでした。この新しいモデルは、超高速な非自己回帰型(non-autoregressive)のタイムキーパーのようなものです。
  • 仕組み: 一単語ずつ推測する(これは遅い)のではなく、文章全体を見て、すべての単語や文字に瞬時にタイムスタンプを割り当てます。
  • 結果: 驚異的に正確で高速です。11の言語を扱うことができ、話し手が文章の途中で言語を切り替えた場合でも機能します。非常に高速で、1時間の音声をわずか数分で処理できます。

3. 彼らはどのように学んだのか(トレーニング)

「どうしてこれほど賢くなったのか?」と思うかもしれません。

  • 基礎: 彼らは、音声、視覚、テキストをすでに理解しているモデル(Qwen3-Omni)からスタートしました。
  • 練習: 彼らは、4,000万時間におよぶ膨大な録音音声ライブラリ(主に中国語と英語)で練習しました。
  • 「実戦」訓練: 単に静かなスタジオで練習したわけではありません。彼らは以下のテストを受けました。
    • 高齢者と子供: 異なる声のピッチ。
    • 早口言葉: 速く難しい話し方。
    • 歌唱: 言葉を引き延ばすメロディ。
    • 背景ノイズ: 激しい音楽や群衆。
  • 「強化」のレッスン: 最後に、彼らは最も困難な間違いに対して修正を受けるという、特別な学習方法(強化学習)を用いました。これにより、現実世界の混沌とした状況においても非常に堅牢になりました。

4. 結果:なぜ重要なのか

論文では、これらの新しいモデルを最高の競合相手(無料のオープンソースモデルと有料の商用モデルの両方)と比較しています。

  • 正確性: 大型モデル(1.7B)は、しばしば最も正確なオープンソースモデルであり、高価な有料サービスに勝るか、あるいは匹敵します。
  • 速度: 小型モデル(0.6B)は最も高速であり、スピードと賢さの最高のバランスを提供します。
  • 汎用性: 彼らは、高品質な音声認識、言語識別、そして歌唱認識を、数十の言語で機能する一つのパッケージとして組み合わせた最初の存在です。

要約すると: Qwen3-ASRファミリーは、コンピューターが、騒がしく、乱雑で、あるいは音楽的な状況であっても、人間と同じように人間の話し言葉を理解できるようにするためのツールキットです。そして、それを多くの異なる言語で行います。彼らは、将来のより優れた音声技術を構築するために、研究者や開発者がこれらのツールを自由に使えるよう、これらを無料で公開しています。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →