← 最新の論文
⚡ electrical engineering

Qwen3-TTS Technical Report

Qwen3-TTSシリーズは、500万時間を超えるデータで学習された、最先端のボイスクローニング、きめ細かな制御、そしてリアルタイムかつ超低遅延なストリーミング合成を可能にする特化型トークナイザーを備えたデュアルトラック・アーキテクチャを特徴とする、Apache 2.0ライセンスの高度な多言語テキスト読み上げモデルファミリーを導入しています。

原著者: Hangrui Hu, Xinfa Zhu, Ting He, Dake Guo, Bin Zhang, Xiong Wang, Zhifang Guo, Ziyue Jiang, Hongkun Hao, Zishan Guo, Xinyu Zhang, Pei Zhang, Baosong Yang, Jin Xu, Jingren Zhou, Junyang Lin

公開日 2026-01-23
📖 1 分で読めます☕ さくっと読める

原著者: Hangrui Hu, Xinfa Zhu, Ting He, Dake Guo, Bin Zhang, Xiong Wang, Zhifang Guo, Ziyue Jiang, Hongkun Hao, Zishan Guo, Xinyu Zhang, Pei Zhang, Baosong Yang, Jin Xu, Jingren Zhou, Junyang Lin

原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む

ポケットの中に、説明した通りの声に瞬時に変化したり、わずか数秒の音声から声をコピーしたりできる、魔法のレコーディングスタジオを持っていると想像してみてください。それが、Qwen3-TTSのチームがこのレポートで紹介しているものです。

このテクノロジーを、単なる「テキスト読み上げ(text-to-speech)」ツールとしてではなく、**「万能な声の変身術師(ボイス・シェイプシフター)」**と考えてください。以下に、簡単な比喩を用いて、その仕組みと何が特別なのかを解説します。

1. 2つの「音声エンジン」(トークナイザー)

チームは、ニーズに応じてテキストを音へと変換するための、2種類の異なる「エンジン」を構築しました。これらをトークナイザーと呼びます。

  • 「高忠実度」エンジン (25Hz):

    • 比喩: これは高解像度の4K映画のようなものです。声のあらゆる細かなディテールを捉え、驚くほど豊かで自然な響きを実現します。
    • 仕組み: 音声を小さな塊に分解します。音が完璧に流れるように(まるで次のシーンを確認するディレクターのように)、少し先読みする必要があるため、最初の音が出るまでに極めてわずかな時間を要します。
    • 最適なかたち: 最高品質を求め、コンマ数秒の遅延を気にしない場合。
  • 「インスタント」エンジン (12Hz):

    • 比喩: これは高速の宅配便サービスのようなものです。荷物の全体像を確認してから最初の箱を送るのではなく、準備ができ次第、すぐに最初の箱を送り出します。
    • 仕組み: 言葉の最も重要な「意味」を先に送り、その直後に音響的な詳細を補完するという巧妙なトリックを使用しています。これにより、わずか97ミリ秒(人間のまばたきよりも速い)で話し始めることができます。
    • 最適なかたち: ロボットアシスタントとの会話など、AIが「考える」のを待たずにリアルタイムで会話したい場合。

2. 「ボイス・クローニング」の魔法

通常、声を複製するには何時間もの録音が必要ですが、Qwen3-TTSはこう言います。「3秒だけちょうだい。そうすれば、その声のすべてを再現してみせるよ」

  • 比喩: スープをたった一匙味わうだけで、隠し味まで含めたレシピ全体を即座に再現できるマスターシェフを想像してください。
  • できること: 誰かが話している3秒間のクリップを入力するだけで、その声で無限の新しい文章を生成できます。また、「寝起きのような、低くて不機嫌なロボットの声」のように、言葉で説明するだけで、全く新しい声を作り出すことも可能です。

3. 「多言語を操るポリグロット(博学な人)」

このモデルは、単一の言語が得意なだけではありません。**「言語の変幻自在なカメレオン」**なのです。

  • 比喩: 10の異なる言語の台本を暗記しながらも、すべての言語において同じ個性と演技スタイルを維持し続ける俳優を想像してください。
  • できること: 10言語にわたる500万時間以上の音声データで学習されています。例えば、中国語の話し手から学んだ声を使って韓国語で話すよう指示した場合、単に言葉を翻訳するだけでなく、その話し手独自の「音色(声の質感)」を維持したまま、完璧な韓国語を話します。これにより、これまでのシステムよりも、中国語から韓国語といった難易度の高い言語ペアを巧みに扱えます。

4. 「無限のストーリーテラー」

AI音声の大きな問題の一つは、数分経つと疲れを感じたり、繰り返しが多くなったり、ロボットのように聞こえたりすることです。

  • 比喩: 1時間も経つと言葉に詰まり始める、疲れ切ったラジオパーソナリティを想像してください。Qwen3-TTSは、息を切らしたりトーンを変えたりすることなく、10分間の物語を読み上げることができる**「超エネルギッシュなナレーター」**のようなものです。
  • できること: チームは、長いテキストを扱うために特別に訓練を行いました。AIが長時間話し続けようとする際に発生しがちな「不具合(グリッチ)」を起こすことなく、10分間以上の連続した流暢な音声を生成できます。

5. 「指示に従う」ディレクター

あなたは単に声をコピーするだけでなく、そのパフォーマンスを演出することもできます。

  • 比喩: あなたは映画のディレクターとして俳優に指示を出していると考えてください。「このセリフを、秘密を打ち明けるようなささやき声で読んで」とか、「これを、サプライズに興奮しているような感じで言って」と指示できます。
  • できること: 「ゆっくりと悲しげに話して」や「明るいニュースキャスターのように」といった指示を入力すると、モデルは即座に声の調子を調整します。この複雑な指示への理解力は、従来の多くのモデルよりも優れています。

まとめ

Qwen3-TTSのチームは、高速で多言語に対応し、驚くほどコントロールしやすいモデルファミリーをリリースしました。彼らは、2つのバージョン(即時性を求めるものと、最大限の品質を求めるもの)を提供することで、「速度と品質」のトレードオフの問題を解決しました。そして、AIが極めて短いサンプルから声を複製し、複数の言語を同時に流暢に話し、疲れを知らずに長い物語を語れることを証明しました。

彼らはこれらのツールを(オープンソースとして)すべての人に公開しており、開発者や研究者が次世代の人間とコンピュータの対話を生み出すために活用することを期待しています。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →