← 最新の論文
⚡ electrical engineering

dots.tts Technical Report

本論文は、AudioVAEの学習、フルヒストリー・コンディショニング、および報酬なしの自己修正における革新を通じて、多言語音声生成、ボイスクローニング、および感情表現における最先端の性能を達成した、20億パラメータを持つ連続自己回帰型TTS基盤モデルであるdots.ttsを紹介し、同時にMeanFlow蒸留による低遅延推論を提供するとともに、すべてのコードとチェックポイントをオープンソースとして公開する。

原著者: Shi Lian, Changtao Li, Bohan Li, Hankun Wang, Da Zheng, Junfeng Tian, Yufeng Ma, Colin Zhang, Kai Yu

公開日 2026-06-08
📖 1 分で読めます☕ さくっと読める

原著者: Shi Lian, Changtao Li, Bohan Li, Hankun Wang, Da Zheng, Junfeng Tian, Yufeng Ma, Colin Zhang, Kai Yu

原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む

以下は、dots.tts のテクニカルレポートを、日常的な言葉と独創的な比喩を用いて分かりやすく翻訳したものです。

ビッグアイデア:新しいタイプの声優

想像してみてください。あらゆる言語を話し、どんな人のようにも聞こえ、あらゆる感情を表現できるロボットを作りたいとします。長い間、ほとんどの音声ロボットは、モールス信号機のような仕組みで動いていました。音声を話す前に、言葉を限られた「音のブロック(離散的なトークン)」に変換しなければなりませんでした。これは効率的ではありましたが、そのせいで、ロボットは人間の話し方の微妙で流動的なニュアンス、例えば、わずかな息遣いや、独特の笑い声、歌における複雑なメロディなどを捉えることができませんでした。

dots.tts は、この「音のブロック」という概念を捨て去った、20億パラメータを持つ新しいAIモデルです。このモデルは、音声を川の流れ(連続的なストリーム)のように扱います。音声をバラバラの破片に切り刻むのではなく、ストリームの中の「次の小さな一滴」を予測することで、より滑らかで自然、かつ表現力豊かな声を実現しています。

仕組み:三部構成のオーケストラ

論文では、dots.ttsを、この流動的な声を作り出すために協力し合う「三部構成のチーム」として説明しています。

  1. 翻訳者 (AudioVAE):
    これは高精細なカメラとプロジェクターのようなものです。生の音波を取り込み、コンピュータが理解できる「秘密の言語(連続的な潜在空間)」へと圧縮します。

    • 革新性: 通常、こうした秘密の言語は乱雑になりがちです。dots.ttsのチームは、この翻訳者を特別な「教師(WavLM)」を使って訓練しました。これにより、秘密の言語が感情や音響の詳細をすべて保持し、次のチームが読み取りやすいようにしました。
  2. ストーリーテラー (LLM):
    これは、テキストAI(Qwen2.5)に基づいた、オペレーションの「脳」にあたります。入力されたテキストを読み、何を話すべきかを計画します。

    • 革新性: ストーリーテラーに生の乱雑な音声データをそのまま与えるのではなく、チームは**セマンティック・エンコーダー(意味エンコーダー)**を構築しました。これは「要約メモ」のような役割を果たします。「直前の数秒間の音声は、明るく大きな声だった」とストーリーテラーに伝えることで、技術的なノイズに圧倒されることなく、物語の本質に集中させます。これにより、長い文章の最中にストーリーテラーが混乱するのを防ぎます。
  3. 画家 (Flow-Matching Head):
    これは、実際に音を描き出すアーティストです。ストーリーテラーの計画と、過去の音声の「要約メモ」を受け取り、次の数秒間の音を描き出します。

    • 革新性: チームは、もし画家が小さなミスをすると、次のステップがそのミスを引き継いでしまい、音声がコースから外れてしまう(「伝言ゲーム」のように)ことに気づきました。これを防ぐため、彼らは**フルヒストリー・コンディショニング(全履歴条件付け)**を採用しました。これは、画家が単に「直前の筆致」を見るのではなく、「これまでに描いたキャンバス全体」を見渡しながら描くようなものです。これにより、全体の整合性が保たれます。

「ドリフト問題」の解決:自己修正ループ

優れた画家であっても、長い文章を扱う際にミスが発生することがあります。論文では、**報酬フリー自己修正(Reward-Free Self-Correction)**と呼ばれる巧妙なトリックを紹介しています。

  • 比喩: 絵を学んでいる学生を想像してください。通常、学生は「その線は曲がっているよ」と教えてくれる先生を必要とします。しかしここでは、AI自身が自分の先生となります。AIは一度絵を描き、その後すぐにその一部を「取り消して」描き直そうとします。人間による採点を受けることなく、自らのミスから学ぶのです。この「自己修正型」の訓練により、音声は非常に安定し、長いスピーチの最中に不具合(グリッチ)が発生しにくくなります。

高速化:「MeanFlow」ショートカット

流動的な音を生成することは、コンピュータが結果を正しく出すために多くの小さなステップを踏む必要があるため、通常は時間がかかります。

  • 比喩: 家から公園まで歩く場面を想像してください。古いやり方は、100歩の小さく慎重なステップを踏むことです。新しいやり方(MeanFlow Distillationと呼ばれます)は、GPSが「あと4歩の大きな、自信に満ちた足取りで到着します」と教えてくれるようなものです。
  • 結果: チームはこのプロセスを圧縮することに成功し、AIが多くのステップを踏む代わりに、わずか2〜4ステップで生成できるようにしました。これにより、AIは驚異的な速さ、わずか54ミリ秒(人間のまばたきよりも速い!)で話し始めることができ、リアルタイムの会話に最適となりました。

成績表(スコアボード)

チームは、既存の最高峰の音声システム(CosyVoice、Seed-TTS、および商用製品など)に対し、いくつかの課題を通じてdots.ttsのテストを行いました。

  • 正確性: 言葉の間違いが非常に少なく(低い単語誤り率)、標準的なテストにおいてほぼすべてのモデルを上回りました。
  • ボイスクローニング: 3秒間の音声クリップを与えるだけで、その人の声を模倣でき、その「類似性」において他のどのオープンソースモデルよりも高いスコアを記録しました。
  • 多言語対応: 24の言語を流暢に話し、言語を切り替えても話者の声を維持します。
  • 表現力: 「音のブロック」に依存する従来のモデルよりも、歌唱や感情的な対話、パラ言語的要素(ため息や笑い声など)といった複雑なタスクをより巧みに扱います。

結論

dots.tts が画期的なのは、声をAIにするために音声を小さく硬い破片に切り刻む必要はない、ということを証明した点にあります。音声を連続的な流れとして扱い、AIに自己修正機能と「全体像」を見るためのツールを与えることで、彼らは以下の特徴を持つシステムを作り上げました。

  1. より自然であること(ブロック状ではなく、水のように流動的)。
  2. より安定していること(長い会話の最中に脱線しない)。
  3. リアルタイムのチャットが可能なほど高速であること

チームはすべてのコードとモデルを無料で公開しており、誰もがこの「連続的(continuous)」な音声技術のアプローチに基づいて、新たな開発を行えるようになっています。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →