← 最新の論文
💬 NLP

DLLM-TTS: Block Discrete Diffusion Language Model for Text-to-Speech Synthesis

本論文は、テキストから音声への合成をニューラルオーディオコーデクトークン上の条件付きブロック離散拡散として定式化し、逐次的なブロック内での並列なトークン予測を通じて、高い明瞭性と0.15のリアルタイムファクターを実現しつつ、競合力のある性能を達成する0.6BパラメータのフレームワークであるDLLM-TTSを導入している。

原著者: Wasim Madha, Nityanand Mathur, Hamees Sayed, Apoorv Singh, Sameer Khurana, Akshat Mandloi, Sudarshan Kamath

公開日 2026-08-04
📖 1 分で読めます☕ さくっと読める

原著者: Wasim Madha, Nityanand Mathur, Hamees Sayed, Apoorv Singh, Sameer Khurana, Akshat Mandloi, Sudarshan Kamath

原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む

ロボットに歌を教えようとしている場面を想像してみてください。あなたには主に2つの方法がありますが、どちらにも厄介な欠点があります。1つ目の方法は、生徒が本を一度に一単語ずつ音読するようなものです。彼らは発音を完璧にこなしますが、次の文を始める前に、その文を最後まで読み終えなければなりません。これは時間がかかりますし、もしロボットに特定の人物のような声で歌わせたいなら、膨大な量の本(この場合は、何時間もの録音された音声)を読み込ませる必要があります。2つ目の方法は、合唱団の全員が全く同時に自分のパートを歌うようなものです。これは非常に速いのですが、前の人の声を聞いていないため、歌手が迷子になったり、言葉を飛ばしたり、あるいは同じ言葉を繰り返したりすることがよくあります。

長年、科学者たちは「完璧だが遅い」か「速いが乱雑」かの選択に頭を悩ませてきました。Smallest.aiのチームによって書かれたこの論文は、その乱雑な中間地点へと踏み込みます。彼らはテキスト読み上げ(TTS)と呼ばれる技術の分野で研究を行っています。これは、書かれたテキストを音声に変換する技術です。彼らが操っている鍵となるアイデアは「離散拡散(discrete diffusion)」です。これは、伝言ゲームの逆転版だと考えてください。メッセージを列に沿ってささやくのではなく、文章の中のすべての単語がクエスチョンマークの後ろに隠されている状況を想像してください。ロボットの仕事は、欠落している単語を推測することですが、単語を一つずつ推測するわけではありません。塊(チャンク)として一気に推測し、それが意味を成しているかを確認し、それから洗練させていくのです。著者たちは、この「合唱」方式のスピードと、「生徒」方式の正確さをどのように組み合わせることができるかを検証したいと考えました。

チームはDLLM-TTSと呼ばれる新しいフレームワークを導入しています。音声信号全体を一度に生成しようとしたり、あるいは極小の断片を一つずつ生成したりするのではなく、彼らは音声を「ブロック」と呼ばれる小さな単位に分割します。これは、本の「章」のようなものです。音声を長い列車だと想像してください。古い高速な手法は、列車全体を一度に作ろうとしたため、しばしば車両が脱線してしまいました。古い低速な手法は、前の車両が完成するのを待ってから次の車両を作るという、一両ずつ列車を作っていました。DLLM-TTSは、車両をグループ(ブロック)ごとに組み立てます。各グループ内では、ロボットはすべての車両を同時に推測しますが、前のグループが完了するのを待ってから次のグループを開始します。

この「ブロック」によるアプローチにより、ロボットは音の多くの部分を同時に処理できるため高速になりますが、物語の順序も守るため正確さを維持できます。ロボットは特別な「マスキング」を用いて学習します。トレーニング中、ロボットはある文章の中でいくつかの単語が隠された状態を見せられ、テキストと模倣したい声の短いサンプルに基づいて、それらが何であるかを突き止めなければなりません。ロボットは、同じ文章であっても毎回異なる単語が隠された状態で提示されるため、単に最初から最後まで文章を読み上げるよりもずっと早く音声のルールを学習します。これは、曲を何度も最初から最後まで歌い直すのではなく、さまざまな節をランダムな順序で練習することで、メロディと歌詞をより効率的に学ぶことに似ています。

結果は非常に有望です。チームは、0.6B(6億)のパラメータ(ロボットの脳の大きさを測る指標)を持つモデルを、わずか2万時間の音声データを用いて訓練しました。これを比較すると、他のトップクラスのロボットが同じ技術を習得するために、6万時間から25万時間のデータを必要とすることが多いことがわかります。これほど少ないデータを使用しているにもかかわらず、彼らのロボットは、音声の質や模倣する人物への似具合に関する標準的なテストにおいて、競争力のある性能を示しました。速度に関しては、このロボットは0.15の「リアルタイム係数(RTF)」でリアルタイムに音声を生成できます。これは、ロボットが1秒間の音声を生成するのにわずか0.15秒しかかからないことを意味しており、ライブでの会話にも対応できる速さです。

この論文は、このブロックベースのアプローチが従来のメソッドに対する強力な代替案であることを示唆しています。高品質な音声を生成するために、必ずしも膨大な量のデータや、超低速な逐次処理が必要なわけではないことを証明しています。問題を管理可能な塊に分割し、「推測して洗練させる」戦略を用いることで、著者たちはデータ効率が高く、かつ高速なシステムを作り上げました。この論文は、これがすべての音声問題に対する絶対的な最終解であると主張しているわけではありませんが、この特定の「スピードと正確さの組み合わせ方」が非常にうまく機能することを示しており、世界中のあらゆる声を学習するための膨大なライブラリを必要とせずに、自然かつ迅速に話すロボットを作るための新しい道を提示しています。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →