← 最新の論文
💬 NLP

Confucius4-TTS: Transcript-Free Cross-Lingual Zero-Shot TTS with a Learnable Speaker Encoder

Confucius4-TTSは、自己教師あり学習による音声表現から音色の特徴を抽出するための学習可能なスピーカーエンコーダーを用いた2段階のアーキテクチャを採用することで、トランスクリプトを必要としないクロスリンガルなボイスクローニングを可能にし、14言語にわたって高い明瞭度と話者類似性を実現する多言語ゼロショットテキスト読み上げシステムである。

原著者: Huaxuan Wang, Huimin Wang, Ruiyu Zhang, Yingjie Li, Yitao Duan

公開日 2026-08-13
📖 1 分で読めます☕ さくっと読める

原著者: Huaxuan Wang, Huimin Wang, Ruiyu Zhang, Yingjie Li, Yitao Duan

原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む

ロボットに、あなたのお気に入りの映画のキャラクターのような話し方を教えようとしているところを想像してみてください。コンピュータサイエンスの世界では、これは「テキスト読み上げ(Text-to-Speech: TTS)」と呼ばれます。通常、ロボットにそのキャラクターそっくりの声で喋らせるには、2つのものが必要です。一つは、その人物が話している短い音声クリップ、そしてもう一つは、そのクリップの中で実際に何を言ったかを正確に記した書き起こし(スクリプト)です。スクリプトは地図のようなものです。それがないと、ロボットは声と単語を一致させることに迷ってしまいます。しかし、ここに問題があります。現実の世界では、私たちが目にするほとんどの音声クリップ(TikTokの動画やポッドキャストの断片など)には、スクリプトが付いていません。これらは「未転写(untranscribed)」の状態です。このことは、元の音声とは異なる言語をロボットに喋らせたい場合、野生の状態で存在する音声をクローンすることを非常に困難にします。この論文は、まさにその悩みに取り組んでいます。つまり、元の音声のスクリプトがなくても、特定の人物のような声で新しい言語を話させるにはどうすればよいのか、という問題です。

そこで登場するのが、NetEase Youayoによる新しいシステム、Confucius4-TTSです。これは、熟練した「声の変幻自在なカメレオン」のように振る舞います。研究者たちは、見知らぬ人の短い音声クリップと、異なる言語のテキストを入力として受け取り、その人が新しい言語を話しているように聞こえる音声を生成できる、2段階の機械を構築しました。しかも、元のスクリプトを必要としません。

その仕組みを、簡単な比喩を使って説明します。このシステムを、2人組のチーム、すなわち「翻訳者」と「俳優」であると考えてみてください。

まず、「翻訳者」(Text-to-Semanticモジュールと呼ばれます)は、あなたが話させたいターゲットとなるテキストを見ます。しかし、単に言葉を読むのではなく、参照用オーディオクリップにも耳を傾けます。重要なのは、翻訳者は参照オーディオが「何を」言っているかを知る必要はなく、単に「誰が」言っているかを知る必要があるという点です。これを行うために、システムは特別な「学習可能なスピーカーエンコーダー(Learnable Speaker Encoder)」を使用します。このエンコーダーは、声の指紋スキャナーのようなものです。これは、未転写の乱雑なオーディオから、特定の単語を無視して、ギターの弦の質感のような、その声特有の「音色(timbre)」や「色彩」を抽出します。そして、この「声の指紋」を翻訳者に渡し、翻訳者はこれを新しいテキストと組み合わせ、一連の「セマンティック・トークン(意味論的トークン)」を作成します。これらのトークンは、音声の設計図のようなものです。それらは意味とリズムを含んでいますが、最終的な音そのものではありません。

次に、「俳優」(Semantic-to-Acousticモジュールと呼ばれます)が、その設計図と声の指紋を受け取ります。この部分は、「条件付きフロー・マッチング(conditional flow matching)」と呼ばれる高度なテクニックを使用しており、これは粘土の塊を彫刻家がゆっくりと彫像へと変えていくプロセスに似ています。システムはランダムなノイズから始まり、声の指紋と設計図に一致するように、メルスペクトログラム(音波の視覚的なマップ)を徐々に形作っていきます。最後に、「ボコーダー(vocoder)」(音響合成器)が、そのマップを実際に耳で聞くことができる音声波へと変換します。

この論文の主な発見は、このシステムがスクリプトなしでも驚異的に機能するということです。著者らは、中国語、英語、日本語、韓国語、およびいくつかのヨーロッパや東南アジアの言語を含む14の言語でテストを行いました。彼らが、クロスリンガルな音声クローニングをテストするCV3-EvalというベンチマークでConfucius4-TTSを他のトップシステムと競わせたところ、6つの異なる言語方向において平均**3.73%の単語誤り率(WER)**を達成しました。これは非常に低いエラー率であり、音声の明瞭性が極めて高いことを意味します。実際、X-Voiceベンチマークにおいて、同システムは7つの異なるソースから中国語への言語ペアにおいて、他の主要なシステムに勝利するか、あるいは並ぶ結果を出しました。

また、研究者たちは、もし参照オーディオのスクリプトが手元にある場合は、システムを「継続クローニング(continuation cloning)」モードに切り替えられることも発見しました。これは、俳優にスクリプトと声の指紋の両方を与えるようなものです。これにより、声が元の話者にさらに似る(スピーカー類似度スコアが向上する)一方で、小さなトレードオフが生じます。つまり、スクリプトなしのバージョンよりも、音声の明瞭性がわずかに低下する場合があるのです。しかし、デフォルトの「トランスクリプトフリー(スクリプトなし)」モードこそが真の主役であり、声を見つけるために地図は必要ないことを証明しています。

人間によるテスト(実際の人間が結果を聞いてランク付けを行うテスト)において、Confucius4-TTSは、音色の類似性(どれだけ元の人物に似ているか)と自然さ(どれだけ人間らしいか)において、しばしばトップの座を勝ち取りました。例えば、中国語から英語への変換テストでは、商業的な大手モデルや他のオープンソースモデルを抑え、ほぼすべてのカテゴリーで1位または2位を獲得しました。

この論文は、高品質なクロスリンガル・クローニングを実現するために、必ずしもトランスクリプトが必要であるという考えを明確に否定しています。従来の手法は、強制アライメント(言葉と音を完璧に一致させること)や合成トレーニングペアに大きく依存してきましたが、Confucius4-TTSは、自己教師あり学習による音声表現(言葉を教えられなくても、ただ聴くことで音声を理解するように学習したAI)を使用することで、声のアイデンティティを直接抽出できることを示唆しています。著者らは、大規模なデータ(約50万時間の音声)を用いてテストを行い、複数の公開ベンチマークおよび内部の人間の評価を通じて検証を行っているため、これらの結果に自信を持っています。

では、これは将来にとって何を意味するのでしょうか? 著者らは、これがビデオの吹き替え、オーディオブック、そしてランダムなクリップから即座に声をクローンして、スクリプトなしでどんな言語でも喋らせることができるアクセシビリティ・ツールの扉を開くと示唆しています。彼らはコードとモデルを公開しており、この「トランスクリプトフリー」のマジックの上にさらなる構築を行うよう、他の人々を招待しています。システムは完璧ではなく(依然としてわずかなエラー率があり、より高速化できる余地もあります)、しかし、音声クローニングを「動画の再生ボタンを押すこと」と同じくらい簡単にすることへの重要な一歩となっています。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →