X-Voice: Enabling Everyone to Speak 30 Languages via Zero-Shot Cross-Lingual Voice Cloning
X-Voice は、42 万時間のコーパスを用いて訓練された軽量な 0.4B パラメータの多言語ゼロショット音声クローニングモデルであり、新規の 2 段階パラダイムとアーキテクチャの改良を採用することで、音声プロンプトに文字起こしを必要とせず 30 言語で高品質な音声合成を実現し、数十億規模のモデルに匹敵する性能を達成しています。
原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む
30 種類の異なる言語を話せるようになりたいと想像してみてください。しかし、教師も教科書も、さらにはスクリプトさえもありません。あるのは、友人の声を録音した短い音声ファイルだけです。X-Voiceは、これを可能にする新しい AI モデルです。これは「声のカメレオン」であり、友人の声を受け取り、その友人が過去に一度も話したことがない 30 種類の言語のいずれでも話させることができます。
以下に、論文が X-Voice を説明する内容を、簡単な概念に分解して示します。
1. 課題:「スクリプト」のボトルネック
現在のほとんどの音声クローン AI は、スクリプトを必要とする厳格な俳優のようです。声をクローンするには、通常、以下の 2 つが必要です。
- その人物の短い音声クリップ。
- そのクリップで何と言ったかを正確に記した書き起こしテキスト。
これは、書き起こしテキストが入手しやすい英語や中国語では非常にうまく機能します。しかし、多くの他の言語(特に希少言語や方言)では、正確な書き起こしテキストを取得することが困難、あるいは不可能です。スクリプトがなければ、AI は混乱し、声を正しくクローンできません。
2. 解決策:2 段階のトレーニングキャンプ
研究者たちは、熟練した料理人が見習いを鍛えるような、巧妙な「2 段階」トレーニング手法を用いて X-Voice を構築しました。
第 1 段階:巨匠シェフ(X-Voice1)
まず、30 種類の異なる言語からの 42 万時間の音声データを用いて、大規模なモデルを訓練しました。これは、世界中のあらゆるレシピと風味を知り尽くした「巨匠シェフ」のようなものです。このモデルは話すことに非常に優れていますが、何を話すかを知るためには依然としてスクリプトが必要です。第 2 段階:見習い(X-Voice2)
ここに魔法が働きます。研究者たちは「巨匠シェフ」を用いて、1 万時間の新しい音声を生成しました。実際の音声クリップを巨匠シェフに与え、異なるテキストを話させるよう指示しました。次に、これらの新しい音声クリップを用いて、モデルに新しい教訓を授けました。「スクリプトは無視せよ。声に耳を澄ませよ」。モデルは、テキストを完全に隠蔽し、音声のみを用いて元の声を再現するように訓練されました。これにより、書き起こしテキストを読む必要が一切ない最終モデルであるX-Voice2が生まれました。
3. 秘密の武器:「デュアルレベル」言語注入
AI に古い声を使って新しい言語を話させる際、よくある問題が「アクセントの漏れ」です。例えば、フランス語話者に日本語で「こんにちは」と言わせるよう頼むと、AI が誤ってフランス語のアクセントをつけてしまう可能性があります。
これを解決するため、研究者たちはデュアルレベル言語注入システムを発明しました。AI が言語を制御するための 2 つの異なる「ダイヤル」を持っていると想像してください。
- テキストダイヤル: AI に何の単語を言うべきかを伝えます。
- 時間ダイヤル: AI にいつ言うべきか、そしてリズムがどうあるべきかを伝えます。
この 2 つのダイヤルを同時に操作することで、AI は声(その人固有の音)とアクセント(言語のリズム)を完璧に分離できます。これにより、その人が自分自身のように聞こえつつ、新しい言語を正しく話すことを保証します。
4. 結果:高速、無料、流暢
論文によると、X-Voice は「0.4B モデル」であり、これはサーバー室全体を占有するような巨大なモデルと比較して、相対的に小さく軽量であることを意味します。
- 速度: 1 語ずつ書くような遅い段階的な「自己回帰」方式を使用しないため、非常に高速に音声を生成できます。
- 品質: 試験では、書き起こしテキストを必要としないにもかかわらず、はるかに巨大な商用モデル(Qwen3-TTS など)と同等のパフォーマンスを発揮しました。
- オープンソース: チームはすべてのデータ(42 万時間の音声)とコードを無料で公開しており、誰でも利用できます。
要約の比喩
X-Voice を声の汎用翻訳機と考えてください。
- 従来の AI: 「この特定の文を読んでくれれば、あなたの声をクローンできます。ただし、その文の書き起こしテキストが必要です。」
- X-Voice: 「5 秒間のハミングのクリップさえあればあなたの声をクローンできます。また、あなたが何をハミングしていたかを知る必要もなく、瞬時に 30 種類の異なる言語を話させることができます。」
論文は、この技術が多言語音声クローニングにおける最大の障壁である「書き起こしテキストの必要性」を取り除くと結論付けています。短い音声サンプルさえあれば、誰でも誰かの声でどの言語でも話せるようになります。
自分の分野の論文に埋もれていませんか?
研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。