UniVoice: A Unified Model for Speech and Singing Voice Generation
UniVoiceは、条件付きフローマッチングに基づき、コンディショニングをコンテンツ、メロディ、音色へと分解し、学習されたヌル・メロディ・トークンを利用することで、歌唱における明示的なメロディ制御を可能にすると同時に、音声における自然なプロソディ推論を可能にする、統一された音声および歌唱生成フレームワークである。
原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む
一つのロボットに、二つの全く異なる仕事、すなわち「物語を語ること(話すこと)」と「オペラを歌うこと(歌うこと)」を教えようとしている場面を想像してみてください。
通常であれば、あなたは二つの別々のロボットを作るでしょう。一つは自然な会話ができるように設計され、読んでいる言葉からリズムを拾い上げます。もう一つは、厳格な楽譜に従い、すべての音符と拍子を正確に刻むように設計されています。
問題は、たった一つのロボットにこの両方をやらせようとした時に起こります。指示の内容が互いに矛盾してしまうのです。
- 歌う場合: ロボットに特定のメロディに従わせる必要があります(まるで線路の上を走る列車のようです)。
- 話す場合: もしロボットをその「線路」に縛り付けてしまうと、ロボいかなくて不自然な響きになってしまいます。物語の感情に基づいて、自由に動き回る必要があるのです。
もし、単にトレーニングデータを混ぜ合わせてしまうと、ロボットは混乱してしまいます。自由であるべき時に線路に従おうとし、線路に従うべき時に自由になろうとしてしまいます。その結果、どちらの仕事もダメになってしまうのが普通です。
解決策:UniVoice
研究者たちは、「因子分解条件付け(Factorized Conditioning)」という巧妙なトリックを用いて、この問題を解決する新しい「ロボット(コンピュータモデル)」であるUniVoiceを作り出しました。これは、一つの大きくて混沌としたスイッチではなく、三つの独立した「コントロールノブ」を与えるようなものです。
これら三つのノブの仕組みは以下の通りです:
- コンテンツ・ノブ(何を言っているか): これは歌詞やテキストを読み取ります。これは話すことも歌うことも共通しています。
- 音色のノブ(誰が言っているか): これは人の声の短いサンプル(例えば5秒間のクリップ)を聞き取り、ささやき声であれ力強い歌声であれ、その人独自の音をコピーします。
- メロディ・ノブ(旋律): これが魔法の部分です。
- 歌う時: 特定の楽曲スコア(MIDIノート)を差し込みます。ロボットはこのトラックに必ず従わなければなりません。
- 話す時: トラックを差し込む代わりに、特別な**「ヌル・トークン(Null Token)」**を差し込みます。これは、メロディに対する「立ち入り禁止」の看板のようなものです。これはロボットにこう伝えます。「音楽トラックは無視してください。言葉だけを聞いて、自分自身でリズムを判断してください。」
エンジン:共有された脳
その仕組みの裏側では、**「拡散トランスフォーマー(Diffusion Transformer: DiT)」**という強力なエンジンが動いています。これは、どんなものでも描けることができる熟練した画家に例えてみましょう。
- 以前は、二人の異なる画家(音声用と歌唱用)が必要だったかもしれません。
- UniVoiceは、三つのコントロールノブの指示を非常にうまく聞き取ることができる、**「一人の画家」**を使用しています。
- 「メロディ・ノブ」が「ヌル・トークン」に設定されているとき、その画家は自然なリズムで即興演奏(インプロヴィゼーション)を行うことを理解します。逆に、ノブが特定の曲に設定されているときは、楽譜に完璧に従います。
なぜこれが重要なのか(結果)
研究者たちは、膨大な量のデータ(3万時間の音声と3万5千時間の歌唱)を用いてテストを行いました。その結果、以下のことが分かりました。
- 両方の達人である: UniVoiceは、最高峰の音声専用ロボット(F5-TTSなど)とほぼ同等の話し方をし、かつ従来の「オールインワン」型ロボットよりもはるかに優れた歌唱を実現しています。
- 効率的である: これらすべてを、比較的小さなサイズ(0.3Bパラメータ)で実現しています。従来の統合モデルはもっとサイズが大きく、それでも性能は劣っていました。
- 「ヌル・トークン」が機能している: 特殊な「立ち入り禁止」の看板を使うことが、後に歌唱能力を損なうことなく、モデルにメロディを無視させるための数学的に正しい方法であることを彼らは証明しました。
新しいテスト:UNISINGING-EVAL
ロボットが本当に優れているかどうかを確認するために、チームは**「UNISINGING-EVAL」**という新しいテストを構築しました。これは、ポップスからジャズ、ヒップホップまで、12の異なる音楽ジャンルを含むオーディション番組のようなものです。彼らは、ロボットが同じ声を維持しながら、話すことと歌うことを切り替え、かつ様々なスタイルを扱えるかどうかをテストしました。
まとめ
UniVoiceは、いわば**「万能な声優」**です。話すことと歌うことのために、再学習したり、異なる脳を持ったりする必要はありません。ただ指示を見るだけです。
- 「ここにテキストがあり、ここに声があり、そしてここに歌がある」→ 完璧に歌います。
- 「ここにテキストがあり、ここに声があり、そしてここに歌はない」→ 自然に話します。
指示を分離することで、彼らはロボットの混乱を抑え、同時に両方の仕事において卓越した能力を発揮させることに成功したのです。
自分の分野の論文に埋もれていませんか?
研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。