← 最新の論文
🤖 machine learning

Adding Voice Cloning to Text-to-Audio-Video Models with a Single Zero-Initialised Layer

本論文は、ゼロ初期化された単一の線形層をベースとなるテキスト・トゥ・オーディオ・ビデオ・モデルに加えることで、既存のテキスト・トゥ・スピーチ・ベースラインと比較して優れた話者類似性を伴う高忠実度な音声クローニングが可能になると同時に、音声生成をビデオのパスから分離させることにより30倍の推論高速化を実現できることを実証している。

原著者: Ivan Mikheev, Viacheslav Vasilev, Anna Dmitrienko, Alexey Letunovskiy, Ivan Kirillov, Kirill Chernyshev, Denis Dimitrov

公開日 2026-08-18
📖 1 分で読めます☕ さくっと読める

原著者: Ivan Mikheev, Viacheslav Vasilev, Anna Dmitrienko, Alexey Letunovskiy, Ivan Kirillov, Kirill Chernyshev, Denis Dimitrov

原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む

コンピュータがシーンの記述を観察し、それにふさわしい音響を伴うビデオクリップを瞬時に作成できる世界を想像してみてください。もし「公園で吠える犬」と入力すれば、マシンは公園の映像と、吠え声のオーディオを生成します。テキストからオーディオ・ビデオを生成する技術として知られるこの技術は急速に進化し、言葉だけでシーン全体を合成することを可能にしました。しかし、重大な限界が存続していました。コンピュータはどのような音を作るかは決定できますが、「誰が」その音を出すのかを決めることはできないのです。出力される声や吠え声は、本質的にマシンが学習した膨大な可能性のプールからランダムに引き出されたものであり、特定のキャラクターに特定の人物のような声を持たせたいと制作者が指定することはできませんでした。この制御の欠如により、パーソナライズされた物語や、アニメーションキャラクターへの吹き替え、あるいは特定の個人の声をデジタルアバターに反映させるといったツールとしての活用が困難になっていました。

同時に、別の系統の人工知能は、わずか数秒の声を聞くだけでその人の独特なトーンを模倣できる、ボイスクローニング(音声複製)の技術を習得してきました。しかし、これらのボイスクローニング・システムはオーディオに厳格に限定されており、付随するビデオを生成することはできず、多くの場合、ゼロから構築された特殊で複雑な構造を必要とします。研究者たちの課題は、強力なビデオおよびサウンド生成器を取り込み、既存のシステムを完全に作り直すことなく、特定の声をコピーする方法を教え込むという、これら二つの世界を融合させることでした。

ある研究チームは、この溝を埋める驚くほどシンプルな方法を実証しました。ビデオとサウンドの両方を生成できる既存の大規模なモデルに対し、オーディオ処理ユニットの上に、たった一つの小さな空の数学的接続レイヤーを追加するだけで、ボイスクローニング・ツールへと変容させられることを示したのです。この新しいレイヤーは学習済みの情報を持たない状態で始まるため、モデルは変更前と全く同じように振る舞います。研究者たちは、特定のメソッドを用いて、この修正されたシステムを比較的短期間で訓練しました。彼らはターゲットとなる話者の短い録音データとテキストによる記述をモデルに与えました。システムはその録音を聴き、その独特な音の性質を利用して生成される新しいオーディオを形作りながら、ビデオ生成の整合性を維持することに成功しました。

この成功の鍵は、研究者がどのようにリファレンス・ボイス(参照音声)をマシンに導入したかにあります。彼らは二つの補完的な信号を使用しました。第一に、短いリファレンス録音のデジタル表現をオーディオ・データストリームの最始部に配置し、モデルが新しい音を作成する際にそれを常に振り返ることができるようにしました。第二に、話者の声のコンパクトな要約を一つ抽出し、モデルが生成するあらゆる音のトーンを優しく促す(ナッジする)ために使用しました。このアプローチでは、単一の新しい線形レイヤーのみが必要であり、このレイヤーは初期段階でモデルを混乱させないようゼロで初期化されました。これらの信号に注意を向けるようシステムを訓練することで、研究者たちは声の音色、すなわち独特の「色彩」を高い精度でコピーすることを可能にしました。

このアプローチの結果は、30人の異なる話者を含む674組のユニークなテキストと音声のペアを用いたベンチマークにおいて、他の5つの主要なボイスクローニング・システムと比較してテストされました。50億のパラメータを持つこの新モデルは、ターゲットとなる話者の声を一致させる能力において、他のすべてのシステムを凌駕しました。このモデルは、二つの音声がいかに似ているかを測定するために設計された3つの独立した検証ネットワークにおいて、最高スコアを記録しました。研究者たちは、このモデルが話者の声の微妙で自然な癖、つまり、その声を識別可能にする特定の音響的テクスチャさえも捉えられることを発見しました。たとえその結果、単語の選択に軽微なエラーが含まれることがあったとしてもです。このトレードオフは、モデルが完璧なテキストの正確性よりも、話者の音の真正な再構築を優先していることを示唆しており、これはよりクリーンだが特徴の乏しい声を生成する傾向にある他のシステムとは異なる挙動です。

このアーキテクチャの予期せぬ利点は、最終的な作成段階において、ビデオとオーディオの部分を分離できることです。モデルが、ビデオとオーディオのストリームが異なって処理されるものの接続されている非対称構造として設計されているため、研究者たちはオーディオ部分のみを単独で実行できることを見出しました。これにより、ビデオが作成されるのを待つことなく、ボイスクローンされたオーディオを生成することが可能になり、フルシステムを実行する場合と比較して約30倍の速度向上を実現しました。全コンピューティング・パワーのわずかな一部を使用するこのバリアント(変種)であっても、効果的な音声クローニングの能力を保持しており、完全なビデオ生成を行う前に、異なる声を素早く試聴するための実用的な方法を提供しています。

決定的なことに、研究者たちは、このボイスクローニング機能の追加がモデルの元の能力を損なっていないことを検証しました。修正されたモデルを、リファレンス・ボイスが提供されないタスクでテストしたところ、オリジナルのバージョンよりも優れた性能を示し、より自然で、テキストの記述により密接に一致したオーディオを生成しました。これは、中立な状態から始まった新しいレイヤーが、既存の知識を忘れさせることなく、システムを強化する柔軟な追加要素として機能したことを示しています。本研究は、高度なビデオおよびサウンド生成器に、最小限のアーキテクチャ変更を通じて特定の声を模倣する能力を授けることが可能であることを結論付けており、大規模な再学習や複雑な新設計を必要とせずに、よりパーソナライズされ、制御されたオーディオ・ビジュアル・コンテンツの作成への扉を開いています。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →