← 最新の論文
💬 NLP

Fusion Embedding: A Unified Embedding Space for Text, Image, Video, and Audio

本論文は、ベースとなるパラメータを更新することなく、テキスト、画像、ビデオ、およびオーディオ間でのゼロショットのクロスモーダル検索を可能にするために、軽量でモダリティ固有のアダプターを用いてオーディオを凍結されたビジョン・ランゲージ・エンベディング空間に統合する統一モデルであるFusion Embeddingファミリーを紹介している。

原著者: Abdul Basit Tonmoy, Kazi Fardinul Hoque, Md. Shahrier Islam Arham, Arman Luthra

公開日 2026-07-22
📖 1 分で読めます☕ さくっと読める

原著者: Abdul Basit Tonmoy, Kazi Fardinul Hoque, Md. Shahrier Islam Arham, Arman Luthra

原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む

あなたは、インターネット全体のための究極の図書館を構築していると想像してください。現在、もし音楽を探したいと思ったら、音楽司書に尋ねなければなりません。写真が欲しければ写真司書に、動画が欲しければ動画司書に尋ねる必要があります。彼らは皆、異なる言語を話し、それぞれ別の部屋に本を保管しています。そのため、「満月の下で犬が吠えている動画」のように、これらを組み合わせたものを検索することは非常に困難です。

この問題を解決するために、科学者たちは「エンベディング(埋め込み)」と呼ばれるものを使用しています。エンベディングを、データのユニークなIDカードやGPS座標だと考えてください。理想的な世界では、犬の写真と「犬」という文章があった場合、それらがテキストであっても画像であっても、全く同じGPS座標を持つべきです。これにより、コンピュータはそれらが同じものであると理解できるようになります。現在の大きな課題は、テキスト、画像、動画のための優れたGPSシステムは存在するものの、音に対しては非常に不十分であることです。音を理解するほとんどのシステムは、「ノイズ」の言葉しか話せない専門家のようで、テキストや画像の司書と全く会話ができません。

この論文は、テキスト、画像、動画、そしてオーディオをようやく一つの共通マップに統合する、Fusion Embeddingと呼ばれる新しいツールファミリーを紹介しています。研究者たちは、既存のライブラリ全体をゼロから再構築しようとしたわけではありません。彼らは、すでにテキスト、画像、動画を扱うことができる非常に強力な既存のライブラリを取り、それを壊すことなく「サウンド部門」を追加する巧妙な方法を見出したのです。

「凍結された」ライブラリの魔法

ここでの秘訣は、メインのライブラリを「凍結(frozen)」させたことです。メインのライブラリを、熟練した書記官によって書かれた巨大で完璧な百科事典だと想像してください。通常、新しいセクション(サウンドなど)を追加したい場合、百科事典の一部を書き直す必要があり、それは古い言葉の意味を変えてしまうリスクを伴います。

著者たちは、「書き換え禁止」と決めました。彼らは百科事典を、最後の一文字に至るまで、そのままの状態で維持しました。その代わりに、入り口のすぐ横に、小さくて特別な翻訳ブースを建設しました。

**第1世代(Generation 1)**は、この最初の翻訳機です。これは、オーディオタワー(音を聞く部分)と凍結された百科事典の間に位置する、非常に小さく効率的な1640万パラメータのコネクター(小さな効率的なロボットのようなもの)です。音を入力すると、このロボットはノイズを、百科事典が理解できる形式へと翻訳します。これは百科事典を変更するのではなく、単にその言語を話しているだけなのです。驚くべきことに、このシンプルなセットアップは非常にうまく機能しました。それは音をテキストによる説明と一致させることができ、さらに優れたことに、一度も見せたことがない音の画像に対しても、音と画像を一致させることができました。これは、フランス語しか話せない人に、新しい言語の文法を教えることなく、辞書を見せるだけで新しい言語を理解させるようなものです。

**第2世代(Generation 2)**は、「『書き換え禁止』のルールを破らずに、さらに良くできるか?」と問いかけました。彼らは、翻訳ブースも優秀でしたが、百科事典自体にも、サウンドを理解するのに役立つ未使用の脳の力が眠っていることに気づきました。そこで、彼らは「モダリティ・ゲーテッド・ディープ・アダプター(modality-gated deep adapters)」を追加しました。

これらは、百科事典のページの中に隠された、目に見えない秘密のドアのようなものです。これらのドアは、サウンドが処理されている時にのみ開きます。テキストや画像が入ってきたとき、ドアは閉じたままであり、本は常に通り通りに読まれます。サウンドが入ってくると、ドアが開き、4420万パラメータのヘルパーモジュールが介入して、本が音をより良く理解できるよう手助けします。その結果、テキストや画像に対する本の出力は、元の凍結されたバージョンと**ビット単位で同一(bit-for-bit identical)**となります。もし、サウンド機能を追加する前と後で、同じテキストをシステムに通したとしても、コンピュータは全く何の差も見出さないでしょう。これにより、テキスト、画像、または動画のために保存されたすべての検索結果が、完全に有効であることが保証されます。

彼らが見つけたこと(そして見つけられなかったこと)

チームは、膨大なサウンドとキャプションのデータセットを用いてこのシステムをテストしました。彼らは、「凍結されたベース」のルールを守ることで、AudioCapsと呼ばれる標準的なテストにおいて0.741というスコアに達し、最先端の結果を達成できることを発見しました。これは、他の多くのシステムが、脳全体を再学習させる必要がある(つまり、他のことをする方法を忘れたり、古い結果を壊したりすることが多い)中で、非常に大きな成果です。

しかし、この論文は、何がうまくいかなかったのかについても述べています。研究者たちは、助けになると思われるいくつかの試みをしましたが、実際には状況を悪化させました。

  • キャプションの書き換え: 彼らは、トレーニング用の説明をより「綺麗」にするために、超高性能なAIを使って書き換えを試みました。驚くべきことに、これによりシステムの性能は低下しました。システムは、洗練されたAIによるものよりも、元の、雑多な人間の記述からより良く学習していたのです。
  • 「より強力な」サウンドタワーの使用: 彼らは、通常は世界最高峰とされるサウンドエンコーダーに差し替える試みを行いました。しかし、これを凍結されたシステムに接続したところ、この「より強力な」タワーは、彼らが選んだものよりも性能が悪くなりました。これは、スタンドアロンのシステムにおいて優れたサウンドエンコーダーとなるものが、必ずしも凍結されたライブラリ・システムにおいて優れたサウンドエンコーダーになるとは限らないことを示唆しています。
  • コネクターを広げすぎること: 彼らは、翻訳ロボットをより大きく、より広くしようとしました。しかし、ロボットは賢くなるどころか、単にトレーニングデータを暗記してしまい、汎用性を失ってしまいました。

「プロトコル」の驚き

最も興味深い発見の一つは、モデルそのものについてではなく、「どのように話しかけるか」についてでした。研究者たちは、テキストをシステムに投入する方法が、予想以上に重要であることを発見しました。もし、テキストを「裸の(bare)」形式(単なる言葉だけ)で入力すると、性能は低くなります。しかし、もし、元の百科事典がトレーニングされた通りの正確な「チャット・テンプレート」形式(特定の指示やフォーマットを含む)でテキストを入力すれば、パフォーマンスは14.5ポイントも劇的に跳ね上がります。

これは、司書に質問を投げかけるようなものです。もしあなたがただ「犬!」と叫ぶだけなら、彼らは理解できないかもしれません。しかし、「こんにちは司書さん、私は犬の写真を探しています」と、彼らが教えられた通りの丁寧な形式で伝えれば、彼らは即座にそれを見つけ出します。論文は、もし元のトレーニング形式を尊重しなければ、パフォーマンスを数十ポイント失い、実質的にシステムをより「愚か」にしてしまうことを示しています。

まとめ

Fusion Embeddingファミリーは、新しい部屋を追加するために、家全体を建て直す必要はないということを証明しました。凍結されたベースを使用し、スマートなゲーテッド・コネクターを追加することで、彼らはテキスト、画像、ビデオ、オーディオが共に暮らす統一された空間を作り上げました。

  • 第1世代は、小さなコネクターがあれば、オーディオをライブラリにおける「第一級市民」にするのに十分であることを示しました。
  • 第2世代は、テキストや画像のあらゆるビットを一切変えることなく、オーディオのためのさらなる脳力を追加できることを示しました。

その結果、音を聞いて一致する動画を見つけたり、動画を見て一致する音を見つけたりできるシステムが誕生しました。しかも、元のテキストや画像の検索結果を完璧に保持したままです。これは、コンピュータに「雨の動画を見せて」と頼んだとき、コンピュータが「雨」という言葉が視覚的であり、音響的であり、かつ言葉でもあることを、個別のアプリを介さずとも同時に理解できる未来への一歩です。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →