← 最新の論文
🤖 machine learning

FuseLIP: Multimodal Embeddings via Early Fusion of Discrete Tokens

FuseLIPは、離散的な画像トークナイザーを活用して、アーリーフュージョンを通じて単一のトランスフォーマー内でテキストと画像の処理を統合することで、より豊かなクロスモーダルな相互作用を可能にし、様々な埋め込みタスクにおいて従来のレイトフュージョン手法を凌駕する、新しいマルチモーダル埋め込みアーキテクチャを導入している。

原著者: Christian Schlarmann, Francesco Croce, Nicolas Flammarion, Matthias Hein

公開日 2026-08-18
📖 1 分で読めます☕ さくっと読める

原著者: Christian Schlarmann, Francesco Croce, Nicolas Flammarion, Matthias Hein

原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む

人工知能の世界において、コンピュータは視覚と言語という2つの異なるレンズを通して世界を理解することにおいて、驚くほど上手くなっています。長年、最も成功してきたシステムは、これら2つの感覚を別々のストリームとして扱ってきました。それらは、画像を処理するための専門化された一つの脳と、文章を処理するためのもう一つの脳を使用し、プロセスの最後でこれら2つの独立したストリームを無理やり合流させるのです。この手法により、特定の画像に対する事前の学習なしに、テキストによる説明から特定の写真を見つけ出すといった、印象的な偉業を機械が成し遂げることが可能になりました。しかし、この分離は盲点を生み出します。人間が写真を見てそれに関する質問を読んでいるとき、人間は画像と単語を分離して処理してから組み合わせるのではなく、両者の関係性を同時に理解しているのです。従来の手法は、画像の細かな視覚的詳細を見ながら特定の指示を読み取る必要があるタスクにおいて、情報の2つのストリームが合流する前に、それぞれ個別に深く処理されすぎてしまうため、苦戦することになります。

研究者チームは、視覚と音を最初から融合させる人間の能力を模倣した、これらのシステムを構築するための異なる方法を提案しました。彼らは「FuseLIP」と呼ばれる新しいアーキテクチャを導入し、画像とテキストのための別々の脳という概念を放棄しました。代わりに、画像と単語の両方を、単一の統一された基本構成要素、すなわち「トークン」の単一のストリームへと変換し、それを一つの単一の処理エンジンへと投入します。このようにすることで、システムは学習プロセスのあらゆる段階で視覚情報と言語情報が相互作用することを可能にし、プロセスの最後に待つのではなく、最初から混ぜ合わせるのです。この情報の早期融合により、モデルは、特にタスクが「特定の指示がいかに視覚的なシーンを変化させたり記述したりするか」を理解する必要がある場合に、従来の分離されたシステムが見落としていた複雑な関係性を学習することができます。

研究者たちは、まず画像をコンピュータがテキストに使用するのと同じ種類の離散的な単位に変換する方法を見つけることで、この新しいシステムを構築しました。テキストは自然に文字や単語で構成されていますが、画像は単なる色のピクセルの格子です。このギャップを埋めるために、チームは画像を128個の明確なコードのシーケンスに圧縮するツールを使用し、事実上、画像を「視覚的な単語の文章」へと翻訳しました。そして、これらの視覚的な単語を標準的なテキストの単語と組み合わせて、一つの長いリストを作成しました。このリストは、文脈と関係性を理解するために設計されたニューラルネットワークの一種である、単一のトランスフォーマー・モデルによって処理されます。画像とテキストが最初から混ざり合っているため、モデルは「左」や「回転した」といった言葉が、見ている視覚的特徴にどのように直接影響を与えるかを理解することができ、結合された入力に対してより豊かな理解を生み出すことができます。

この新しいシステムを教えるために、研究者たちは、モデルに画像と単語の両方に注意を払わせるようなカリキュラムを作成する必要がありました。彼らは膨大な量の標準的な画像とテキストのデータを収集しましたが、同時に、モデルにパズルを解かせるような新しい方法で訓練例を生成することも発明しました。例えば、テキストによる説明に基づいて、画像がクロップ(切り抜き)、回転、または反転されているものを特定させるタスクを作成しました。これらのシナリオでは、単に画像内の物体を認識するだけでは不十分であり、モデルは正しい答えを見つけるために特定の空間的な指示を理解しなければなりませんでした。また、彼らはシステムに対し、画像に関する質問に答えたり、説明に基づいて画像内の特定の部分を特定したりするように訓練しました。決定的なのは、間違った答えが正解と非常によく似ている難しい例をモデルに示すことで、正しく向き合った物体と、わずかに位置がずれた物体の微妙な違いを学習させるようにしたことです。

この新しいアプローチを、画像とテキストの処理を別々に維持する伝統的な手法と比較してテストしたところ、結果は驚くべきものでした。新しいシステムであるFuseLIPは、テキストと画像がいかに相互作用するかについての深い理解を必要とするタスクにおいて、一貫して古いモデルを凌駕しました。伝統的なシステムは、回転した画像やテキストのヒントに基づく特定のクロップを特定するよう求められると失敗することが多かったのに対し、新しいシステムは高い精度でこれらの問題を解決しました。研究者たちは、情報の統合を最後に行う古いシステムは、画像が単独で処理された後に、これらのパズルを解くために必要な微細な視覚的詳細にアクセスできないことを発見しました。情報を早期に混合するという新システムの能力により、言語的な指示を適用しながら、必要な視覚的構造を保持することが可能になったのです。

また、この研究は、モデルの学習方法がアーキテクチャと同様に重要であることも明らかにしました。研究者たちは、これらの困難で紛らわしい例を訓練データに含めることが、システムが学習するために不可ニであることを示しました。これらがなければ、モデルは似たような選択肢を区別することに苦労しました。さらに、彼らはこの新しいアーキテクチャが、二目的の学習方法を用いて訓練できることを実証しました。モデルは画像とテキストを一致させることを学習するだけでなく、入力の欠落している部分を予測することも学習し、この技術がデータの理解をさらに強化しました。この「早期融合」と「挑戦的な例に対する厳格な訓練」の組み合わせにより、モデルは最先端の性能を達成し、マルチモーダル・データの処理における単一の統一されたアプローチが、単に可能であるだけでなく、より優れていることを証明しました。

この研究の意義は、単なるテストのスコア向上にとどまりません。単一のエンコーダーが画像とテキストの両方を効果的に処理できることを示すことで、研究者たちは、より効率的で有能なAIシステムへの道を切り開きました。これらのシステムは、世界を理解するために、二つの別々の重厚なメカニズムを維持する必要はなく、すべてをまとめて処理する一つの合理化されたエンジンを使用できます。新しいシステムは、一つの画像をトークナイザーに通すために多くの計算資源を必要としますが、全体的な訓練プロセスはより効率的であり、結果として得られるモデルはより堅牢です。研究者たちは、データの規模やモデルのサイズを拡大することを含め、まだ成長の余地があることを認めていますが、彼らの知見は、マルチモーダルな理解の未来は、コンピュータが人間と同じように、見ることと読むことを同時に学ぶ「早期融合」にあることを示唆しています。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →