Can Frontier LLMs Match Natively Multimodal Embeddings? A Comparison on Hard-Negative Text-to-Image Retrieval
本研究は、GPT-4.1やClaude Sonnet 4.6といった最先端のLLMが、Flickr30kにおいてGoogle独自のマルチモーダルなGemini Embedding 2と同等の検索性能を達成していることを示しているが、後者は事前計算可能な埋め込みにより、低レイテンシのアプリケーションにおいて依然として優位である。
原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む
巨大で混沌とした干し草の山の中から、特定の針を見つけ出そうとしている場面を想像してみてください。しかし、ここにはひねりがあります。その針はただの金属片ではなく、「画像」であり、あなたはそれを「言葉」を使って表現しようとしています。これが、コンピューターが「目に見えるもの(画像)」と「読めるもの(テキスト)」をどのように結びつけるかを学習する、コンピューターサイエンスの一分野であるマルチモーダル検索の世界です。長年、これを行う標準的な方法は、2つの別々の「脳」を構築することでした。一つはテキストを読み取って独自の暗号に変換する脳、もう一つは画像を見て別の暗号に変換する脳です。コンピューターは、まるで目を細めて一生懸命に形を合わせようとするかのように、これら2つの暗号を一致させようと試みるのです。
最近、2つの新しいスーパーツールがこの舞台に登場しました。第一に、**フロンティア大規模言語モデル(LLM)**です。これらは、驚くほど賢く、すべてを知り尽くした司書のようなものです。彼らは25枚の写真の束と一つの文章を一目見るだけで、即座にすべての写真を読み取り、それらを互いに比較して、最適な一致を選び出すことができます。第二に、**ネイティブ・マルチモーダル・エンベディング(埋め込み)**です。これらは、最初から「画像」と「テキスト」の両方を流暢に話すユニバーサル翻訳者のようなもので、2つの脳が互いに会話する必要なく、すべてを単一の統一された暗号へと変換します。ここで誰もが抱いている大きな疑問は、スーパー賢い司書がすべての写真を見て比較する必要があるのか、それともユニバーサル翻訳者が単独でも十分に速くて正確なのか、ということです。これは非常に重要です。もし司書が遅すぎるなら、道を歩きながらフォトギャラリーを検索するといったリアルタイムのアプリには使えないからです。
この論文は、Flickr30kというデータセットを使用して、これら2つのアプローチ間の高レベルなレースを設定しています。このデータセットには、人間が書いた説明文が付いた31,000枚の画像が含まれています。このレースを真に公平で困難なものにするために、研究者たちは単にランダムな写真をモデルに投げつけたわけではありません。彼らは、正解に非常によく似ているものの、決定的な違いがある「ハード・ネガティブ(難しい負例)」を作成しました。これは、賢いシステムさえも欺くように設計されたものです。彼らは、4つの重量級モデルをテストしました。ユニバーサル翻訳者であるGemini Embedding 2とAmazon Nova 2に対し、スーパー賢い司書であるGPT-4.1とClaude Sonnet 4.6をぶつけたのです。
結果は、スピードスターたちには衝撃的であり、精度重視派には安堵をもたらすものでした。正解を得るという点においては、ユニバーサル翻訳者とスーパー賢い司書は互角でした。研究によると、Gemini Embedding 2、GPT-4.1、そしてClaude Sonnet 4.6は統計的に同じ性能を示しました。それらは非常に近く、精度だけで両者を区別することはできず、これらはいずれも、このトリッキーなシナリオにおいて約80%の確率で正しい画像を選択できました。この論文は、司書が精度において圧倒的に優れているという考えを明確に否定しており、新しいエンベディング・モデルが、正しい針を見つけ出す能力において、まさに同等の鋭さを持っていることを示しています。しかし、一つのモデル、Amazon Nova 2は後れを取り、正解率が約13パーセントポイント低くなりました。これは、おそらくこのモデルがこの特定のタイプの画像検索ではなく、一般的なタスク向けに設定されていたためと考えられます。
しかし、本当の物語は、誰が精度のレースに勝ったかだけではありません。それは、誰がマラソンを完走できるかという物語です。ここで、2つのアプローチは大きく分かれます。スーパー賢い司書(LLM)は、質問ごとにグループ内のすべての写真を見なければなりません。論文はこの測定を行い、1,000件のクエリをランキングするのに、司書たちは6,100秒(GPT-4.1の場合)および9,415秒(Claude Sonnet 4.6の場合)を要したことを明らかにしました。それは、何時間もの待ち時間を意味します。対照的に、ユニバーサル翻訳者(エンベディング・モデル)は異なる動きをします。彼らは、図書館に足を踏み入れる前にすべての本にバーコードを刻印しておくように、すべての写真の暗号を一度に「事前計算」することができます。この「事前計算」が完了していれば、1,000件のクエリに対して正しい写真を見つけるのに、エンベディング・モデルは2秒未満しかかかりませんでした。
著者たちは、スーパー賢い司書は推論や画像の並列比較には非常に優れているものの、瞬時に実行される必要があるあらゆる用途においては、ユニバーサル翻訳者が明確な勝者であると結論付けています。もしあなたが、ユーザーが大量の画像コレクションを瞬きする間に検索できるようなアプリを作りたいのであれば、エンベディング・モデルの方が優れた選択肢となります。司書は、写真のコレクションが毎秒変化する場合や、コレクションが非常に小さい場合(つまり、事前計算のステップが無意味になる場合)には依然として有用ですが、スピードとスケールに関しては、新しいエンベディング・モデルが、巨人の精度に匹沢しながら、1,000倍速く動作できることを証明したのです。
自分の分野の論文に埋もれていませんか?
研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。