Gemini Embedding 2: A Native Multimodal Embedding Model from Gemini
本論文は、ビデオ、音声、画像、テキストを単一の表現空間に統合するネイティブなマルチモーダル埋め込みモデルであるGemini Embedding 2を導入し、多様な単一モーダル、クロスモーダル、マルチモーダル検索タスクにおいて最先端のパフォーマンスを達成するとともに、専門分野における堅牢なゼロショット能力を実証するものである。
原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む
巨大な図書館を想像してください。そこには本、映画、音楽の録音、そして写真が収められています。現在、映画のシーンに似た特定の曲や、料理の写真に合うレシピを見つけたい場合、通常はまずすべてをテキストに変換する必要があります。写真の説明を書き、音声を言葉に書き起こし、それから検索するのです。これは、絵の具の名前のリストだけを眺めて特定の色を見つけるようなもので、色そのものの「感覚」を失ってしまいます。
Gemini Embedding 2 は、ゲームのルールを変えるグーグルの新しいツールです。すべてをテキストに強制するのではなく、画像、音声、動画、言葉がすべて同じ方言で話せる、単一の普遍的な「言語」を作り出します。
ここでは、その仕組みと重要性を、簡単な比喩を用いて解説します。
1. 万能翻訳機(中核となるアイデア)
従来の方法を、言語ごとに異なる辞書を持っていると考えるとわかりやすいでしょう。フランス語の本とドイツ語の映画を比較したい場合、まず両方を英語に翻訳する必要があり、その過程でニュアンスが失われることがよくありました。
Gemini Embedding 2 は、「意味」を話す万能翻訳機のようなものです。
- 動画、曲、写真、あるいは文章の段落を受け取り、それらすべてを単一の種類の「ID カード」(数学的なベクトル)に変換します。
- すべてが同じ「言語」にあるため、モデルは、犬が吠える動画と「大きな犬」というテキストが関連していることを瞬時に認識できます。一方が音で他方が言葉であっても、音声を言葉に変換する必要はありません。モデルは音声を直接理解するのです。
2. 「オールインワン」のシェフ
従来のモデルは、一種類の料理しか上手に作れないシェフのようでした。あるシェフはテキストが得意で、別のシェフは画像、さらに別のシェフは動画が得意です。もし三つすべてを含む食事を作りたい場合、三人のシェフを雇い、彼らが味について合意することを願うしかありませんでした。
Gemini Embedding 2 は、どんな食材も扱える巨匠シェフです。
- コードの読解、映画の理解、音声の聴取、文書の分析など、膨大なタスクの組み合わせでトレーニングされました。
- この多様な学習のおかげで、食材を混ぜても混乱しません。写真と文章を組み合わせて動画クリップを検索するように頼んでも、その組み合わせを完璧に理解します。
3. 「ゼロショット」の超能力
通常、コンピュータに天文学や料理のような非常に特定のトピックを理解させたい場合、そのトピックのために特別に教える必要があります。これは、生徒に太陽系についてだけ教えるために家庭教師を雇うようなものです。
Gemini Embedding 2 は、すでに何でもの専門家である学生のようなものです。
- 論文によると、このモデルは追加のトレーニングなしで、顕微鏡観察(生物学)、天文学、美術、料理といった専門分野において驚くほどよく機能します。
- これは「箱から出してすぐ使える」状態です。星図や複雑なレシピの写真を示せば、それらのうちの一つのみに特化してトレーニングされたモデルよりも、即座に文脈を深く理解します。
4. 音声のブレイクスルー(文字起こし不再要)
音声検索における最大の課題の一つは、コンピュータが通常、検索する前にまず音声を「読む」(音声からテキストへの文字起こし)必要があることです。これは、歌詞を読んで曲を探すようなもので、歌手がもごもご話したり訛りが強かったりすると、コンピュータは歌詞を間違え、曲を見つけることができません。
Gemini Embedding 2 は仲介者をスキップします。
- 生の音声を直接聞き取ります。言葉だけでなく、声のトーン、ピッチ、感情を理解します。
- 論文では、文字起こしされたテキストで検索するよりも、生の音声で検索する方がはるかに正確であることがわかりました。これは、何と言っているかを聞く必要もなく、群衆の中から友人の声を認識するようなものです。
5. 構築方法(トレーニングのレシピ)
この「万能翻訳機」を構築するために、チームは一つずつ教えるのではなく、三段階の調理プロセスを使用しました。
- プレファインチューニング: モデルに、テキスト、コード、画像など、膨大で散らかったデータを与え、「情報」をエンコードする概念に慣れさせました。
- ファインチューニング: 質問と回答、あるいは動画と説明を一致させるなど、物事を一致させる方法の非常に具体的で高品質な例を与えました。
- モデルスープング: これは巧妙なトリックで、トレーニングされたモデルのいくつかの異なるバージョンを、完璧な味を出すために異なるバッチのスープを混ぜるように「ブレンド」しました。これにより、最終的なモデルはより安定し、同時に異なる種類のタスクを処理する能力が向上しました。
結論
Gemini Embedding 2 は、コンピュータが人間のように世界を理解することを可能にする強力な新しいエンジンです。見る、聞く、読むすべての情報を、つながった全体として捉えるのです。テキストの説明を使って動画の特定の瞬間を検索したり、口ずさんだメロディに基づいて曲を見つけたり、チャートとテキストを含む文書を検索したりする場合、このモデルはそれらすべてを一つの統一された空間で処理します。それは、しばしばそれらの仕事のうちの一つのみに特化して設計されたツールよりも優れています。
自分の分野の論文に埋もれていませんか?
研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。