UEmbed: Unified Sparse and Dense Multimodal Embeddings
UEmbedは、単一の因果的フォワードパスにおいて疎な語彙表現と密な表現の両方を生成する、統合されたデコーダーのみのマルチモーダル埋め込みモデルを導入し、マルチモーダルベンチマークで最先端の性能を達成すると同時に、効率的なエージェンティックなアプリケーションを可能にします。
原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む
膨大な、混沌とした図書館の中から特定の書籍を探し出そうとしている場面を想像してみてください。長い間、司書たちはシンプルなトリックを使っていました。それは「正確な単語」を探すという方法です。もしあなたが「猫(cat)」と頼めば、彼らは「cat」という言葉が含まれている本だけを見つけ出しました。これは速くて簡単ですが、少し愚かなやり方です。「猫」という言葉を一度も使っていない「ネコ科の動物(felines)」や「子猫(kittens)」についての本を見逃してしまうからです。これを解決するために、科学者たちは「意味」を理解する「スマート」な検索エンジンを発明しました。これらのエンジンは、あなたの質問と本を、長い数字のリスト(「高密度ベクトル」と呼ばれます)へと変換します。これは、すべての本にその雰囲気や物語に基づいた独自の「指紋」を与えるようなものです。これは理解力には優れていますが、重くて遅く、なぜその本が選ばれたのかを説明するのが難しいことがあります。
次に、これら両方の仕事を同時にこなせる、新しいタイプの司書を想像してみてください。彼らは「雰囲気の指紋」と「最も重要なキーワードのリスト」の両方を、一瞬の、電光石火の眼差しで提示することができます。これが情報検索の世界、つまりデジタルの干草の山から針を見つけ出す科学の世界です。大きな問いはこうです。異なる2つの、使い勝手の悪いシステムを用意することなく、「正確な単語」による検索と「意味に基づいた」検索の両方を処理できる、単一の超スマートな脳を構築できるだろうか?そして、この脳はテキストだけでなく、画像、動画、文書もすべて一度に理解できるだろうか?ここで、UEmbedと呼ばれる新しい発明の物語が始まります。
単一の脳による解決策:UEmbed
UEmbed(Unified Embedding:統合埋め込み)をご紹介しましょう。これは、Alibaba、中国科学院、およびイェール大学の研究者によって設計された、新しい種類のコンピュータの脳です。UEmbedを、言葉の魔術師か意味の達人のどちらかを選ぶことを拒む、マルチタスクなスーパーヒーローだと考えてください。かつて、意味の深い理解を求める検索エンジンが欲しかったら、重くて遅いシステムを使わなければなりませんでした。もしキーワードを使った高速なものが欲しかったら、より単純で、あまり賢くないシステムを使わなければなりませんでした。通常、特に画像や動画を扱う場合、これらを一つのパッケージとして持つことはできませんでした。
UEmbedは、「デコーダーのみ(decoder-only)」のアーキテクチャを使用することで、ゲームのルールを変えます。簡単な比喩を使うなら、標準的な検索エンジンは、物語全体を理解するために前後を行き来しながら本を最初から最後まで読む人のようです(これは「双方向(bidirectional)」と呼ばれます)。しかし、UEmbedは、物語全体を聴き、その最後に、2つの方法で即座に要約するストーリーテラーのようなものです。第一に、「雰囲気スコア」(高密度部分)を出し、第二に、頭に浮かんだ最も重要な単語を10個から20個叫びます。これらすべてを、スイッチを切り替えるように、たった一度のパスで行います。
仕組み:特殊トークンの魔法
では、この脳はどうやってキーワードを叫びながら、同時に物語全体を理解することができるのでしょうか?その秘訣は、「特殊トークン」を用いた巧妙なトリックにあります。
あなたが物語を書いていると想像してください。そして、その最後に、いくつかの目に見えない、魔法の付箋を取り付けます。UEmbedの場合、研究者は入力の最後に16個のこれらの特殊な付箋(トークンと呼ばれます)を取り付けます。コンピュータが読み始める前に、コンピュータは単語の辞書全体(語彙)を、巨大なレゴブロックの箱を16個の異なる色のビンに仕分けるように、16の異なるグループに分割します。
コンピュータがあなたの画像、動画、またはテキストを読み進めるにつれ、それは物語を処理していきます。最後に16個の魔法の付箋に到達したとき、各付箋には特定の役割が割り当てられます。「君は赤いビンの単語を担当」「君は青いビンを担当」といった具合です。各付箋は、今聴いた物語全体を見渡し、「私の色のビンの中にある、最も重要な単語はこれだ」と決定します。
コンピュータの作業が終わる頃には、重要単語の16個の小さなリストができあがっています。それらをすべて繋ぎ合わせることで、巨大で超詳細なキーワードのリスト(疎ベクトル)を作成します。同時に、物語全体の「雰囲気」を取り込み、高密度な指紋を作成します。この巧妙な分割により、大きな問題が解決されます。通常、コンピュータの脳は物語全体を記述するために一つの「要約トークン」しか使用できず、それではすべてのキーワードを保持するには不十分です。16個の異なるトークンを使用することで、UEmbedは仕事を分散させ、キーワードが豊富でありながら、意味も豊かな状態を同時に実現しているのです。
数字が示すもの
研究者たちは、検索の世界における最も困難な課題を用いてUEmbedをテストしました。彼らはテキストだけでなく、画像、動画、そして複雑な文書も投げ込みました。
- 最高スコア: さまざまな種類のメディアを理解する能力をテストするMMEB-v2という大規模なベンチマークにおいて、UEmbedの最大バージョン(パラメータ数が90億である9Bモデル)は、「雰囲気」検索で71.8、「キーワード」検索で71.0を記録しました。
- 比較: これは大きな出来事です。通常、キーワードベースの検索は「雰囲気」検索よりも大きく遅れをとります。しかしここでは、UEmbedのキーワードモードは、その雰囲気モードとほぼ同等の性能を示しており、公開データでトレーニングされたほぼすべてのモデルを上回っています。例えば、70億パラメータのモデルであるRzenEmbed-V2-7B(スコア71.1)や、20億パラメータのモデルであるEmbed-RL-4B(スコア68.1)を凌駕しました。
- 効率性: Uembedは(人気のあるチャットボットと同じ種類の)「デコーダーのみ」のモデルとして構築されているため、高速なサーバーと相性が良いです。これら二重の結果を驚異的な速さで生成できるため、実社会での利用が可能です。
なぜこれが重要なのか:「エージェント」の優位性
論文は、この二重のパワーを持つアプローチが単なる面白いトリックではなく、AI「エージェント」(ウェブを閲覧し、あなたの代わりにタスクを実行するスマートなプログラム)の未来にとって実用的な必然性であることを示唆しています。
AIエージェントが問題を解決しようとする際、「近くの最高のピザ」や「漏水を直す方法」のように、キーワードの多い短い質問をすることがよくあります。高密度の「雰囲気」検索は、深い意味を探るため、こうしたケースを見逃すことがあります。一方でキーワード検索は速いですが、単純すぎます。UEmbedはその両方の良いところを提供します。BrowseComp-Plusというベンチマークを用いたテストにおいて、研究者たちは、Uembedのキーワードモードを使用することで、AIエージェントがより少ない検索試行回数で正しい情報を見つけ出し、時間と計算資源を節約できることを発見しました。
限界と未来
著者たちは、UEmbedがまだ完璧ではないことも慎重に指摘しています。このモデルは主に英語と中国語でトレーニングされているため、それ以外の言語では時として混乱が生じることに気づきました。また、「魔法の付箋」が、コンピュータの内部辞書による副産物である、奇妙で非標準的な単語("_alt" や "_perm" など)を叫んでしまうこともあることが分かりました。
しかし、核となるアイデアは強固です。UEmbedは、スピードと賢さ、あるいは言葉と意味の間で選択する必要はないことを証明しました。これら二つの世界を単一のデコーダーのみのモデルへと統合することで、単一の文章からフルレングスの動画に至るまで、デジタル世界のすべてを一度に理解できる、より速く、よりスマートな検索エンジンの扉を開きました。それは、検索エンジンが単に言葉を探したり、単に雰囲気を感じたりするのではなく、その両方を即座に行う、新しいパラダイムなのです。
自分の分野の論文に埋もれていませんか?
研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。