Zamba2-VL Technical Report
Zamba2-VLは、Mamba2状態空間層とTransformerブロックを組み合わせたハイブリッドZamba2アーキテクチャに基づいた効率的なビジョン・ランゲージモデルのスイートであり、主要なオープンウェイトVLMに対して競争力のある性能を実現しながら、特にエッジ展開に適した小規模スケールにおいて、大幅に高速な最初のトークン生成時間(time-to-first-token)を提供します。
原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む
ビッグアイデア:画像のための、より賢く、より速い脳
想像してみてください。あなたには、写真を見てそれに関する質問に答える必要があるロボットの助手がいるとします。通常、こうした助手は、膨大な、増え続ける「インデックスカードの束」を持つ図書館のような構造で作られています。新しい画像の一部を見るたびに、彼らはその束にカードを一枚追加していきます。もし画像が巨大だったり複雑だったりすると、カードの束があまりに高くなりすぎて、ロボットは次のカードを見つけるためだけに、その束を検索することに全ての時間を費やさなければならなくなります。これでは、動作が遅くなり、コストも高くついてしまいます。
Zamba2-VLのチームは、異なる種類のロボットを作り上げました。増え続けるカードの束の代わりに、彼らはロボットに、どれだけ多くの情報を読み込んでもサイズが変わらない、**コンパクトで高速な「メモ帳」**を与えました。彼らはこれを、2種類の「考え方」を組み合わせていることから、「ハイブリッド」モデルと呼んでいます。
- ファストレーン(Mamba2): これは仕事の大部分を担います。大量の情報(画像全体など)を、停滞することなく、一定の超高速スピードで読み進めます。
- スポットライト(Transformer): これは、特定の詳細を完璧に記憶し、ズームアップする必要がある時にだけ使われる、小さくて専門的なツールです。
彼らが解決した問題
現在のAIモデル(Transformerと呼ばれます)は画像を理解することに長けていますが、非常に「重い」のが難点です。高解像度の写真を読み込ませると、モデルはその写真を何千もの小さな断片(トークン)に分解します。モデルは、これまでに見たすべての断片の「記憶」を持ち続けなければなりません。画像が大きくなるにつれて、メモリ要件が爆発的に増加し、スマートフォンやノートパソコンのような一般的なデバイスでの起動が遅くなり、実行コストも高くなってしまいます。
この問題を解決しようとする以前の試みでは、「純粋な」高速メモリシステム(SSM)が使われていました。しかし、それらのモデルは、画像内の特定の詳細を見つけ出すこと(例えば、人混みの中から特定の一人を指し示すこと)が苦手でした。それらは速かったのですが、詳細については「愚かな」モデルだったのです。
Zamba2-VLのソリューション
Zamba2-VLのチームは、両者の良いとこ取りをしたモデルを作り出しました。
- エンジン: 彼らはZamba2と呼ばれる新しいエンジンを使用しました。これはハイブリッドカーのようなものです。巡航時には主に電気エネルギー(高速で効率的なMamba2レイヤー)を使用しますが、複雑なタスクを処理するためのパワーが必要な時には、小さなガソリンエンジン(Transformerレイヤー)が作動します。
- 結果: このモデルは、巨大で重いモデルと同じくらい画像を理解する能力がありますが、起動(Time-to-First-Token)が10倍速いのです。
どうやって学習させたのか
この高速なモデルを賢くするために、彼らはただランダムな写真を投げつけたわけではありません。彼らは特定の「食事(データセット)」を厳選しました。
- 「OCR」の食事: モデルは一般的な画像には強いものの、文字の多い文書(チャートやスキャンされた書類など)には苦戦することに気づきました。そこで、読解力を「増強」するために、ドキュメントやテキストのデータを追加で与えました。
- 「指差し」のスキル: 彼らは、モデルに画像内のものを指し示す方法を教えました。もし「サイクリストは何人いますか?」と尋ねられたら、モデルは単に「6」と答えるだけでなく、それぞれのサイクリストを座標とともに指し示すことができます。これは、子供に「リンゴを数える」だけでなく、「数えながら一つひとつに触れる」ことを教えるようなものです。
パフォーマンス:速くて正確
論文では、彼らの新しいモデル(1.2B、2.7B、7Bパラメータの小・中・大サイズが用意されています)を、他社のトップティアのモデルと比較しています。
- 正確性: 物体のカウント、チャートの読み取り、複雑なシーンの理解といったテストにおいて、Zamba2-VLは、現在主流の重量級モデルと同等の性能を発揮しました。
- 速度: ここが真骨頂です。その「コンパクトなメモ帳」のようなメモリのおかげで、競合他社よりも約10倍速く質問への回答を開始できます。
- スイートスポット: スピードの優位性は、特に小型モデル(1.2Bおよび2.7B)で顕著です。これらのサイズは、軽量でありながら非常に高い能力を持っているため、ノートパソコンやスマートフォンなどの個人用デバイスで実行するのに最も適しています。
まとめ
Zamba2-VLを、**「チェスの達人でもある短距離ランナー」**だと考えてください。以前の速いモデルは、先を読むことができない短距離ランナーのようであり、以前の賢いモデルは、動きが遅すぎるチェスの達人のようでした。Zamba2-VLは、短距離ランナーのスピードとチェスの達人の戦略的な記憶力を兼ね備えており、高価で巨大なコンピュータを必要とすることなく、複雑な画像を素早く処理することを可能にしています。
自分の分野の論文に埋もれていませんか?
研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。