MolmoPoint: Better Pointing for VLMs with Grounding Tokens
この論文は、テキスト出力として座標を生成する従来の手法に代わり、視覚トークンを直接選択する直感的なポインティング機構(「Grounding Tokens」)を導入することで、画像・GUI・動画におけるポインティング精度と効率を大幅に向上させ、複数のベンチマークで最先端の性能を達成した「MolmoPoint」を提案しています。
原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む
この論文は、「AI が画像や動画を指差す(ポインティング)能力」を劇的に向上させた新しい技術について書かれています。
これまでの AI は、指差すときに「座標(X 座標、Y 座標)」という数字の羅列を言葉で出力していました。しかし、この新しい方法「MolmoPoint」は、「指差す」という行為そのものを、AI の「目」が直接選べるようにしたという点で画期的です。
以下に、難しい専門用語を使わず、身近な例え話を使って解説します。
🎯 従来の方法:「地図の座標」で探す
昔の AI は、画像の中の「左の車のブレーキライト」を指差すとき、以下のような手順を踏んでいました。
- 画像全体をグリッド(マス目)に区切った「地図」を頭の中で持っている。
- 「ブレーキライト」の位置を計算し、**「X 座標は 345、Y 座標は 120」**という数字の組み合わせを言葉で出力する。
- 人間やロボットがその数字を見て、「あ、そこか」と指を向ける。
【問題点】
- 計算が面倒: AI は「座標」という複雑なルールを覚えなければなりません。
- 言葉が長い: 座標を伝えるだけで、多くの「トークン(言葉の単位)」を使ってしまい、処理が遅くなります。
- ズレやすい: 画像のサイズが変わると、座標の計算が狂ってしまい、指差す場所がズレることがありました。
✨ 新しい方法(MolmoPoint):「直接、その場所を指す」
この論文が提案する「MolmoPoint」は、「座標」を捨てて、AI が直接「画像のピクセル(点)」を選び取るという直感的な方法を採用しました。
🏗️ 3 段階の「ズームイン」方式
AI は指差すとき、3 つの特別な「魔法のトークン(合言葉)」を使って、**「大まかな場所」→「細かい場所」→「正確な点」**の順に、まるでズームインカメラのように狙いを定めます。
<PATCH>(パッチ):「大まかなエリア」を選ぶ- 例え: 「車の左側」という大きなエリアを指差す。
- AI は画像の大きなブロックの中から、一番関係ありそうな場所を「これだ!」と選びます。
<SUBPATCH>(サブパッチ):「もっと細かく」選ぶ- 例え: 選んだ「車の左側」の中から、**「ブレーキライトがある小さな四角」**をさらに選びます。
- ここでは、画像のより細かい部分(ViT 特徴量)を見て、エリアを絞り込みます。
<LOCATION>(ロケーション):「正確な点」を決める- 例え: 選んだ「ブレーキライトの四角」の中で、**「中心の点」**を指します。
- これで、画像の解像度がどんなに高くても、常にピタリと正確な場所を指し示せます。
🚫「もう指さない」ボタン
AI が「あれ?もう指す場所ないかも?」と思ったとき、無理やり指し続けると、同じ場所を何回も指したり、意味のない点を連発したりします(これを「デジェネレート」と呼びます)。
そこで、**「もう指さない(No-More-Points)」**という特別な合言葉を導入しました。これにより、AI は「もう指す必要がない」と判断した瞬間に、指差しを自然に終わらせることができます。
🌟 なぜこれがすごいのか?
1. 座標を覚える必要がない(直感的!)
AI は「座標というルール」を暗記する必要がなくなりました。代わりに、「見たもの(画像の点)」と「言葉(質問)」を直接つなげるだけで済みます。
- 例え: 「リンゴを指して」と言われたとき、AI は「リンゴの画像データ」を直接指差すので、「リンゴ」のイメージと「指差す動作」が一体化します。
2. 高解像度でも正確(4K 画像でも OK!)
従来の座標方式は、画像が巨大になると計算が狂いやすかったのですが、この方法は**「画像のどの部分か」を直接選ぶ**ため、4K などの超高画質画像でも、ピクセル単位の正確さを保ったまま指差しできます。
3. 動画や GUI(画面操作)でも活躍
- 動画: 「前のフレームで指した場所」から「次のフレームの場所」への動きを、座標計算なしでスムーズに追跡できます。
- GUI(スマホや PC の画面): 画面のボタンを指差す際、座標ではなく「そのボタンの画像データ」を直接選べるため、画面サイズが変わっても正確に操作できます。
📊 結果:どれくらい良くなった?
実験の結果、この新しい方法は既存の AI を大きく凌駕しました。
- 画像の指差し: 世界最高レベルのスコアを達成(PointBench で 70.7%)。
- 画面操作(GUI): 座標方式の AI と比べて、**61.1%**という高い正解率を記録(オープンモデルの中で最高)。
- 動画の追跡: 人間が評価したところ、**59.1%**の確率で「こちらの指差しの方が正しい」と選ばれました。
💡 まとめ
この論文は、**「AI に座標という『言語』を教えるのではなく、AI の『目』そのものに指差しの感覚を持たせた」**という画期的なアプローチを紹介しています。
まるで、子供が「あの赤い車!」と言ったとき、大人が「X 座標 300、Y 座標 200」ではなく、「その赤い車!」と直接指を差して示すような、自然で直感的な AI になったのです。これにより、ロボットが物を掴んだり、AI がスマホの画面を操作したりする未来が、より現実的かつ正確なものになりました。
自分の分野の論文に埋もれていませんか?
研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。