← 最新の論文
💻 computer science

Can Graphs Help Vision SSMs See Better?

本論文は、幾何学的な直列化を特徴条件付きセマンティックルーティングに置き換えることでビジョン状態空間モデルを強化し、線形な計算スケーリングを維持しながら多様なビジョンタスクにおいて最先端の性能を達成するグラフ誘起型動的走査演算子であるGraphScanを導入する。

原著者: Dhruv Parikh, Anvitha Ramachandran, Haoyang Fan, Mustafa Munir, Rajgopal Kannan, Viktor Prasanna

公開日 2026-05-13
📖 1 分で読めます☕ さくっと読める

原著者: Dhruv Parikh, Anvitha Ramachandran, Haoyang Fan, Mustafa Munir, Rajgopal Kannan, Viktor Prasanna

原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む

複雑な絵画、例えば賑やかな街並みを描いた絵画を理解しようとしていると想像してください。あなたは、情報を一列に、一つずつ処理するのが得意な非常に高速で効率的な脳(「ビジョン・ステート・スペース・モデル」または「ビジョン SSM」と呼ばれる)を持っています。

しかし、問題があります。その絵画は二次元(高さ幅を持つ)ですが、あなたの脳が理解できるのは、文のような一次元のリストだけです。絵画をそのリストに適合させるために、あなたは絵画を小さな正方形(トークン)の長い列に平らに広げなければなりません。まるで絨毯を巻き戻すようにです。

従来の方法:「芝刈り」の問題

従来、絵画を線形に変換するために、研究者たちは固定された走査パターンを使用していました。

  • ラスタ走査: 芝刈り機が芝生の上を行ったり来たりする様子を想像してください。左から右へ移動し、一段下がり、右から左へ移動し、というように繰り返します。
  • 問題点: 絵画において、隣り合った二つの正方形が、「刈られた」列の中では遠く離れている可能性があります。例えば、猫の耳と鼻を見ていた場合、固定された走査器はそれらをリストの中で何マイルも離れて配置してしまうかもしれません。脳はそれらを結びつけるために長い間待たなければならず、あるいは硬直的な経路に従っているため、結びつきを見逃してしまうかもしれません。

一部の新しい手法は、経路を変形させることでこの問題を解決しようとしました。芝刈り機の運転手が賢くなって、「あの芝の部分は花のように見えるから、まずそこを切りに行くためにジャンプしよう」と言う様子を想像してください。これは座標オフセット走査と呼ばれます。これは改善されましたが、依然として主に意味(その芝の部分が実際何であるかを理解する)ではなく、幾何学(新しい座標へ移動する)に関するものでした。

新しいアイデア:GraphScan(「賢い近所」アプローチ)

この論文の著者たちは、単純な問いを投げかけました。「もし、絵画を脳に送り込む前に、正方形たちが単に位置だけでなく、見た目に基づいて隣接する正方形と会話させたらどうなるでしょうか?」

彼らはGraphScanを導入しました。その仕組みを簡単な比喩で説明します。

  1. 近所の集会: 単に芝刈り機を動かす代わりに、絵画内のすべての正方形が小さな近所の集会を開くと想像してください。
  2. 意味的な会話: 各正方形は、すぐ隣の正方形たちを見ます。しかし、「あなたは私の左にいる」と言うのではなく、「私たちは似ているか?同じ物体の一部か?」と問いかけます。
    • もしある正方形が「犬の毛並み」の一部であれば、幾何学的に複雑であっても、近くの他の「毛並み」の正方形と強く結びつきます。
    • ある正方形が「空」の一部であれば、他の「空」の正方形と結びつきます。
  3. メッセージ: 正方形はこの会話から最良の情報を集め、それを混ぜ合わせて、自分が何であるかという自身の「意見」を更新します。
  4. 引き渡し: 今や、すべての正方形が近所の文脈についてより良く、より情報に基づいた理解を得た後、それは長い列で処理されるために、高速な脳(ビジョン SSM)に引き渡されます。

これが画期的な理由

この論文は、この単純な変更によって AI がはるかに良く「見る」ようになると主張しています。

  • 代替ではない: 彼らは、遅く複雑なグラフ機械で高速な脳を置き換えたわけではありません。脳が働き始める直前に「準備ステップ」を追加しただけです。
  • 局所的で賢い: 一度に絵画全体を見る(これは遅い)のではなく、小さな境界のある近所(3x3 または 5x5 のグリッドなど)だけを見ます。しかし、誰に耳を傾けるかは、グリッドの位置ではなく、内容(意味)に基づいて決定されます。
  • 結果: 彼らはこの新しい「GraphScan-Mamba」を標準的なタスクでテストしたところ、以下の結果が得られました。
    • 画像識別(ImageNet): 以前のモデルよりも高いスコアを記録しました。
    • 物体検出(COCO 検出): 車、人、動物をより正確に検出しました。
    • シーンセグメンテーション(ADE20K): 物体の正確な形状を塗り分ける作業がより上手に行われました。

結論

この論文は、画像を走査することを単なる幾何学的なパズル(これらのタイルをどのように列に配置するか?)として考えるべきではないと結論付けています。代わりに、それらを何であるかについて情報を共有させる(それらが整理される前に)という意味的ルーティングの問題として扱うべきです。

画像のパッチがより良い局所的な理解を構築するために隣接するパッチと「会話」することを可能にすることで、ビジョン SSM は処理するためのはるかに明確で意味のあるリストを受け取り、より賢く、より正確なコンピュータビジョンへとつながります。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →