← 最新の論文
🤖 AI

RoRA: Role-Oriented Regional Allocation for Visual Token Pruning in MLLMs

RoRAは、トークンを意味的、文脈的、および詳細な役割に分割し、それらをアテンション・アンカー領域を通じて割り当てることで、保持されたトークンを互換性のあるものとして扱わずに包括的なオブジェクト被覆を保証し、マルチモーダル大規模言語モデルの推論効率と精度を向上させる、学習不要のビジュアルトークンプルーニングフレームワークである。

原著者: Qiyanhui Lu, Han Wu, Rongjian Xu, Tingzhang Luo, Cheng Fan, Xinghao Chen, Minjing Dong, Jufeng Yang, Jianyuan Guo

公開日 2026-08-10
📖 1 分で読めます☕ さくっと読める

原著者: Qiyanhui Lu, Han Wu, Rongjian Xu, Tingzhang Luo, Cheng Fan, Xinghao Chen, Minjing Dong, Jufeng Yang, Jianyuan Guo

原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む

あなたは、超高性能なロボットに世界の「見方」を教えようとしていると想像してください。単に画像を見せるのではありません。あなたは、デジタル的なパズルの断片である「トークン」と呼ばれる、膨大な、終わりのない情報の流れをロボットに送り込みます。各断片は、画像に関するわずかな情報を持っています。単純な写真であれば、これで十分です。しかし、高解像度の写真や動画、あるいは複雑なシーンの場合、ロボットは何千もの断片の洪水にさらされることになります。それは、隅にいる猫についてのたった一つの質問に答えるために、図書館にある本を一冊丸ごと読み上げるようなものです。ロボットは圧倒され、考えるのに時間がかかりすぎ、それらすべての断片を記憶の中に保持するために膨大なメモリを必要とします。これが、マルチモーダル大規模言語モデル(MLLM)の研究者が解決しようとしている問題です。つまり、いかにしてノイズに埋もれることなく、画像の重要な部分にロボットの注意を向けさせるか、ということです。

一般的な手法は、重要そうに見える断片を捨ててしまうことです。しかし、ここに落とし穴があります。ロボットの脳は、何が重要かを判断するのが完璧ではありません。時には、画像の端に気を取られたり、特定の場所に固執したりして、尋ねられた実際の対象物を見逃してしまうことがあります。他の手法では、画像の断片を均等に散りばめようとしますが、それは群衆の写真を撮って、一人ひとりのシャツから数ピクセルずつ抜き取った結果、顔を完全に見逃してしまうようなものです。その結果、ロボットは背景は見えているものの、メインイベントを見落としてしまうという事態を招きます。

ここで、RoRA(Role-Oriented Regional Allocation:役割指向型領域割り当て)と呼ばれる新しい手法が登場します。これは、ロボットの視覚における「賢い編集者」として機能します。単に「最も重要な」断片を選ぶのではなく、RoRAは画像を、正しく物語を伝えるために3つの特定の種類の「証拠」を必要とする物語のように扱います。

第一に、RoRAは**セマンティック・コア(意味的核心)**を特定します。これは物語の「主人公」だと考えてください。もしあなたが「あの選手のユニフォームの番号は何ですか?」と尋ねたなら、コアとは、そのユニフォームの上にある、確信度の高い特定のピクセルです。RoRAはこれらの断片を断固として保護し、画像の他の部分をどれほど削り取ったとしても、ロボットが主役を見失わないようにします。

第二に、**補完的なコンテキスト(文脈)**を探します。これは「脇役」と「舞台設定」です。ロボットが主人公を認識したら、次に彼らがどこに立っていて、周囲で何が起きているかを知る必要があります。RoRAは、主人公のすぐ外側のエリアからも断片を確実に取得するようにします。これにより、ロボットが単に「浮いているユニフォーム」を見るのではなく、それがスタジアムにいる選手の上にあるのだと理解できるようにします。RoRAは、同じ場所から断片を取りすぎる(冗長になる)ことを積極的に避け、代わりに周囲のエリアから新しい情報を探し出します。

第三に、RoRAは**微細なディテール(詳細)**のために小さな予算を確保します。これらは「物語の伏線」や小さな手がかり、例えば看板の小さな文字、布の質感、あるいは隅に隠れている小さな物体などです。これらの詳細は小さくて見逃されやすいため、RoROAは、単に画像の中で一番大きなものではないという理由だけで誤って削除されないよう、特別な「救助任務」を与えます。

RoRAの魔法は、これらの役割をどのように整理するかという点にあります。単に「どの断片が一番キラキラしているか?」と問うのではありません。代わりに、「主人公は揃っているか? 舞台設定はあるか? そして、小さな手がかりはあるか?」と問いかけるのです。RoRAは、**アテンション・アンカー領域(AARs)**というスマートなマップを使用して、主人公がどこにいるかをマークします。そうすることで、設定(マップの外側)をどこで探すべきか、そして手がかり(マップの内側)をどこで探すべきかを正確に把握するのです。

結果は驚異的です。LLaVAやQwen-VLといった強力なロボットの脳を用いてテストした際、RoRAは画像の断片を大幅に削減することに成功しました。一部のモデルでは、元の精度の96.5%を維持しながら、断片を最大88.9%も削減できました。実際、あるテストでは、RoRAは非常に効率的であり、未加工のバージョンよりも思考時間を24.6%短縮し、1.33倍高速化しました。さらに重要なことに、これは単なる推測ではなく、実際のハードウェア(NVIDIA H800 GPU)上で測定された数値であり、どの断片を残すかを決定するのにわずか0.7ミリ秒しかかかりません。

古い手法のように、画像の誤った部分に注意を向けてしまったり、すべての断片を互いに照合するループに陥って(これは低速でコストがかかります)、処理が停滞したりすることはありません。RoRAは、速く、そして集中しています。画像の断片に「最高のもの」を選ぶのではなく、特定の「仕事」を割り当てることで、超スマートなロボットが大量のデータによる頭痛を感じることなく、クリアに、かつ迅速に世界を見ることができるようになることを、RoRAは証明しました。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →