← 最新の論文
🤖 machine learning

ReToken: One Token to Improve Vision-Language Models for Visual Retrieval

ReTokenは、事前充填されたKVキャッシュからクエリに関連する視覚的トークンを効率的に検索する軽量で単一の学習可能な埋め込みであり、単一のGPU上での計算可能性を維持しつつ、長文脈の画像およびビデオ検索タスクにおける視覚言語モデルの性能を大幅に向上させます。

原著者: Yao Xiao, Reuben Tan, Zhen Zhu, Yuqun Wu, Jianfeng Gao, Derek Hoiem

公開日 2026-07-31
📖 1 分で読めます☕ さくっと読める

原著者: Yao Xiao, Reuben Tan, Zhen Zhu, Yuqun Wu, Jianfeng Gao, Derek Hoiem

原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む

巨大で混沌とした干し草の山の中から、特定の針を見つけ出そうとしている場面を想像してみてください。今度は、その干し草の山が単なる積み藁ではなく、数千冊の本が詰まった巨大な図書館であり、あなたは超スマートなロボット司書に向かって、あなたの質問に答えるたった一つの文章を見つけるために図書館全体を読み解くよう頼んでいると想像してください。これが、「視覚言語モデル(Vision-Language Models: VLMs)」の世界です。これは、画像とテキストの両方を同時に理解しようとする人工知能の一分野です。

長い間、これらのロボットは単一の写真や短いクリップを見ることは得意としてきました。しかし、1時間のビデオや100枚の画像の束を与えられると、彼らは圧倒されてしまいます。それは、人間に一度に千冊の本を読ませるようなものです。彼らの脳(この場合はコンピュータのメモリ)はそれらすべてを保持することができず、混乱し始めてしまいます。彼らは、同時にすべてを処理しようとするあまり、間違ったページを見てしまったり、手がかりを見逃したりしてしまうのです。科学者たちが問い続けてきた大きな疑問は、「どうすれば、これらのロボットに自分自身の記憶を『検索』する能力をより向上させることができるのか?」ということです。どうすれば、巨大な家のサイズのスーパーコンピュータを必要とせずに、退屈な部分を無視して、正確な瞬間や画像にズームインできるよう教えることができるのでしょうか?

ここで、ReTokenと呼ばれる新しいアイデアが登場します。視覚言語モデルを、証拠を見て犯罪を解決するように訓練された探偵だと考えてみてください。通常、あなたが探偵に「赤い車はどこですか?」と尋ねると、探偵はすべての証拠(画像)を調べ、どれにどれだけの「注意(アテンション)」を払うかに基づいて、どれが重要かを推測しようとします。研究者たちは、この「注意」という手法が、実はビデオや大量の画像コレクションに対しては非常に信頼できないものであることを発見しました。それは、探偵が背景にある光る物体に気を取られて、赤い車を見逃してしまうようなものです。

チームは、ロボットの現在の検索方法には欠陥があることを見出しました。彼らがテストを行ったところ、ロボットが標準的な「注意」信号を使用してビデオから正しいフレームを選ぼうとしたとき、正解できる確率はわずか5%程度でした。それは実質的に、暗闇の中で手探りで推測しているようなものです。彼らはまた、奇妙なことにも気づきました。ロボットの「注意」は、特定の画像を見つけるためではなく、文章の次の単語を予測するように訓練されているのです。そのため、司書としてはあまり優秀ではありません。

これを修正するために、著者たちはReTokenを発明しました。あなたが持てる「検索ボタン」を質問に貼り付けられる、魔法のボタンを想像してください。ロボットに図書館全体をスキャンさせる代わりに、この特別なボタンを渡すのです。このボタンは、ロボットが探し物をするために特別に使用するように訓練された、学習可能な小さなコードの断片です。これは、ロボットが通常使用する「ラベル」や「キー」ではなく、画像の「内容」(論文では「バリュー(value)」空間と呼んでいます)を見ることで機能します。

ここからが魔法のトリックです。研究者たちは、この単一の「検索ボタン」を、少数の画像に関する質問を用いて訓練しました。彼らは、このボタンがノイズを無視し、答えとなる正確なフレームにロックオンするように教え込みました。一度訓練されると、この小さなトークンは超効率的なリトリーバー(検索器)となりました。ロボットが長いビデオに関する質問を受けたとき、このトークンはレーザーポインターのように機能し、数千のフレームの中から関連する数フレームを瞬時に見つけ出し、残りの部分は無視します。

結果は驚くほど強力でした。彼らが「ビジュアル・ヘイスタック(Visual Haystack)」チャレンジ(多くの画像の中から関連する1枚を見つける課題)でテストしたところ、ReTokenを使用するロボットは、以前の最高記録と比較して精度が13ポイント以上向上しました。さらに印象的なことに、彼らは静止画のみでこれを訓練しましたが、長いビデオを与えても、依然として機能しました!そのスキルは完璧に転移し、難しいベンチマークであるLVBenchにおいて、ビデオ理解のスコアを8ポイント向上させました。

最も素晴らしい点は、このソリューションが非常に軽量であることです。ロボット全体を作り直したり、巨大なスーパーコンピュータを使用したりする必要はありません。訓練から長いビデオの視聴に至るまでの全プロセスは、単一の高性能グラフィックスカード(H100)に収まります。著者たちは、このシンプルな単一トークンによるアプローチこそが、詳細に迷うことなく、数時間のビデオや膨大な画像コレクションを真に理解できるAIを実現するための鍵である可能性を示唆しています。これは、ロボットに「より大きな脳」を与えるのではなく、単に「より良い見方」を与えることで、木を見て森を見失わないようにする、小さな、しかし重要な変化なのです。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →