← 最新の論文
💻 computer science

VisCo: Leveraging Large Language Models as Intrinsic Encoders for Visual Token Compression

VisCoは、学習効率の高いフレームワークであり、事前学習済みのVision-Language Modelを内在的なエンコーダーとして活用することで、視覚トークンをコンパクトなメモリトークンの集合へと圧縮し、大規模な再学習や外部モジュールを必要とすることなく、様々な圧縮率において優れた性能と安定性を実現します。

原著者: Yupeng Zheng, Kai Zou, Bin Liu, Nenghai Yu

公開日 2026-08-10
📖 1 分で読めます☕ さくっと読める

原著者: Yupeng Zheng, Kai Zou, Bin Liu, Nenghai Yu

原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む

想像してみてください。あなたのそばに、写真を見て物語を語ってくれる、ものすごく賢いロボットの友達がいるとします。このロボットは非常に才能豊かですが、その脳みそはとても小さく、しかも非常に高価です。あなたが高精細な写真を見せると、ロボットは画像内のすべてのピクセルを見ようとし、画像を「トークン」と呼ばれる数千もの小さなメモの膨大なリストへと変換してしまいます。それはまるで、写真に写っているのが猫なのか犬なのかを決めるためだけに、百科事典を一冊丸ごと読み込もうとするようなものです。このプロセスは非常に負荷が高いため、ロボットを動作を遅くさせ、メモリを大量に消費させ、一般的なスマートフォンやリアルタイムの状況での使用を困難にします。科学者たちは、ロボットをもっと効率的に動かせるよう教えてこようとしてきました。通常、彼らは「退屈な」メモを捨て去る(これによってロボットが重要な詳細を見逃してしまうことがあります)か、あるいは要約を助けるための、全く新しい重厚なマシンを構築する(これはコストがかかり、訓練も困難です)という方法をとってきました。大きな疑問は、「既存のロボットの脳力を使って、外部に大規模な改造を施すことなく、ロボット自身に画像を要約させることはできるだろうか?」ということです。

これこそが、まさにVisCoの開発者たちが解決しようとした課題です。彼らは、ロボットの脳(視覚言語モデル)がすでに画像を理解することの達人であることに気づきました。ただ、これまで効率的に要約するように頼まれたことがなかっただけなのです。VisCoは、新しいツールを作ったり、盲目的にメモを削除したりする代わりに、ロボットの脳を「自己完結型の圧縮マシン」として扱います。彼らは、一連の小さな「メモリ・トークン」(ロボットが書き込みできる、数枚の付箋のようなものと考えてください)を導入し、ロボットに画像全体を読み取らせ、そのすべての情報をその数枚のメモへと凝縮させるよう指示します。魔法は、ロボットが自身の内部的な「アテンション(注意)」、つまり画像の異なる部分にどのように焦点を当てるかを用いて、単純な質感から複雑な意味に至るまで、層を重ねるごとに何が重要であるかを判断することによって起こります。

論文では、このアプローチがゲームチェンジャーであることが示されています。他の手法では、非常に少ない数のメモを使うように強制すると(例えば、街全体の様子をたった一言で表現しようとするかのように)、失敗に終わってしまいますが、VisCoは驚くほど高い性能を維持します。テストにおいて、画像をたった一つのトークンまで圧縮した場合でも、VisCoは元の知能の約85%を維持しており、35〜50%程度まで低下してしまう他の手法を大きく引き離しました。さらに素晴らしいことに、研究者たちは、これらの「メモリ・メモ」が単に元の画像の縮小版であるだけでなく、画像を捉えるための「新しい方法」を実際に捉えており、それが時としてロボットを以前よりもさらに賢くすることさえあることを発見しました。これは、ロボットの脳全体を最初から訓練し直すことなく、より少ないリソースでより多くのことをさせるための、軽量で効率的な方法なのです。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →