← 最新の論文
🤖 AI

Buried in Textual Debt: Context Pruning with Visual Evidence Preservation for MLLM Agents

本論文は、マルチモーダル大規模言語モデルエージェントにおいて、不可欠な視覚的証拠を保持しつつ冗長な推論テキストを効果的に削減するKL誘導型フレームワークであるSPAREを導入しており、これによりタスク精度を向上させ、長期的なマルチモーダル・ツール使用シナリオにおける「テキスト的負債(textual debt)」の問題を軽減する。

原著者: Yuchen Huang, Sijia Li, Jun Zhang, Yi R. Fung

公開日 2026-08-25
📖 1 分で読めます☕ さくっと読める

原著者: Yuchen Huang, Sijia Li, Jun Zhang, Yi R. Fung

原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む

急速に進化する人工知能の分野において、見ることも考えることもできるデジタルアシスタントとして機能する、特定の種類のコンピュータプログラムが登場しました。マルチモーダル大規模言語モデルとして知られるこれらのシステムは、画像を見、それに関する質問を理解し、答えを見つけるために外部ツールを使用するように設計されています。複雑な問題を解決するために、彼らは単に推測するのではなく、タスクを一連のステップに分解し、進めていく過程で自分自身の思考と計画を書き出していきます。この思考を書き留めるプロセスは、人間がパズルを解きながらメモを取る時のように、彼らが整理された状態を保ち、異なるアクションを調整するのに役立ちます。しかし、これらのデジタルアシスタントが長く困難なタスクに取り組むにつれ、生成されるテキストが積み重なっていきます。この自ら書き込んだメモの蓄積は、やがて膨大なものとなり、元の画像やツールが提供する新しい視覚的な手がかりを押し退けてしまい、システムが目の前にある新鮮な証拠よりも、自身の過去の言葉に依存しすぎる原因となります。

香港科技大学の研究者たちは、この現象を「テキストの負債(textual debt)」として特定しました。これは、会話の履歴が、エージェントが分析すべき視覚的な現実を飲み込んでしまう状態を指します。エージェントが初期の誤った考えに陥ると、その考えを補強する膨大なテキストの量が、新しい情報に対する目隠しとなり、ミスを誘発します。これを解決するために、チームはエージェントの記憶に対する選択的なエディターとして機能する「SPARE」という手法を開発しました。SPAREは、古いテキストを単に削除したり画像を圧縮したりするのではなく、エージェントの過去の推論を注意深くレビューし、何が依然として有用で、何が冗長になったかを判断します。それは、次のような単純な問いを立てることで機能します。「もしエージェントが現在の状況を数文で要約するとしたら、次のステップを理解するために、以前に書いた特定の推論の段落をまだ読む必要があるだろうか?」

このプロセスには、システムが自分自身の思考の2つのバージョンを比較するという、巧妙な診断チェックが含まれています。一つのバージョンでは、エージェントは思考と行動の全履歴を読みます。もう一方のバージョンでは、同じ履歴を読みますが、そこに現在のタスクの状態を凝縮した要約を加えています。システムはその後、その要約の存在が、次の単語に対するエージェントの予測をどれだけ変化させるかを測定します。もし要約によってエージェントの思考が大きく変化する場合、それは古い段落に、要約が逃した独自の重要な詳細が含まれていることを意味するため、その段落は保持されます。もし要約によってほとんど変化が生じない場合、それは古い段落が、すでに要約に捉えられている情報を繰り返しているだけであり、削除しても安全であることを意味します。これにより、システムはタスクに不可欠な座標や画像内のテキストといった特定の視覚的詳細を保持しながら、コンテキストを乱す「鮮度の落ちた」テキストを刈り取ることができるのです。

このプルーニング(枝刈り)をより効果的にするために、研究者たちはシステムに対し、より優れた、より包括的な要約を書くよう訓練も行いました。エージェントがタスクの状態をより効率的に凝縮できるように教えることで、プルーニングツールが重要な情報を失うことなく、さらに多くの冗長なテキストを削除することを可能にしました。画像編集、ツール使用、視覚的探索を含むいくつかの困難なベンチマークを用いてテストしたところ、このアプローチは非常に高い成功を収めました。システムは、推論トークン(エージェントが自分自身に書き込んだ言葉)の37.89%から64.58%を削除することに成功しましたが、同時にタスクの精度も向上させました。多くの場合、プルーニングされたエージェントは、全履歴を保持していたエージェントよりも優れたパフォーマンスを示しました。これは、テキストのノイズを減らすことが、視覚的な証拠への集中力を高めるのに役立ったことを示唆しています。

これらの知見は、エージェントが成功するためには推論のあらゆるステップを記憶しておく必要があるという一般的な仮定に異を唱えるものです。むしろ、この研究は、長期的な複雑なタスクにおいては、無関係な部分を忘れる能力が、推論する能力と同じくらい重要であることを示唆しています。テキストの負債を解消することで、システムは、自身の過去の仮定のループに陥ることなく、画像やツールから提供される新しいデータに注意を向ける能力を取り戻します。この研究は、人工知能が視覚的タスクにおける真に効果的な長期的なパートナーとなるためには、単に「どう考えるか」だけでなく、「どの思考を捨て去るべきか」をも学ぶ必要があることを示しています。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →