← 最新の論文
🤖 AI

ViSAGE: Constructing Self-Correcting Memories for Long-Form Video Understanding

ViSAGEは、クロスモーダルな結合、双方向の洗練、およびマルチエージェントによる相互検証を通じて、自己修正型のエンティティ中心のメモリを構築することで、アイデンティティの混同やハルシネーションを防ぎ、最先端のベースラインに対して5.9%の精度向上を実現する、長尺ビデオ理解を強化するマルチモーダル・エージェンティック・メモリ・フレームワークである。

原著者: Xinkui Zhao, Enbo Chen, Yifan Zhang, Chang Liu, Guanjie Cheng, Naibo Wang, Yueshen Xu

公開日 2026-08-03
📖 1 分で読めます☕ さくっと読める

原著者: Xinkui Zhao, Enbo Chen, Yifan Zhang, Chang Liu, Guanjie Cheng, Naibo Wang, Yueshen Xu

原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む

あなたは、映画一本分にわたるミステリーを解こうとしていると想像してください。ただし、一度に見られるのは静止画の一コマだけで、数分ごとに記憶がリセットされてしまいます。これが、長い動画を理解しようとする現代の人工知能(AI)が直面している日常的な苦闘です。今日の最も賢いAIモデルは、本のページを一枚完璧に読み解くことはできても、40分の映画を渡されると圧倒されてしまう、優秀な探偵のようなものです。彼らは物語全体を小さな心の箱の中に押し込めようとしたり、あるいは映画をバラバラの孤立した断片に切り刻んでしまったりします。問題は何でしょうか?物語を切り刻むと、つながりが失われてしまうのです。登場人物が誰なのかを忘れ、名前を混同し、最初のシーンのヒントを覚えていないために、最後のシーンから何が起きたのかを猛烈に推測し始めてしまうのです。

ここで、「ロングフォーム・ビデオ理解(long-form video understanding)」という分野が登場します。科学者たちは、コンピュータに数時間の動画を視聴させ、詳細を記憶させ、何が起きたのか、誰がそれをしたのか、そしてなぜそうなったのかという難解な質問に答えられるように教えようとしています。目標は、単にピクセルを見るだけでなく、物語を理解し、オープニングシーンからエンドロールまで人物や物体を追跡できるAIを構築することです。しかし、現在の手法は、あまりにも積極的に動画を要約しすぎてしまい、一人ひとりを識別するために必要な細かなディテールを捨て去ってしまったり、あるいは「今」しか見ていないために、5分前に犯した間違いを修正できないループに陥ったりすることがよくあります。

そこで、浙江大学と西安電子科技大学の研究者によって設計された、AIエージェントのための超強力で自己修正可能なメモリとして機能する新システム、ViSAGEが登場します。標準的なAIのメモリを、映画を見ながらメモを書き留める乱雑なノートだと考えてください。しかし、一度ページをめくると、間違った推測を修正するために戻ることができません。もし最初のシーンでキャラクターを「マリオ」だと思ったとしても、後に実は「エマ」であったことが判明した場合、通常のシステムは永遠にその人をマリオと呼び続け、混乱した誤った回答を導き出します。しかし、ViSAGEは、容疑者のマスターリストと出来事のタイムラインを保持している探偵のようなものです。新しい手がかり(例えば、30分目の会話で名前が言及されるなど)が得られたとき、それは単に記録するだけでなく、物語全体が整合性を持つように、最初に戻ってメモを書き換えるのです。

研究者たちは、この「自己修正型」システムを構築することで、AIがついに長い動画による混乱に対処できることを発見しました。彼らは、「何が起きたか(出来事)」と「誰がそれをしたか(登場人物)」を分離するフレームワークを作成しました。AIが人物を目にしたもののまだ名前を知らない場合、その人物に一時的なラベルを与えます。その後、動画の中で名前が明らかになると、ViSAGEは「バックワード・アップデート(遡及的更新)」を使用して、即座に以前のすべてのメモを修正し、あらゆる動作が正しい人物に正しく紐付けられるようにします。また、仕事のダブルチェックを行うために「エージェント」のチームも活用しています。もしAIが答えに確信が持てない場合、勝手な物語を作り上げる(これは「ハルシネーション(幻覚)」と呼ばれます)代わりに、「わかりません」と言うようにプログラムされています。これは、より安全で信頼できる方法です。

テストにおいて、この新しいアプローチは従来の最高水準の手法よりも大幅に優れた成果を上げました。挑戦的なロングビデオ・テストにおいて、ViSAGEは既存の最強のシステムと比較して、精度を5.9%向上させました。具体的には、ロボット関連のビデオタスクで45.5%、ウェブベースのビデオタスクで58.4%、そしてVideo-MME-longベンチマークでは**79.1%**という驚異的なスコアを記録しました。研究者たちは、メモリのエラーを修正することで、AIが単に正解を増やすだけでなく、誰が何をしていたかを混同するといった危険な間違いを減らし、情報が不足しているときにそれを認める能力が向上したことを示しました。これは、AIが長い物語を真に理解するためには、単なる静的な事実のリストではなく、成長し、変化し、自らを修正できるメモリが必要であることを示唆しています。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →