← 最新の論文
🤖 AI

video-SALMONN S: Memory-Enhanced Streaming Audio-Visual LLM

本論文は、短期的な表現を長期記憶へと継続的に変換するためにテスト時学習を利用することで、3時間を超えるビデオの処理を可能にし、長時間のビデオおよびエピソード学習のベンチマークにおいて既存のモデルを大幅に上回る、メモリ強化型ストリーミング・オーディオビジュアルLLMであるvideo-SALMONN Sを導入する。

原著者: Guangzhi Sun, Yixuan Li, Xiaodong Wu, Yudong Yang, Wei Li, Zejun Ma, Chao Zhang

公開日 2026-02-04
📖 1 分で読めます☕ さくっと読める

原著者: Guangzhi Sun, Yixuan Li, Xiaodong Wu, Yudong Yang, Wei Li, Zejun Ma, Chao Zhang

原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む

あなたは、あるロボットに3時間の映画を理解させる方法を教えようとしています。ただし、あなたは1秒間に1フレームという非常に遅く、カクカクとした映像しか見せることができず、画質も360pと少しぼやけています。さらに、そのロボットは「脳(メモリ)」が非常に小さく、一度に保持できる情報量が極めてわずかです。

現在のほとんどのAIロボットは、映画の最後まで到達する頃には、冒頭の内容を忘れてしまいます。この論文は、この問題を解決する「video-SALM0N S」という新しいロボットを紹介しています。その仕組みを、簡単な比喩を使って説明します。

1. 問題点:「漏れるバケツ」

バケツに穴が開いている状態で、バケツに水(ビデオ情報)を注ぎ続けようとしている場面を想像してください。

  • 従来のAIモデルは、底に大きな穴が開いたバケツのようなものです。3時間のビデオを注ぎ込もうとしても、最後までたどり着く前に水(情報)が漏れ出してしまいます。メモリに収めるために、彼らはビデオの大部分を捨て去らなければならず、重要な詳細を忘れてしまいます。
  • ストリーミングモデル(現在の最高峰)はより優れていますが、それでも新しいデータのために古いデータを常に削除しなければならないため、時間の経過とともに情報を失ってしまいます。

2. 解決策:「自己編集ノート」(TTT)

video-SALMONN Sの秘訣は、「TTT(Test-Time Training)」と呼ばれる手法です。

  • 比喩: あなたがとても長い本を読んでいると想像してください。ただ読んで忘れるのではなく、あなたには魔法のノートがあります。新しいページを読むたびに、ただ書き留めるだけでなく、読んだ内容に基づいて「自分自身の脳」を書き換えていくのです。読んでいる最中に、物語への理解を更新していきます。
  • 仕組み: ビデオが再生されるにつれ、モデルは物語の詳細を保存するために、自身の内部設定(「重み」)を絶えず微調整します。これは、短期的な記憶(たった今起きたこと)を長期的な記憶(物語全体)へと変えていくプロセスであり、自身の構造自体を変化させる作業です。これは、ロボットが単にビデオを「見ている」のではなく、リアルタイムでビデオを「学習している」ようなものです。

3. 「長距離予測」のトリック

ロボットが映画の冒頭を忘れないようにするために、著者たちは「Long-Span Prediction(長スパン予測)」と呼ばれる特別なルールを追加しました。

  • 比喩: あなたが友人と「伝言ゲーム」をしていると想像してください。ただし、そのゲームは3時間続きます。通常、メッセージは途中でめちゃくちゃになってしまいます。しかし、このモデルにはルールがあります。「メッセージを伝えるたびに、30分前に言われた内容を今でも覚えているかを確認しなければならない」というルールです。
  • 結果: これにより、最新のフレームを処理している間でも、ビデオの初期部分を鮮明に記憶し続けることができます。

4. 「賢い司書」(メモリリーダー)

魔法のノートがあったとしても、誰かに特定の質問をされたとき、3時間の本の全ページを読み返すことはできません。それでは時間がかかりすぎるからです。

  • 比喩: ユーザーが「次に何が起こりますか?」と尋ねたとき、ロボットは賢い司書のように振る舞います。3時間のアーカイブ全体を取り出す代わりに、質問に関連する「正確な数ページ」を素早くスキャンし、それ以外の部分は無視します。
  • メリット: これにより、何時間ものビデオを視聴した後でも、ロボットは高速かつ効率的に動作できます。

5. 新しいテスト:「ELViM」(メモリ・チャレンジ)

著者たちは、既存のテストは簡単すぎると気づきました。それらは、ロボットが「まさに今」見ているビデオに関する質問しかしていなかったからです。そこで、彼らはELViM(Episodic Learning from Video Memory)という新しいテストを作成しました。

  • シナリオ: ロボットが誰かがケーキを焼いているビデオを見ます。その後、30分間、他のビデオ(自然ドキュメンタリーなど)を見ます。最後に、再び製菓のビデオに戻り、製菓人が卵を割る直前で停止します。
  • 質問: 「次のステップは何ですか?」
  • ゴール: ロボットは、30分前の製菓のステップを記憶し、その間に流れた自然ドキュメンタリーを無視して、正解を出さなければなりません。
  • 結果: video-SALMONN Sはこのテストを圧倒し、従来の最高モデルよりも15%高いスコアを叩き出しました。これは、ロボットが数時間前に学んだスキルを実際に「記憶」できることを証明しています。

実績のまとめ

  • 長いビデオを視聴可能: 低フレームレートで3時間を超えるビデオを、メモリ不足に陥ることなく扱うことができます。
  • 優れた記憶力: 標準的なテストにおいて、ライブ視聴を行う「ストリーミング」モデルおよび、ビデオ全体を一度に見る「オフライン」モデルの両方を、大幅な差(標準テストで3〜7%、メモリ・テストで15%)で上回りました。
  • 効率的: これを行うためにスーパーコンピュータを必要としません。標準的なメモリ予算内に収まります。

要約すると、video-SALMONN Sは、長い映画を視聴し、そこから学び、数時間後でも詳細を記憶することができる、世界初のAIです。しかも、メモリ使用量を小さく一定に保ったまま実現しています。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →