← 最新の論文
💻 computer science

E.M.Ground: A Temporal Grounding Vid-LLM with Holistic Event Perception and Matching

E.M.Groundは、全体的な意味的連続性のための特殊なトークン、ノイズ低減のためのサビツキー・ゴレイ法、および既存のタイムスタンプ依存型手法の限界を克服するための多粒度フレーム特徴集約を導入することで、イベントの局在化精度を向上させる、時間的ビデオグラウンディングのための新しいビデオ大規模言語モデルです。

原著者: Jiahao Nie, Wenbin An, Gongjie Zhang, Yicheng Xu, Yap-Peng Tan, Alex C. Kot, Shijian Lu

公開日 2026-02-06
📖 1 分で読めます☕ さくっと読める

原著者: Jiahao Nie, Wenbin An, Gongjie Zhang, Yicheng Xu, Yap-Peng Tan, Alex C. Kot, Shijian Lu

原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む

非常にスマートなビデオアシスタント(「ビデオ大規模言語モデル」)を想像してみてください(このアシスタントは映画を視聴し、その内容に関する質問に答えることができます)。しかし、「猫が注射を受ける場面を見せて」と頼むと、アシスタントはしばしば正確な開始時刻と終了時刻を見つけるのに苦労します。猫が登場する時刻を推測することはできても、針が実際に触れた瞬間を見逃したり、途中で終わってしまったりすることがあります。

この論文は、この問題を解決するための新しいシステムであるE.M.Groundを紹介しています。これは、アシスタントを「ストップウォッチ・タイマー」から「ストーリーテラー(物語の語り手)」へとアップグレードさせるようなものです。

E.M.Groundの仕組みを、簡単な比喩を用いて説明します:

1. 古い方法:2つの独立したストップウォッチ

以前の手法(E.T.Chatと呼ばれるシステムなど)は、2つの独立したトークン(2つの異なるストップウォッチのようなもの)を使用して答えを見つけようとしていました。

  • ストップウォッチAは、イベントがいつ「始まるか」を正確に推測しようとします。
  • ストップウォッチBは、イベントがいつ「終わるか」を正確に推測しようとします。

問題点: これは、映画の最初のフレームと最後のフレームだけを見て、特定のシーンを探そうとするようなものです。これでは、その間で起きていることのすべてを見落としてしまいます。動画が長い場合、アシスタントは「中身」の部分を無視してしまうため、混乱してしまいます。イベントを一つの連続した物語として理解していないため、誤った開始時刻や終了時刻を選んでしまうことがよくあります。

2. 新しい方法:1つの「ストーリー・トークン」

E.M.Groundは戦略を変更します。2つのストップウォッチを使う代わりに、<evt>(「event」の略)と呼ばれる1つの特別なトークンを使用します。

  • 比喩: 本の中で特定の章を探している場面を想像してください。「その章はどこから始まりますか?」そして「それはどこで終わりますか?」と別々に尋ねるのではなく、「章全体」と書かれたしおりを掲げるようなものです。
  • 仕組み: この単一の <evt> トックンは、ビデオのすべてのフレームを一度に観察します。そして、「このフレームは『猫が注射を受ける』という物語の一部か?」と問いかけます。これにより、物語を一つにまとめ、開始、中間、終了を一つの連続した、一貫性のあるイベントとして理解させます。これにより、物語の筋書きを見失うことがなくなるため、長い動画に対してもより優れた性能を発揮できます。

3. 「ジッター(小刻みな揺れ)」を滑らかにする

新しい「ストーリー・トークン」を用いても、コンピュータの確信度は少し「ジッター(小刻みな揺れ)」が生じることがあります。ある瞬間にはフレームがイベントの一部であることに90%の自信を持っていたのに、次の瞬間には、わずかな視覚的なノイズのせいで40%にまで急落し、またすぐに跳ね上がる、といった具合です。

  • 比喩: グラフ上に線を引く手が震えている様子を想像してください。線が上下に激しく動きすぎてしまい、本来の形が見えにくくなります。
  • 解決策: E.M.Groundは、サビツキー・ゴーレイ(Savitzky-Golay)平滑化と呼ばれる数学的手法を使用します。これは、しわの寄ったシャツに温かいアイロンをかけるようなものです。全体の形(実際のイベント)を変えることなく、小さなノイズ(ジッター)を滑らかにします。これにより、ノイズを無視して、開始時刻と終了時刻をより正確に特定できるようになります。

4. 失われた詳細を再構築する

コンピュータがビデオを処理しやすくするために、システムはしばしば動画を「圧縮」し、一部の視覚的な詳細(高解像度の写真をサムネイルのように縮小するなど)を捨ててしまいます。これが原因で、コンピュータは重要な手がかりを見逃してしまうことがあります。

  • 比喩: ぼやけた低画質の写真から顔を認識しようとしているようなものです。
  • 解決策: E.M.Groundは、マルチグレイン(多層的)特徴量を使用します。単にぼやけたサムネイルを見るのではなく、異なるレベルの詳細(鋭いエッジ、色、質感など)で写真を見、それらを組み合わせます。これは、拡大鏡、広角レンズ、カラーフィルターを同時に使って、失われた詳細を再構築するようなものであり、コンピュータが重要なことを見逃さないようにします。

結果

論文では、E.M.Groundを多くの異なるビデオデータセットでテストしました。

  • 精度の向上: E.M.Groundは、以前の最高の手法(E.T.Chatなど)を大幅に上回る精度を一貫して示しました。
  • 長い動画への対応: 古いシステムは動画が長くなるにつれて性能が低下しましたが、E.M.Groundはイベント全体を理解しているため、高い性能を維持しました。
  • エラーの減少: 予測された時間が実際のイベントと全く重ならないケースや、イベントの中間部分だけを見つけて開始・終了を見逃してしまうといったエラーが大幅に減少しました。

要約すると: E.M.Groundは、開始時刻と終了時刻を別々に推測しようとするのをやめます。代わりに、イベントを一つの連続した物語として扱い、コンピュータの混乱を滑らかにし、利用可能なすべての視覚的詳細を使用して、イベントが発生する正確な瞬間を見つけ出します。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →