← 最新の論文
💻 computer science

TOC-Bench: A Temporal Object Consistency Benchmark for Video Large Language Models

本論文は、被覆、状態変化、相互作用にわたるビデオ大規模言語モデルの未探索な能力である時間的物体の一貫性を維持する能力を評価するために設計された厳密にフィルタリングされ人間が検証したベンチマークであるTOC-Benchを導入し、一般的なビデオ理解の進展にもかかわらず、現在のモデルがアイデンティティに敏感な推論やイベントの順序付けにおいて著しく困難を抱えていることを明らかにする。

原著者: Junzhe Chen, Siyuan Meng, Yuxi Chen, Man Zhao, Wenyao Gui, Xiaojie Guo

公開日 2026-05-13
📖 1 分で読めます☕ さくっと読める

原著者: Junzhe Chen, Siyuan Meng, Yuxi Chen, Man Zhao, Wenyao Gui, Xiaojie Guo

原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む

友人と一緒に、その友人がまだ見たことのない映画を観ていると想像してください。あなたは友人に尋ねます。「赤いボールがソファの後ろに転がって消えたのか、それとも部屋から完全に去ったのか、どちらだった?」

もしあなたの友人が標準的な AI 動画モデルなら、彼らは「赤いボールが見えて、その後ソファが見えたので、ソファの後ろにあるに違いない」と答えるかもしれません。彼らは単一のスナップショット内の物体を認識するのは得意です。しかし、「ボールが隠れる前に何回跳ねたか?」や「ボールは犬が入ってくる前と後、どちらに跳ねたか?」と尋ねると、彼らはしばしば混乱します。特に、ボールが隠れたり後で戻ってきたりする場合、その特定のボールの物語を時間を通じて一貫して追跡することに苦労します。

この論文は、時間が進むにつれてこれらの AI「映画鑑賞者」が物体をどの程度正確に追跡できるかを確認するための新しいテスト、TOC-Bench(Temporal Object Consistency Benchmark:時間的物体一貫性ベンチマーク)を紹介します。

問題:「記憶喪失」の鑑賞者

現在の AI モデルは、個々の写真については優れた記憶力を持つが、それらの写真の間では記憶喪失に苦しむ人のようです。彼らは写真の中に何が写っているかを教えてくれますが、以下の点を見失うことが多いのです:

  • 同一性: 隠れた後に再登場する人物は、同じ人物なのか、それとも別人なのか?
  • 連続性: 物体は部屋を出たのか、それとも単に視界から遮られただけなのか?
  • 数え上げ: 猫は何回跳んだり着地したりしたか?
  • 順序: コップが割れたのは、犬が吠える前か後か?

既存のテストは主に「この動画で何が起きているか?」や「主人公は誰か?」といった広範な質問をします。AI が物語全体を通じて特定の物体の旅を追跡できるかどうかは検証していません。

解決策:探偵のノート(TOC-Bench)

著者らは、TOC-Benchと呼ばれる特別なテストスイートを開発しました。これは動画 AI 向けの「探偵のノート」と考えてください。

  1. 真実の基盤(地図): AI に質問する前に、研究者らは特殊なツールを用いて動画の完璧な「地図」を作成しました。彼らは赤いボールや人物などのすべての物体をフレームごとに追跡し、いつ現れ、消え、隠れ、他者と相互作用したかを正確に記録しました。

  2. 質問(なぞなぞ): 彼らはこの地図に基づいてのみ、数千の質問を生成しました。例えば、「赤いボールが青い箱の後ろに隠れた回数を数えて」といった具合です。

  3. 「近道」フィルター(罠): ここが巧妙な部分です。研究者らは AI が抜け道を使えないようにしたかったのです。彼らは以下のいずれかで答えられる質問を除外する 3 段階のフィルターを使用しました:

    • 質問を読むだけ(言語的なトリック)。
    • 単一のフレームを見るだけ(静止画像のトリック)。
    • フレームを無作為な順序で見る(時間の無視)。

    動画を順序通りに観ていなくても解ける質問はすべて排除されました。これにより、AI は正解を得るために、時間の流れと物体の歴史を理解しなければならないことが保証されます。

結果:現実のチェック

研究者らは、この新しいテストで 23 種類の異なる AI モデル(無料のものから高価なものまで)をテストしました。結果は驚くべきものでした:

  • 格差: 人間の正解率は約**89%でした。最高性能の AI モデルはわずか47%**でした。
  • 弱点: AI は以下の点でひどく苦手でした:
    • 数え上げ: 「これは何回起きたか?」(実際は 4 回なのに、よく 2 回と推測していました)。
    • 順序: 「どちらが先に起きたか?」(タイムラインをしばしば混同していました)。
    • 幻覚: 動画に存在しなかった物体について尋ねられたとき、AI は「その物体はそこにない」と言う代わりに、自信満々にそれに関する物語を捏造することがよくありました。

大きな教訓

この論文は、「一般的な動画理解」(シーンの描写など)に優れていることが、必ずしも「時間的物体一貫性」(時間の経過に伴う特定の物体の物語を追跡すること)に優れていることを意味しないと結論付けています。

次のように考えてみてください:ある友人が、シーン内のすべての俳優の名前と服装を知っているとしても、10 分間の口論の間に誰が誰に秘密の手紙を渡したかを追跡するように頼めば、その友人は失敗するでしょう。TOC-Bench は、現在の AI モデルが、時間を通じて物体の具体的な旅を追跡する際、まだ「記憶喪失」の状態にあることを証明しています。

著者らは、このテストが開発者たちが、単にスナップショットを認識するだけでなく、真に物語を追跡できるより優れた AI を構築する手助けになることを願っています。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →