← 最新の論文
🤖 AI

EgoCoT-Bench: Benchmarking Grounded and Verifiable Operation-Centric Chain of Thought Reasoning for MLLMs

本論文は、マルチモーダル大規模言語モデルの根拠に基づく操作中心の推論能力を評価・向上させるために設計された、3,172 の検証可能な質問応答対と明示的な段階的根拠注釈を備えた微細な第一人称視点動画ベンチマークである EgoCoT-Bench を紹介する。

原著者: Yang Dai, Dian Jiao, Tianwei Lin, Wenqiao Zhang

公開日 2026-05-20
📖 1 分で読めます☕ さくっと読める

原著者: Yang Dai, Dian Jiao, Tianwei Lin, Wenqiao Zhang

原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む

あなたが誰かが調理している様子を、その人の視点(額にGoProを装着しているようなもの)で見る動画を想像してみてください。手が包丁、鍋、スプーンを掴むのが見えます。さて、超賢いAIロボットに「シェフが塩コショウ入れを置いた後、それはどこにありますか?」と聞いてみましょう。

ロボットは「カウンターの上にあります」と言うかもしれません。そして、それが正しいかもしれません!しかし、ここが肝心です:ロボットは実際に塩コショウ入れがそこへ移動するのを見たのでしょうか、それとも単に推測しただけなのでしょうか?

これが、論文「EgoCoT-Bench」が解決しようとしている問題です。

問題:「ラッキーな推測」をするロボット

現在、多くのAIモデルは、答えを丸暗記するが数学を理解していない生徒のようです。彼らは動画を見て質問に正解を答えることはできても、その説明(「推論」)は作り話だったり、矛盾していたり、実際には動画で起こらなかった事実に基づいていたりします。

「一人称視点(Egocentric)」動画の世界では、これは特に困難です。なぜなら:

  • 手が視界を遮ることが多い。
  • 物体が消えたり再出現したりする。
  • カメラが揺れ、激しく動く。

既存のAIテストは、最終的な答えが正しいかどうかだけをチェックします。しかし、この論文は言います。「それだけでは不十分だ!AIが『何が起こったか』について語る『物語』が、実際に動画と一致しているかを確認する必要がある」。

解決策:EgoCoT-Bench(「真実の探偵」テスト)

著者たちは、EgoCoT-Benchと呼ばれる新しい、極めて詳細なテストを構築しました。これはAIに対する「運転試験」のようなものですが、車を運転する代わりに、AIは誰かが手を使ってタスクを遂行する動画を理解する必要があります。

どのように構築されたか:

  1. 地図(STSG): 単に動画を見るのではなく、まず動画の「地図」を作成しました。この地図は、すべての物体、すべての手、そしてすべての時間を追跡します。まるで演劇の台本のように詳細です。
  2. 質問: この地図を使って、3,172の質問を作成しました。これらは「コップの色は何ですか?」といった単純なものではありません。「手が1:00に青いコップを掴み、1:05に赤いコップを掴んだ。1:03の時点でテーブルにあったのはどちらか?」といった難しいものです。
  3. 証拠: すべての質問には「領収書」が付いています。テストには、回答に必要な正確な時刻、場所、視覚的証拠が含まれています。これにより、AIの推論が領収書と一致するかどうかを確認できます。

4 つの種類の課題

このテストは、ビデオゲームのレベルのように、4 つの主要なカテゴリに分かれています。

  1. 行動の特定(グラウンディングと知覚): 「今、手は何に触れていますか?」(AIは「今」何が起こっているかを見ることができますか?)
  2. タイムマシン(回顧): 「手がスプーンを拾う前、スプーンはどこにありましたか?」(AIは過去を思い出せますか?)
  3. 予言者(予測と因果推論): 「手が蓋を持っています。次に何が起こるでしょう?」または「なぜコーヒーがこぼれたのですか?」(AIは未来を推測したり、原因を説明したりできますか?)
  4. 全体像(高次推論): 「シェフはサンドイッチ作りを終えましたか、それとももう一工程ありますか?」(AIは全体の目標を理解できますか?)

AI をテストした結果は?

著者たちは、利用可能な最も賢いAIモデル(GPT-5、Qwen、LLaVA など)をこのテストにかけました。彼らが発見したのは以下の通りです。

  • 「ラッキーな推測」現象: 多くのモデルは正解(例:「ボトルは棚の上にあります」)を出しましたが、「なぜか」と聞かれると、その説明は間違っていました。例えば、「ボトルを見たから」と言いますが、実際には質問の時刻のにボトルが移動する様子が動画に映っていたのです。
  • ギャップ: 最高のAIモデルでも正解率は約60〜70%でした。人間は約96%でした。これは、手が物体を動かす様子を見るという点において、人間の理解とAIの理解の間にはまだ大きな隔たりがあることを意味します。
  • 最も難しい部分: AIは次に何が起こるかを推測するのにはそれなりにできましたが、物体の履歴を追跡すること(例えば、シャツから引き抜かれる特定のタグを追うこと)には極めて不向きでした。

結論

この論文は、AIを評価する新しい方法を提示します。最終的な答えに基づいて評価するのではなく、推論も評価対象に含めます。

彼らは、多くのAIが「偶発的に正しい」結果を出していること、つまり間違った理由で正解を得ていることを発見しました。これは危険です。なぜなら、もしAIにロボットをキッチンで手伝うよう頼み、AIが正解を推測したものの、包丁の位置について誤った認識を持っていた場合、ロボットは取るべきでないものを切断してしまう可能性があるからです。

EgoCoT-Benchは、AIに推測を止めさせ、動画内の実際の証拠にステップバイステップで注意を払わせるためのツールです。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →