← 最新の論文
💻 computer science

Perception Test 2025: Challenge Summary and a Unified VQA Extension

本論文は、統一された動画 QA や追跡などの統合されたトラックを備えた統一ベンチマーク上で最先端のマルチモーダル動画モデルを評価した Perception Test 2025 チャレンジの結果を要約するものであり、単一のインターフェースを通じて多様な知覚タスクに取り組む際に現在のモデルが直面する顕著な困難を浮き彫りにするものである。

原著者: Joseph Heyward, Nikhil Parthasarathy, Tyler Zhu, Aravindh Mahendran, João Carreira, Dima Damen, Andrew Zisserman, Viorica Pătrăucean

公開日 2026-04-30
📖 1 分で読めます☕ さくっと読める

原著者: Joseph Heyward, Nikhil Parthasarathy, Tyler Zhu, Aravindh Mahendran, João Carreira, Dima Damen, Andrew Zisserman, Viorica Pătrăucean

原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む

コンピュータビジョンのための巨大なハイレベルなタレントショーを想像してみてください。ただし、歌ったり踊ったりする代わりに、出場者は世界を「見て」理解しようとする人工知能モデルです。この論文は、主要なコンピュータサイエンス会議と併せて開催された、このショーの2025年版、すなわち「Perception Test」の成績表です。

以下に、簡単なアナロジーを用いて何が起きたかを解説します。

大きなアイデア:専門ツールからスイスアーミーナイフへ

過去には、AI モデルは専門ツールのように機能していました。あるモデルは群衆の中から特定の人物を見つけること(トラッキング)に優れ、別のモデルは車の衝突を検知すること(アクション検出)に優れ、さらに別のモデルは動画に関する質問に答えるのが得意でした。

今年のチャレンジでは、主催者はこれらの「専門ツール」のテストを中止することにしました。代わりに、彼らはスイスアーミーナイフを求めました。彼らは、単一の AI モデルが帽子を切り替えることなく、一度に「すべて」をこなせるかどうかを確認したかったのです。彼らは問いかけました。「一つの脳が、ボールを追跡し、音を聞き、そして場面に関する質問に答えることを、すべて同時に処理できるだろうか?」

5 つの主要な競技(トラック)

この競技には、AI の異なる「筋肉」をテストする 5 つの主要な競技がありました。

  1. 統合ビデオクイズ(「マジックアイ」テスト):

    • 従来の方法: AI が動く点を追跡できるかどうかをテストするには、特定のトラッカーを構築する必要がありました。
    • 新しい方法: 主催者はこれらの難しいタスクを多肢選択問題に変えました。テーブル上の特定の場所が緑色に点滅する動画を想像してください。AI には、「この 5 つの点のうち、どれが点滅した点ですか?」と問われます。
    • ひねり: 「これらの動作はどの順序で起こったか?」や「どの物体が何かをしているふりをしていたか?」といったトリッキーな質問が追加されました。これにより、AI は視覚的なパズルを解くために言語を使用することを強要されました。
  2. 二重トラッキング・チャレンジ:

    • AI は、一つの物体全体(跳ねるボールなど)と、その物体上の特定の点(ボールの赤いシールなど)の両方を同時に追跡しなければなりませんでした。ボールが壁の後ろに隠れる(遮蔽)場合でも同様です。
  3. 音と動作の探偵:

    • AI は動画を視聴し、「ちょうど 10 秒目に、誰かがボールを蹴り、ドスンという音が聞こえた」と述べる必要がありました。視覚的な動作と音の両方について、「いつ」と「何」を同時に特定しなければなりませんでした。
  4. 「ポインとクリック」の探偵:

    • AI には、「どの犬が猫を追いかけているか?」という質問が投げかけられ、「茶色い方」と答えるだけでなく、その特定の犬の周りに枠を描き、動画全体を通じてそれを追跡する必要がありました。
  5. マラソンランナー(1 時間動画):

    • ほとんどの AI モデルは 30 秒のクリップを見ただけで疲れてしまいます。この競技では、1 時間の動画が投げかけられました。AI は、最後の質問に答えるために、冒頭からの詳細を記憶しなければなりませんでした。

結果:二つの速度の物語

この論文は、AI の成果における興味深い分裂を報告しています。

  • 言語の勝者: AI が言語(質問への回答や場面の説明)を使用できた場合、その成績は昨年よりも大幅に向上しました。実際、「ポインとクリック」および「1 時間動画」のテストでは、スコアがほぼ倍増しました。まるで AI が突然マニュアルを読んで、それを視覚世界に応用することを学んだかのようです。
  • 「沈黙」の苦戦: AI が言語を使用せずにタスクを遂行しなければならない場合(点を追跡するだけや音を見つけるなど)、改善はあまり見られませんでした。今年の最優秀な「スイスアーミーナイフ」モデルは、実際には昨年の専門的な「単一タスク」モデルよりも遅いものでした。

結論: この論文は、AI が自分が目にするものについて語ることは驚くほど上手くなっている一方で、一度に「すべて」を完璧にこなす単一の統合された脳となることには依然として苦しんでいると結論付けています。「汎用知覚」モデルは地平線に見えますが、まだ完全には到達していません。

勝者

  • 総応募数: 100 以上のチームが 450 件の応募を行いました。
  • 賞金: 勝者たちは合計 47,000 ドルを手にしました。
  • トップパフォーマー: 「NJUST_KMG」チームは頻繁に優勝し、トラッキング、音、1 時間動画のカテゴリーで上位を占めました。もう一つのチーム「SGVR@KAIST」は、「ポインとクリック」カテゴリーで優勝しました。

要約

2025 年の Perception Test は、AI が自分が目にするものについて語ることを急速に学んでいることを示しましたが、混乱することなく一度にすべてをこなす方法をまだ学んでいることを示しました。「専門的なロボット」と「人間のような汎用知覚」の間のギャップは縮まっていますが、ゴールラインはまだ少し先にあります。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →