← 最新の論文
💻 computer science

Results of the 1st Asynchronous CASTLE Challenge at the Joint Egocentric Vision Workshop in Conjunction with CVPR 2026

本論文は、CVPR 2026に併設されたJoint Egocentric Vision Workshopにおいて開催された、第1回Asynchronous CASTLE Challengeの貢献と結果をまとめたものである。

原著者: Luca Rossetto, Werner Bailer, Cathal Gurrin, Graham Healy, Omar Shahbaz Khan, Stevan Rudinac, Klaus Schöffmann, Allie Tran

公開日 2026-08-25
📖 1 分で読めます☕ さくっと読める

原著者: Luca Rossetto, Werner Bailer, Cathal Gurrin, Graham Healy, Omar Shahbaz Khan, Stevan Rudinac, Klaus Schöffmann, Allie Tran

原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む

4日間の休暇中に起きたこと、単なるハイライトだけでなく、あらゆる会話、動かされたあらゆる物体、そして部屋の些細な変化までも、10人の異なる人物の目を通して同時に見守りながらすべてを記憶しようとする場面を想像してみてください。これは、たとえ何千時間ものビデオを与えられたとしても、コンピュータが苦戦する種類の記憶テストです。人工知能の分野において、研究者たちは、日常生活の長く台本のない録画を視聴し、日記を読んだり映画を見たりした後の人間のように、それらについて具体的な質問に答えることができるシステムの構築を試みています。課題は、情報の膨大な量と、数時間あるいは数日離れた詳細を関連付ける必要性にあります。もし機械がこれを学習できれば、数年分の個人の映像の中から特定の瞬間を見つけ出したり、人々の生活様式の複雑なパターンを理解したりすることに、最終的に役立つ可能性があります。

この解決にどれほど近づいているかをテストするために、研究者グループは「CASTLEチャレンジ」と呼ばれるコンペティションを企画しました。彼らは、あらゆる細部を捉えるために高速で記録された、超高精細ビデオを含む膨大なデータセットをチームに提供しました。映像は、10人の参加者が日常生活を送る際に装着していたカメラと、室内を監視する5台の固定カメラからのものでした。データは非常に豊かで、音声、心拍モニター、さらには熱画像まで含まれており、4日間の活動の完全なデジタル記録を作成していました。対戦チームの任務は、理論的には単純ですが、実践的には極めて困難なものでした。彼らは、ビデオの中で起きたことに関する185個の選択式問題に答えなければなりませんでした。これらの質問には、人物を追跡し、物体を数え、物がどこに隠されているかを記憶し、誰が最初にケーキの一切れを食べたか、あるいは最終日に誰がどれくらいの速さで車を充電していたかといった、イベントのタイミングを理解することが求められました。

4つのチームがこの挑戦に立ち向かい、それぞれが問題に対して異なる戦略を持ち込みました。WDLとして知られる優勝チームは、このタスクを手がかりを集める探偵のように扱いました。600時間のビデオを一度にすべて見ようとする代わりに、彼らのシステムはまず、人物の名前や特定の日付といったキーワードを見つけるために質問を調べました。次に、これらの手がかりを使って、残りの部分は無視し、最も関連性の高いビデオの部分と発言の書き起こしだけを抽出しました。彼らは、マルチサンプル自己一貫性を通じて一貫性を確保するために、各質問に対して厳格、均衡、および攻撃的なプロンプトのバリエーションを実行し、見つけた証拠に厳密に集中するようにコンピュータモデルを訓練しました。このアプローチにより、彼らは58パーセント近い精度に達しました。つまり、185問中約108問に正解したことになります。

別のチームであるMARSは、よりインタラクティブなアプローチを取りました。彼らは、次にどの種類の情報を確認すべきかをステップバイステップで決定する、好奇心旺盛なエージェントのように振る舞うシステムを構築しました。もし質問が身体活動に関するものであれば、システムは心拍データに特化してチェックすることを選択するかもしれません。もし誰がどこを見ているかについての質問であれば、視線追跡データを呼び出します。すべての情報を一度に処理しようとするのではなく、検討すべき証拠を動的に選択することで、彼らはスコアを57パーセントに向上させました。3番目のチームであるTAHAKOMは、情報を、人物、場所、物体をタイムスタンプと共に結びつける構造化された関係のマップへと整理しました。これにより、イベント間のつながりについてシステムに特定の質問を投げかけることが可能になり、54.6パーセントの精度を達成しました。最後のチームであるCuriosAIは、コンピュータが作り話をするのを防ぐことに焦点を当てました。彼らは、システムが証拠を検索し、それを生のビデオに対して検証してから回答するという厳格なプロセスを構築し、あらゆる主張が実際に見たものや聞いたことに基づいていることを保証しました。彼らの最高の手法は、49.7パーセントの精度に達しました。

このコンペティションの結果は、コンピュータはビデオの理解が進歩しているものの、まだ長い道のりがあることを示しています。トップのチームは半分以上の質問に正解しており、これはランダムな推測に比べれば大きな進歩ですが、依然として回答の半分近くを逃しています。おそらく最も示唆に富んでいるのは、チームごとに正解した質問が異なったことです。4つのチームの正解を組み合わせると、176の質問を解くことができ、どのチームも答えられなかったのはわずか9問でした。これは、単一の方法ではまだ完璧ではないものの、異なるアプローチがパズルの異なるピースを捉えていることを示唆しています。研究者たちは、最大の障害は、膨大なデータの量の中で迷うことなく、十分な証拠をカバーできる能力であると考えています。システムは数百時間の映像をナビゲートできますが、台本のない現実世界の出来事を長期間にわたって推論していくというタスクは、依然として困難な問題です。このコンペティションは問題を解決したわけではありませんが、これらの異なる戦略を組み合わせることが、私たちの日常生活を真に理解する機械を構築するための鍵になることを明確に示しました。

自分の分野の論文に埋もれていませんか?

研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。

Digest を試す →