CuriosAI Submission to the CASTLE Challenge at EgoVis 2026
CuriosAI チームは、EgoVis 2026 の CASTLE チャレンジに向けて SVA と TMKG の 2 つのアプローチを提示し、600 時間以上の同期マルチビュー egocentric ビデオから派生した 185 問の多肢選択問題において、3 段階の検索・検証・回答パイプラインがリーダーボード精度 0.50 を達成しました。
原論文は CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) でライセンスされています。 これは以下の論文のAI生成解説です。著者が執筆または承認したものではありません。技術的な正確性については原論文を参照してください。 免責事項の全文を読む
12 人が共同生活を送る様子を、15 台のカメラで同時に撮影した 600 時間にわたる映像 footage を基に、巨大な謎を解こうと想像してみてください。その課題とは、何が起こったのか、誰がそれをやったのか、そしていつ行われたのかについて、185 の具体的な多肢選択問題に答えることです。
これが「CASTLE チャレンジ」であり、ソフトバンク(CuriosAI)のチームは、人工知能を用いてこの課題を解決する 2 つの異なるアプローチを試みました。彼らはその手法を「SVA」と「TMKG」と名付けました。
以下に、それらがどのように機能したかを簡潔に説明します。
共通の基盤:「図書館」
問題を解く前に、両方の手法はまず映像の巨大で整理された「図書館」を構築しました。彼らは生の映像をただ視聴しただけではなく、それを 5 つの有用な層に分解しました。
- 誰が誰か:12 人の人物を特定する。
- 何が起きているか:シーンのキャプションを作成する。
- どのような物体があるか:ボードゲームやキッチン用品などの特定のアイテムを特定する。
- 何が話されたか:音声を文字起こしし、誰が話したかを特定する。
- タイムライン:各人物の行動スケジュールを作成する。
両方の手法はこの同じ「図書館」を使用しましたが、答えを見つけるための道筋は大きく異なりました。
アプローチ A:SVA(検索 – 検証 – 回答)
比喩:厳格な規則書を持つ探偵
SVA を、厳格な生産ラインで働く 3 人の探偵のチームと想像してください。
- 検索(スカウト):まず、彼らは図書館全体を見て、答えが含まれている可能性が高い 15 分間の映像の断片を推測します。数時間から小さな時間枠に絞り込みます。
- 検証(懐疑論者):これが最も重要な部分です。彼らはその 15 分間の枠をさらに 5 分間の短いクリップに分割します。そして、AI にこれらのクリップを見てもらいますが、嘘(捏造)を防ぐための厳格な規則書を与えます。
- 規則 1:質問をそのまま繰り返してはいけません。
- 規則 2:映像が無音または空白の場合は、知らないことを認めなければなりません。
- 規則 3:何かを数える場合、映像内の正確な場所を指し示さなければなりません。
- 規則 4:見えない事実は作り出してはいけません。
- 回答(裁判官):最後に、賢明な「裁判官」AI が、懐疑論者が収集したすべての証拠を検討し、重み付けを行います(曖昧な視覚的な推測よりも音声の引用を重視します)そして、最終的な答えを選びます。
結果:この手法は非常に慎重でした。1 つの謎に対して約 28 回 AI に質問を行いましたが、正解率は**50%**でした。これが彼らの優勝入賞作品となりました。
アプローチ B:TMKG(時空間・マルチモーダル・知識グラフ)
比喩:つながりの網
TMKG を、事実の巨大な 3 次元の蜘蛛の巣を構築していると想像してください。
- 5 分ごとに、システムは「誰がそこにいたか」「何を話したか」「どのような物体が見えたか」を含むすべての事象を格納した「ノード(点)」を作成します。
- これらの点を、誰が何をどこで行い、次に何が起きたかを示す「糸(エッジ)」で結びます。
- 質問が入ってくると、システムはこの網を検索し、適切な点のクラスターを見つけます。
- 場所を見つけると、映像と網のデータを単一の AIに渡し、即座に答えを出させます。
結果:この手法は高速で、1 つの謎に対して AI に質問する回数が少なかった(約 1 回のみ)ですが、精度は低く、正解率は**35%**にとどまりました。
大きな教訓
チームは 2 つの手法を比較し、明確な教訓を得ました。
- SVA(探偵) が勝ったのは、規律正しかったからです。AI に作業を二重チェックさせ、事実を捏造しないという厳格な規則に従わせることで、愚かな間違いを回避しました。
- TMKG(網) が苦戦したのは、追加の「事実確認」レイヤーなしに、すべてを一度に処理する単一の AI に依存していたためです。
結論:
この巨大な規模(600 時間の映像)において、単により賢いデータベースを構築するだけでは不十分です。秘密の鍵は検証にありました。「探偵」手法は実行に多くの計算資源と時間を要しましたが、AI に回答する前に事実を証明させるという追加のステップが、35% のスコアと 50% のスコアの違いを生みました。
チームは、両方の手法が時として、最初に取り上げた 15 分間のウィンドウが誤っていたために失敗したと指摘しました。しかし、彼らは結論として、適切なウィンドウを見つけることができれば、答えを正しく導き出す最良の方法は「規律ある検証者」を追加することであると述べました。
自分の分野の論文に埋もれていませんか?
研究キーワードに一致する最新の論文のダイジェストを毎日受け取りましょう——技術要約付き、あなたの言語で。