← Derniers articles
💻 computer science

CuriosAI Submission to the CASTLE Challenge at EgoVis 2026

L'équipe CuriosAI présente deux approches, SVA et TMKG, pour le défi CASTLE à EgoVis 2026, leur pipeline en trois étapes Recherche-Vérifier-Répondre atteignant une précision de 0,50 sur le classement pour 185 questions à choix multiples dérivées de plus de 600 heures de vidéo égocentrique multi-vues synchronisées.

Auteurs originaux : Yuto Kanda, Hayato Tanoue, Takayuki Hori

Publié 2026-05-28
📖 5 min de lecture🧠 Analyse approfondie

Auteurs originaux : Yuto Kanda, Hayato Tanoue, Takayuki Hori

Article original sous licence CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Ceci est une explication générée par l'IA de l'article ci-dessous. Elle n'a pas été rédigée ni approuvée par les auteurs. Pour une précision technique, consultez l'article original. Lire la clause de non-responsabilité complète

Imaginez que vous essayez de résoudre un immense mystère basé sur 600 heures de séquences vidéo provenant de 12 personnes vivant ensemble, filmées simultanément par 15 caméras différentes. Le défi ? Répondre à 185 questions à choix multiples spécifiques concernant ce qui s'est passé, qui l'a fait et quand.

Voici le Défi CASTLE, et l'équipe de SoftBank (CuriosAI) a essayé deux approches différentes pour le résoudre en utilisant l'intelligence artificielle. Ils appellent leurs méthodes SVA et TMKG.

Voici comment elles fonctionnent, expliquées simplement :

Le Fondement Commun : La « Bibliothèque »

Avant d'essayer de résoudre les questions, les deux méthodes ont d'abord construit une bibliothèque massive et organisée de la vidéo. Elles ne se sont pas contentées de regarder la vidéo brute ; elles l'ont décomposée en cinq couches utiles :

  1. Qui est qui : Identifier les 12 personnes.
  2. Ce qui se passe : Rédiger des légendes pour les scènes.
  3. Quels objets sont présents : Repérer des éléments spécifiques comme des jeux de société ou des ustensiles de cuisine.
  4. Ce qui a été dit : Transcrire l'audio et déterminer qui a parlé.
  5. La chronologie : Établir un calendrier des actions pour chaque personne.

Les deux méthodes ont utilisé cette même « bibliothèque », mais elles ont emprunté des voies très différentes pour trouver les réponses.


Approche A : SVA (Recherche – Vérification – Réponse)

L'Analogie : Le Détective avec un Livret de Règles Strict

Imaginez SVA comme une équipe de trois détectives travaillant sur une chaîne de montage stricte :

  1. Recherche (L'Éclaireur) : D'abord, ils examinent toute la bibliothèque et devinent quel segment de 15 minutes de vidéo contient probablement la réponse. Ils réduisent le champ de plusieurs heures à une petite fenêtre temporelle.
  2. Vérification (Le Sceptique) : C'est la partie la plus importante. Ils prennent cette fenêtre de 15 minutes et la découpent en clips plus petits de 5 minutes. Ils demandent à une IA d'examiner ces clips, mais ils lui fournissent un livret de règles strict pour l'empêcher de mentir (de confabuler).
    • Règle 1 : Ne répétez pas simplement la question.
    • Règle 2 : Si la vidéo est muette ou vide, admettez que vous ne savez pas.
    • Règle 3 : Si vous comptez quelque chose, vous devez indiquer exactement où cela se trouve dans la vidéo.
    • Règle 4 : N'inventez pas de faits si vous ne pouvez pas les voir.
  3. Réponse (Le Juge) : Enfin, une IA « Juge » intelligente examine toutes les preuves collectées par le Sceptique, les pèse (faisant davantage confiance aux citations audio qu'aux suppositions visuelles vagues) et choisit la réponse finale.

Le Résultat : Cette méthode était très prudente. Elle a posé beaucoup de questions à l'IA (environ 28 fois par mystère), mais elle a trouvé la bonne réponse 50 % du temps. C'était leur soumission gagnante.


Approche B : TMKG (Graphique de Connaissances Temporelles–Multimodales)

L'Analogie : Le Toile d'Araignée de Connexions

Imaginez TMKG comme la construction d'une immense toile d'araignée en 3D de faits.

  • Toutes les 5 minutes, le système crée un « nœud » (un point) contenant tout ce qui s'est passé : qui était présent, ce qu'ils ont dit et quels objets étaient visibles.
  • Il relie ces points avec des fils (arêtes) montrant qui a fait quoi, où ils étaient et ce qui s'est passé ensuite.
  • Lorsqu'une question arrive, le système parcourt cette toile pour trouver le bon regroupement de points.
  • Une fois l'endroit trouvé, il remet la vidéo et les données de la toile à une seule IA pour fournir la réponse immédiatement.

Le Résultat : Cette méthode était plus rapide et a posé moins de questions à l'IA (environ 1 fois par mystère), mais elle était moins précise, obtenant la bonne réponse seulement 35 % du temps.


La Grande Leçon

L'équipe a comparé les deux et a tiré une leçon claire :

  • SVA (Le Détective) a gagné parce qu'il était discipliné. En forçant l'IA à vérifier son travail et à suivre des règles strictes concernant l'invention de faits, elle a évité des erreurs bêtes.
  • TMKG (La Toile) a eu du mal car elle reposait sur une seule IA pour tout faire à la fois, sans cette couche supplémentaire de « vérification des faits ».

La Conclusion :
À cette échelle massive (600 heures de vidéo), construire simplement une base de données plus intelligente ne suffit pas. L'ingrédient secret était la vérification. Bien que la méthode « Détective » ait nécessité plus de puissance de calcul et de temps pour s'exécuter, l'étape supplémentaire consistant à forcer l'IA à prouver ses faits avant de répondre a fait la différence entre un score de 35 % et un score de 50 %.

L'équipe a noté que les deux méthodes ont parfois échoué parce qu'elles avaient choisi la mauvaise fenêtre de 15 minutes pour commencer. Mais elles ont conclu que si l'on peut trouver la bonne fenêtre, ajouter un « vérificateur discipliné » est le meilleur moyen d'obtenir la bonne réponse.

Noyé(e) sous les articles dans votre domaine ?

Recevez des digests quotidiens des articles les plus récents correspondant à vos mots-clés de recherche — avec des résumés techniques, dans votre langue.

Essayer Digest →