← Ultimi articoli
💻 computer science

CuriosAI Submission to the CASTLE Challenge at EgoVis 2026

Il team di CuriosAI presenta due approcci, SVA e TMKG, per la CASTLE Challenge all'EgoVis 2026, con la loro pipeline in tre fasi Search-Verify-Answer che ottiene un'accuratezza di 0,50 nella classifica su 185 domande a scelta multipla derivate da oltre 600 ore di video egocentrici sincronizzati multi-vista.

Autori originali: Yuto Kanda, Hayato Tanoue, Takayuki Hori

Pubblicato 2026-05-28
📖 4 min di lettura☕ Lettura da pausa caffè

Autori originali: Yuto Kanda, Hayato Tanoue, Takayuki Hori

Articolo originale sotto licenza CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Questa è una spiegazione generata dall'IA dell'articolo qui sotto. Non è stata scritta né approvata dagli autori. Per precisione tecnica, consulta l'articolo originale. Leggi il disclaimer completo

Immagina di dover risolvere un mistero enorme basato su 600 ore di riprese video di 12 persone che vivono insieme, riprese simultaneamente da 15 telecamere diverse. La sfida? Rispondere a 185 domande a scelta multipla specifiche su cosa è successo, chi lo ha fatto e quando.

Questa è la CASTLE Challenge, e il team di SoftBank (CuriosAI) ha provato due modi diversi per risolverla utilizzando l'intelligenza artificiale. Chiamano i loro metodi SVA e TMKG.

Ecco come funzionavano, spiegati in modo semplice:

La Base Comune: La "Biblioteca"

Prima di tentare di risolvere le domande, entrambi i metodi hanno prima costruito una biblioteca enorme e organizzata delle riprese video. Non si sono limitati a guardare il video grezzo; lo hanno scomposto in cinque livelli utili:

  1. Chi è chi: Identificare le 12 persone.
  2. Cosa sta succedendo: Scrivere didascalie per le scene.
  3. Quali oggetti ci sono: Individuare oggetti specifici come giochi da tavolo o utensili da cucina.
  4. Cosa è stato detto: Trascrivere l'audio e capire chi ha parlato.
  5. La cronologia: Creare un programma delle azioni per ogni persona.

Entrambi i metodi hanno utilizzato questa stessa "biblioteca", ma hanno seguito percorsi molto diversi per trovare le risposte.


Approccio A: SVA (Ricerca – Verifica – Risposta)

L'Analogia: Il Detective con un Rigido Manuale di Regole

Pensa a SVA come a un team di tre detective che lavorano in una catena di montaggio rigorosa:

  1. Ricerca (Lo Esploratore): Per prima cosa, esaminano l'intera biblioteca e ipotizzano quale segmento di 15 minuti del video contenga probabilmente la risposta. Riducono il campo da ore a una piccola finestra temporale.
  2. Verifica (Lo Scettico): Questa è la parte più importante. Prendono quella finestra di 15 minuti e la suddividono in clip più piccole di 5 minuti. Chiedono a un'intelligenza artificiale di esaminare queste clip, ma le forniscono un rigido manuale di regole per impedire che menta (fabbrichi informazioni).
    • Regola 1: Non limitarti a ripetere la domanda.
    • Regola 2: Se il video è silenzioso o vuoto, ammetti di non sapere.
    • Regola 3: Se conti qualcosa, devi indicare esattamente dove si trova nel video.
    • Regola 4: Non inventare fatti se non riesci a vederli.
  3. Risposta (Il Giudice): Infine, un'intelligenza artificiale "Giudice" intelligente esamina tutte le prove raccolte dallo Scettico, le pesa (fidandosi delle citazioni audio più che di ipotesi visive vaghe) e sceglie la risposta finale.

Il Risultato: Questo metodo era molto attento. Ha posto all'intelligenza artificiale molte domande (circa 28 per ogni mistero), ma ha ottenuto la risposta corretta il 50% delle volte. Questa è stata la loro partecipazione vincitrice.


Approccio B: TMKG (Grafo di Conoscenza Temporale–Multimodale)

L'Analogia: La Ragnatela di Connessioni

Pensa a TMKG come alla costruzione di una gigantesca ragnatela tridimensionale di fatti.

  • Ogni 5 minuti, il sistema crea un "nodo" (un punto) contenente tutto ciò che è accaduto: chi era presente, cosa hanno detto e quali oggetti erano visibili.
  • Collega questi punti con fili (spigoli) che mostrano chi ha fatto cosa, dove si trovavano e cosa è successo dopo.
  • Quando arriva una domanda, il sistema cerca in questa ragnatela per trovare il giusto gruppo di punti.
  • Una volta trovato il punto, consegna il video e i dati della ragnatela a un'unica intelligenza artificiale per fornire immediatamente la risposta.

Il Risultato: Questo metodo era più veloce e ha posto all'intelligenza artificiale meno domande (circa 1 volta per ogni mistero), ma era meno accurato, ottenendo la risposta corretta solo il 35% delle volte.


La Grande Lezione

Il team ha confrontato i due metodi e ha trovato una lezione chiara:

  • SVA (Il Detective) ha vinto perché era disciplinato. Costringendo l'intelligenza artificiale a ricontrollare il proprio lavoro e a seguire regole rigide sul non inventare cose, ha evitato errori sciocchi.
  • TMKG (La Ragnatela) ha faticato perché si affidava a un'unica intelligenza artificiale per fare tutto in una volta, senza quel livello aggiuntivo di "verifica dei fatti".

La Conclusione:
A questa scala enorme (600 ore di video), costruire semplicemente un database più intelligente non è sufficiente. Il segreto è stata la verifica. Anche se il metodo "Detective" richiedeva più potenza di calcolo e tempo per essere eseguito, il passaggio aggiuntivo di costringere l'intelligenza artificiale a provare i propri fatti prima di rispondere ha fatto la differenza tra un punteggio del 35% e uno del 50%.

Il team ha notato che entrambi i metodi a volte fallivano perché sceglievano la sbagliata finestra di 15 minuti per iniziare. Ma hanno concluso che, se riesci a trovare la finestra giusta, aggiungere un "verificatore disciplinato" è il modo migliore per ottenere la risposta corretta.

Sommerso dagli articoli nel tuo campo?

Ricevi digest giornalieri degli articoli più recenti corrispondenti alle tue parole chiave di ricerca — con riassunti tecnici, nella tua lingua.

Prova Digest →