CuriosAI Submission to the CASTLE Challenge at EgoVis 2026
Het CuriosAI-team presenteert twee benaderingen, SVA en TMKG, voor de CASTLE-uitdaging bij EgoVis 2026, waarbij hun drie-traps Search-Verify-Answer-pijplijn een leaderboard-nauwkeurigheid van 0,50 behaalt op 185 meerkeuzevragen afgeleid van meer dan 600 uur gesynchroniseerd multi-view egocentrisch videomateriaal.
Oorspronkelijk artikel gelicentieerd onder CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dit is een AI-gegenereerde uitleg van het onderstaande artikel. Het is niet geschreven of goedgekeurd door de auteurs. Raadpleeg het oorspronkelijke artikel voor technische nauwkeurigheid. Lees de volledige disclaimer
Stel je voor dat je probeert een enorm mysterie op te lossen op basis van 600 uur videomateriaal van 12 mensen die samenwonen, gefilmd door 15 verschillende camera's tegelijk. De uitdaging? Beantwoord 185 specifieke meerkeuzevragen over wat er gebeurde, wie het deed en wanneer.
Dit is de CASTLE Challenge, en het team van SoftBank (CuriosAI) probeerde twee verschillende manieren om deze op te lossen met kunstmatige intelligentie. Ze noemen hun methoden SVA en TMKG.
Hier is hoe ze werkten, eenvoudig uitgelegd:
Het Gemeenschappelijke Fundament: De "Bibliotheek"
Voordat ze probeerden de vragen op te lossen, bouwden beide methoden eerst een enorme, georganiseerde bibliotheek van de video. Ze keken niet alleen naar het ruwe videomateriaal; ze splitsten het op in vijf nuttige lagen:
- Wie is wie: Het identificeren van de 12 personen.
- Wat er gebeurt: Het schrijven van bijschriften voor de scènes.
- Welke objecten er zijn: Het opsporen van specifieke items zoals bordspellen of keukengerei.
- Wat er gezegd werd: Het transcriberen van de audio en het bepalen wie er sprak.
- De tijdlijn: Het maken van een schema van acties voor elke persoon.
Beide methoden gebruikten dezelfde "bibliotheek", maar ze volgden zeer verschillende paden om de antwoorden te vinden.
Benadering A: SVA (Zoek – Verifieer – Antwoord)
De Analogie: De Detective met een Strikt Regelboek
Stel je SVA voor als een team van drie detectives die werken in een strikte assemblagelijn:
- Zoek (De Verkenners): Eerst kijken ze naar de hele bibliotheek en raden ze welk stuk van 15 minuten video waarschijnlijk het antwoord bevat. Ze beperken het van uren tot een heel klein venster.
- Verifieer (De Scepticus): Dit is het belangrijkste deel. Ze nemen dat 15-minutenvenster en splitsen het op in kleinere clips van 5 minuten. Ze vragen een AI om deze clips te bekijken, maar ze geven het een strikt regelboek om te voorkomen dat het liegt (confabuleert).
- Regel 1: Herhaal de vraag niet zomaar aan jou.
- Regel 2: Als de video stil is of leeg, geef toe dat je het niet weet.
- Regel 3: Als je iets telt, moet je precies aangeven waar het in de video te zien is.
- Regel 4: Verzin geen feiten als je ze niet kunt zien.
- Antwoord (De Rechter): Tot slot kijkt een slimme "Rechter"-AI naar alle bewijzen die door de Scepticus zijn verzameld, weegt ze af (vertrouwt audioquotes meer dan vage visuele gissingen) en kiest het definitieve antwoord.
Het Resultaat: Deze methode was zeer voorzichtig. Het stelde de AI veel vragen (ongeveer 28 keer per mysterie), maar het kreeg het juiste antwoord 50% van de tijd. Dit was hun winnende inzending.
Benadering B: TMKG (Temporeel–Multimodaal–Kennis–Graf)
De Analogie: Het Web van Verbindingen
Stel je TMKG voor als het bouwen van een gigantisch, 3D-spinnenweb van feiten.
- Elke 5 minuten maakt het systeem een "knooppunt" (een stip) aan met daarin alles wat gebeurde: wie er was, wat ze zeiden en welke objecten zichtbaar waren.
- Het verbindt deze stippen met draden (randen) die aangeven wie wat deed, waar ze waren en wat er daarna gebeurde.
- Wanneer er een vraag binnenkomt, zoekt het systeem in dit web naar het juiste cluster van stippen.
- Zodra het de plek heeft gevonden, geeft het de video en de web-data aan één enkele AI om direct het antwoord te geven.
Het Resultaat: Deze methode was sneller en stelde de AI minder vragen (slechts ongeveer 1 keer per mysterie), maar was minder nauwkeurig en kreeg het juiste antwoord slechts 35% van de tijd.
De Grote Les
Het team vergeleek de twee en vond een duidelijke les:
- SVA (De Detective) won omdat het gedisciplineerd was. Door de AI te dwingen zijn werk te controleren en strikte regels te volgen over het niet verzinnen van dingen, werden domme fouten vermeden.
- TMKG (Het Web) had moeite omdat het vertrouwde op één enkele AI om alles tegelijk te doen zonder die extra laag van "feitencontrole".
De Conclusie:
Op deze enorme schaal (600 uur video) is het simpelweg bouwen aan een slimmere database niet genoeg. De geheime saus was verificatie. Hoewel de "Detective"-methode meer rekenkracht en tijd kostte om uit te voeren, maakte de extra stap om de AI zijn feiten te laten bewijzen voordat hij antwoordde, het verschil tussen een score van 35% en een score van 50%.
Het team merkte op dat beide methoden soms faalden omdat ze het verkeerde 15-minutenvenster kozen om mee te beginnen. Maar ze concludeerden dat als je het juiste venster kunt vinden, het toevoegen van een "gedisciplineerde verificateur" de beste manier is om het juiste antwoord te krijgen.
Verdrinkt u in papers in uw vakgebied?
Ontvang dagelijkse digests van de nieuwste papers die bij uw onderzoekswoorden passen — met technische samenvattingen, in uw taal.