← Últimos artículos
💻 computer science

CuriosAI Submission to the CASTLE Challenge at EgoVis 2026

El equipo de CuriosAI presenta dos enfoques, SVA y TMKG, para el Reto CASTLE en EgoVis 2026, con su pipeline de tres etapas Búsqueda-Verificación-Respuesta alcanzando una precisión de 0.50 en el ranking de clasificación sobre 185 preguntas de opción múltiple derivadas de más de 600 horas de video egocéntrico multivista sincronizado.

Autores originales: Yuto Kanda, Hayato Tanoue, Takayuki Hori

Publicado 2026-05-28
📖 4 min de lectura☕ Lectura para el café

Autores originales: Yuto Kanda, Hayato Tanoue, Takayuki Hori

Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

Imagina que estás intentando resolver un misterio masivo basado en 600 horas de metraje de video de 12 personas viviendo juntas, filmadas simultáneamente desde 15 cámaras diferentes. ¿El desafío? Responder 185 preguntas específicas de opción múltiple sobre qué sucedió, quién lo hizo y cuándo.

Esto es el Desafío CASTLE, y el equipo de SoftBank (CuriosAI) probó dos métodos diferentes para resolverlo utilizando inteligencia artificial. Llaman a sus métodos SVA y TMKG.

Así es como funcionaron, explicado de forma sencilla:

La Base Común: La "Biblioteca"

Antes de intentar resolver las preguntas, ambos métodos construyeron primero una biblioteca masiva y organizada del video. No solo vieron el video crudo; lo descomponieron en cinco capas útiles:

  1. Quién es quién: Identificando a las 12 personas.
  2. Qué está sucediendo: Escribiendo descripciones para las escenas.
  3. Qué objetos hay: Detectando artículos específicos como juegos de mesa o utensilios de cocina.
  4. Qué se dijo: Transcribiendo el audio y determinando quién habló.
  5. La línea de tiempo: Creando un cronograma de acciones para cada persona.

Ambos métodos utilizaron esta misma "biblioteca", pero tomaron caminos muy diferentes para encontrar las respuestas.


Enfoque A: SVA (Buscar – Verificar – Responder)

La Analogía: El Detective con un Libro de Reglas Estricto

Piensa en SVA como un equipo de tres detectives trabajando en una línea de ensamblaje estricta:

  1. Buscar (El Explorador): Primero, examinan toda la biblioteca y adivinan qué fragmento de 15 minutos del video probablemente contiene la respuesta. Reducen el alcance de horas a una pequeña ventana.
  2. Verificar (El Escéptico): Esta es la parte más importante. Toman esa ventana de 15 minutos y la dividen en clips más pequeños de 5 minutos. Piden a una IA que examine estos clips, pero le dan un libro de reglas estricto para evitar que mienta (fabrique información).
    • Regla 1: No repitas simplemente la pregunta.
    • Regla 2: Si el video está en silencio o en blanco, admite que no lo sabes.
    • Regla 3: Si cuentas algo, debes señalar exactamente dónde está en el video.
    • Regla 4: No inventes hechos si no puedes verlos.
  3. Responder (El Juez): Finalmente, una IA inteligente de "Juez" examina todas las pruebas recopiladas por el Escéptico, las pondera (confiando más en las citas de audio que en las suposiciones visuales vagas) y selecciona la respuesta final.

El Resultado: Este método fue muy cuidadoso. Le hizo muchas preguntas a la IA (aproximadamente 28 veces por misterio), pero obtuvo la respuesta correcta el 50% de las veces. Esta fue su presentación ganadora.


Enfoque B: TMKG (Grafo de Conocimiento Temporal–Multimodal)

La Analogía: La Red de Conexiones

Piensa en TMKG como construir una gigantesca telaraña tridimensional de hechos.

  • Cada 5 minutos, el sistema crea un "nodo" (un punto) que contiene todo lo que sucedió: quién estaba allí, qué dijeron y qué objetos eran visibles.
  • Conecta estos puntos con cuerdas (bordes) que muestran quién hizo qué, dónde estaban y qué sucedió después.
  • Cuando llega una pregunta, el sistema busca en esta red para encontrar el grupo correcto de puntos.
  • Una vez que encuentra el lugar, entrega el video y los datos de la red a una sola IA para dar la respuesta inmediatamente.

El Resultado: Este método fue más rápido y le hizo menos preguntas a la IA (solo aproximadamente 1 vez por misterio), pero fue menos preciso, obteniendo la respuesta correcta solo el 35% de las veces.


La Gran Lección

El equipo comparó ambos y encontró una lección clara:

  • SVA (El Detective) ganó porque fue disciplinado. Al obligar a la IA a verificar su trabajo y seguir reglas estrictas sobre no inventar cosas, evitó errores tontos.
  • TMKG (La Red) tuvo dificultades porque confió en una sola IA para hacer todo a la vez sin esa capa adicional de "verificación de hechos".

La Conclusión:
A esta escala masiva (600 horas de video), simplemente construir una base de datos más inteligente no es suficiente. El ingrediente secreto fue la verificación. Aunque el método del "Detective" requirió más potencia de computación y tiempo para ejecutarse, el paso adicional de obligar a la IA a probar sus hechos antes de responder marcó la diferencia entre una puntuación del 35% y una del 50%.

El equipo señaló que ambos métodos a veces fallaron porque eligieron la mala ventana de 15 minutos para comenzar. Pero concluyeron que si puedes encontrar la ventana correcta, agregar un "verificador disciplinado" es la mejor manera de obtener la respuesta correcta.

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →