Results of the 1st Asynchronous CASTLE Challenge at the Joint Egocentric Vision Workshop in Conjunction with CVPR 2026
Este artículo resume las contribuciones y los resultados del 1.er Desafío Asíncrono CASTLE, que se llevó a cabo en el Joint Egocentric Vision Workshop en conjunto con CVPR 2026.
Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo
Imagina intentar recordar todo lo que sucedió durante unas vacaciones de cuatro días, no solo los momentos destacados, sino cada conversación, cada objeto movido y cada pequeño cambio en la habitación, todo mientras observas desde los ojos de diez personas simultáneamente. Este es el tipo de prueba de memoria con la que las computadoras luchan, incluso cuando se les alimentan con miles de horas de video. En el campo de la inteligencia artificial, los investigadores están tratando de construir sistemas que puedan observar grabaciones largas y no guionizadas de la vida cotidiana y responder preguntas específicas sobre ellas, de forma muy similar a como lo haría un humano tras leer un diario o ver una película. El desafío radica en el enorme volumen de información y en la necesidad de conectar detalles que podrían estar separados por horas o días. Si una máquina logra aprender a hacer esto, eventualmente podría ayudarnos a buscar a través de años de metraje personal para encontrar un momento específico o comprender patrones complejos en la forma en que viven las personas.
Para probar qué tan cerca estamos de resolverlo, un grupo de investigadores organizó una competencia llamada el Desafío CASTLE. Proporcionaron a los equipos un conjunto de datos masivo que contenía más de 600 horas de video de ultra alta definición, grabado a alta velocidad para capturar cada detalle. El metraje provenía de cámaras portadas por diez participantes mientras realizaban sus actividades normales, junto con cinco cámaras fijas que observaban desde la habitación. Los datos eran ricos e incluían audio, monitores de frecuencia cardíaca e incluso imágenes térmicas, creando un registro digital completo de cuatro días de actividad. La tarea para los equipos competidores era simple en teoría pero increíblemente difícil en la práctica: tenían que responder 185 preguntas de opción múltiple sobre lo que sucedió en los videos. Estas preguntas requerían que la computadora rastreara personas, contara objetos, recordara dónde estaban escondidas las cosas y comprendiera la cronología de los eventos, como determinar quién comió primero una rebanada de pastel o qué tan rápido estaba alguien cargando su auto en el último día.
Cuatro equipos aceptaron el desafío, cada uno aportando una estrategia diferente al problema. El equipo ganador, conocido como WDL, trató la tarea como un detective reuniendo pistas. En lugar de intentar observar las 600 horas de video a la vez, su sistema primero miraba la pregunta para encontrar palabras clave, como el nombre de una persona o un día específico. Luego, utilizaba estas pistas para extraer solo las partes más relevantes del video y las transcripciones habladas, ignorando el resto. Entrenaron su modelo computacional para enfocarse estrictamente en la evidencia que encontraba, ejecutando variantes de prompts estrictas, equilibradas y agresivas para cada pregunta para asegurar la consistencia a través de la autocoherencia de múltiples muestras. Este enfoque les permitió alcanzar una precisión de casi el 58 por ciento, lo que significa que respondieron correctamente unas 108 de las 185 preguntas.
Otro equipo, MARS, adoptó un enfoque más interactivo. Construyeron un sistema que actuaba como un agente curioso, decidiendo paso a paso qué tipo de información mirar a continuación. Si una pregunta era sobre actividad física, el sistema podía elegir revisar específicamente los datos de la frecuencia cardíaca para esas consultas. Si se trataba de hacia dónde estaba mirando alguien, extraía los datos de seguimiento ocular. Al elegir dinámicamente qué pieza de evidencia examinar en lugar de intentar procesarlo todo a la vez, mejoraron su puntuación al 57 por ciento. Un tercer equipo, TAHAKOM, organizó la información en un mapa estructurado de relaciones, conectando personas, lugares y objetos con marcas de tiempo. Esto les permitió hacer preguntas específicas al sistema sobre las conexiones entre eventos, logrando una precisión del 54.6 por ciento. El equipo final, CuriosAI, se centró en evitar que la computadora inventara cosas. Construyeron un proceso estricto donde el sistema debía buscar evidencia, verificarla contra el video original y luego responder, asegurando que cada afirmación estuviera fundamentada en lo que realmente se vio u oyó. Su mejor método alcanzó un 49.7 por ciento de precisión.
Los resultados de la competencia muestran que, si bien las computadoras están mejorando su comprensión de videos largos, aún tienen un largo camino por recorrer. Los equipos principales respondieron correctamente más de la mitad de las preguntas, lo que representa una mejora significativa respecto al azar, pero todavía fallaron en casi la mitad de las respuestas. Lo que es quizás más revelador es que los equipos no acertaron las mismas preguntas. Cuando se combinan las respuestas correctas de los cuatro equipos, lograron resolver 176 de las 185 preguntas, dejando solo nueve que ningún equipo pudo responder. Esto sugiere que ningún método único es perfecto todavía, pero diferentes enfoques capturan diferentes piezas del rompecabezas. Los investigadores encontraron que el mayor obstáculo sigue siendo la capacidad de cubrir suficiente evidencia sin perderse en el enorme volumen de datos. Aunque los sistemas pueden navegar a través de cientos de horas de metraje, la tarea de razonar a través de eventos del mundo real no guionizados durante periodos largos sigue siendo un problema difícil. La competencia no resolvió el problema, pero dejó claro que combinar estas diferentes estrategias podría ser la clave para construir máquinas que realmente comprendan nuestra vida cotidiana.
¿Ahogado en artículos de tu campo?
Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.