← Últimos artículos
🤖 AI

Do Video-LLMs Actually Watch? Diagnosing Character-Tracking Failures in Long-Form Video

Este artículo revela que los Video-LLMs actuales fallan ampliamente al rastrear genuinamente personajes específicos en videos de larga duración, dependiendo en su lugar de pistas superficiales de género y fallando al distinguir entre individuos del mismo género, lo que causa que las puntuaciones de los benchmarks sobreestimen sus capacidades reales de razonamiento temporal y seguimiento de identidad.

Autores originales: Mohammad Al-Ratrout, Shayla Sharmin, Aditya Raikwar, Roghayeh Leila Barmaki

Publicado 2026-07-14
📖 4 min de lectura☕ Lectura para el café

Autores originales: Mohammad Al-Ratrout, Shayla Sharmin, Aditya Raikwar, Roghayeh Leila Barmaki

Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

Imagina que has contratado a un robot detective súper inteligente, de entre 7.000 y 8.000 millones de parámetros, para que vea un episodio completo de The Big Bang Theory. Tu misión para el robot es simple: "Observa a Sheldon y dime el orden exacto en que cambia su ropa".

Esperarías que el robot fuera como un halcón, fijando su atención en el rostro de Sheldon, rastreándolo a través de cada escena y anotando sus cambios de vestuario con perfecta precisión. Pero aquí está el giro: el robot no está observando realmente a Sheldon. Solo está adivinando basándose en un atajo muy perezoso.

El gran intercambio de "Sheldon"

Para averiguar qué estaba pasando, los investigadores hicieron un truco ingenioso. Tomaron exactamente el mismo video y las mismas respuestas de opción múltiple, pero simplemente cambiaron el nombre en la pregunta.

  • Pregunta original: "¿En qué orden cambia de ropa Sheldon?"
  • El intercambio: "¿En qué orden cambia de ropa Leonard?" (Mismo video, mismas respuestas).

Si el robot estuviera rastreando realmente a los personajes, debería haber dicho: "¡Espera, Leonard usa ropa diferente a la de Sheldon!", y habría elegido una respuesta distinta. Pero, ¿adivina qué? Al robot no le importó.

En aproximadamente un 7% a 17% de los intercambios del mismo género (como cambiar a Sheldon por Leonard), el robot cambió su respuesta. Eso es apenas mejor que lanzar un dado. En su mayor parte, estaba ignorando el nombre y simplemente eligiendo una respuesta que le gustaba.

El fallo de "Género"

Entonces, si no está mirando a la persona, ¿qué es lo que está mirando? Los investigadores descubrieron que el robot estaba utilizando un filtro muy grueso y borroso: el Género.

Cuando cambiaron un personaje masculino por uno femenino (como de Sheldon a Penny), el robot cambió su respuesta con mucha más frecuencia (20% a 43% de las veces). Parecía pensar: "Oh, la pregunta cambió de un 'hombre' a una 'mujer', así que la ropa debe ser diferente".

Pero si intercambiabas a un hombre por otro hombre, el robot estaba completamente perdido. No podía distinguir a Sheldon de Howard mejor de lo que podría distinguir a un gato de un perro. Veía "masculino" y "femenino", pero no podía ver a "Sheldon".

La ilusión de la "Caja Mágica"

El artículo también comprobó si el robot estaba haciendo trampa memorizando la serie de sus datos de entrenamiento (como si hubiera leído el guion de antemano). Probaron mostrando al robot solo el texto de la pregunta y el título de la serie, sin ningún video. El robot obtuvo una puntuación prácticamente al azar (alrededor del 18-20%). Por lo tanto, no estaba haciendo trampa con un guion; simplemente era malo en la parte visual.

También probaron dándole más fotogramas (más "instantáneas" del video) para ver si solo necesitaba ver más. Darle 32 fotogramas en lugar de 16 lo hizo ligeramente mejor para detectar la ropa en general, pero sigue sin mejorar en el rastreo de un personaje específico. Era como darle mejores gafas a un ciego; puede ver mejor la ropa, pero sigue sin saber quién la lleva puesta.

La trampa de la opción múltiple

Aquí está la parte más sorprendente: el robot estaba acertando el 37-38% de las respuestas en la prueba estándar. ¡Eso parece impresionante! Pero esa puntuación era un espejismo.

Cuando los investigadores le pidieron al robot que escribiera la respuesta con sus propias palabras (Abierta/Open-Ended) en lugar de elegir de una lista (Opción Múltiple), la puntuación cayó en picado entre 18 y 25 puntos.

  • Puntuación de Opción Múltiple: ~38%
  • Puntuación de Respuesta Abierta: ~13–19%

¿Por qué la caída? Porque la prueba de opción múltiple le daba al robot una "caja mágica" de cinco opciones. Incluso si el robot solo estaba adivinando o eligiendo la respuesta que más le gustaba (como la "E" o la "A"), tenía una probabilidad de 1 entre 5 de acertar. Cuando se le obligó a generar la respuesta desde cero, no tuvo red de seguridad y falló por completo. De hecho, ninguna de las 151 respuestas abiertas de los robots de código abierto fue totalmente correcta.

La conclusión final

El artículo concluye que estos Video-LLMs no están rastreando realmente a los personajes. Están "alucinando" una conexión entre el nombre y el video. Son buenos detectando que "una persona lleva una camisa", pero son terribles respondiendo "¿Qué persona?".

Los investigadores sugieren que las altas puntuaciones en los puntos de referencia (benchmarks) son engañosas. Están midiendo qué tan bien los modelos pueden adivinar basándose en pistas de género o en golpes de suerte en opciones múltiples, no qué tan bien pueden realmente seguir una historia. Hasta que un modelo pueda pasar la prueba del "Intercambio de Nombre" y la prueba de "Respuesta Abierta", no podemos decir que realmente "ve" el video.

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →