← Últimos artículos
🤖 AI

Accuracy Without Grounding: Diagnosing Visual Dependency Dissociation in Video LLM Benchmarks

Este artículo introduce la Brecha de Dependencia Visual (VDG, por sus siglas en inglés) para demostrar que la alta precisión en los puntos de referencia de los modelos de lenguaje de gran tamaño para video a menudo proviene de prioridades lingüísticas en lugar de una comprensión visual genuina, revelando que el orden temporal contribuye mínimamente al rendimiento mientras que la diversidad de fotogramas impulsa la mayoría de las mejoras.

Autores originales: Jae Joong Lee

Publicado 2026-07-16
📖 5 min de lectura🧠 Análisis profundo

Autores originales: Jae Joong Lee

Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

Imagina que estás tratando de enseñarle a un robot a entender el mundo. Le das una cámara y un cerebro, y le haces preguntas sobre lo que ve. Durante mucho tiempo, los científicos han medido qué tan "inteligentes" son estos robots dándoles una prueba: muéstrales un video, hazles una pregunta y mira si obtienen la respuesta correcta. Si el robot obtiene una puntuación alta, asumimos que realmente está "viendo" y comprendiendo el video. Pero aquí está el truco: el hecho de que un robot obtenga la respuesta correcta no significa que haya mirado la imagen. Podría simplemente haber adivinado basándose en las palabras de la pregunta, como un estudiante que sabe que el profesor siempre pregunta sobre "gatos" los martes y simplemente responde "gato" sin mirar la pizarra. Este artículo se sumerge en el mundo desordenado y confuso de los "Modelos de Lenguaje de Video" (Video Large Language Models)—computadoras superinteligentes que pueden leer texto y ver videos—para hacer una pregunta aterradora: ¿estos robots realmente están viendo las películas, o solo son muy buenos adivinando las respuestas usando solo el texto?

Los investigadores decidieron jugarle una pequeña broma a veinte robots diferentes que ven videos, que van desde diminutos hasta masivos con cerebros enormes. Tomaron una prueba estándar llamada MVBench, que tiene cientos de preguntas sobre videos, y ejecutaron la prueba dos veces para cada pregunta. La primera vez, le mostraron al robot el video real. La segunda vez, le mostcieron exactamente la misma pregunta, pero el video fue reemplazado por una pantalla negra sólida. Si el robot estuviera realmente "viendo", su puntuación debería caer casi a cero cuando el video desaparece. Si el robot seguía obteniendo las respuestas correctas incluso con una pantalla negra, significaba que no estaba mirando en absoluto; solo estaba usando trucos del lenguaje para adivinar.

Los resultados fueron un poco impactantes. El equipo descubrió que, para muchas preguntas, los robots se desempeñaban casi exactamente igual si estaban viendo un video o mirando un vacío negro. Introdujeron una nueva forma de medir esto llamada "Brecha de Dependencia Visual" (Visual Dependency Gap o VDG), que es básicamente la diferencia entre qué tan bien lo hace un robot con un video frente a uno sin él. Descubrieron que para ciertos tipos de preguntas, como "¿De qué color es el coche?" (Percepción de Atributos), los robots realmente necesitaban el video para acertar. Pero para otros tipos, como "¿Qué sucede después?" (Razonamiento Temporal), los robots obtenían las respuestas correctas incluso cuando la pantalla estaba negra. Esto significa que las preguntas de la prueba no estaban probando realmente si los robots entendían el tiempo o la secuencia; solo estaban probando si los robots podían adivinar la respuesta basándose en la redacción de la pregunta.

Los investigadores también intentaron averiguar por qué los robots obtenían estas respuestas. Descompusieron el video en diferentes partes: solo un único fotograma, un montón de fotogramas desordenados y el video completo con el tiempo avanzando. Descubrieron que a los robots no les importaba en absoluto el orden de los eventos. Ya fuera que el video se reprodujera hacia adelante, hacia atrás o fuera un desastre de imágenes mezcladas, los robots obtenían la misma puntuación. Lo único que parecía ayudar era ver diferentes imágenes (diversidad de fotogramas), no verlas en el orden correcto. De hecho, para algunos de los modelos más nuevos y avanzados, el video de entrada parecía confundirlos, haciendo que se desempeñaran ligeramente peor que si simplemente hubieran ignorado el video por completo y adivinaran basándose en el texto.

Uno de los hallazgos más interesantes fue sobre cómo estos robots manejan la compresión. Normalmente, si exprimes un archivo de video para hacerlo más pequeño, la calidad empeora. Los investigadores esperaban que, si un robot estuviera realmente "viendo", un video borroso y comprimido lo haría fallar. Pero las puntuaciones de los robots se mantuvieron planas y estables incluso cuando el video estaba fuertemente comprimido. El equipo se dio cuenta de que esto no era porque los robots fueran súper robustos; era porque las preguntas eran tan fáciles de adivinar a partir del texto que los robots no necesitaban los detalles visuales en absoluto. La "robustez" era una ilusión creada por malas preguntas de prueba.

Finalmente, observaron cómo estos robots cambiaban a medida que se hacían más grandes y más inteligentes. Encontraron que, si bien los modelos más grandes generalmente mejoraban en el uso del video, algunos de los modelos más nuevos en realidad se volvían peores en el uso de la información visual. Un modelo, Qwen3-VL, parecía haber olvidado cómo usar los fotogramas de video de manera efectiva, dependiendo casi totalmente de adivinar a partir del texto, aunque sus puntuaciones generales en la prueba parecían buenas. El artículo concluye que ya no podemos confiar ciegamente en las puntuaciones de las tablas de clasificación. Una puntuación alta no significa que un robot sea un gran observador; puede significar que es un gran adivinador. Para saber si un robot realmente está viendo, necesitamos verificar si falla cuando la pantalla se pone negra. Si no falla, es que no estaba mirando en primer lugar.

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →