What Does a Temporal Benchmark Score Measure? Decomposing Channel Use in Video VLM Evaluation
Este artículo introduce una métrica de "caída por inversión" sin etiquetas para descomponer las puntuaciones de los benchmarks de los VLM de video temporales, revelando que los modelos a menudo dependen de las codificaciones posicionales en lugar del contenido visual y demostrando que las puntuaciones agregadas enmascaran modos de falla distintos y no intercambiables entre arquitecturas dominantes en posición y arquitectes dominantes en secuencias visuales.
Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo
El Gran Lío de los Detectives de Video: Por qué dos modelos con la misma puntuación son en realidad diferentes
Imagina que estás probando a dos detectives, Molmo2 y Qwen3-VL, para ver quién es mejor resolviendo misterios de video. Les das una serie de clips cortos y les haces preguntas como: "¿El gato saltó antes o después de que el perro ladrara?". Ambos detectives obtienen una puntuación alta en tu prueba, digamos un 0.96 (o 96% de precisión). Podrías pensar: "¡Genial! Ambos entienden el tiempo perfectamente".
Pero este artículo argumenta que tu prueba es en realidad un truco. Es como preguntarle a un detective: "¿Resolviste el caso?", sin preguntar cómo lo resolvió. El artículo revela que, aunque ambos detectives obtuvieron la respuesta correcta, utilizaron métodos completamente diferentes y opuestos para llegar a ella. Uno es un "Viajero en el Tiempo" que ignora lo que ve, y el otro es un "Realista" que confía en sus ojos.
Las dos preguntas ocultas en una sola puntuación
Los autores dicen que la puntuación estándar de una prueba de video es en realidad un cóctel desordenado de dos preguntas diferentes:
- La Pregunta de la Tarea: ¿Requiere realmente la pregunta observar el video en orden? (por ejemplo, "¿El balón rebotó?" podría requerir solo un fotograma, pero "¿El balón rebotó y luego rodó?" requiere la secuencia).
- La Pregunta del Canal: Cuando el modelo realmente necesita el orden, ¿de dónde obtiene esa información? ¿Lee los píxeles (el movimiento real en la pantalla) o hace trampa leyendo los números de posición (las etiquetas invisibles que le dicen a la computadora qué fotograma es el #1, #2, #3)?
La mayoría de las pruebas solo comprueban la primera pregunta. Desordenan los fotogramas y ven si la puntuación cae. Si la puntuación cae, dicen: "Bien, el modelo necesita el orden". Pero no comprueban qué parte del modelo está haciendo el trabajo pesado.
El truco de magia: La "Caída por Reversión" (Reversal-Drop)
Para descubrir cómo funcionan realmente los modelos, los autores realizaron un truco de magia llamado reversal-drop.
Imagina que tienes un video de un globo inflándose.
- Los Píxeles: Los fotogramas visuales muestran al globo haciéndose más grande.
- Las Etiquetas de Posición (RoPE): Estas son etiquetas invisibles adheridas a cada fotograma que dicen "Fotograma 1", "Fotograma 2", "Fotograma 3".
Los autores tomaron un video, revirtieron los píxeles (así que el globo parece estar desinflándose, encogiéndose de grande a pequeño), pero mantuvieron las etiquetas de posición hacia adelante (de modo que la computadora todavía cree que está viendo el Fotograma 1, luego el 2, luego el 3).
Ahora, los píxeles dicen "Desinflándose", pero las etiquetas dicen "Inflándose". Los dos canales están luchando entre sí.
- Molmo2 (El Detective Dominante en Posición): Cuando los píxeles y las etiquetas luchan, Molmo2 ignora los píxeles. Mira las etiquetas, ve "Fotograma 1, 2, 3" y responde como si el globo se estuviera inflando. Aunque está viendo un globo desinflándose, dice: "¡Se está inflando!" porque las etiquetas se lo dijeron.
- El Resultado: Su precisión apenas cambió. No le importó que el video estuviera invertido. Estaba leyendo los índices de posición.
- Qwen3-VL (El Detective Dominante en Secuencia Visual): Cuando los píxeles y las etiquetas luchan, Qwen3-VL ignora las etiquetas. Mira los píxeles, ve al globo encogiéndose y responde: "¡Se está desinflando!".
- El Resultado: Su precisión colapsó. Obtuvo la respuesta incorrecta porque fue engañado por el video invertido. Estaba leyendo el orden visual.
Los números no mienten
El artículo midió esta "caída" en la precisión para demostrar la diferencia:
- En un benchmark llamado TVBench, cuando el video se invirtió pero las etiquetas se mantuvieron hacia adelante:
- Molmo2 cayó casi nada (aproximadamente +0.00 a +0.08 puntos). Estuvo totalmente bien.
- Qwen3-VL cayó una cantidad enorme (entre +0.24 y +0.55 puntos). Se desplomó.
- En TempCompass, utilizando una prueba especial de "verdad de terreno emparejada" (donde conocen la respuesta tanto para el video hacia adelante como para el invertido):
- Molmo2 respondió el evento "hacia adelante" (ignorando el video invertido) con una puntuación de 0.965 en ambos casos.
- Qwen3-VL cayó de 0.944 (normal) a 0.576 (invertido).
Esto demuestra que dos modelos pueden tener exactamente la misma puntuación alta en una prueba normal, pero uno depende del "mapa" (etiquetas) y el otro del "terreno" (píxeles). Si cambias el mapa por uno falso, el primer modelo falla, pero el segundo podría seguir estando bien.
Lo que el artículo descarta
Los autores fueron muy cuidadosos para asegurarse de que esto no fuera solo un error o un artefacto extraño de su prueba.
- No es solo "confusión": Utilizaron una técnica llamada parche de activación (que es como intercambiar las células cerebrales de un modelo con las células cerebrales "correctas" de otro) para demostrar que la diferencia es real.
- Cuando arreglaron el "cerebro" de Molmo2 en la primera capa, se recuperó perfectamente.
- Cuando arreglaron el "cerebro" de Qwen3-VL en la primera capa, este todavía fallaba un poco. Tuvieron que arreglarlo hasta las capas 0, 1 y 2 (donde una característica llamada DeepStack inyecta datos visuales adicionales) para lograr que se recuperara.
- Esto demuestra que la diferencia es una propiedad profunda e interna de cómo están construidos los modelos, no solo un truco superficial.
- No son solo "marcas de tiempo": Comprobaron si los modelos solo estaban leyendo el tiempo escrito en la pantalla (como "00:01", "00:02"). Descubrieron que, aunque las marcas de tiempo ayudan, los modelos siguen dependiendo fuertemente de las etiquetas de posición o de los píxeles incluso cuando las marcas de tiempo se eliminan.
- No es solo trampa de "fotograma único": Demostraron que ambos modelos genuinamente necesitan múltiples fotogramas para resolver estos problemas (obtienen un aumento de +0.20 al ver el video completo frente a un solo fotograma). Por lo tanto, no están simplemente adivinando a partir de una sola imagen; realmente están procesando la secuencia, solo que de diferentes maneras.
La gran conclusión
El artículo concluye que una única "puntuación temporal" es engañosa. Es como decir que dos autos tienen la misma velocidad máxima, pero uno funciona con gasolina y el otro con electricidad. Si conduces los dos en una carretera sin gasolineras, el auto eléctrico fallará, aunque tuvieran la misma puntuación en la prueba de velocidad.
- Molmo2 es dominante en posición: Confía más en las etiquetas invisibles (RoPE) que en lo que ve.
- Qwen3-VL es dominante en secuencia visual: Confía más en lo que ve (píxeles) que en las etiquetas.
Los autores sugieren que las pruebas futuras deberían dejar de dar solo un número. En su lugar, deberían reportar la "caída por reversión" para ver si un modelo está leyendo el mapa o el terreno. Esto ayuda a entender cómo falla un modelo, no solo que falla. Si necesitas un modelo que preste atención al contenido real del video, no quieres el que solo lee las etiquetas. Si necesitas uno que siga un horario estricto, podrías preferir al lector de etiquetas. Pero no puedes notar la diferencia simplemente mirando la puntuación final.
¿Ahogado en artículos de tu campo?
Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.