VidNum-1.4K: A Comprehensive Benchmark for Video-based Numerical Reasoning
Este artículo presenta VidNum-1.4K, un benchmark exhaustivo anotado por humanos que cuenta con 1.379 pares de video-pregunta organizados en una jerarquía de tres niveles para evaluar rigurosamente y exponer las limitaciones significativas de los modelos actuales de visión-lenguaje al realizar razonamientos numéricos complejos y de múltiples pasos dentro de contextos de video del mundo real.
Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo
Imagina que estás viendo una película, pero en lugar de solo disfrutar la trama, te están evaluando tu capacidad para contar objetos y eventos, calcular diferencias entre cantidades y determinar si el número de personas en una multitud aumentó o disminuyó después de un corte de escena. Este es el mundo de los Modelos de Visión y Lenguaje (VLM). Piensa en estos modelos como súper inteligentes detectives digitales que pueden "ver" imágenes y videos y "leer" texto, tratando de entender el mundo tal como lo hacemos nosotros. Durante un tiempo, estos detectives de IA se han vuelto muy buenos describiendo lo que ven, como decir: "Hay un perro corriendo". Pero los científicos se han estado preguntando: ¿Realmente estos sistemas de IA entienden la historia, el paso del tiempo y la lógica de cómo cambian las cosas? O, ¿solo están adivinando basándose en patrones que memorizaron de sus datos de entrenamiento? Esta pregunta es importante porque si una IA no puede comprender verdaderamente el mundo físico —como saber que si añades dos manzanas a tres, tienes cinco, incluso si el ángulo de la cámara cambia—, entonces no podemos confiar en ella para ayudarnos en tareas complejas en el mundo real.
Entra un nuevo desafío llamado VidNum-1.4K, un "examen final" riguroso diseñado específicamente para probar si estos detectives de IA pueden realizar razonamiento numérico en videos. Los investigadores detrás de este estudio, Shaoyang Cui y su equipo, construyeron una enorme colección de 1,37án 1,379 clips de video y preguntas que obligan a la IA a hacer más que solo mirar; deben contar, comparar y calcular. Organizaron estas preguntas en tres niveles de dificultad, como un videojuego con niveles de dificultad progresiva. El Nivel 1 es el "modo fácil", donde la IA solo tiene que contar cosas simples, como "¿Cuántas puertas verdes hay en esta habitación?". El Nivel 2 aumenta la dificultad, pidiéndole a la IA que cuente tipos específicos de cosas, como "¿Cuántos perros marrones hay?", mientras ignora los negros, incluso si la cámara cambia a diferentes ángulos. El Nivel 3 es el "modo hardcore", que requiere que la IA realice una lógica de múltiples pasos, como contar jugadores en la primera toma de un partido de fútbol, contarlos de nuevo en una segunda toma bajo restricciones específicas, y luego realizar una comparación lógica o un cálculo entre estos dos eventos aislados para encontrar la respuesta.
Los resultados de este examen fueron un golpe inesperado. Incluso los modelos de IA más avanzados, incluyendo el potente modelo de código cerrado "Gemini-3.1-pro", solo lograron acertar aproximadamente el 60% de las respuestas cuando se les permitió pensar paso a paso. Los modelos de código abierto, que son como las herramientas construidas por la comunidad en el mundo de la IA, tuvieron más dificultades, puntuando entre el 25% y el 45%. El artículo sugiere que estos modelos todavía dependen de "atajos", como adivinar basándose en frases comunes que han escuchado antes, en lugar de construir un "modelo de mundo interno" estable que entienda cómo se comportan los objetos y los números a través del tiempo. Por ejemplo, cuando el video corta a una nueva escena, los modelos a menudo pierden la cuenta o cuentan dos veces el mismo objeto, lo que demuestra que no comprenden verdaderamente que el perro al principio del clip es el mismo perro al final.
Curiosamente, los investigadores descubrieron que pedirle a la IA que "piense en voz alta" (una técnica llamada Cadena de Pensamiento o Chain-of-Thought) ayudó a resolver los acertijos lógicos más difíciles, pero a veces hizo que cometieran errores en las tareas de conteo más fáciles que habían resuelto correctamente antes. Esto sugiere que, si bien estos modelos están mejorando en lógica de alto nivel, su capacidad básica para rastrear objetos en movimiento en un video sigue siendo inestable. El estudio concluye que simplemente hacer que los modelos de IA sean más grandes (añadiendo más "parámetros") les ayuda con la lógica compleja, pero no soluciona mágicamente sus problemas para rastrear cosas a través de diferentes escenas de video. VidNum-1.4K sirve como un espejo duro y honesto, mostrándonos que, aunque nuestros detectives de IA se están volviendo más inteligentes, aún tienen un largo camino por recorrer antes de que puedan comprender verdaderamente el mundo dinámico y cambiante que los rodea.
¿Ahogado en artículos de tu campo?
Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.