CompareBench: A Benchmark for Visual Comparison Reasoning in Vision-Language Models
Este artículo presenta CompareBench, una suite de evaluación integral que incluye TallyBench, OmniCaps y un conjunto de datos de comparación visual de 1.200 preguntas, para evaluar y revelar debilidades sistemáticas en los modelos actuales de visión y lenguaje con respecto al conteo de objetos y al razonamiento geométrico, espacial y temporal.
Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo
La visión humana no se trata simplemente de ver; se trata de comparar. Cuando miramos una habitación, no solo registramos que existen sillas y mesas; juzgamos instantáneamente qué silla es más alta, qué mesa está más cerca, cuántas tazas hay sobre el mostrador o si una fotografía muestra una escena del pasado o del presente. Esta capacidad de sopesar una cosa frente a otra es una parte fundamental de cómo entendemos el mundo. En años recientes, las computadoras han aprendido a ver con una habilidad notable, siendo capaces de describir imágenes y responder preguntas sobre lo que contienen. Estos sistemas, conocidos como modelos de visión y lenguaje, son los motores detrás de muchas herramientas modernas que pueden leer un gráfico, describir una foto o resolver un acertijo visual. Sin embargo, aunque estas máquinas se han vuelto expertas en el reconocimiento y la descripción, no ha quedado claro si poseen la misma comprensión intuitiva de la comparación que los humanos utilizan cada segundo del día.
Un investigador ha construido ahora una prueba especializada para responder a esta pregunta, creando un nuevo conjunto de evaluación diseñado para aislar el acto específico de comparar información visual. Descubrieron que, si bien los sistemas informáticos más avanzados funcionan bien en tareas generales, tienen dificultades significativas cuando se les pide realizar comparaciones directas sobre cantidad, tamaño, distancia o tiempo. El estudio revela que incluso los modelos más inteligentes pueden fallar al contar objetos que son claramente visibles, juzgar erróneamente cuál de dos artículos es más largo o confundirse sobre cuál de dos personas está más cerca de la cámara. El investigador descubrió que estos sistemas suelen tropezar en tareas que son triviales para un humano, lo que sugiere que la capacidad de comparar detalles visuales sigue siendo una debilidad sistemática en la inteligencia artificial actual.
Para investigar esta brecha, el investigador construyó un conjunto exhaustivo de pruebas llamado CompareBench, el cual está respaldado por otros dos recursos que desarrolló: TallyBench y OmniCaps. TallyBench es una colección de dos mil imágenes, cada una emparejada con una pregunta simple que pide a la computadora contar un tipo específico de objeto, como perros, libros o cucharas. Este recurso sirve como base para probar qué tan bien puede un modelo contar artículos individuales y también proporciona las imágenes de origen para la tarea de comparación de cantidades. OmniCaps es un conjunto más pequeño de setecientas dieciséis imágenes que presentan eventos históricos, monumentos famosos y personas notables, cada una etiquetada con una fecha específica. Esta colección permite al investigador probar si un modelo puede comprender el paso del tiempo mediante el ordenamiento cronológico de las imágenes. La prueba principal, CompareBench, reúne estos elementos en mil doscientas preguntas que piden a la computadora realizar comparaciones directas. Estas preguntas se dividen en cuatro categorías: comparar cantidades, comparar propiedades geométricas como longitud y grosor, juzgar relaciones espaciales como profundidad y altura, y ordenar eventos en el tiempo. El subconjunto de comparación de cantidades se nutre específicamente de TallyBench para formar seiscientas preguntas.
El investigador probó nueve versiones diferentes de sistemas de visión computacional líderes de tres grandes empresas tecnológicas. Pidieron a estos modelos que resolvieran las mil doscientas preguntas de comparación y las dos mil tareas de conteo. Los resultados mostraron una clara división entre el desempeño humano y el desempeño de las máquinas. Los humanos lograron puntuaciones casi perfectas en casi todas las tareas, contando objetos y juzgando tamaños con facilidad. Los modelos de computadora, sin embargo, mostraron errores persistentes. En las tareas de conteo, los mejores modelos obtuvieron aproximadamente el ochenta y siete por ciento de las respuestas correctas, lo que significa que omitieron o contaron mal objetos en más de uno de cada diez imágenes. En las tareas de comparación, el desempeño varió según la categoría. Los modelos fueron razonablemente buenos comparando cantidades, pero tuvieron dificultades significativas con el razonamiento espacial, fallando a menudo al determinar qué objeto estaba más cerca de la cámara o qué punto estaba más alto del suelo. También tuvieron problemas con las comparaciones geométricas, como decidir qué libro era más grueso.
Uno de los hallazgos más sorprendentes surgió en la categoría de comparación temporal, o basada en el tiempo. En esta sección, se pidió a los modelos que observaran imágenes de escenas históricas, monumentos o personajes famosos y decidieran cuál de ellos ocurrió antes en la historia. Aquí, los modelos de computadora superaron de hecho a los sujetos humanos de la prueba. Los humanos, que estaban limitados a observar únicamente la evidencia visual en las fotos, a menudo no podían determinar el orden correcto porque las imágenes se veían muy similares. Los modelos de computadora, sin embargo, tenían acceso a una vasta cantidad de conocimiento preexistente sobre historia, arquitectura y figuras famosas. Podían recurrir a esta base de datos interna para ordenar correctamente las imágenes, incluso cuando las pistas visuales por sí solas eran insuficientes. Esto sugiere que, si bien los modelos carecen de una verdadera comprensión visual del espacio y el tamaño, a veces pueden compensar esto utilizando su enorme memoria de hechos para resolver problemas que requieren conocimiento externo.
A pesar de estos éxitos ocasionales, el estudio destaca que la capacidad central de comparar elementos visuales aún no ha sido totalmente dominada por la inteligencia artificial. El investigador observó que los modelos frecuentemente confundían la longitud de un objeto con su altura, o fallaban al distinguir entre un objeto en primer plano y uno en el fondo. También encontraron que los modelos a menudo pasaban por alto objetos parcialmente ocultos al contar, una tarea que los humanos manejan instintivamente. El investigador concluyó que los sistemas actuales aún no son confiables para tareas que requieren una comparación visual detallada, y que estos fallos no son errores aleatorios, sino limitaciones sistemáticas en cómo los modelos procesan la información visual. Al proporcionar un conjunto de pruebas enfocado que aísla estas habilidades específicas, el nuevo referente ofrece una forma clara de medir el progreso en esta área. El investigador espera que, al hacer públicos sus datos y métodos, otros científicos puedan utilizar estas herramientas para construir mejores modelos que eventualmente puedan igualar la capacidad humana de ver, comparar y comprender el mundo que nos rodea.
¿Ahogado en artículos de tu campo?
Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.