The Illusion-Illusion: Vision Language Models See Illusions Where There Are None
Este artículo revela que los modelos actuales de visión y lenguaje sufren de "ilusiones-ilusiones", al percibir erróneamente imágenes no ilusorias (como líneas genuinamente torcidas o círculos de diferentes tamaños) como ilusiones ópticas, exponiendo así errores fundamentales de procesamiento en su razonamiento visual.
Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA de un preprint que no ha sido revisado por pares. No es consejo médico. No tome decisiones de salud basándose en este contenido. Leer descargo de responsabilidad completo
Resumen Técnico: La ilusión-ilusión: Los modelos de lenguaje visual ven ilusiones donde no las hay
Planteamiento del problema
Las ilusiones perceptivas sirven como herramientas diagnósticas en la ciencia cognitiva al revelar brechas entre la realidad y la apariencia, iluminando así los mecanismos de procesamiento mental subyacentes. Si bien investigaciones previas han investigado si los sistemas artificiales caen víctimas de las mismas ilusiones clásicas que los humanos, este artículo sostiene que probar las ilusiones clásicas es insuficiente para diagnosticar los actuales Modelos de Lenguaje Visual (VLM, por sus siglas en inglés). El autor postula que una herramienta diagnóstica más reveladora es la "ilusión-ilusión" (o "ilusión-ilusión"): imágenes que poseen las características visuales de una ilusión pero carecen del truco perceptivo real. En estos casos, la realidad visual coincide con la apariencia (por ejemplo, líneas que son genuinamente de diferentes longitudes, un pato que es genuinamente un pato), pero son vecinas de ilusiones famosas. El problema central abordado es si los VLM actuales perciben erróneamente estas "ilusiones-ilusiones" como ilusiones, revelando así un fallo al distinguir entre anomalías perceptivas genuinas y hechos visuales directos.
Metodología
El estudio empleó un marco de evaluación comparativa que involucró diez ilusiones visuales representativas que cubren diversos fenómenos perceptivos (por ejemplo, las flechas de Müller-Lyer, los círculos de Ebbinghaus, los triángulos de Kanizsa, las sombras de un tablero de ajedrez). Para cada ilusión clásica, el autor construyó tres tipos de estímulos:
- La Ilusión: La imagen original diseñada para provocar un error perceptivo.
- La Ilusión-Ilusión: Una versión modificada donde se elimina el "truco" y las propiedades visuales son literales (por ejemplo, flechas con longitudes de eje genuinamente diferentes, una imagen clara de un pato).
- El Control: Versiones simplificadas diseñadas para verificar la competencia básica (por ejemplo, identificar un solo triángulo).
La evaluación probó ocho VLM actuales: GPT-4o, Claude 3, Gemini Pro Vision, miniGPT, Qwen-VL, InstructBLIP, BLIP2 y LLaVA-1.5. Los modelos fueron presentados con imágenes y prompts específicos dirigidos al sujeto de la ilusión (por ejemplo, "¿Cuál es más larga, la línea azul o la línea roja?"). Una condición secundaria consistió en anteponer la frase "En la siguiente ilusión visual" a los prompts para probar la influencia del contexto.
El rendimiento se calificó de forma binaria (0 o 1) basándose en la alineación con las respuestas humanas. Para las ilusiones clásicas, una puntuación de 1 indicaba reportar la percepción ilusoria o reconocer la ilusión. Para las ilusión-ilusiones y los controles, una puntuación de 1 indicaba reportar la verdad literal como lo haría un humano. El autor señala que esta calificación es permisiva, tendiendo a sobreestimar el rendimiento del modelo.
Resultados clave
Los resultados indican una divergencia significativa entre la percepción humana y las capacidades actuales de los VLM:
- Fallo en las Ilusión-Ilusiones: Los modelos líderes (GPT-4o, Claude 3, Gemini Pro), que reconocen o reportan con éxito las ilusiones clásicas, también clasifican erróneamente las ilusión-ilusiones como ilusiones con frecuencia. Por ejemplo, cuando se les presentan líneas que son genuinamente de diferentes longitudes, estos modelos a menudo afirman que tienen la misma longitud (imitando la ilusión) o describen la imagen como una ilusión.
- Fragilidad Contextual: Cuando el prompt etiquetaba explícitamente una imagen como una "ilusión visual", el rendimiento de los tres mejores modelos se degradó significativamente en las ilusión-ilusiones y los controles. Reportaron abrumadoramente estas imágenes no ilusorias como ilusiones, lo que sugiere que sus respuestas están fuertemente sesgadas por el prompt textual en lugar de la evidencia visual.
- Fallos en el Control: Contrario a la hipótesis de que los controles servirían como una base para la competencia, modelos como GPT-4o, Gemini Pro y Claude 3 reportaron con frecuencia imágenes de control simples (por ejemplo, un solo triángulo) como ilusiones. Esto sugiere que, para estos modelos, el concepto de "ilusión" se está aplicando ampliamente a imágenes que simplemente se asemejan a la categoría de ilusión, en lugar de ser un juicio perceptivo específico.
- Comportamiento del Modelo: El comportamiento de los mejores modelos no se alinea con un hipotético "Modelo B" (que reconocería las ilusiones pero no las ilusión-ilusiones). En su lugar, exhiben un patrón más cercano al rendimiento "plano" o a una tendencia a alucinar ilusiones donde no existen, particularmente cuando son estimulados por la palabra "ilusión".
Contribuciones Clave
El artículo introduce el concepto de "iluscción-ilusión" como una herramienta diagnóstica novedosa para los sistemas artificiales. Al invertir el uso estándar de las ilusiones, el autor demuestra que los VLM actuales sufren un modo de fallo específico: aplican el patrón de reconocimiento de la ilusión a imágenes que no la justifican. Este trabajo destaca que el fallo al distinguir entre una ilusión y una ilusión-ilusión es un indicador más profundo de errores de procesamiento que la mera capacidad de detectar una ilusión clásica. El estudio proporciona un conjunto de datos y un protocolo de evaluación que muestra cómo los modelos a menudo fallan al fundamentar sus respuestas en la realidad visual literal cuando el contexto sugiere que hay una ilusión presente.
Significado y Reivindicaciones
El autor sostiene que estos fallos no son meras curiosidades, sino indicativos de errores de procesamiento más amplios en los VLM actuales. El artículo sugiere que cuando un modelo falla en una ilusión-ilusión, implica que el sistema no está participando en un reconocimiento reflexivo de la entrada "ordinaria". En su lugar, el modelo probablemente depende de la coincidencia de similitud de bajo nivel con los datos de entrenamiento, asociando las características visuales de una imagen con el concepto de una ilusión encontrado en su corpus de entrenamiento, en lugar de imitar los fallos perceptivos específicos de la biología humana.
La importancia de este trabajo radica en que desafía la suposición de que la capacidad de un modelo para identificar una ilusión prueba que posee una comprensión perceptiva similar a la humana. El autor argumenta que caer en una ilusión es un rasgo humano, pero caer en una "ilusión-ilusión" (donde el truco está ausente) es señal de un sistema que es "engañado" por la idea de una ilusión más que por los datos visuales en sí mismos. El artículo concluye que estos fallos sugieren que los sistemas actuales aún no son robustos para distinguir entre la apariencia de un problema y la realidad de la entrada, una limitación que se extiende más allá de la visión hacia otras modalidades y dominios.
¿Ahogado en artículos de tu campo?
Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.