Diagnosing Vision Language Models' Perception by Leveraging Human Methods for Color Vision Deficiencies
Este artículo evalúa los Modelos de Visión y Lenguaje a Gran Escala (LVLMs) utilizando la Prueba de Ishihara y encuentra que, a pesar de poseer conocimiento factual sobre las deficiencias de la visión cromática, los modelos no logran simular las experiencias perceptivas alteradas de las personas afectadas, recurriendo en su lugar a una percepción del color normativa y resaltando una brecha crítica en su capacidad para apoyar la accesibilidad inclusiva.
Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo
Imagina que tienes un asistente robot muy inteligente y culto. Le has enseñado todo sobre el ojo humano, la daltonismo y cómo las personas con diferentes tipos de visión ven el mundo. Puede escribir un ensayo perfecto explicando qué es ser daltónico.
Pero luego, le muestras una imagen y le preguntas: "Si fueras daltónico, ¿qué número verías en esta imagen?".
En lugar de ver el mundo a través de los ojos de una persona daltónica, el robot simplemente mira la imagen con sus propios ojos "perfectos" y te da la respuesta que vería una persona normal. Conoce los hechos sobre el daltonismo, pero no puede sentir o simular la experiencia.
Ese es el núcleo del descubrimiento de este artículo.
La prueba "Ishihara": El examen de la vista del robot
Para probar esto, los investigadores utilizaron una herramienta famosa llamada Test de Ishihara. Probablemente hayas visto estos antes: son círculos llenos de puntos coloridos.
- Para una persona con visión normal: Los puntos forman un número claro, como "12" o "8".
- Para una persona con daltonismo rojo-verde: Los colores se mezclan, y pueden ver un número completamente diferente (como "3") o nada en absoluto.
Los investigadores trataron estas imágenes como una herramienta de diagnóstico para robots. Les pidieron a varios modelos de IA de gran tamaño (los "robots") que miraran estas imágenes y fingieran ser diferentes tipos de personas daltónicas.
Las tres formas en que evaluaron a los robots
Los investigadores no se limitaron a preguntar "¿Qué número ves?". Observaron a los robots de tres maneras diferentes, como un médico revisando a un paciente:
La comprobación de "Lo que dices" (Generación):
Les pidieron al robot que simplemente dijera el número que veía.- El resultado: Incluso cuando se le decía: "Eres daltónico rojo-verde", el robot casi siempre daba la respuesta que daría una persona con visión perfecta. No podía "alucinar" el número incorrecto que una persona daltónica realmente vería. Estaba atrapado en el "modo de visión normal".
La comprobación de "¿Qué tan seguro estás?" (Confianza):
Midieron qué tan seguro estaba el robot de su respuesta.- El resultado: El robot estaba muy seguro al responder por la "visión normal". Pero cuando se le pidió que respondiera como una persona daltónica, se mostró muy confundido e inseguro. No solo adivinó el número equivocado; ni siquiera sabía cómo estar inseguro de la manera correcta. Era como un estudiante que sabe la respuesta a un problema matemático pero se pierde cuando se le pide resolverlo a la inversa.
La comprobación de "Dentro del cerebro" (Representación interna):
Observaron profundamente dentro del "cerebro" del robot (sus capas de datos internas) para ver si estaba procesando la imagen de manera diferente según las instrucciones.- El resultado: Incluso en lo más profundo, el robot no estaba cambiando su perspectiva. Estaba procesando la imagen como si tuviera visión perfecta, independientemente de lo que se le dijera que fingiera. Era como una persona con los ojos vendados pero que sigue describiendo la habitación como si pudiera verla perfectamente.
El "Doctor" y el "Aprendiz de patrones"
Los investigadores se preguntaron: "¿Tal vez los robots solo necesitan más entrenamiento médico?" o "¿Tal vez solo están memorizando los patrones de puntos?".
- Probaron con un robot entrenado específicamente con datos médicos. Resultado: Seguía sin poder simular el daltonismo.
- Entrenaron a un robot con miles de patrones de puntos falsos para ver si solo estaba memorizando formas. Resultado: Mejoró su capacidad para ver números cuando tenía visión perfecta, pero se volvió peor fingiendo ser daltónico.
La gran conclusión
El artículo concluye que, si bien estos modelos de IA son excelentes hablando sobre el daltonismo, son terribles experimentándolo.
Piénsalo de esta manera: Puedes leer un libro sobre qué se siente estar bajo el agua, pero leer el libro no significa que puedas contener la respiración durante cinco minutos. Estos modelos de IA han leído el "libro" sobre el daltonismo, pero no pueden realmente "contener la respiración" y ver el mundo a través de los ojos de una persona daltónica.
Esto es importante porque, a medida que empezamos a usar estos robots para ayudar a las personas a navegar por el mundo, leer mapas o entender gráficos, necesitamos asegurarnos de que no den accidentalmente instrucciones que solo funcionen para personas con visión perfecta, dejando atrás a los demás. El artículo muestra que, en este momento, estos robots siguen siendo "visualmente normales" en su esencia, incluso cuando intentan fingir lo contrario.
¿Ahogado en artículos de tu campo?
Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.