← Últimos artículos
💻 computer science

What Color Is the Text? A Benchmark for Hallucination Induced by Image-Embedded Prompt

Este artículo presenta el benchmark "Embedded Stroop" y el conjunto de datos "What-Color-Is-the-Text" (WCIT) para demostrar que los Modelos de Lenguaje de Gran Escala Multimodales sufren frecuentemente de "alucinaciones de Stroop", donde responden incorrectamente con el significado semántico del texto incrustado en una imagen en lugar del color real de dicho texto, revelando que la legibilidad semántica puede prevalecer sobre la percepción del color visual.

Autores originales: Jinkun Zhao, Lei Huang, Haixin Ge, Wenjun Wu

Publicado 2026-08-24
📖 5 min de lectura🧠 Análisis profundo

Autores originales: Jinkun Zhao, Lei Huang, Haixin Ge, Wenjun Wu

Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

En el mundo de la inteligencia artificial, existe una clase creciente de sistemas conocidos como modelos de lenguaje de gran tamaño multimodales. Estas son mentes digitales que pueden ver imágenes y leer texto, para luego combinar esos dos sentidos y responder preguntas sobre el mundo. Se han vuelto notablemente buenos describiendo una foto o resolviendo un rompecabezas basado en una imagen. Sin embargo, al igual que los humanos, estos sistemas no son inmunes a la confusión. A veces pueden ser engañados por lo que ven o, más precisamente, por cómo interpretan lo que ven. Un ejemplo clásico de esta confusión proviene de una famosa prueba psicológica llamada el efecto Stroop. En esta prueba, se le muestra a una persona una palabra como "ROJO" impresa en tinta azul. Si se le pide que nombre el color de la tinta, el cerebro humano suele tropezar porque lee automáticamente la palabra "ROJO" antes de poder concentrarse en el color azul. El cerebro tiene que trabajar duro para ignorar el significado de la palabra y concentrarse solo en el color visual. Durante años, los científicos se han preguntado si estos modelos informáticos avanzados sufren el mismo tipo de fallo mental cuando miran imágenes.

Un equipo de investigadores de la Universidad de Beihang en China decidió poner a prueba esta cuestión con un nuevo experimento diseñado específicamente para las máquinas. Crearon un referente llamado "What Color Is the Text" (¿De qué color es el texto?), que presenta a la computadora una imagen simple pero engañosa. En lugar de hacerle una pregunta a la computadora en un cuadro de texto separado, escribieron la pregunta directamente en la propia imagen. Imagine un cuadrado blanco con las palabras "¿De qué color es el texto?" escritas en tinta negra. Dentro de esa misma imagen, hay otra palabra, como "AZUL", pero esta palabra está impresa en tinta roja. Se le pide a la computadora que identifique el color de la tinta utilizada para la palabra "AZUL". El desafío es que la computadora debe ignorar el significado de la palabra "AZUL" e informar que la tinta es en realidad roja. Esta configuración obliga a la máquina a elegir entre lo que dice el texto y lo que ven los ojos.

Cuando los investigadores realizaron esta prueba en dieciséis modelos de inteligencia artificial diferentes, que iban desde proyectos de código abierto hasta potentes sistemas comerciales, los resultados fueron sorprendentes. Las máquinas fallaron mucho más de lo que tuvieron éxito. De hecho, cuando la pregunta estaba incrustada directamente en la imagen, los modelos frecuentemente ignoraban el color real de la tinta y simplemente respondían con el color nombrado en el texto. Por ejemplo, si la palabra "VERDE" estaba escrita en tinta púrpura, el modelo diría con confianza "verde". Esto sucedía incluso cuando los modelos podían identificar correctamente el color si la pregunta se hacía en un cuadro de texto separado en lugar de estar escrita en la imagen. El estudio encontró que este tipo específico de error, donde la máquina se distrae por el significado de las palabras en lugar de la realidad visual, ocurrió en una parte significativa de los intentos. En algunos casos, más de la mitad de los errores cometidos por los modelos se debieron a esta confusión específica, donde priorizaron el texto sobre el color.

Los investigadores querían estar seguros de que esto no era simplemente un caso de que los modelos fueran malos nombrando colores en general. Para comprobarlo, analizaron un grupo de imágenes donde los modelos habían tenido éxito previamente al nombrar colores correctamente cuando la pregunta se hacía por separado. Incluso cuando los modelos conocían los nombres de los colores, seguían cayendo en la trampa cuando la pregunta estaba incrustada en la imagen. Esto demostró que el problema no era una falta de vocabulario o una simple incapacidad para ver colores, sino un problema más profundo donde la capacidad de la máquina para leer texto superaba su capacidad para ver detalles visuales. El estudio también probó qué pasaría si hacían el texto más difícil de leer. Cuando voltearon la imagen de cabeza o cubrieron partes de las palabras con bloques negros, los modelos cometieron menos errores. Esto sugiere que la confusión proviene de la capacidad de la máquina para leer claramente el significado semántico de las palabras. Cuando el texto está desordenado o escondido, la máquina depende más del color visual y su rendimiento mejora.

A pesar de estos hallazgos, los investigadores señalaron que el problema no se resuelve fácilmente simplemente diciéndole a la máquina que preste atención. Intentaron dar a los modelos instrucciones especiales para advertirles sobre el truco y, aunque esto redujo la cantidad de veces que los modelos caían en el texto, no los hizo mucho mejores en ver realmente el color correcto. Los modelos simplemente empezaron a cometer otros tipos de errores. El estudio concluye que los sistemas actuales de inteligencia artificial tienen una debilidad fundamental: cuando la información visual y el texto entran en conflicto, el texto suele ganar. Esto sugiere que estos modelos no están "viendo" realmente el mundo de la misma manera que los humanos, sino que están fuertemente influenciados por los patrones de lenguaje que han aprendido. A medida que estos sistemas se despliegan en situaciones del mundo real, como leer señales de tráfico o identificar objetos en entornos complejos, esta tendencia a confiar en el texto por encima de la vista podría conducir a decisiones poco fiables. El trabajo sirve como una clara advertencia de que, para que estas máquinas sean verdaderamente robustas, necesitan aprender a equilibrar lo que leen con lo que ven, en lugar de dejar que un sentido domine completamente al otro.

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →