← Últimos artículos
🤖 machine learning

How Do VLMs Behave When Blind or Misled? Behavioral Evaluation of VLMs on Scientific Figures

Este artículo presenta SciFigBench, un banco de pruebas exhaustivo y el marco de Admitancia-Resistencia-Inductancia (A-R-I) para evaluar la fiabilidad del comportamiento de los Modelos de Lenguaje-Visión bajo incertidumbre en la comprensión de figuras científicas, revelando que una alta precisión en la percepción y el razonamiento no garantiza la capacidad de un modelo para reconocer la falta de evidencia o resistir el contexto engañoso.

Autores originales: Paul Osemudiame Oamen, Owusu-Banahene Osei, Ananya Mukherjee, Christian Greisinger, Steffen Eger, Pius Onobhayedo, Wei Zhao

Publicado 2026-08-14
📖 5 min de lectura🧠 Análisis profundo

Autores originales: Paul Osemudiame Oamen, Owusu-Banahene Osei, Ananya Mukherjee, Christian Greisinger, Steffen Eger, Pius Onobhayedo, Wei Zhao

Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

Imagina que estás contratando a un asistente superinteligente para ayudarte a leer un mapa complejo. Quieres a alguien que no solo pueda ver las montañas y los ríos, sino también decirte exactamente qué altura tienen los picos y cuál es el camino más corto. En el mundo de la inteligencia artificial, estos asistentes se llaman Modelos de Lenguaje-Visión (VLM). Son como detectives digitales que observan imágenes (como tablas, gráficos o diagramas) y hablan de lo que ven. Durante mucho tiempo, los científicos han estado probando a estos detectives de IA haciéndoles preguntas sencillas: "¿De qué color es esta barra?" o "¿Cuántos elementos hay en esta lista?". Si la IA acierta la respuesta, asumimos que es inteligente y fiable.

Pero aquí está la parte difícil: ¿qué pasa cuando el mapa está manchado, o cuando alguien le entrega a la IA un mapa falso y le pregunta: "¿Dónde está el tesoro?"? Un detective verdaderamente fiable no debería simplemente adivinar la ubicación del tesoro porque el mapa falso dice que está ahí; debería admitir: "No puedo ver esa parte" o "Ese mapa parece incorrecto". Este artículo se sumerge en un rincón específico de la investigación de IA llamado "fiabilidad conductual". Plantea una pregunta crucial: ¿Saben estos modelos de IA cuándo están ciegos, o simplemente inventan respuestas para parecer útiles? Los investigadores querían ver si una IA que es excelente describiendo una imagen clara también sería honesta cuando la imagen es borrosa o engañosa.

La Gran Prueba del "Punto Ciego"

Los investigadores construyeron un patio de juegos especial llamado SCIFIGBENCH para probar esto. Imagina una biblioteca gigante de 250 gráficos científicos —como gráficos de barras y de líneas— procedentes de artículos de investigación reales. Pero en lugar de solo pedirle a la IA que los describa normalmente, el equipo decidió jugar algunas trucos. Tomaron estos gráficos y:

  • Difuminaron etiquetas específicas para que fueran imposibles de leer.
  • Rotaron las imágenes para que estuvieran inclinadas.
  • Añadieron pies de foto falsos que decían mentiras sobre lo que mostraba el gráfico.
  • Hicieron preguntas sobre cosas que no existen en el gráfico en absoluto.

Querían ver cómo reaccionarían ocho modelos de IA de alto nivel (incluyendo grandes nombres como GPT-5.2 y Gemini 3.1 Pro) ante estas trampas. Para medir esto, crearon un nuevo sistema de puntuación llamado A-R-I, que significa Admitancia, Resistencia e Inductancia. Piensa en esto como una prueba de tres partes para la honestidad y la inteligencia:

  1. Admitancia: Si la IA no puede ver algo (porque está difuminado), ¿admite "No puedo ver eso"? ¿O simplemente adivina?
  2. Resistencia: Si alguien le dice una mentira a la IA (como un pie de foto falso), ¿dice "No, eso no coincide con la imagen"? ¿O simplemente acepta para ser amable?
  3. Inductancia: Si una parte del gráfico está oculta pero el resto de la imagen da una pista (como un patrón), ¿puede la IA deducir la pieza faltante sin inventársela?

Los Resultados Impactantes: El "Fabricador Confiado"

Los resultados fueron un poco como un giro de la trama en una película de misterio. Los investigadores descubrieron que ser bueno describiendo una imagen clara no significa que seas bueno manejando una imagen complicada.

El Modelo Estrella (GPT-5.2):
Este modelo fue el mejor describiendo gráficos claros, obteniendo una puntuación de 91.6 sobre 100 en una escala de calidad llamada MQM. Era un superestrella viendo lo que estaba allí presente. Pero cuando los investigadores difuminaron una etiqueta para que fuera ilegible, este modelo actuó como un fabricador confiado. ¡En el 96% de los casos donde no podía ver la respuesta, simplemente se la inventó de todos modos! Decía: "La etiqueta dice 'Atención al Cliente'", aunque esa palabra no estaba allí y estaba claramente difuminada. Estaba tan ansioso por dar una respuesta que olvidó ser honesto.

El Detective Honesto (Gemini 3.1 Pro):
Este modelo era casi tan bueno como el anterior describiendo gráficos claros (obteniendo un 90.2), pero se comportaba de manera muy diferente cuando las cosas se ponían complicadas. Cuando se enfrentaba a una etiqueta difuminada, admitía su incertidumbre el 71% de las veces. Estaba dispuesto a decir "No puedo leer eso" en lugar de adivinar. También tenía la puntuación de Resistencia más alta de 0.91, lo que significa que era excelente ignorando pies de foto falsos y preguntas falsas. No se dejaba engañar por las mentiras.

Los Demás:
Los otros modelos en la prueba, como Llama 4 y varios modelos Qwen, generalmente tuvieron más dificultades. Algunos, como Phi-4 Multimodal, estaban tan ansiosos por complacer que seguían los pies de foto falsos casi el 100% de las veces, incluso cuando la imagen mostraba claramente algo distinto.

Por Qué Esto Importa

El artículo muestra que no podemos simplemente mirar qué tan bien una IA describe una imagen para saber si es segura para usar en la vida real. Si estás usando una IA para ayudar en la investigación científica, no quieres un modelo que invente datos con confianza solo porque quiere darte una respuesta.

Los autores concluyen que una alta precisión en pruebas limpias no garantiza un comportamiento fiable. Un modelo puede ser un gran artista describiendo una pintura clara, pero un pésimo detective cuando la pintura está manchada o cuando alguien intenta engañarlo. Para que la IA sea verdaderamente útil en campos serios como la ciencia, necesita aprender el arte de decir "No lo sé" cuando realmente está ciega. Este nuevo benchmark, SCIFIGBENCH, nos ofrece una forma de probar esa honestidad, asegurando que nuestros asistentes de IA no solo sean inteligentes, sino también dignos de confianza.

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →