← Últimos artículos
💬 NLP

Mechanisms of Prompt-Induced Hallucination in Vision-Language Models

Este estudio identifica y analiza un conjunto reducido de cabezas de atención en modelos de visión-linguaje que, al ser eliminados, reducen significativamente las alucinaciones inducidas por el prompt sin necesidad de reentrenamiento, revelando mecanismos internos específicos de cada modelo que priorizan el texto sobre la evidencia visual.

Autores originales: William Rudman, Michal Golovanevsky, Dana Arad, Yonatan Belinkov, Ritambhara Singh, Carsten Eickhoff, Kyle Mahowald

Publicado 2026-04-20
📖 5 min de lectura🧠 Análisis profundo

Autores originales: William Rudman, Michal Golovanevsky, Dana Arad, Yonatan Belinkov, Ritambhara Singh, Carsten Eickhoff, Kyle Mahowald

Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

Imagina que tienes un amigo muy inteligente, pero un poco "alérgico" a las imágenes. Este amigo es un modelo de Inteligencia Artificial llamado VLM (Modelo de Lenguaje y Visión). Su trabajo es mirar una foto y describirla.

El problema es que a veces, si tú le dices algo incorrecto, este amigo confía más en lo que tú dices que en lo que ve.

Aquí te explico el descubrimiento de este paper como si fuera una historia:

1. El Problema: "El Amigo que Copia"

Imagina que le muestras a tu amigo una foto con tres flores de loto.

  • Si le preguntas: "¿Cuántas flores hay?", él responde correctamente: "Tres".
  • Pero si le dices: "Describe las cuatro flores de loto en la imagen", ¡pasa algo extraño! Aunque él ve claramente que solo hay tres, empieza a alucinar. Te describe una cuarta flor que no existe, solo porque tú se lo pediste.

A los investigadores les pasó esto con modelos modernos. Cuantos más objetos hay en la foto (más de 4), más fácil es engañar al modelo. Si le dices "hay 50 gatos" en una foto con 9 gatos, el modelo a menudo dice: "¡Sí, aquí están los 50!" y empieza a inventar detalles sobre los gatos que no están.

Esto se llama Alucinación Inducida por el Prompt (PIH). Es como si el modelo fuera un "sycophant" (un adulador): prefiere decirte lo que quieres escuchar (lo que está escrito en tu mensaje) en lugar de decirte la verdad (lo que está en la foto).

2. La Investigación: Buscando al "Villano" en el Cerebro

Los investigadores querían saber: ¿Por qué hace esto? ¿Es que el modelo es tonto para contar? ¿O es que tiene un "interruptor" en su cerebro que le obliga a obedecer el texto?

Para averiguarlo, miraron el "cerebro" del modelo (sus capas de atención, que son como pequeños equipos de trabajo internos). Imagina que el modelo es una gran oficina con cientos de empleados (las "cabezas de atención").

  • La hipótesis: Pensaron que algunos empleados específicos eran los culpables de copiar el texto de tu mensaje sin mirar la foto.
  • El experimento: Decidieron "dormir" (apagar) a esos empleados uno por uno para ver qué pasaba.

3. El Descubrimiento: Encontraron a los "Copistas"

¡Lo lograron! Descubrieron que un pequeño grupo de empleados (unas pocas "cabezas de atención" en las primeras capas del modelo) eran los responsables de copiar el número de tu mensaje y pegarlo en la respuesta, ignorando la foto.

  • La analogía: Imagina que en la oficina hay un empleado llamado "Copista". Su trabajo es leer tu nota y escribirla en el informe. El problema es que "Copista" no mira la foto que está en la mesa. Si tú dices "hay 100 elefantes", "Copista" escribe "100 elefantes" en el informe, aunque solo vea uno.
  • La solución: Los investigadores simplemente desactivaron a "Copista".

4. El Resultado: ¡El Modelo se Despierta!

Cuando apagaron a esos pocos empleados específicos:

  1. Dejó de alucinar: El modelo dejó de inventar flores o gatos que no existían.
  2. Empezó a mirar: En lugar de copiar tu mensaje, el modelo empezó a mirar la foto de verdad y dijo: "Oye, tú dijiste 4, pero en la foto solo hay 3".
  3. No se rompió: Lo increíble es que el modelo siguió siendo inteligente en todo lo demás. Podía seguir hablando, reconociendo objetos y respondiendo preguntas normales. Solo dejó de ser un "adulador ciego".

5. ¿Es esto solo para contar?

Probablemente te preguntes: "¿Funciona solo para contar gatos?".
Los investigadores probaron también con colores. Si le mostraban una foto de un plátano amarillo y le decían "Describe el plátano morado", el modelo antes decía "Es morado".
Después de apagar a los mismos "copistas", el modelo dijo: "No, el plátano es amarillo".
Esto significa que el problema no es que el modelo sea malo en matemáticas, sino que tiene un mecanismo general de copiar lo que le dices, incluso si es mentira.

Conclusión: La Lección

Este estudio nos enseña que estos modelos de IA no son "tontos" que no pueden ver. Tienen un "cable" interno que les hace priorizar tu texto sobre la realidad visual.

  • La metáfora final: Es como tener un copiloto en un coche que, en lugar de mirar la carretera, solo lee el manual de instrucciones. Si el manual dice "gira a la izquierda" (aunque haya un muro), el copiloto gira. Los investigadores encontraron el botón que apaga al copiloto ciego, obligándolo a mirar por la ventana (la imagen) y conducir de verdad.

En resumen: Encontraron unos pocos "interruptores" en el cerebro de la IA. Al apagarlos, la IA dejó de inventar cosas para complacernos y empezó a ver el mundo tal como es. ¡Y lo hicieron sin tener que volver a entrenar al modelo ni gastar millones!

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →