← Últimos artículos
💻 computer science

Mitigating Hallucination in Large Vision-Language Models via Adaptive Attention Calibration

El artículo presenta CAAC, un marco de calibración de atención que mitiga las alucinaciones en los modelos de lenguaje-visión grandes mediante la corrección de sesgos espaciales y de modalidad, logrando una mejor alineación visual y reduciendo significativamente las alucinaciones en generaciones largas.

Autores originales: Mehrdad Fazli, Bowen Wei, Ahmet Sari, Ziwei Zhu

Publicado 2026-04-13
📖 5 min de lectura🧠 Análisis profundo

Autores originales: Mehrdad Fazli, Bowen Wei, Ahmet Sari, Ziwei Zhu

Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

¡Claro que sí! Imagina que los Modelos de Lenguaje Visuales Grandes (LVLMs) son como unos chicos muy inteligentes que tienen una cámara en la cabeza y un libro de texto gigante en el bolsillo. Pueden describirte lo que ven en una foto con mucha fluidez, pero a veces, cuando se les pide que hablen mucho tiempo o que describan cosas complejas, empiezan a alucinar.

¿Qué significa "alucinar" en este contexto? Significa que el chico empieza a inventar cosas. Por ejemplo, le muestras una foto de una playa vacía y él te dice: "¡Ah, qué bonito, veo un perro jugando con una pelota y un vendedor de helados!". No hay perro, ni pelota, ni helado. Simplemente, su cerebro (el modelo) se ha dejado llevar por lo que cree que debería haber, en lugar de lo que realmente hay.

Los autores de este paper, Mehrdad Fazli y su equipo, han creado una solución llamada CAAC (Calibración de Atención Consciente de la Confianza). Vamos a explicarlo con una analogía sencilla.

El Problema: Dos "Vicios" del Modelo

El paper dice que estos modelos tienen dos malos hábitos que les hacen inventar cosas:

  1. El "Foco Ciego" (Sesgo Espacial): Imagina que el modelo tiene una linterna para mirar la foto. A veces, en lugar de iluminar toda la imagen por igual, la linterna se queda pegada en un solo punto (por ejemplo, solo en la esquina superior izquierda) y el resto de la foto queda en la oscuridad. Si la foto es de una playa vacía y la linterna solo mira la arena, el modelo podría empezar a inventar cosas porque no está viendo el mar.
  2. El "Oído Sordo" (Sesgo de Modalidad): Imagina que el modelo está contando una historia. Al principio, mira la foto con atención. Pero cuanto más tiempo pasa contando la historia, más se aburre de mirar la foto y empieza a confiar más en lo que cree que debería pasar según su libro de texto. Es como si un narrador empezara a decir: "Y entonces, el perro... espera, no hay perro, pero en las historias de playa siempre hay perros, así que pondré uno". Deja de mirar la realidad (la imagen) y empieza a seguir su imaginación (el texto).

La Solución: CAAC (El "Inspector de Realidad")

El equipo propone CAAC, que actúa como un supervisor inteligente que no necesita reentrenar al modelo (no hay que darle clases nuevas), sino que lo corrige mientras trabaja. Funciona en dos pasos mágicos:

1. Calibración de Tokens Visuales (VTC): "La Linterna Equilibrada"

Este paso arregla el "Foco Ciego".

  • La analogía: Imagina que el modelo es un pintor que solo pinta un rincón del lienzo. El supervisor (VTC) le dice: "Oye, no te quedes solo ahí. Mira toda la foto por igual".
  • Cómo lo hace: El sistema detecta si el modelo está mirando demasiado un solo pedazo de la imagen. Si es así, le da un pequeño "empujón" para que distribuya su atención de forma más pareja, asegurándose de que ninguna parte de la foto sea ignorada. Es como si le dijeras al pintor: "No te obsesiones con la esquina, mira el cielo, la arena y el mar también".

2. Reescalado Adaptativo de Atención (AAR): "El Semáforo de la Confianza"

Este paso arregla el "Oído Sordo" cuando el modelo empieza a divagar.

  • La analogía: Imagina que el modelo tiene un semáforo interno que mide su confianza.
    • Si el modelo está muy seguro de lo que dice (ej. "Esto es una playa"), el semáforo está en verde. El supervisor deja que el modelo siga hablando con naturalidad.
    • Pero si el modelo empieza a dudar (su confianza baja, el semáforo se pone en amarillo o rojo), el supervisor interviene. Le grita: "¡Espera! No estás seguro de lo que estás diciendo. ¡Vuelve a mirar la foto!".
  • Cómo lo hace: Cuando el modelo está a punto de inventar algo (porque su confianza es baja), el sistema aumenta artificialmente la atención hacia la imagen. Obliga al modelo a volver a mirar la foto antes de escribir la siguiente palabra. Es como si el supervisor le quitara el libro de texto de las manos y le dijera: "Mira la foto, mira la foto, ¡y solo escribe lo que ves!".

¿Por qué es tan bueno esto?

La mayoría de los métodos anteriores funcionaban bien para frases cortas, pero cuando tenías que escribir un texto largo (como un cuento o una descripción detallada), fallaban y el modelo volvía a alucinar.

CAAC es como un entrenador que te vigila durante todo el partido:

  • No te deja mirar solo un lado del campo (corrige el foco).
  • Si te ves cansado y empiezas a inventar jugadas, te obliga a mirar el balón de nuevo (corrige la confianza).

Los Resultados

En pruebas reales (como describir fotos de la base de datos COCO), este sistema logró:

  • Reducir drásticamente las mentiras: El modelo inventó mucho menos objetos que no estaban en la foto.
  • Funcionar en textos largos: A diferencia de otros métodos que fallaban cuando la historia se hacía larga, CAAC mantuvo al modelo "aterrizado" en la realidad durante todo el proceso.
  • No necesitar reentrenar: Es como un parche o un ajuste de software que se aplica al modelo existente sin tener que volver a entrenarlo desde cero (lo cual es muy caro y lento).

En resumen

Imagina que tienes un amigo muy creativo pero un poco soñador que te describe fotos. A veces te cuenta historias increíbles que no son ciertas. CAAC es como ponerle unas gafas de realidad aumentada que le recuerdan constantemente: "Mira lo que tienes delante, no lo que te imaginas". Gracias a esto, podemos confiar más en que lo que nos dicen estas Inteligencias Artificiales es verdad, lo cual es vital para cosas importantes como diagnósticos médicos o coches autónomos, donde inventar cosas podría ser peligroso.

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →