← Últimos artículos
💬 NLP

ADAPT: Attention Dynamics Alignment with Preference Tuning for Faithful MLLMs

El artículo presenta ADAPT, un marco basado en la atención que mitiga las alucinaciones en los Modelos de Lenguaje Grandes Multimodales mediante la alineación de la dinámica de atención cruzada de texto a imagen a través de anclajes visuales, mecanismos de corrección en línea y ajuste de preferencias, logrando una reducción significativa de las alucinaciones mientras preserva las capacidades generales.

Autores originales: Zhiyuan Yao, Zheren Fu, Zhixiao Zheng, Jiajun Li, Yi Tu, Zhendong Mao

Publicado 2026-07-01
📖 5 min de lectura🧠 Análisis profundo

Autores originales: Zhiyuan Yao, Zheren Fu, Zhixiao Zheng, Jiajun Li, Yi Tu, Zhendong Mao

Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

Imagina un Modelo de Lenguaje de Gran Escala Multimodal (MLLM) como un guía turístico muy inteligente y culto que acaba de recibir una fotografía. Su trabajo es describir la foto con precisión. Sin embargo, este guía tiene un mal hábito: a medida que habla, comienza a desviarse. Empieza a confiar más en lo que cree que debería haber en la foto (basándose en su conocimiento general) en lugar de en lo que realmente hay allí. Esto se llama alucinación: inventar detalles como "una bicicleta roja" cuando la foto solo muestra un coche azul.

El artículo ADAPT investiga por qué sucede esto y ofrece una solución de tres partes para mantener al guía enfocado en la foto.

El Problema: La "Mirada Errante"

Los investigadores descubrieron que los "ojos" del modelo (su atención cruzada interna) comienzan con fuerza, pero se cansan y se confunden a medida que la descripción se alarga.

  • Al principio: El modelo mira exactamente el lugar correcto (por ejemplo, el avión en la foto).
  • Más adelante: La mirada se vuelve "difusa". Puede que se quede mirando una esquina equivocada de la imagen, o que deje de mirar la imagen por completo y simplemente adivine basándose en las palabras que acaba de decir.
  • El Resultado: El modelo empieza a inventar cosas porque ya no está verificando la evidencia visual.

Piensa en ello como un estudiante haciendo un examen. Al principio, mira el libro de texto (la imagen) para responder. Pero a mitad del camino, se cansa, deja de mirar el libro y empieza a adivinar basándose en lo que recuerda de la clase (sesgos del lenguaje). Es ahí cuando empieza a equivocarse.

La Solución: ADAPT

Los autores construyeron un sistema llamado ADAPT (Alineación de la Dinámica de la Atención con Ajuste de Preferencias) para solucionar esto. Utilizan tres herramientas creativas para mantener la "mirada" del modelo constante.

1. El "Ancla Dorada" (Mejora Visual)

Antes de que el modelo comience a escribir su larga descripción, el sistema echa un vistazo rápido y temprano a la foto para encontrar los hechos más importantes e innegables.

  • La Analogía: Imagina que al guía turístico se le entrega un resaltador antes de empezar a hablar. Escanea rápidamente la foto y resalta el sujeto principal (por ejemplo, "Esto es un avión blanco").
  • La Solución: Esta área resaltada se convierte en un "Ancla Dorada". Es un punto de referencia estable que dice: "Pase lo que pase, recuerda que esto es un avión". El sistema limpia este ancla para eliminar cualquier sesgo (como que el modelo siempre mire el lado izquierdo de la imagen independientemente del contenido).

2. El "Supervisor de Foco" (Inferencia Supervisada por Atención)

Mientras el modelo habla, este supervisor observa su "mirada" en tiempo real.

  • La Analogía: Imagina a un profesor estricto de pie junto al guía. Cada vez que los ojos del guía se desvían del "Ancla Dorada" o empiezan a mirar al vacío, el profesor le da un ligero toque en el hombro.
  • La Solución: Si la atención del modelo empieza a desviarse o a volverse "desenfocada", el sistema redirige instantáneamente la atención del modelo hacia las partes relevantes de la imagen. No obliga al modelo a decir exactamente las mismas palabras, pero lo obliga a mirar la evidencia correcta antes de hablar.

3. El "Entrenamiento con Venda" (Guía de Atención Visual DPO)

Este es un paso de entrenamiento donde el modelo aprende a preferir mirar la foto en lugar de adivinar.

  • La Analogía: El modelo es entrenado en dos escenarios:
    1. Escenario A (La forma correcta): El modelo ve la foto con el "Ancla Dorada" resaltada y da una respuesta correcta.
    2. Escenario B (La forma incorrecta): El modelo ve una pantalla en blanco y con ruido (una "venda") e intenta adivinar la respuesta.
  • La Solución: El sistema le enseña al modelo: "Si estás mirando una pantalla en blanco, no deberías tener confianza. Si estás mirando la foto real, deberías tener confianza". Esto entrena al modelo para confiar en la evidencia visual en lugar de simplemente inventar cosas.

Los Resultados

Cuando los investigadores probaron este sistema en diferentes modelos de IA:

  • Menos Alucinación: Los modelos inventaron entre un 40 y un 60% menos de detalles falsos.
  • Siguen siendo Inteligentes: Los modelos no perdieron su capacidad general de hablar o comprender; simplemente se volvieron mucho mejores para ceñirse a los hechos de la imagen.
  • Eficientes: El sistema funciona rápidamente, añadiendo muy poco tiempo extra al proceso.

Resumen

En resumen, ADAPT se da cuenta de que los modelos de IA se "distraen" y empiezan a adivinar a medida que hablan. Para solucionarlo, les proporciona un punto de referencia estable (el Ancla), un supervisor en tiempo real para detectar miradas errantes y un entrenamiento especial para valorar lo que ven por encima de lo que imaginan. El resultado es una IA que dice la verdad sobre la imagen que está mirando.

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →