← Últimos artículos
💻 computer science

Look Clearly Before Answering: Mitigating Hallucinations in LVLMs via Saliency-Driven Perceptual Realignment

Este artículo propone el Realineamiento Perceptual Impulsado por Saliencia (SDPR, por sus siglas en inglés), un marco de trabajo libre de entrenamiento que mitiga las alucinaciones en los Grandes Modelos de Visión y Lenguaje mediante la redistribución de la atención de los tokens no semánticos, la alineación de las características de la caché KV para prevenir la distorsión espacial y la aplicación de decodificación contrastiva para contrarrestar los sesgos del lenguaje, logrando así un rendimiento superior sin entrenamiento adicional ni una sobrecarga significativa en el tiempo de ejecución.

Autores originales: Pengxu Chen, Yao Zhu, Guangming Zhu, Jun Sheng, Jincai Huang, Xiangyang Ji, Liang Zhang

Publicado 2026-08-20
📖 6 min de lectura🧠 Análisis profundo

Autores originales: Pengxu Chen, Yao Zhu, Guangming Zhu, Jun Sheng, Jincai Huang, Xiangyang Ji, Liang Zhang

Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

En el mundo de la inteligencia artificial, que evoluciona rápidamente, ha surgido una nueva generación de sistemas que pueden ver y hablar al mismo tiempo. Estos grandes modelos de visión y lenguaje actúan como observadores digitales, capaces de mirar una fotografía y describir lo que está sucediendo en ella, o responder preguntas sobre la escena. Han aprendido a conectar el mundo visual con el lenguaje humano, creando un puente entre los píxeles y las palabras. Sin embargo, a pesar de su impresionante capacidad para generar frases fluidas y a menudo sensatas, estos sistemas sufren de un fallo persistente y frustrante: mienten con frecuencia. Pueden describir con confianza a una persona sosteniendo un globo rojo cuando la imagen muestra una cometa azul, o inventar detalles que simplemente no existen. Esta tendencia a generar información falsa, conocida como alucinación, surge de una profunda dependencia de lo que el modelo ha leído antes en lugar de lo que realmente está viendo en este momento. Cuando la evidencia visual es poco clara o compleja, el sistema suele recurcia al azar basándose en su biblioteca interna de patrones lingüísticos, produciendo respuestas que suenan correctas pero que son fácticamente erróneas. Esta falta de fiabilidad impide que estas poderosas herramientas puedan ser confiables en situaciones del mundo real donde la precisión es esencial.

Investigadores de la Universidad de Xidian y la Universidad de Tsinghua han identificado las causas fundamentales de esta confusión visual y han desarrollado un método para ayudar a estos modelos a "ver claramente" antes de responder. Su trabajo revela que el problema no es solo una falta de conocimiento, sino un fallo en cómo el modelo procesa y recuerda lo que ve durante la fracción de segundo en que está pensando. El equipo descubrió que, a medida que el modelo analiza una imagen, su atención suele ser secuestrada por detalles irrelevantes del fondo, lo que hace que ignore las partes más críticas de la imagen. Además, a medida que el modelo comienza a generar su respuesta palabra por palabra, su memoria de la escena visual se degrada, volviéndose distorsionada y menos conectada con la pregunta específica que se le ha formulado. Para solucionar esto, los investigadores introdujeron un marco de trabajo libre de reentrenamiento llamado Realineación Perceptual Impulsada por la Saliencia (Saliency-Driven Perceptual Realignment). Este enfoque no requiere reentrenar el enorme modelo de IA desde cero; en su lugar, actúa como una guía durante el proceso de pensamiento, corrigiendo suavemente el enfoque y la memoria del modelo para asegurar que permanezca anclado en la realidad visual de la imagen.

El primer paso en este proceso de corrección aborda el momento en que el modelo mira la imagen por primera vez. Los investigadores descubrieron que el mecanismo de atención interna del modelo a menudo se queda estancado en "tokens de sumidero" (sink tokens), que son esencialmente elementos de fondo sin sentido que accidentalmente captan demasiado enfoque. Imagine a una persona intentando escuchar una conversación en una habitación ruidosa; si su atención es secuestrada por un ruido fuerte e irrelevante, pierde las palabras importantes que se están pronunciando. Del mismo modo, el modelo permitía que estas distracciones de fondo ahogaran las señales visuales salientes, como el rostro de una persona o un objeto específico. El nuevo método detecta cuándo ocurre este secuestro y redistribuye la atención del modelo, alejando el enfoque del ruido y devolviéndolo hacia las partes significativas de la imagen. Al hacer esto, el modelo recupera la evidencia visual suprimida que anteriormente estaba ignorando, permitiéndole ver la escena con mayor precisión incluso antes de empezar a hablar.

Una vez que el modelo tiene una visión más clara, surge el segundo desafío a medida que comienza a generar su respuesta. El modelo almacena una memoria de la imagen para consultarla mientras escribe cada nueva palabra. Sin embargo, los investigadores observaron que esta memoria se distorsiona con el tiempo. Debido a que el modelo procesa la imagen y la pregunta en un orden específico, la memoria de los detalles visuales queda ligada a su posición en la secuencia en lugar de a su importancia real para la pregunta. Es como si el modelo olvidara que un objeto específico es importante porque fue visto temprano en la secuencia, mientras que más tarde, detalles menos importantes se vuelven excesivamente prominentes en su memoria. Para contrarrestar esto, el nuevo marco realinea esta memoria interna. Inyecta una señal que resalta qué partes de la imagen son realmente relevantes para la pregunta actual, asegurando que la memoria del modelo permanezca enfocada en la evidencia visual correcta durante todo el proceso de generación, en lugar de derivar hacia detalles irrelevantes.

Finalmente, incluso con una visión clara y una buena memoria, el modelo todavía enfrenta la tentación de confiar en sus hábitos lingüísticos preexistentes. A veces, el modelo sabe que la respuesta es "sí" basándose en la imagen, pero sus patrones de lenguaje internos sugieren fuertemente "no" porque esa es una frase común en sus datos de entrenamiento. Para prevenir esto, los investigadores añadieron un control final que compara la predicción basada en la visión del modelo contra una referencia construida a partir de sus propios hábitos de lenguaje. Si ambos no coinciden, el sistema suprime activamente la conjetura basada en el lenguaje y obliga al modelo a mantenerse fiel a la evidencia visual. Este proceso contrastivo asegura que la respuesta final sea impulsada por lo que realmente hay en la imagen, no por lo que el modelo espera ver.

Los resultados de aplicar esta estrategia de tres partes son significativos. Al ser probada en varios modelos de visión y lenguaje de gran tamaño, el método redujo consistentemente el número de alucinaciones y mejoró la precisión de las respuestas. En pruebas específicas que miden la frecuencia con la que los modelos identifican objetos correctamente, el nuevo enfoque mostró mejoras de hasta casi siete puntos, y en pruebas que miden la frecuencia de los detalles alucinados, redujo los errores en más de un tercio. Crucialmente, todo esto se logró sin la necesidad de un reentrenamiento costoso o datos adicionales, simplemente ajustando cómo el modelo presta atención y recuerda la información mientras trabaja. Al abordar sistemáticamente la degradación de la conciencia visual desde la mirada inicial hasta la frase final, esta investigación ofrece una forma robusta de hacer que estos poderosos sistemas de IA sean más fiables, asegurando que digan la verdad sobre lo que ven.

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →