← Últimos artículos
💻 computer science

MLLMs Hallucinate when Information Distribution Drifts in Synergy Heads

El artículo propone HEAL, un nuevo marco que identifica y mitiga las alucinaciones en los Modelos de Lenguaje Multimodales Grandes mediante el análisis de las derivas en la distribución de información en las cabezas de sinergia y la aplicación de calibración dinámica para dirigir las salidas hacia la evidencia fáctica.

Autores originales: Meng'en Qin, Junye Chen, Jucheng Liu, Youlu Xing, Song Wang, Ruize Han

Publicado 2026-09-10
📖 6 min de lectura🧠 Análisis profundo

Autores originales: Meng'en Qin, Junye Chen, Jucheng Liu, Youlu Xing, Song Wang, Ruize Han

Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

Los modelos de lenguaje de gran tamaño multimodales son una nueva y poderosa clase de inteligencia artificial diseñada para ver y hablar al mismo tiempo. A diferencia de los sistemas tradicionales que procesan texto o imágenes de forma aislada, estos modelos pueden observar una fotografía y describirla, responder preguntas sobre ella o contar una historia basada en lo que ven. Funcionan entrelazando dos flujos de información distintos: los datos visuales de la imagen y los patrones lingüísticos aprendidos de vastas cantidades de texto. Para que estos sistemas sean verdaderamente útiles en campos de alto riesgo como la imagenología médica o la conducción autónoma, deben ser fiables. Sin embargo, frecuentemente sufren un problema conocido como alucinación. Esto ocurre cuando el modelo genera una respuesta que suena segura y plausible, pero que es fácticamente errónea respecto al mundo visual, como afirmar que una foto de un gato contiene un perro, o inventar detalles que simplemente no están presentes en la imagen.

Durante mucho tiempo, los investigadores creyeron que estos errores ocurrían porque el modelo prestaba demasiada atención a su conocimiento interno del lenguaje y no lo suficiente a la imagen real. La idea predominante era que, a medida que el modelo escribía su respuesta, se alejaba de la imagen y dependía demasiado de lo que esperaba ver basándose únicamente en las palabras. Para solucionar esto, los intentos previos se centraron en obligar al modelo a mirar más intensamente la imagen o en reentrenar todo el sistema desde cero. Estos métodos a menudo trataban al modelo como una caja negra, ajustando su comportamiento desde el exterior sin comprender la mecánica interna de por qué ocurría el error en primer lugar.

Un equipo de investigadores de la Universidad de Tecnología Avanzada de Shenzhen ha mirado ahora dentro del motor de estos modelos para encontrar una explicación diferente. Proponen que las alucinaciones no son causadas por una simple falta de atención a la imagen, ni por el hecho de que el modelo ignore la imagen por completo. En cambio, descubrieron que el error surge cuando el equilibrio interno entre la información visual y la lingüística se vuelve inestable dentro de partes específicas de la red de procesamiento del modelo. Los investigadores desarrollaron un método llamado HEAL, que significa Head-lEvel information disentAnglement and caLibration (Desentrelazamiento y Calibración de Información a Nivel de Cabezal), para identificar y corregir este desequilibrio en tiempo real.

El núcleo de su descubrimiento reside en cómo el modelo procesa la información. Dentro de estos grandes modelos, hay muchas pequeñas unidades de procesamiento llamadas cabezales de atención (attention heads). Piense en estos cabezales como un equipo de especialistas trabajando juntos para entender una oración. Algunos especialistas se centran puramente en las palabras, otros se centran puramente en la imagen, y un tercer grupo trabaja para combinar ambos elementos. Los investigadores descubrieron que el grupo responsable de mezclar los dos flujos —lo que llaman cabezales de sinergia (synergy heads)— es donde comienza el problema. Cuando el modelo funciona correctamente, estos cabezales de sinergia mantienen un equilibrio saludable, sosteniendo la información visual y lingüística en una balanza estable. Sin embargo, cuando el modelo comienza a alucinar, este equilibrio se altera. La distribución de la información dentro de estos cabezales de mezcla se desvía de ese equilibrio saludable, provocando que el modelo pierda su base en la evidencia visual.

Crucialmente, los investigadores descartaron la idea de que las alucinaciones ocurren porque hay simplemente pocos especialistas mirando la imagen o porque los especialistas en imágenes son demasiado débiles. Su análisis mostró que el número de cabezales enfocados en lo visual permanece constante, tanto si el modelo dice la verdad como si miente. El problema no es una escasez de atención visual, sino un desvío en cómo los especialistas de la mezcla manejan la combinación de información. Cuando el modelo genera una descripción correcta, los cabezales de sinergia mantienen la entrada visual y lingüística en una proporción constante. Cuando alucina, esa proporción se sesga, a menudo inclinándose demasiado hacia los patrones del lenguaje mientras la conexión visual se debilita, aun cuando la imagen sigue presente.

Para resolver esto, el equipo creó una estrategia de calibración dinámica que actúa como un regulador en tiempo real. En lugar de reentrenar el modelo o cambiar su arquitectura, HEAL interviene durante el proceso de generación. Monitorea la información que fluye a través de los cabezales de sinergia y detecta cuándo el equilibrio comienza a desviarse. Cuando se detecta un desvío, el sistema inyecta un factor de calibración que empuja suavemente la información visual y lingüística de vuelta hacia el equilibrio correcto. Este proceso es continuo y adaptativo; no obliga al modelo a ignorar el lenguaje o a enfocarse excesivamente en la imagen, sino que dirige la representación interna de vuelta a un estado donde la evidencia visual se pondera adecuadamente frente al contexto lingüístico.

Los investigadores probaron este enfoque en varios modelos de vanguardia, incluyendo versiones de LLaVA y Qwen. Los resultados fueron consistentes en diferentes sistemas y tareas. Al aplicar esta calibración dinámica, los modelos produjeron significativamente menos alucinaciones manteniendo su capacidad para hablar con fluidez y creatividad. En pruebas diseñadas para medir qué tan seguido los modelos inventan objetos que no están en la foto, el nuevo método redujo los errores de manera más efectiva que las técnicas anteriores que intentaban simplemente aumentar la atención visual. El estudio sugiere que la clave de la confiabilidad en estos sistemas no es solo hacer que miren más intensamente la imagen, sino asegurar que la mezcla interna de la vista y el habla permanezca estable.

Este trabajo ofrece una nueva perspectiva sobre cómo la inteligencia artificial entiende el mundo. Muestra que la fiabilidad no se trata solo de tener suficientes datos o hardware potente, sino de mantener un delicado equilibrio interno entre diferentes tipos de información. Al identificar el punto específico donde este equilibrio se rompe y proporcionar una forma sencilla de restaurarlo, los investigadores han abierto un camino hacia sistemas multimodales más dignos de confianza. El método es ligero y no requiere los masivos recursos computacionales necesarios para el reentrenamiento, lo que lo convierte en una herramienta práctica para mejorar la precisión de la IA que ve y habla. Los hallazgos sugieren que las mejoras futuras en la fiabilidad de la IA podrían provenir del ajuste fino de estas relaciones internas en lugar de construir modelos más grandes y complejos desde cero.

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →