← Últimos artículos
⚡ electrical engineering

Mitigating Multimodal LLMs Hallucinations via Relevance Propagation at Inference Time

Este artículo propone LIME, un marco de inferencia sin entrenamiento que mitiga las alucinaciones en los modelos de lenguaje grandes multimodales mediante el uso de la Propagación de Relevancia por Capas para ajustar dinámicamente las representaciones clave-valor y exigir una mayor dependencia de las entradas perceptuales sobre los priores textuales.

Autores originales: Itai Allouche, Joseph Keshet

Publicado 2026-05-05
📖 5 min de lectura🧠 Análisis profundo

Autores originales: Itai Allouche, Joseph Keshet

Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

Imagina que tienes un asistente robótico muy inteligente y con múltiples talentos. Este robot puede ver imágenes, escuchar sonidos y leer texto todo a la vez. Se supone que debe ser un detective que observa una foto o escucha una grabación y te dice exactamente qué está sucediendo.

Sin embargo, este robot tiene un mal hábito: se miente a sí mismo.

A veces, le muestras una foto de un parque vacío y dice con confianza: "¡Veo un perro jugando a buscar la pelota!". O le haces escuchar una grabación de silencio y insiste: "¡Escucho a un gato maullando!". Esto se llama una alucinación. El robot está tan acostumbrado a leer historias y hablar de cosas que empieza a adivinar basándose en lo que usualmente sucede, en lugar de observar lo que realmente está allí.

El Problema: El Robot es "Demasiado Centrado en Texto"

Los autores de este artículo descubrieron por qué el robot hace esto. Encontraron que, cuando el robot toma una decisión, escucha demasiado a su "cerebro de texto" (su conocimiento de palabras y historias) y apenas escucha a sus "ojos" o "oídos" (la imagen o el sonido reales).

Piénsalo como un estudiante que rinde un examen. El estudiante ha estudiado mucho y conoce el libro de texto de memoria. Pero cuando el profesor muestra una foto y pregunta: "¿Qué hay en esta foto?", el estudiante ignora la foto y simplemente escribe lo primero que le viene a la mente del libro de texto. El estudiante está "alucinando" porque no está mirando la evidencia.

La Solución: LIME (Mejora de la Inferencia en Tiempo de Aprendizaje)

Los investigadores crearon una solución llamada LIME. ¿La parte genial? No tuvieron que volver a enseñarle al robot ni cambiar su cerebro (su código). En su lugar, le dieron un "empujón" justo en el momento en que está respondiendo una pregunta.

Así es como funciona LIME, usando una analogía sencilla:

La Analogía del "Foco"
Imagina que el robot está en una habitación oscura con una linterna.

  1. Sin LIME: El robot dirige su linterna principalmente sobre una pila de libros (el texto). Ignora los objetos reales en la habitación (la imagen o el sonido). Adivina qué hay en la habitación basándose en los libros.
  2. Con LIME: Los investigadores instalan un sensor inteligente que detecta hacia dónde está mirando el robot. Si el robot empieza a ignorar la imagen, LIME empuja suavemente el haz de la linterna de vuelta hacia la imagen. Obliga al robot a decir: "Espera, déjame volver a mirar la imagen antes de hablar".

Cómo lo hace técnicamente (simplificado):
El robot responde una palabra a la vez. Cada vez que está a punto de elegir la siguiente palabra, LIME interviene y pregunta:

  • "¿Cuánto te ayudó la imagen a decidir esta palabra?"
  • "¿Cuánto te ayudó el texto?"

Si la imagen no ayudó lo suficiente, LIME realiza un ajuste pequeño y temporal en la memoria interna del robot (específicamente en las partes de "Clave" y "Valor" de su cerebro) para que la imagen cuente más. Lo hace en una fracción de segundo y luego se reinicia para la siguiente palabra. Es como un entrenador susurrando: "¡Mira el balón!" justo antes de que el jugador golpee.

¿Qué Pasó Cuando Lo Probaron?

Los investigadores probaron esto en muchas tareas diferentes:

  • Visión: Le mostraron al robot imágenes y preguntaron: "¿Hay una pelota de deportes?" o "Describe esta imagen".
  • Audio: Le hicieron escuchar sonidos y preguntaron: "¿Puedes escuchar a un gato?"

Los Resultados:

  • Menos Mentiras: El robot dejó de inventar objetos que no estaban. Si no había pelota, dijo "No" en lugar de adivinar "Sí".
  • Mejor Enfoque: Cuando el robot habló de algo, realmente estaba mirando la parte correcta de la imagen o el momento correcto del sonido.
  • Sin Re-entrenamiento: No tuvieron que pasar meses volviendo a enseñarle al robot. Solo cambiaron cómo pensaba mientras respondía.

La Compensación

Hay un inconveniente. Como LIME debe pausar y realizar este ajuste extra de "foco" por cada palabra que dice el robot, tarda un poco más en dar una respuesta. Es como tener un asistente muy inteligente que es ligeramente más lento porque verifica su trabajo antes de cada frase. Pero para situaciones donde la precisión es más importante que la velocidad, esto es una gran victoria.

Resumen

El artículo muestra que los modelos de IA a menudo mienten porque dependen demasiado de su memoria de palabras y no lo suficiente de lo que realmente están viendo u oyendo. El nuevo método, LIME, actúa como un entrenador en tiempo real que obliga a la IA a prestar atención a la evidencia (la imagen o el sonido) justo antes de hablar, lo que resulta en respuestas mucho más honestas y precisas sin necesidad de reentrenar la IA desde cero.

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →