← Últimos artículos
💻 computer science

Where MLLMs Attend and What They Rely On: Explaining Autoregressive Token Generation

Este trabajo presenta EAGLE, un marco ligero y de caja negra que explica la generación de tokens en modelos multimodales grandes atribuyendo decisiones a regiones visuales específicas y cuantificando la influencia relativa de los antecedentes lingüísticos y la evidencia perceptual, logrando así una mayor fidelidad y eficiencia en la interpretabilidad.

Autores originales: Ruoyu Chen, Xiaoqing Guo, Kangwei Liu, Siyuan Liang, Shiming Liu, Qunli Zhang, Laiyuan Wang, Hua Zhang, Xiaochun Cao

Publicado 2026-03-19
📖 4 min de lectura☕ Lectura para el café

Autores originales: Ruoyu Chen, Xiaoqing Guo, Kangwei Liu, Siyuan Liang, Shiming Liu, Qunli Zhang, Laiyuan Wang, Hua Zhang, Xiaochun Cao

Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

¡Claro que sí! Imagina que los Modelos de Lenguaje Multimodales (MLLM) son como un chef increíblemente talentoso que cocina platos (respuestas) basándose en dos ingredientes principales: una foto (lo que ve) y una receta previa (lo que ya sabe o espera).

El problema es que a veces este chef alucina. Por ejemplo, si le muestras una foto de una playa vacía, él podría decir: "¡Aquí hay un tiburón!". ¿Por qué? ¿Vio realmente al tiburón en la foto, o simplemente su cerebro le dijo "en la playa suele haber tiburones"?

Hasta ahora, nadie sabía exactamente qué miraba el chef en la foto ni en qué se basaba para inventar cosas.

Aquí es donde entra EAGLE, la nueva herramienta presentada en este paper.

¿Qué es EAGLE? (El "Detective de la Atención")

Imagina que EAGLE es un detective privado que se sienta al lado del chef mientras cocina. Su trabajo es responder dos preguntas mágicas:

  1. ¿Dónde miró el chef? (Atención visual).
  2. ¿En qué se basó realmente? (¿En lo que vio en la foto o en lo que imaginó?).

¿Cómo funciona? (La analogía del "Puzzle de la Foto")

En lugar de mirar la foto entera de golpe, EAGLE hace algo muy inteligente:

  1. Corta la foto en pedazos: Imagina que toma la foto y la divide en cientos de pequeños recortes de puzzle (como si fuera un mosaico).
  2. Juega a "¿Qué pasa si...?": EAGLE empieza a quitar pedazos del puzzle uno por uno y le pregunta al chef: "¿Sigue diciendo lo mismo si borro esta parte?".
    • Si el chef sigue diciendo "Hay un gato" aunque borres la parte de la pared, significa que el gato no estaba en la pared, ¡o que el chef está alucinando!
    • Si al borrar una mancha verde el chef deja de decir "hay un árbol", entonces EAGLE sabe: "¡Ah! El chef estaba mirando esa mancha verde para decir 'árbol'".
  3. El "Puntaje de Intuición" y el "Puntaje de Necesidad":
    • Intuición (Insight): ¿Es suficiente este pedazo de foto para que el chef diga la palabra correcta? (¿Basta con ver solo la cola para saber que es un gato?).
    • Necesidad: ¿Es indispensable este pedazo? (¿Si borro la cola, el chef se olvida del gato?).

Al combinar estos dos puntajes, EAGLE crea un mapa de calor que le dice exactamente qué partes de la imagen son las verdaderas responsables de la respuesta.

La Gran Diferencia: ¿Cerebro o Ojos?

Lo más genial de EAGLE es que no solo te dice dónde miró, sino qué usó para pensar.

  • Escenario A (Confianza en los ojos): El chef ve una manzana roja, la señala y dice "Manzana". EAGLE confirma: "Correcto, se basó en la foto".
  • Escenario B (Alucinación): El chef ve una foto de una mesa vacía y dice "Hay una manzana". EAGLE investiga y descubre que el chef no miró la mesa, sino que su "receta previa" (su memoria) le dijo "las mesas suelen tener manzanas". EAGLE te dice: "Oye, el chef no vio nada, ¡se lo inventó!".

¿Por qué es importante esto?

Imagina que usas este chef para diagnosticar enfermedades o conducir un coche autónomo.

  • Si el coche dice "¡Frena! Hay un niño", pero en realidad solo vio una bolsa de plástico y su cerebro "imaginó" un niño porque es hora de ir al colegio, ¡es un desastre!
  • Con EAGLE, podemos auditar al coche: "¿Viste al niño de verdad o solo adivinaste?". Si EAGLE dice "Solo adivinaste", podemos corregir el error antes de que pase algo grave.

Resumen en una frase

EAGLE es como una lupa mágica que nos permite entrar en la mente de la IA para ver si realmente está "viendo" lo que dice ver, o si simplemente está contando historias basadas en lo que cree que debería haber.

Es más eficiente que los métodos anteriores (gasta menos energía de la computadora) y es mucho más honesto, ayudándonos a confiar más en estas máquinas inteligentes.

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →