← Últimos artículos
🤖 machine learning

IG-Lens: Exact Additive Probability Attribution Across Transformer Layers via Telescoping Integrated Gradients

Este artículo presenta IG-Lens, un método novedoso que logra la atribución de probabilidad exacta y aditiva a través de las capas de los transformers mediante la aplicación de Gradientes Integrados telescópicos a lo largo de un único camino, superando así las limitaciones de no linealidad y sesgo de las herramientas de lectura existentes basadas en logits o no aditivas, asegurando al mismo tiempo la completitud sin error de discretización.

Autores originales: Duc Anh Nguyen

Publicado 2026-06-30
📖 5 min de lectura🧠 Análisis profundo

Autores originales: Duc Anh Nguyen

Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

Imagina un modelo de lenguaje de gran tamaño (como el que impulsa este chat) como una fábrica de varios pisos donde una idea bruta entra por la parte inferior y un producto terminado (la palabra predicha) sale por la parte superior.

Durante mucho tiempo, los investigadores han intentado responder a una pregunta sencilla: "¿En qué piso exacto de esta fábrica se toma la decisión de decir 'Hanoi'?"

Las herramientas existentes han intentado responder a esto, pero han sido como contables mediocres:

  • Algunas herramientas observan cada piso y adivinan qué tan "confidente" está la fábrica, pero sus suposiciones no suman el 100%. Es como decir que el Piso 1 tiene un 40% de certeza, el Piso 2 un 60% y el Piso 3 un 80%—un total de 180%, lo cual no tiene sentido.
  • Otras herramientas observan los números brutos (logits) antes de que se conviertan en porcentajes. Pero convertir números brutos en probabilidades es como hornear un pastel; no puedes simplemente sumar la harina y los huevos por separado y esperar obtener el peso del pastel terminado. El "horneado" (el proceso matemático llamado softmax) lo cambia todo.
  • Un tercer grupo de herramientas intenta medir el trabajo realizado en cada piso, pero miden cada piso con respecto a un punto de partida diferente, por lo que sus números no se acumulan para indicar el trabajo total realizado.

Entra IG-Lens: El Contador Perfecto

El artículo presenta IG-Lens, un nuevo método que actúa como un contador perfecto para esta fábrica. Resuelve el problema utilizando un truco de "telescopio" (piensa en un telescopio colapsable que se extiende y se retrae).

Así es como funciona en términos sencillos:

1. La Regla de la "Instantánea Única"
En lugar de dejar que la palabra viaje a través de toda la fábrica y se mezcle con otras palabras en cada giro, IG-Lens toma una "instantánea" (snapshot) del estado de la palabra en pisos específicos. Luego pregunta: "Si tomáramos el estado del Piso 10 y lo pasáramos solo por la máquina de 'acabado' final (la parte que convierte los datos brutos en una probabilidad), ¿cuál sería el resultado?"

2. La Suma Telescópica
IG-Lens divide el viaje en segmentos (por ejemplo, del Piso 10 al 11, del 11 al 12, etc.).

  • Calcula la probabilidad de la palabra en el Piso 10.
  • Calcula la probabilidad en el Piso 11.
  • La diferencia entre ambas es la cantidad exacta de trabajo realizado en ese segmento específico.
  • Debido a que mide el cambio en cada paso, cuando sumas todos los cambios desde la parte inferior hasta la superior, estos igualan perfectamente el cambio total desde el principio hasta el fin. No hay matemáticas faltantes, no hay "errores de horneado" y no hay problemas de redondeo.

3. El Filtro "Consciente de la Predicción"
La mayoría de los métodos observan cuánto se "mueven" los números (gradientes) para adivinar la importancia. Pero a veces los números se mueven mucho sin que realmente cambien la decisión final.
IG-Lens es más inteligente. Solo otorga crédito a un piso por el trabajo si la probabilidad real de la palabra cambió. Si los números se mueven pero la predicción permanece igual, IG-Lens ignora ese movimiento. Es como un gerente que solo paga a los trabajadores por los días en que realmente terminaron una tarea, no solo por los días en que estuvieron ocupados moviendo cajas de un lado a otro.

Por qué esto es importante (según el artículo)

  • Es Exacto: A diferencia de otras herramientas que te dan una aproximación, IG-Lens garantiza que si sumas las contribuciones de cada capa, obtienes exactamente la probabilidad final. Es matemáticamente perfecto (dentro de los límites de la matemática computacional).
  • Encuentra el "Inicio" (Onset): Puede decirte la capa exacta donde el modelo "decidió" una palabra. Por ejemplo, podría mostrar que para la palabra "capital", la decisión fue tomada principalmente por la capa 12, pero para "Hanoi", la decisión ocurrió mucho después, alrededor de la capa 15 o 16.
  • Es Honesto sobre sus Límites: El artículo admite una compensación. Debido a que IG-Lens observa la "instantánea" de una palabra en una capa específica, no cuenta el trabajo que esa capa podría realizar más tarde mientras la palabra viaja hacia la parte superior. Mide: "¿Cuánto contribuyó esta capa a la respuesta final, dado nuestro punto de partida?" en lugar de "¿Cuál fue el efecto total de esta capa en todo el sistema?"

Conclusión

IG-Lens es una nueva forma de mirar dentro de los modelos de IA que finalmente responde a la pregunta "¿Cuándo decidió el modelo?" con un "recibo" matemáticamente perfecto que suma el 100%. No adivina; calcula el cambio exacto en la probabilidad capa por capa, filtrando el ruido para mostrarte exactamente dónde ocurrió la decisión.

Los autores planean probar esto "rompiendo" el modelo en las capas que IG-Lens identifica para ver si el modelo realmente deja de funcionar correctamente allí, lo que demostraría que el método está encontrando los verdaderos puntos de decisión.

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →