← Últimos artículos
💻 computer science

Towards Explainability of SLMs by investigating Token Level Activation

Este artículo propone la Red de Flujo de Activación (AFN), un marco ligero y agnóstico al modelo que cuantifica la importancia a nivel de token en BERT mediante el análisis de las intensidades de activación de los estados ocultos de la capa 8, demostrando que los tokens semánticamente significativos exhiben magnitudes de activación significativamente mayores que los tokens estructurales y ofreciendo así una alternativa interpretable a los métodos centrados en la atención.

Autores originales: Sayantani Ghosh, Rajashik Datta, Amit Kumar Das, Amlan Chakrabarti

Publicado 2026-05-22
📖 5 min de lectura🧠 Análisis profundo

Autores originales: Sayantani Ghosh, Rajashik Datta, Amit Kumar Das, Amlan Chakrabarti

Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

Imagina que tienes un bibliotecario robot muy inteligente, pero secreto, llamado BERT. Este bibliotecario ha leído casi todo lo que alguna vez se ha escrito y puede responder preguntas o entender sentimientos en las oraciones. Pero hay un truco: nadie sabe cómo piensa realmente. Es como una "caja negra": introduces una oración y sale una respuesta, pero los engranajes internos están ocultos.

Durante mucho tiempo, los investigadores intentaron echar un vistazo al interior observando la "atención" del bibliotecario. Pensaron: "¡Si el bibliotecario está mirando una palabra, esa palabra debe ser importante!". Pero descubrieron un truco: el bibliotecario a menudo mira fijamente cosas aburridas como comas, puntos o palabras como "el" y "es", mientras ignora las palabras realmente jugosas como "hermoso", "desastre" o "Canadá". Era como ver una cámara de seguridad que solo hace zoom en el pomo de la puerta e ignora a la persona que atraviesa la puerta.

La Nueva Idea: Medir la "Energía" en lugar de la "Mirada"

Los autores de este artículo decidieron probar un enfoque diferente. En lugar de preguntar: "¿Dónde está mirando el bibliotecario?", preguntaron: "¿Cuánta energía está usando el bibliotecario para pensar en cada palabra?".

Se centraron en una habitación específica del cerebro del bibliotecario llamada Capa 8. Imagina el cerebro del bibliotecario como un edificio de 12 pisos:

  • Pisos 1–5: La planta baja. Aquí, el bibliotecario solo nota cosas básicas como letras mayúsculas o si una palabra es un sustantivo o un verbo.
  • Pisos 10–12: El ático. Aquí es donde se decide la respuesta final.
  • Piso 8 (El Punto Dulce): Esta es la "zona de consolidación". Es donde el bibliotecario deja de mirar la gramática y empieza a entender realmente el significado de la historia.

Los investigadores construyeron una herramienta llamada Red de Flujo de Activación (AFN). En lugar de observar los ojos del bibliotecario, midieron la "electricidad" (matemáticamente llamada Norma L2) que fluía a través de cada palabra a medida que pasaba por el Piso 8.

Lo que Descubrieron: Las Palabras de "Alto Voltaje"

Cuando midieron esta energía, encontraron un patrón claro:

  • Las Palabras de "Alto Voltaje": Palabras ricas en contenido como "primer", "ministro", "Canadá", "hermoso" o "disfrutando" se iluminaron como letreros de neón brillantes. Tenían la energía más alta.
  • Las Palabras de "Bajo Voltaje": Palabras estructurales como "el", "de" o signos de puntuación como "?" eran más tenues. Estaban allí, pero no llevaban el peso principal del significado.

La Analogía: Imagina un equipo de mudanzas empacando una casa. Las palabras de "Alto Voltaje" son los sofás pesados y los pianos; requieren el mayor esfuerzo para moverlos. Las palabras de "Bajo Voltaje" son las cajas vacías o la cinta adhesiva; son necesarias para el trabajo, pero no ocupan mucho espacio ni energía. Los investigadores descubrieron que el Piso 8 es donde ocurre el trabajo pesado.

El Experimento del "Efecto Ondulatorio"

Para probar esto, los investigadores jugaron a un juego de "encuentra las diferencias". Le dieron al bibliotecario dos oraciones muy similares:

  1. "¡Disfrutando de un hermoso día en el parque!"
  2. "¡Disfrutando de un hermoso paseo en la playa!"

Observaron cómo cambiaba la "energía" cuando cambiaban "día" por "paseo" y "parque" por "playa".

  • Lo Obvio: Las palabras que cambiaron ("día" y "parque") tuvieron un salto masivo en energía.
  • La Sorpresa: ¡Incluso las palabras que no cambiaron (como "hermoso" o "en") tuvieron un cambio significativo de energía!

La Analogía: Es como tirar una piedra en un estanque. Cuando cambias una palabra (la piedra), las ondas (cambios de energía) se extienden y cambian el agua a su alrededor, incluso las partes que no fueron golpeadas directamente. Esto mostró que el Piso 8 está profundamente conectado; cambiar una parte de la historia obliga a toda la oración a reevaluar su significado.

La Prueba del "Cubo"

Finalmente, intentaron separar las palabras "importantes" de las palabras "de fondo" usando una regla simple. Dibujaron una línea (un umbral) y pusieron todas las palabras con alta energía en un CUBO ALTO y el resto en un CUBO BAJO.

Descubrieron que:

  • El CUBO ALTO solo tenía alrededor del 25% de las palabras (las importantes).
  • Pero, estas pocas palabras eran responsables del 76% de los cambios totales de significado.

La Analogía: Es como un concierto donde el 25% de los músicos (los solistas) están tocando la melodía que todos recuerdan, mientras que el otro 75% está tocando el ritmo de fondo. Si silencias a los solistas, la canción pierde su alma. Si silencias el fondo, aún puedes escuchar la canción, aunque se sienta un poco vacía.

La Gran Conclusión

Este artículo no solo dice "BERT es inteligente". Nos ofrece una nueva forma de ver cómo piensa. Al medir la "energía" de las palabras en la mitad del proceso (Capa 8), convirtieron la "caja negra" en una "caja de cristal".

Demostraron que BERT no solo está mirando la puntuación; en realidad está enfocando su energía mental en las palabras que llevan el significado real. Esto nos ayuda a entender que, cuando el modelo procesa una oración, realiza un gran trabajo pesado en las palabras de "contenido" para dar sentido al mundo, mientras que las palabras de "estructura" solo mantienen unido el marco.

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →