← Últimos artículos
💻 computer science

Grad-CAM for Vision Transformers: A Systematic Taxonomy and Audit of Methodological Ambiguity in Explainable AI

Este artículo presenta una taxonomía sistemática y una auditoría de 175 estudios para exponer la ambigüedad metodológica generalizada y la falta de detalles de implementación rigurosos al adaptar Grad-CAM para Vision Transformers, argumentando que tratarlo como una extensión trivial de su contraparte en CNN oscurece decisiones críticas que afectan la reproducibilidad y la interpretación.

Autores originales: Casey Wall, Longwei Wang, Rodrigue Rizk, KC Santosh

Publicado 2026-08-07
📖 6 min de lectura🧠 Análisis profundo

Autores originales: Casey Wall, Longwei Wang, Rodrigue Rizk, KC Santosh

Artículo original bajo licencia CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Esta es una explicación generada por IA del artículo a continuación. No ha sido escrita ni avalada por los autores. Para mayor precisión técnica, consulte el artículo original. Leer descargo de responsabilidad completo

Imagina que estás tratando de entender cómo un detective brillante y superrápido resuelve un misterio. En los viejos tiempos, este detective usaba un conjunto específico de herramientas: una lupa que observaba diminutos parches en forma de cuadrícula de la escena del crimen, uno por uno. Esta herramienta se llamaba Grad-CAM. Era famosa por iluminar los puntos exactos en una foto que ayudaban al detective a decidir: "¡Ajá, esto es un gato!" o "¡Esto es un coche!". Como el detective miraba la foto en una cuadrícula ordenada, la herramienta podía señalar fácilmente cuadrados específicos y decir: "Vimos la oreja del gato en este cuadrado".

Pero recientemente, el detective recibió una mejora masiva. En lugar de mirar una cuadrícula, el nuevo detective (llamado Vision Transformer o ViT) observa toda la imagen a la vez, dividiéndola en una larga lista de pequeñas notas llamadas "tokens". Es como leer una historia donde cada palabra es una pista, en lugar de mirar un mapa. El problema es que la vieja lupa (Grad-CAM) fue construida para cuadrículas, no para listas. No sabe cómo señalar una "palabra" en una lista y decir: "¡Esta palabra es importante!".

Así que, los científicos empezaron a intentar forzar la vieja lupa sobre la nueva lista de notas del detective. Querían ver por qué el nuevo detective tomaba sus decisiones. Pero aquí está el truco: nadie se ponía de acuerdo sobre cómo hacerlo. Algunos señalaban la primera nota, otros la del medio, otros la lista completa, y otros simplemente adivinaban. Este artículo es como un inspector de detectives que viene a auditar todos los informes. Quiere saber: "¿Estamos usando realmente la herramienta correctamente, o solo estamos fingiendo?".


La Auditoría: Un Desastre Sistemático

Los autores de este artículo, Casey Wall y su equipo, decidieron jugar a ser detectives ellos mismos. Se lanzaron a una búsqueda masiva en la literatura científica, buscando cada artículo que intentara usar la vieja herramienta "Grad-CAM" en los nuevos detectives "Vision Transformer". Comenzaron con una enorme pila de más de 550 artículos. Tras un proceso de selección muy cuidadoso, redujeron la cifra a 175 artículos que realmente intentaron aplicar este método.

Lo que encontraron fue un poco un desastre. Descubrieron que la mayoría de estos artículos trataban la nueva lista de notas del detective como si todavía fuera la vieja cuadrícula. Estaban usando la herramienta sin explicar realmente cómo la estaban haciendo encajar.

El artículo introduce una "taxonomía", que es solo una palabra elegante para un inventario detallado o un menú de opciones. Los autores se dieron cuenta de que, cuando intentas usar Grad-CAM en un Vision Transformer, tienes que tomar varias decisiones importantes, y casi nadie las estaba dejando por escrito:

  1. Dónde mirar: ¿Miras la primera nota que escribió el detective? ¿La del medio? ¿El resumen final?
  2. Qué medir: ¿Estás midiendo cuánto importa una nota específica, o cuánto le importa al "pensamiento principal" del detective (el token [CLS]) las otras notas?
  3. Cómo mezclarlo: Si el detective tiene muchas "cabezas" diferentes (como muchas perspectivas distintas), ¿promedias todas juntas o las miras una por una?

Los autores realizaron algunas pruebas para demostrar cuánto importan estas decisiones. Tomaron un modelo estándar y pasaron la misma imagen a través de él utilizando diferentes configuraciones de su lista de verificación. ¿El resultado? Los "mapas de calor" (las imágenes brillantes que muestran lo que el modelo vio) eran completamente diferentes dependiendo de las decisiones que se tomaran. Una configuración podría resaltar al perro en la foto, mientras que otra podría resaltar el césped, y una tercera podría no mostrar casi nada.

El Gran Problema: "Plug-and-Play" Sin Instrucciones

El estudio encontró que, de los 175 artículos que examinaron, un asombroso 101 (alrededor del 58%) simplemente citaron el artículo original para el viejo detective basado en cuadrículas y no explicaron cómo lo adaptaron para el nuevo detective basado en listas. Otros 17 simplemente señalaron una biblioteca de código (un repositorio de GitHub) sin explicar la matemática. Solo 26 artículos (alrededor del 15%) se tomaron el tiempo de explicar sus elecciones específicas o citar un artículo que lo hiciera.

Los autores argumentan que este es un problema serio. Cuando un científico dice: "Usamos Grad-CAM para demostrar que nuestro modelo es justo", pero no nos ha dicho qué versión de Grad-CAM utilizó, no podemos confiar en el resultado. Es como si un chef dijera: "Horneé un pastel", pero no te dijera si usó harina o arena, o si lo horneó durante 10 minutos o durante 10 horas. El resultado puede parecer un pastel, pero no podemos estar seguros de que sea el mismo pastel del que todos los demás están hablando.

Lo que el Artículo Realmente Dice (y lo que No Dice)

El artículo es muy cuidadoso de no decir: "Aquí está la única forma correcta de hacer esto". En su lugar, sugieren que aún no existe una única respuesta "correcta". Encontraron que el campo no se ha decidido por una forma estándar de hacer esto.

Descartan explícitamente la idea de que puedes simplemente tomar la fórmula antigua y pegarla en el nuevo modelo sin pensar. Demuestran que hacer eso crea "ambigüedad metodológica", que es una forma elegante de decir "confusión sobre cómo funciona la herramienta".

Los autores sugieren que, para que el campo avance, los investigadores deben dejar de tratar el uso de Grad-CAM en estos nuevos modelos como un paso simple y automático. Deben escribir exactamente qué "característica" eligieron, qué "gradiente" midieron y cómo "reestructuraron" los datos de vuelta a una imagen.

Por Qué Esto Importa

Esto no es solo una minuciosidad académica. Estos mapas de calor se utilizan para demostrar que los modelos de IA son seguros, justos y confiables, especialmente en trabajos importantes como el diagnóstico médico o los coches autónomos. Si la explicación es vaga, no podemos estar seguros de si la IA está mirando realmente lo que debe. El artículo concluye que, hasta que los científicos no empiecen a ser súper específicos sobre sus elecciones, las imágenes brillantes que vemos en los artículos de investigación podrían tratar más de verse geniales que de decir la verdad.

En resumen, el artículo sugiere que debemos dejar de adivinar y empezar a escribir nuestras recetas. Hasta entonces, el "Grad-CAM" que vemos en estos nuevos modelos de IA es un poco un misterio, y no podemos estar seguros de lo que realmente nos está diciendo.

¿Ahogado en artículos de tu campo?

Recibe resúmenes diarios de los artículos más novedosos que coincidan con tus palabras clave de investigación — con resúmenes técnicos, en tu idioma.

Probar Digest →