← Derniers articles
💻 computer science

Grad-CAM for Vision Transformers: A Systematic Taxonomy and Audit of Methodological Ambiguity in Explainable AI

Cet article présente une taxonomie systématique et un audit de 175 études pour exposer l'ambiguïté méthodologique généralisée et le manque de détails de mise en œuvre rigoureux lors de l'adaptation de Grad-CAM pour les Vision Transformers, soutenant que le traiter comme une extension triviale de son homologue CNN occulte des choix critiques affectant la reproductibilité et l'interprétation.

Auteurs originaux : Casey Wall, Longwei Wang, Rodrigue Rizk, KC Santosh

Publié 2026-08-07
📖 6 min de lecture🧠 Analyse approfondie

Auteurs originaux : Casey Wall, Longwei Wang, Rodrigue Rizk, KC Santosh

Article original sous licence CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Ceci est une explication générée par l'IA de l'article ci-dessous. Elle n'a pas été rédigée ni approuvée par les auteurs. Pour une précision technique, consultez l'article original. Lire la clause de non-responsabilité complète

Imaginez que vous essayez de comprendre comment un détective brillant et super rapide résout un mystère. Dans l'ancien temps, ce détective utilisait un outil spécifique : une loupe qui examinait de minuscules zones en forme de grille sur la scène du crime, une par une. Cet outil s'appelait Grad-CAM. Il était célèbre pour illuminer les endroits exacts sur une photo qui permettaient au détective de décider : « Aha ! C'est un chat ! » ou « C'est une voiture ! ». Comme le détective regardait la photo selon une grille ordonnée, l'outil pouvait facilement pointer des carrés spécifiques et dire : « Nous avons vu l'oreille du chat dans ce carré ».

Mais récemment, le détective a reçu une mise à jour massive. Au lieu de regarder une grille, le nouveau détective (appelé Vision Transformer ou ViT) regarde l'image entière d'un coup, en la décomposant en une longue liste de petites notes appelées « tokens ». C'est comme lire une histoire où chaque mot est un indice, plutôt que de regarder une carte. Le problème est que l'ancienne loupe (Grad-CAM) a été conçue pour des grilles, pas pour des listes. Elle ne sait pas comment pointer un « mot » dans une liste et dire : « Ce mot est important ! ». Ainsi, des scientifiques ont commencé à essayer de forcer l'ancienne loupe sur la nouvelle liste de notes du détective. Ils voulaient voir pourquoi le nouveau détective faisait ses choix. Mais attention : personne n'était d'accord sur la manière de le faire. Certains pointaient le premier mot, d'autres le milieu, d'autres la liste entière, et d'autres devinaient simplement. Ce document est comme un inspecteur de détectives venant effectuer un audit de tous les rapports. Ils veulent savoir : « Sommes-nous réellement en train d'utiliser l'outil correctement, ou sommes-nous juste en train de faire semblant ? »


L'Audit : Un désordre systématique

Les auteurs de ce document, Casey Wall et son équipe, ont décidé de jouer aux détectives eux-mêmes. Ils se sont lancés dans une traque massive dans la littérature scientifique, cherchant chaque article qui tentait d'utiliser l'ancien outil « Grad-CAM » sur les nouveaux détectives « Vision Transformer ». Ils ont commencé avec une énorme pile de plus de 550 articles. Après un processus de sélection très minutieux, ils ont réduit le nombre à 175 articles qui tentaient réellement d'appliquer cette méthode.

Ce qu'ils ont découvert est un peu un désordre. Ils ont découvert que la plupart de ces articles traitaient la liste de notes du nouveau détective comme s'il s'agissait encore de l'ancienne grille. Ils utilisaient l'outil sans vraiment expliquer comment ils le faisaient correspondre.

Le document introduit une « taxonomie », ce qui est juste un mot savant pour un pense-bête détaillé ou un menu de choix. Les auteurs ont réalisé que lorsque vous essayez d'utiliser Grad-CAM sur un Vision Transformer, vous devez prendre plusieurs décisions importantes, et presque personne ne les consignait par écrit :

  1. Où regarder : Regardez-vous la toute première note écrite par le détective ? La du milieu ? Le résumé final ?
  2. Quoi mesurer : Mesurez-vous à quel point une note spécifique est importante, ou à quel point la « pensée principale » du détective (le jeton [CLS]) se soucie des autres notes ?
  3. Comment mélanger : Si le détective possède de nombreuses « têtes » différentes (comme autant de perspectives différentes), est-ce que vous les faites toutes la moyenne, ou regardez-vous chacune d'elles une par une ?

Les auteurs ont mené des tests pour montrer à quel point ces choix sont importants. Ils ont pris un modèle standard et ont passé la même image à travers lui en utilisant différents réglages de leur liste de contrôle. Le résultat ? Les « cartes de chaleur » (les images lumineuses montrant ce que le modèle a vu) étaient complètement différentes selon les choix effectués. Un réglage pourrait mettre en évidence le chien dans la photo, tandis qu'un autre mettrait en évidence l'herbe, et un troisième pourrait ne presque rien montrer du tout.

Le Gros Problème : Le « Plug-and-Play » sans instructions

L'étude a révélé que sur les 175 articles examinés, un nombre impressionnant de 101 articles (environ 58 %) citait simplement l'article original pour l'ancien détective basé sur la grille, sans expliquer comment ils l'adaptaient pour le nouveau détective basé sur la liste. Un autre groupe de 17 articles pointait simplement vers une bibliothèque de code (un dépôt GitHub) sans expliquer les mathématiques. Seuls 26 articles (environ 15 %) ont réellement pris le temps d'expliquer leurs choix spécifiques ou de citer un article qui le faisait.

Les auteurs soutiennent que c'est un problème sérieux. Lorsqu'un scientifique dit : « Nous avons utilisé Grad-CAM pour montrer que notre modèle est équitable », mais qu'il ne vous a pas dit quelle version de Grad-CAM il a utilisée, vous ne pouvez pas faire confiance au résultat. C'est comme si un chef disait : « J'ai cuit un gâteau », mais ne vous disait pas s'il a utilisé de la farine ou du sable, ou s'il l'a cuit pendant 10 minutes ou 10 heures. Le résultat peut ressembler à un gâteau, mais vous ne pouvez pas être sûr qu'il s'agit du même gâteau dont tout le monde parle.

Ce que le document dit (et ne dit pas)

Le document est très prudent à ne pas dire : « Voici l'unique bonne façon de faire cela ». Au lieu de cela, ils suggèrent qu'il n'existe pas encore de réponse unique « correcte ». Ils ont constaté que le domaine ne s'est pas encore stabilisé sur une méthode standard.

Ils excluent explicitement l'idée que l'on puisse simplement prendre l'ancienne formule et l'appliquer bêtement sur le nouveau modèle sans réfléchir. Ils montrent que faire cela crée une « ambiguïté méthodologique », ce qui est une façon savante de dire « confusion sur le fonctionnement de l'outil ».

Les auteurs suggèrent que pour que le domaine progresse, les chercheurs doivent cesser de traiter l'utilisation de Grad-CAM sur ces nouveaux modèles comme une étape simple et automatique. Ils doivent écrire précisément quelle « caractéristique » ils ont choisie, quel « gradient » ils ont mesuré, et comment ils ont « remodelé » les données pour recréer une image.

Pourquoi cela importe

Il ne s'agit pas seulement de chipotage académique. Ces cartes de chaleur sont utilisées pour prouver que les modèles d'IA sont sûrs, équitables et dignes de confiance, particulièrement dans des métiers importants comme le diagnostic médical ou les voitures autonomes. Si l'explication est vague, nous ne pouvons pas être certains que l'IA regarde réellement la bonne chose. Le document conclut que tant que les scientifiques ne commenceront pas à être extrêmement précis dans leurs choix, les images lumineuses que nous voyons dans les articles de recherche pourraient davantage servir à paraître impressionnantes qu'à dire la vérité.

En bref, le document suggère que nous devons cesser de deviner et commencer à écrire nos recettes. D'ici là, le « Grad-CAM » que nous voyons sur ces nouveaux modèles d'IA est un peu un mystère, et nous ne pouvons pas être sûrs de ce qu'il nous dit réellement.

Noyé(e) sous les articles dans votre domaine ?

Recevez des digests quotidiens des articles les plus récents correspondant à vos mots-clés de recherche — avec des résumés techniques, dans votre langue.

Essayer Digest →