← Derniers articles
🤖 machine learning

Inpainting Insights: Elevating Visual XAI with Photorealistic Perturbations

Cet article propose d'améliorer la méthode d'explicabilité LIME en remplaçant les perturbations traditionnelles basées sur les pixels par de l'inpainting génératif afin de produire des échantillons photoréalistes et conformes à la distribution qui améliorent significativement la qualité et la fiabilité des explications visuelles pour les modèles d'apprentissage automatique.

Auteurs originaux : Josef Lindl, Mariana Chaves, Damien Garreau

Publié 2026-07-20
📖 7 min de lecture🧠 Analyse approfondie

Auteurs originaux : Josef Lindl, Mariana Chaves, Damien Garreau

Article original sous licence CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Ceci est une explication générée par l'IA de l'article ci-dessous. Elle n'a pas été rédigée ni approuvée par les auteurs. Pour une précision technique, consultez l'article original. Lire la clause de non-responsabilité complète

Imaginez que vous essayez de comprendre comment un robot super intelligent voit le monde. Vous lui demandez : « Qu'est-ce qui fait que cette image ressemble à un chien ? » et il répond : « Les oreilles ! » Mais comment savoir s'il ne devine pas simplement à cause d'une ombre étrange ou d'une couleur spécifique ? C'est le monde de l'IA explicable (XAI). C'est le domaine dédié à l'exploration de la « boîte noire » de l'intelligence artificielle pour voir ce qui s'y passe réellement. Une des méthodes populaires pour faire cela est la perturbation. Voyez cela comme un jeu de « Et si ? » avec une photo. Vous cachez certaines parties de l'image — peut-être les oreilles ou la queue du chien — et vous demandez au robot : « Est-ce qu'il pense toujours que c'est un chien ? » Si le robot cesse soudainement de reconnaître le chien quand vous cachez les oreilles, vous savez que les oreilles sont importantes.

Cependant, il y a un piège. Si vous cachez les oreilles avec un gros carré gris et laid, vous ne testez pas vraiment la compréhension du robot sur ce qu'est un chien ; vous testez sa réaction à un énorme bloc gris. Le robot pourrait être confus par ce carré étrange et non naturel, et vous donner une réponse erronée sur ce qui est important. Cet article s'attaque à ce problème. Il suggère qu'au lieu d'utiliser de ennuyeux et faux carrés gris pour cacher des parties d'une image, nous devrions utiliser une « gomme magique » qui remplit les espaces manquants avec des détails photoréalistes qui semblent appartenir à l'endroit. De cette façon, le robot n'est confus que par l'objet manquant, et non par un artefact bizarre, ce qui nous donne une réponse bien plus claire sur ce qu'il regarde réellement.


Le Problème : Carrés Laids et Robots Confus

Dans le monde de la vision par ordinateur, les modèles d'IA deviennent incroyablement doués pour repérer des choses, mais ils deviennent aussi de plus en plus difficiles à comprendre. Pour y remédier, les chercheurs utilisent des outils comme LIME (Local Interpretable Model-agnostic Explanations). LIME fonctionne en prenant une image, en la découpant en petits morceaux de puzzle appelés « superpixels », puis en cachant certains de ces morceaux pour voir comment la prédiction de l'IA change.

La méthode traditionnelle pour cacher une pièce consiste à la peindre avec une couleur unie, comme du gris ou du noir. Les auteurs de cet article soutiennent que c'est un peu comme essayer de tester la capacité d'un chef à reconnaître un gâteau en remplaçant le glaçage par un bloc de béton. Le béton ne fait pas partie du gâteau et ne ressemble à rien de naturel. Lorsque l'IA voit ce « béton », elle peut paniquer et faire une prédiction qui n'a rien à voir avec le gâteau, menant à une explication déroutante.

L'article montre que ces « carrés laids » (occlusion déterministe) échouent souvent. Par exemple, lors d'un test avec l'image d'un pansement, les méthodes standards utilisant des carrés gris ou d'autres remplacements de couleurs simples ont complètement manqué le pansement comme étant la partie la plus importante de l'image. Elles étaient trop distraites par les blocs gris non naturels qu'elles créaient.

La Solution : L'Astuce de l'« Inpainting Magique »

Pour résoudre cela, les auteurs introduisent une nouvelle méthode appelée LILI (Leveraging Inpainting for Local Interpretability). Au lieu de peindre les pièces de puzzle cachées avec de la peinture grise, LILI utilise un modèle d'IA générative appelé LaMa pour effectuer un « inpainting » de l'image.

Voyez l'inpainting comme un artiste très talentueux capable de regarder un trou dans une photo et de peindre exactement ce qui devrait s'y trouver en se basant sur l'environnement. Si vous cachez un pansement, LaMa ne met pas un carré gris ; il peint une zone de peau qui ressemble exactement à la peau autour du pansement. Cela crée une « perturbation photoréaliste ». Le modèle d'IA voit une image qui semble naturelle, à l'exception du fait que le pansement a disparu. Cela force l'IA à se reposer sur sa connaissance réelle de ce qu'est un pansement, plutôt que de réagir à un carré gris bizarre.

Mais il y avait un second problème. Même avec l'artiste magique, les bords de la zone cachée laissaient parfois des indices minuscules et invisibles (des artefacts) que l'IA pouvait encore voir. Pour corriger cela, les auteurs ont ajouté une étape d'« expansion de masque ». Imaginez que, au lieu de simplement cacher le pansement, vous cachiez aussi un tout petit peu de la peau autour de celui-ci. Cela garantit que l'artiste magique doit remplir toute la zone avec une nouvelle peau de fond, effaçant ainsi toute trace de l'objet original.

Ce Qu'Ils Ont Trouvé : Le Réalisme Gagne

L'équipe a testé LILI par rapport à l'ancienne méthode (LIME avec des carrés gris) et à une tentative antérieure qui utilisait un autre modèle d'inpainting appelé DeepFill (LIME-G). Ils ont effectué des centaines de tests sur des images du jeu de données ImageNet, en utilisant un modèle d'IA standard appelé InceptionV3 pour la reconnaissance.

1. Les images sont meilleures
Les auteurs ont mesuré à quel point les fausses images paraissaient « réelles » en utilisant un score appelé Fréchet Inception Distance (FID). Un score plus bas signifie que les fausses images sont plus similaires aux vraies photos.

  • L'ancienne méthode LIME (carrés gris) a obtenu un score de 30,532.
  • La précédente méthode d'inpainting (LIME-G avec DeepFill) a obtenu un score de 56,524 (ce qui était étonnamment pire, probablement parce que le modèle n'était pas aussi bon).
  • La nouvelle méthode LILI a obtenu un score de 6,727.
    Cette chute massive du score prouve que LILI crée des images beaucoup plus proches de la distribution réelle des données. Elles ont l'air naturelles, et non comme une photo sur laquelle on aurait plaqué un bloc gris.

2. Les explications sont plus précises
Pour voir si les explications étaient réellement meilleures, ils ont utilisé une « métrique de saillance ». Cela mesure la capacité de l'explication à mettre en évidence les parties les plus importantes de l'image. Des scores plus bas sont meilleurs ici.

  • LILI avec une expansion de masque de 3 pixels a obtenu les meilleurs scores, battant à la fois l'ancienne méthode LIME et la méthode LIME-G.
  • Par exemple, dans l'exemple du pansement, seul LILI a correctement identifié le pansement comme la caractéristique la plus importante. Les autres méthodes ont été distraites par l'arrière-plan ou les artefacts.

3. Stabilité et Vitesse
Les chercheurs ont également vérifié si les explications étaient cohérentes. Si vous lancez le test dix fois, obtenez-vous la même réponse ?

  • L'ancien LIME était le plus stable (score d'accord de 0,889), suivi de près par LILI (0,852).
  • LIME-G était moins stable (0,723).
  • Les auteurs notent que LILI est légèrement moins stable que l'ancienne méthode des carrés gris car l'« artiste magique » (LaMa) peut parfois peindre des arrière-plans légèrement différents selon le masque exact. Cependant, c'est un petit prix à payer pour obtenir la bonne réponse.
  • En ce qui concerne la vitesse, LILI prend un peu plus de temps. L'ancien LIME prenait environ 4,4 secondes par image, tandis que LILI en prenait environ 12,5 secondes. C'est parce que l'« artiste magique » doit faire un travail supplémentaire pour peindre les parties manquantes, mais c'est toujours beaucoup plus rapide que d'autres méthodes de haute technologie qui utilisent des modèles de diffusion.

La Conclusion

L'article conclut qu'en remplaçant les carrés gris faux et laids par un remplissage de fond réaliste généré par l'IA, nous pouvons obtenir de bien meilleures explications de la façon dont l'IA voit le monde. La méthode LILI suggère que les perturbations photoréalistes s'alignent mieux sur la façon dont l'IA a été entraînée, menant à des résultats plus dignes de confiance. Bien qu'elle nécessite un peu plus de puissance de calcul et un réglage minutieux de l'« expansion de masque » pour éviter de laisser des indices, l'échange en vaut la peine. Les auteurs suggèrent que cette approche nous aide à faire davantage confiance à l'IA, surtout dans les situations où nous avons besoin de savoir exactement pourquoi un ordinateur a pris une décision, sans la confusion causée par des artefacts non naturels.

Noyé(e) sous les articles dans votre domaine ?

Recevez des digests quotidiens des articles les plus récents correspondant à vos mots-clés de recherche — avec des résumés techniques, dans votre langue.

Essayer Digest →