← Derniers articles
💻 computer science

Capability \neq Interpretability: Human Interpretability of Vision Foundation Models

Cet article présente un cadre fondé sur la psychophysique démontrant que les modèles de fondation visuels sont systématiquement moins interprétables par l'humain que leurs équivalents supervisés, révélant ainsi que l'interprétabilité constitue une dimension indépendante pilotée par la localité des caractéristiques et l'alignement sémantique à grain large plutôt que par la capacité globale du modèle.

Auteurs originaux : Julien Colin, Lore Goetschalckx, Nuria Oliver, Thomas Serre

Publié 2026-05-21
📖 7 min de lecture🧠 Analyse approfondie

Auteurs originaux : Julien Colin, Lore Goetschalckx, Nuria Oliver, Thomas Serre

Article original sous licence CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Ceci est une explication générée par l'IA de l'article ci-dessous. Elle n'a pas été rédigée ni approuvée par les auteurs. Pour une précision technique, consultez l'article original. Lire la clause de non-responsabilité complète

La Grande Question : Peut-on Comprendre le « Cerveau » de l'IA ?

Imaginez que vous avez un robot surdoué capable d'identifier un chat, une voiture ou un feu de circulation avec une précision incroyable. Il est si bon dans son travail qu'il est utilisé pour conduire des voitures et aider les médecins à diagnostiquer des maladies. Mais voici le problème : Comment voit-il réellement le monde ?

Si vous demandez au robot : « Quelle partie de cette image t'a fait penser que c'était un chat ? », il n'a pas de voix. Il ne possède que des signaux internes (des caractéristiques) qui s'allument. La grande question que ce document pose est la suivante : Un humain ordinaire peut-il regarder ces signaux et comprendre ce qu'ils signifient ?

Les auteurs appellent cela l'Interprétabilité. Il ne s'agit pas de savoir à quel point le robot est intelligent (sa capacité), mais de savoir à quel point sa pensée est claire pour nous.

L'Ancienne Méthode vs La Nouvelle Méthode

L'Ancienne Méthode (Le Piège du « QCM ») :
Les tests précédents tentaient de voir si les humains comprenaient les caractéristiques de l'IA en leur montrant des images et en demandant : « Laquelle de ces deux images correspond au signal de l'IA ? »

  • Le Défaut : Les auteurs ont découvert une faille dans cette méthode. Les humains pouvaient souvent trouver la bonne réponse simplement en sachant ce que la caractéristique n'était pas.
    • Analogie : Imaginez que je vous montre une photo d'un champ de maïs et une photo d'une plage, et que je dis : « Ce signal de l'IA NE concerne PAS le maïs. » Vous pouvez facilement choisir la plage, même si vous n'avez aucune idée de ce que le signal est réellement. Vous éliminez simplement la mauvaise réponse, sans vraiment comprendre le signal. Cela rendait le test injuste et peu fiable.

La Nouvelle Méthode (Le Cadre du « Détective ») :
Les auteurs ont créé un nouveau test plus équitable, composé de deux parties, comme un détective essayant de résoudre une énigme :

  1. Localisabilité (Le Jeu du « Où ») :

    • Le Déroulement : On vous montre un « signal mystère » ainsi que quelques exemples de ce qui le déclenche (par exemple, une photo d'un pneu, une carte thermique montrant où le signal est lumineux).
    • La Tâche : On vous montre une nouvelle image et on vous demande de cliquer exactement là où vous pensez que ce signal s'allumerait.
    • L'Objectif : Pouvez-vous pointer la partie spécifique de l'image (comme le pneu) qui correspond au signal ?
  2. Nomabilité (Le Jeu du « Quoi ») :

    • Le Déroulement : Les mêmes indices visuels que ci-dessus.
    • La Tâche : Vous devez écrire une courte description de ce que le signal représente.
    • L'Objectif : Pouvez-vous le décrire avec des mots ? (par exemple : « C'est une roue de voiture » ou « C'est un feu de circulation rouge »).

Pour s'assurer qu'ils testaient de pures « caractéristiques » et non pas des neurones désordonnés et mélangés, ils ont utilisé un outil spécial (un Autoencodeur Sparse) pour isoler des concepts uniques et clairs, comme séparer des ingrédients individuels d'un smoothie.

La Découverte Choc : Plus Intelligent ne Signifie Pas Plus Clair

Les chercheurs ont testé six modèles d'IA différents :

  • 2 Modèles Anciens : Entraînés de manière traditionnelle et supervisée (comme un élève avec un professeur).
  • 4 Modèles « Fondation » : Les nouveaux modèles massifs et ultra-puissants (comme DINO, CLIP) qui sont entraînés sur tout l'internet et peuvent faire presque n'importe quoi.

Le Résultat :
Les modèles « Fondation » étaient moins interprétables que les modèles plus anciens et plus simples.

  • L'Analogie : Imaginez que les modèles anciens sont comme un élève qui a appris en mémorisant un manuel scolaire. Vous pouvez facilement lui demander : « Pourquoi as-tu choisi cette réponse ? » et il donne une raison claire.
  • Les nouveaux modèles Fondation sont comme un génie qui a appris en lisant toute la bibliothèque du savoir humain. Ils sont plus intelligents et peuvent résoudre des problèmes plus difficiles, mais si vous leur demandez d'expliquer leur raisonnement, ils vous donnent une réponse vague et confuse. Leurs « pensées » internes sont plus difficiles pour les humains à cerner.

Crucialement, être « plus intelligent » n'a pas aidé. Le document a trouvé aucun lien entre la performance du modèle sur des tâches (comme l'identification d'objets) et la facilité avec laquelle les humains pouvaient comprendre ses caractéristiques. Être un meilleur conducteur ne signifie pas que votre cerveau est plus facile à lire.

Qu'est-ce qui Rend une Caractéristique Facile à Comprendre ?

Les auteurs ont découvert deux choses spécifiques qui rendent les « pensées » d'une IA plus faciles à saisir pour les humains :

  1. Localité (L'Effet du « Projecteur ») :

    • Si une caractéristique s'allume dans un endroit précis et restreint (comme juste le pneu d'une voiture), les humains peuvent la comprendre facilement.
    • Si une caractéristique s'allume partout à la fois (comme toute la voiture et la route et le ciel), les humains se confondent. Les nouveaux modèles Fondation ont tendance à avoir ces signaux « diffus » qui couvrent trop de terrain.
    • Analogie : Il est plus facile de trouver une personne spécifique dans une foule si elle porte un chapeau rouge vif (local) que si elle fait simplement partie de « l'ambiance générale » de la foule (diffuse).
  2. Alignement à Grain Grossier (La Correspondance de la « Grande Image ») :

    • Les humains comprennent le monde en catégories larges (par exemple, « Animaux », « Véhicules »). Si l'IA organise ses caractéristiques pour correspondre à ces grandes catégories, les humains la comprennent mieux.
    • Si l'IA se concentre sur des détails hyper-spécifiques et minuscules (comme la texture exacte de l'aile d'un papillon par rapport à un autre papillon), les humains la trouvent en fait plus difficile à comprendre.
    • Analogie : Il est plus facile d'expliquer une carte si vous me montrez « l'Amérique du Nord » et « l'Amérique du Sud » (grain grossier) plutôt que d'essayer d'expliquer la forme spécifique de chaque rue d'une ville (grain fin).

Le Seul Point Lumineux : DINOv3

Il y avait une exception. Un modèle appelé DINOv3 était à la fois très capable et très interprétable. Pourquoi ? Parce que les personnes qui l'ont construit l'ont spécifiquement programmé pour rechercher des caractéristiques « locales » (des choses qui s'allument dans des endroits spécifiques). Cela prouve que nous pouvons construire des modèles intelligents qui sont aussi faciles à comprendre, mais nous devons les concevoir avec cet objectif à l'esprit.

Résumé

  • Capacité ≠ Interprétabilité : Le fait qu'une IA soit super intelligente ne signifie pas que nous pouvons comprendre comment elle pense. En fait, les modèles les plus récents et les plus intelligents sont souvent les plus difficiles à comprendre.
  • Le Fossé : Il existe un fossé entre « bien faire le travail » et « expliquer le travail clairement ».
  • La Solution : Pour rendre l'IA plus transparente, nous devons l'entraîner à se concentrer sur des détails spécifiques et locaux et à organiser ses connaissances en catégories larges et humaines, plutôt que de simplement la rendre plus grande et plus puissante.

Le document conclut que nous ne pouvons pas supposer que, à mesure que l'IA devient plus intelligente, elle deviendra naturellement plus compréhensible. Nous devons intégrer cette clarté dès le départ.

Noyé(e) sous les articles dans votre domaine ?

Recevez des digests quotidiens des articles les plus récents correspondant à vos mots-clés de recherche — avec des résumés techniques, dans votre langue.

Essayer Digest →