← Derniers articles
💻 computer science

Explaining Image Similarity with Automatically Extracted Concept Activation Vectors

Cet article introduit un cadre de travail agnostique vis-à-vis du modèle et de la métrique qui explique la similitude d'images en extrayant automatiquement des vecteurs d'activation de concepts via des auto-encodeurs parcimonieux, permettant ainsi d'obtenir des informations fidèles et interprétables sur les concepts spécifiques (tels que la texture, la forme ou la couleur) qui pilotent les scores de similitude pour des paires d'images individuelles ainsi que pour des groupes d'images.

Auteurs originaux : Isaac Roberts, Petra Bevandic, Alexander Schulz, Barbara Hammer

Publié 2026-07-31
📖 3 min de lecture☕ Lecture pause café

Auteurs originaux : Isaac Roberts, Petra Bevandic, Alexander Schulz, Barbara Hammer

Article original sous licence CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Ceci est une explication générée par l'IA de l'article ci-dessous. Elle n'a pas été rédigée ni approuvée par les auteurs. Pour une précision technique, consultez l'article original. Lire la clause de non-responsabilité complète

Imaginez que vous déambulez dans une bibliothèque géante et invisible où chaque livre est une image. Dans cette bibliothèque, les livres ne sont pas organisés par titre ou par auteur, mais par la mesure de ce qu'ils « ressentent » l'un envers l'autre. Une photo d'un golden retriever pourrait se trouver juste à côté d'une photo d'un chat duveteux, non pas parce qu'ils sont le même animal, mais parce qu'ils partagent une certaine ambiance de « douceur ». C'est ainsi que les ordinateurs voient le monde aujourd'hui : ils traduisent les images en codes secrets (appelés plongements ou « embeddings ») et mesurent la distance entre elles pour décider si deux images sont similaires. C'est la magie qui se cache derrière la recherche de vos photos perdues, la reconnaissance des visages ou la suggestion de la tenue parfaite. Mais voici la partie délicate : l'ordinateur peut vous dire que deux images sont similaires, mais il est souvent incapable de vous dire pourquoi. C'est comme un ami qui dirait : « Ces deux chansons se ressemblent », mais qui refuserait d'expliquer si c'est à cause de la batterie, de la voix du chanteur ou du tempo. Pendant longtemps, les scientifiques ont tenté de jeter un coup d'œil derrière le rideau en utilisant des cartes qui mettent en évidence des points brillants sur une image, mais ces cartes manquent souvent la vue d'ensemble, comme les « ingrédients » spécifiques (tels que la texture ou la forme) qui rendent la similitude possible.

Ce document présente une nouvelle façon ingénieuse de résoudre ce mystère. Les auteurs, Isaac Roberts et son équipe, ont construit un système qui agit comme un « détecteur de saveurs » pour les images. Au lieu de simplement regarder l'image, ils décomposent le code secret de l'image en ses blocs de construction de base, qu'ils appellent des « concepts ». Pensez à ces concepts comme aux notes individuelles d'un accord ; une note pourrait être les « rayures », une autre le « rouge », et une autre le « rond ». L'équipe utilise un outil spécial (un auto-encodeur parcimonieux ou « Sparse Autoencoder ») pour trouver automatiquement ces notes sans avoir besoin qu'un humain leur enseigne ce qu'elles sont. Une fois qu'ils ont la liste des notes, ils jouent à un petit jeu : ils retirent une note spécifique du code de l'image et regardent de combien le « score de similitude » chute. Si retirer la note « rayures » fait que deux chemises paraissent totalement différentes pour l'ordinateur, alors les rayures étaient la raison principale de leur similitude. Ils ont testé cela sur des milliers d'images et ont découvert que leur méthode est bien plus fiable que les anciennes façons de deviner. Ils ont montré qu'en modifiant directement le code secret, ils pouvaient expliquer exactement pourquoi une chemise rayée correspond à une autre chemise rayée, même si les couleurs sont différentes. Ils ont même utilisé cela pour trouver des groupes d'images qui partagent la même raison d'être similaires, et non pas seulement le même aspect, prouvant que leur « détecteur de saveurs » peut nous aider à comprendre la logique cachée de la façon dont les ordinateurs voient le monde.

Noyé(e) sous les articles dans votre domaine ?

Recevez des digests quotidiens des articles les plus récents correspondant à vos mots-clés de recherche — avec des résumés techniques, dans votre langue.

Essayer Digest →