Relational Visual Similarity
Cet article propose une nouvelle approche pour mesurer la similarité visuelle basée sur la logique relationnelle interne plutôt que sur les attributs perceptifs, en introduisant un modèle de langage-visuel entraîné sur un jeu de données de 114 000 images aux légendes anonymisées pour capturer ces correspondances structurelles que les méthodes actuelles ignorent.
Article original sous licence CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Ceci est une explication générée par l'IA de l'article ci-dessous. Elle n'a pas été rédigée ni approuvée par les auteurs. Pour une précision technique, consultez l'article original. Lire la clause de non-responsabilité complète
Imaginez que vous regardez deux photos : l'une montre un pêcher qui perd ses feuilles en automne, et l'autre montre un homme qui perd ses cheveux en vieillissant.
Pour un ordinateur classique, ces deux images sont totalement différentes. L'une est verte et pleine de vie, l'autre est grise et triste. L'une a des feuilles, l'autre a des cheveux. Pour l'ordinateur, ce n'est pas la même chose.
Mais pour un humain ? Nous voyons immédiatement la ressemblance. Nous voyons le cycle de la vie, le temps qui passe, la transformation inévitable. C'est ce que les auteurs de cette nouvelle recherche appellent la "Similarité Relationnelle".
Voici une explication simple de leur travail, avec quelques analogies pour bien comprendre :
1. Le problème : Les ordinateurs sont trop "superficiels"
Aujourd'hui, les intelligences artificielles qui comparent des images (comme celles qui vous suggèrent des photos similaires sur Instagram) fonctionnent comme un détective qui ne regarde que les vêtements.
- Si vous montrez une photo d'un chien et une photo d'un chat, l'IA dira : "Non, ce n'est pas pareil, l'un a des poils bruns, l'autre des poils noirs."
- Elle regarde les couleurs, les formes et les objets (c'est ce qu'on appelle la similarité d'attributs).
Mais elle rate l'essentiel : l'histoire que racontent les objets. Elle ne voit pas que le chien et le chat jouent tous les deux avec la même balle, ou qu'ils sont tous les deux en train de dormir.
2. La solution : Apprendre à lire entre les lignes
Les chercheurs (de l'Université du Wisconsin et d'Adobe) ont décidé de donner aux ordinateurs un super-pouvoir humain : la capacité de voir les relations, pas juste les objets.
Ils ont créé un nouveau système appelé RelSim. Voici comment ils l'ont fait, étape par étape :
Étape A : Le tri des "images intéressantes"
Imaginez que vous avez une bibliothèque de 2 milliards de photos (LAION-2B). La plupart sont ennuyeuses (un simple canapé, un ciel bleu).
Les chercheurs ont entraîné une IA pour repérer les images qui ont une logique cachée.
- Exemple : Une photo d'un gâteau en forme de cerveau n'est pas juste un gâteau. C'est une image qui dit : "Je ressemble à quelque chose d'autre !" C'est une image "intéressante".
Étape B : Le jeu du "Dessine-moi un secret" (Les légendes anonymes)
C'est l'ingrédient secret. Normalement, on décrit une image par ce qu'on voit : "Un chien rouge".
Ici, ils ont demandé à une IA de décrire la logique de l'image en effaçant les noms des objets. Ils utilisent des mots génériques comme {Objet} ou {Action}.
- Image réelle : "Un bananier qui mûrit et devient noir."
- Légende normale : "Une banane."
- Légende "Anonyme" (RelSim) : "Un
{Objet}qui subit une transformation progressive dans le temps."
En faisant cela, l'IA apprend que la banane qui mûrit et le feu qui brûlent sont pareils dans leur logique (ils changent tous les deux avec le temps), même si l'un est jaune et l'autre orange.
Étape C : L'entraînement
Ils ont montré à leur modèle des milliers de ces paires (Image + Légende Anonyme). Le but était d'apprendre à l'IA à dire : "Ah, cette image de banane et cette image de feu ont la même légende cachée, donc elles sont similaires !"
3. Pourquoi c'est génial ? (Les applications)
Grâce à ce système, on peut faire des choses magiques :
- La recherche par "Idée" : Au lieu de chercher "des chiens", vous pouvez chercher "des choses qui ressemblent à des humains". L'IA vous trouvera des photos de chiens qui tiennent des téléphones, des chats qui lisent des journaux, ou même des voitures qui semblent tristes. Elle comprend l'intention, pas juste l'objet.
- La création d'analogies : Imaginez que vous voulez créer une nouvelle image basée sur une idée. Vous montrez une photo d'un "glace qui pleure" (un jeu de mots visuel). Vous demandez à l'IA : "Fais-moi autre chose avec la même logique". Elle pourrait générer une photo d'un "fromage qui rit" ou d'un "nuage qui crie". Elle ne copie pas les couleurs, elle copie l'humour et la structure.
En résumé
Imaginez que les images sont comme des livres.
- Les anciennes IA lisaient seulement la couverture (les couleurs, les formes).
- La nouvelle IA, RelSim, lit le résumé de l'histoire et comprend le thème profond.
Elle nous permet de dire à l'ordinateur : "Je ne veux pas voir des choses qui se ressemblent en apparence, je veux voir des choses qui se ressemblent dans leur esprit." C'est un pas énorme pour rendre les machines plus intelligentes et plus proches de la façon dont nous, humains, pensons et créons.
Noyé(e) sous les articles dans votre domaine ?
Recevez des digests quotidiens des articles les plus récents correspondant à vos mots-clés de recherche — avec des résumés techniques, dans votre langue.