DIFFCZSL: Compositional Zero-Shot Learning Regularized by Diffusion Representations
Le papier propose DIFFCZSL, un cadre qui améliore l'apprentissage zéro-shot compositionnel en intégrant des représentations de diffusion intermédiaires dans les pipelines basés sur CLIP afin de fournir une supervision auxiliaire et des sémantiques riches et sensibles aux compositions sans augmenter les coûts d'inférence.
Article original sous licence CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Ceci est une explication générée par l'IA de l'article ci-dessous. Elle n'a pas été rédigée ni approuvée par les auteurs. Pour une précision technique, consultez l'article original. Lire la clause de non-responsabilité complète
Imaginez un monde où un ordinateur peut regarder la photo d'une pomme rouge et la photo d'une pomme verte, apprendre ce que signifient « rouge » et « vert », puis reconnaître instantanément une « pomme verte » qu'il n'a jamais vue auparavant, même s'il n'a été entraîné que sur des pommes rouges. C'est le défi de l'apprentissage compositionnel à zéro tirage (compositional zero-shot learning), une branche spécifique de l'intelligence artificielle qui demande aux machines de comprendre comment des concepts simples se combinent pour former de nouvelles idées complexes. Pendant des décennies, les chercheurs ont tenté d'enseigner cette compétence aux ordinateurs en leur montrant des milliers d'exemples, mais les machines peinent souvent lorsqu'on leur demande de mélanger et d'associer ces idées de manières qu'elles n'ont pas pratiquées. Elles peuvent reconnaître l'objet, comme une banane, et l'état, comme « mûre », mais échouer à comprendre qu'une « banane mûre » est une réalité visuelle spécifique différente du simple fait d'être une chose « mûre » ou une « banane » en général. La difficulté fondamentale réside dans l'enseignement à la machine de voir la relation entre les parties, et non pas seulement les parties elles-mêmes.
Une équipe de chercheurs de l'Université des sciences et technologies de Hong Kong a trouvé une nouvelle façon d'aider ces machines à acquérir cette compétence, non pas en leur enseignant plus d'exemples, mais en empruntant un autre type d'intelligence. Ils ont découvert que, si les modèles d'IA standards sont excellents pour distinguer une image d'une autre, ils sont parfois maladroits pour comprendre comment les concepts se mélangent. Pour corriger cela, l'équipe a introduit un assistant « génératif » dans le processus d'entraînement. Considérez cet assistant comme un modèle qui a été conçu à l'origine pour créer des images à partir de descriptions textuelles, plutôt que pour simplement les identifier. En laissant l'IA observer le fonctionnement interne de ce modèle de création d'images pendant son apprentissage, les chercheurs ont pu guider le processus d'apprentissage vers une compréhension plus profonde de la manière dont les attributs et les objets s'assemblent.
Les chercheurs, dirigés par Hangyu Tian et ses collègues, ont construit un système qu'ils appellent DIFFCZSL. Leur approche part d'un modèle d'IA puissant et préexistant appelé CLIP, qui est très doué pour faire correspondre des images à des mots. Cependant, l'équipe a remarqué que CLIP traite parfois une « banane mûre » comme une simple banane qui se trouve être proche du mot « mûre », plutôt que comme un concept unifié où la maturité modifie l'apparence du fruit. Pour corriger cela, ils ont ajouté une deuxième étape lors de la phase d'entraînement. Ils ont pris un modèle de génération d'images pré-entraîné, le genre de modèle capable de dessiner une image lorsqu'on lui donne une description textuelle, et ont demandé à ce modèle d'examiner les mêmes images que l'IA principale étudiait. Ce modèle de génération possède une manière unique de voir le monde ; parce qu'il doit apprendre à reconstruire une image à partir de zéro en se basant sur du texte, il prête une attention particulière à la façon dont des détails spécifiques, comme la texture d'une peau de banane ou la couleur d'une pomme, interagissent avec l'objet lui-même.
L'équipe n'a pas remplacé l'IA principale par ce modèle de génération. Au lieu de cela, elle a utilisé le modèle de génération comme un enseignant. Tandis que l'IA principale tentait d'apprendre, le modèle de génération lui fournissait des indices supplémentaires sur la structure de l'image. Il lui murmurait essentiellement : « Regarde, quand tu vois une banane, le concept de "mûre" n'est pas seulement une étiquette séparée ; il modifie la forme visuelle et la couleur de la banane. » Les chercheurs ont extrait ces indices internes du modèle de génération et les ont alignés avec la compréhension de l'IA principale. Ce processus ne s'est produit que pendant que l'ordinateur apprenait. Une fois l'entraînement terminé, le modèle de génération a été retiré, laissant l'IA principale avec sa vitesse et sa structure d'origine, mais dotée désormais d'une capacité beaucoup plus aiguisée pour reconnaître de nouvelles combinaisons.
Les résultats de cette expérience ont été mesurés à travers trois ensembles d'images différents, allant de chaussures à des fruits en passant par des objets du quotidien. Dans chaque cas, les modèles d'IA ayant reçu ce guidage supplémentaire ont obtenu de meilleurs résultats que ceux qui n'en bénéficiaient pas. Sur un ensemble de données de chaussures appelé UT-Zappos, l'équipe a observé un bond significatif de la précision, les modèles identifiant correctement les combinaisons inédites beaucoup plus souvent. Par exemple, lorsqu'on demandait d'identifier une « pomme tranchée » ou une « banane mûre » dans un nouveau contexte, les modèles guidés étaient beaucoup moins susceptibles de se tromper. L'amélioration était constante, que le test soit limité à des catégories connues ou ouvert à une vaste gamme de combinaisons possibles. Les chercheurs ont constaté que les modèles devenaient meilleurs pour équilibrer leurs connaissances de ce qu'ils avaient déjà vu avec leur capacité à deviner ce qu'ils n'avaient jamais vu, une compétence cruciale pour les applications réelles où de nouvelles situations surgissent constamment.
L'une des découvertes les plus frappantes fut que cette amélioration s'est faite sans ralentir l'ordinateur ni le alourdir. Parce que le modèle de génération n'était utilisé que comme guide pendant la phase d'apprentissage et était écarté par la suite, le système final fonctionnait aussi vite que l'original. L'équipe a également testé si le type spécifique de modèle de génération importait, trouvant que les versions plus récentes et plus avancées fournissaient un meilleur guidage que les plus anciennes. Ils ont même comparé leur méthode à d'autres types de modèles d'IA puissants et ont découvert que la capacité unique du modèle de génération à comprendre comment les concepts se mélangent était le facteur clé, et non pas simplement le fait qu'il s'agisse d'un grand système pré-entraîné. L'étude suggère que la manière dont ces modèles de génération apprennent à créer des images à partir de texte capture une structure cachée du monde qui est parfaite pour apprendre aux machines comment combiner des idées.
Ce travail met en lumière une voie prometteuse pour l'intelligence artificielle. Au lieu de chercher à construire un modèle unique et massif qui fait tout parfaitement, les chercheurs ont montré qu'en combinant les forces de différents types de modèles, on peut obtenir de meilleurs résultats. En laissant un modèle qui crée des images enseigner à un modèle qui les reconnaît, ils ont comblé un fossé dans la compréhension du monde par les ordinateurs. Ces conclusions suggèrent que l'avenir de l'IA pourrait résider dans ces collaborations, où les modèles génératifs et discriminatifs travaillent ensemble pour créer des systèmes qui sont non seulement précis, mais aussi profondément capables de comprendre la nature complexe et composée de la réalité. L'approche offre un moyen simple et efficace de rendre les machines plus intelligentes quant à la manière dont les choses s'assemblent, sans ajouter de charge supplémentaire à leurs tâches quotidiennes.
Noyé(e) sous les articles dans votre domaine ?
Recevez des digests quotidiens des articles les plus récents correspondant à vos mots-clés de recherche — avec des résumés techniques, dans votre langue.