← Derniers articles
🤖 machine learning

Quantum Models with Multi-Stage Training for Compositional Concept Generalization

Cet article propose un cadre d'entraînement multi-étapes pour l'apprentissage automatique quantique multimodal qui sépare les représentations de noms et de relations à l'aide de tenseurs et de circuits quantiques variationnels, démontrant une amélioration significative de la généralisation compositionnelle sur le jeu de données CLEVR avec beaucoup moins de paramètres entraînables que les bases de référence classiques.

Auteurs originaux : Mina Abbaszadeh, Matilda Karabina Moore, Mehrnoosh Sadrzadeh, Martha Lewis

Publié 2026-08-18
📖 6 min de lecture🧠 Analyse approfondie

Auteurs originaux : Mina Abbaszadeh, Matilda Karabina Moore, Mehrnoosh Sadrzadeh, Martha Lewis

Article original sous licence CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Ceci est une explication générée par l'IA de l'article ci-dessous. Elle n'a pas été rédigée ni approuvée par les auteurs. Pour une précision technique, consultez l'article original. Lire la clause de non-responsabilité complète

L'intelligence humaine possède une capacité remarquable à recombiner des idées simples et apprises en de toutes nouvelles situations. Une personne qui comprend ce qu'est une « voiture » et ce que signifie « jaune » peut instantanément reconnaître une voiture jaune qu'elle n'a jamais vue auparavant, appliquant sa connaissance du danger à cette nouvelle combinaison. Cette capacité, connue sous le nom de généralisation compositionnelle, nous permet de naviguer dans un monde où nous rencontrons constamment de nouveaux agencements de parties familières. Pour l'intelligence artificielle, cependant, cette compétence demeure un obstacle tenace. Bien que les systèmes modernes excellent dans la reconnaissance de motifs qu'ils ont vus pendant l'entraînement, ils trébuchent souvent lorsqu'on leur demande d'appliquer ces mêmes motifs à de nouvelles combinaisons, comme un objet spécifique placé dans une nouvelle relation spatiale. Cette limitation suggère que les modèles actuels mémorisent des exemples plutôt que de comprendre véritablement les règles sous-jacentes de la manière dont les choses s'assemblent.

Des chercheurs de l'University College London et de l'Université d'Amsterdam ont exploré une voie différente pour résoudre ce problème, se tournant vers la logique étrange et puissante de la mécanique quantique. Dans leurs travaux, présentés lors de la conférence IEEE Quantum Week, ils proposent que la manière dont les ordinateurs quantiques traitent l'information puisse naturellement s'aligner sur la façon dont les humains combinent les concepts. En construisant un modèle qui sépare l'apprentissage des objets de l'apprentissage des relations entre eux, ils ont créé un système capable de se généraliser à des scénarios inédits de manière bien plus efficace que les méthodes traditionnelles, tout en utilisant une fraction de la puissance de calcul.

L'équipe s'est concentrée sur une tâche où un ordinateur doit regarder l'image de deux formes géométriques et choisir la description correcte de leur relation parmi deux options. Par exemple, étant donné une image d'un cube à gauche d'un cône, le système doit distinguer la phrase correcte « cube gauche cône » d'un distracteur comme « cube droite cône ». Pour enseigner à la machine, les chercheurs ont utilisé un ensemble de données contenant des images de formes telles que des sphères, des cylindres et des cônes dans diverses positions. Le défi était d'entraîner le système sur certaines combinaisons, comme un cône à droite d'un cube, puis de le tester sur des combinaisons qu'il n'avait jamais vues, comme un cône à gauche d'un cube. Cette configuration force le modèle à apprendre le concept de « gauche » et de « droite » comme des règles indépendantes pouvant être appliquées à n'importe quelle forme, plutôt que de simplement mémoriser des images spécifiques.

Au lieu d'entraîner l'ensemble du système en une seule fois, les chercheurs ont adopté une approche en deux étapes qui imite un curriculum. Dans la première étape, le modèle a appris à reconnaître les objets individuels. On lui a montré des images de formes isolées, comme une sphère seule ou un cube unique, et on lui a appris à les associer à leurs noms. Une fois que le modèle a maîtrisé ces briques élémentaires, les chercheurs ont figé sa mémoire de l'apparence de ces formes. Dans la seconde étape, ils ont introduit la tâche relationnelle. Le modèle voyait alors des images avec deux formes et devait apprendre uniquement les règles de la manière dont elles se rapportent entre elles, en utilisant les définitions stables et pré-apprises des formes qu'il avait déjà mémorisées. Cette conception garantissait que le système ne tente pas de réapprendre ce qu'est un « cube » chaque fois qu'il voyait une nouvelle relation, le forçant à traiter la relation comme une transformation distincte appliquée à un objet fixe.

Pour mettre cela en œuvre, l'équipe a utilisé un cadre qui traduit le langage et le sens en structures mathématiques appelées tenseurs, qui peuvent être directement mappées sur des circuits quantiques. Ils ont testé différentes manières d'injecter les données d'image dans ces circuits quantiques. Une méthode, appelée encodage d'amplitude, tentait de préserver la géométrie exacte des données d'image originales. Une autre, appelée encodage d'angle, transformait les données d'une manière qui introduisait des changements non linéaires, remodelant efficacement l'information pour rendre les différences entre les relations plus claires. Ils ont également expérimenté une méthode de « collage », où les circuits quantiques de deux formes séparées étaient physiquement combinés pour représenter une seule image relationnelle.

Les résultats de leurs simulations ont été révélateurs. Lorsque les chercheurs ont comparé leur modèle quantique multi-étapes à un système classique standard, la différence d'efficacité était frappante. La référence classique nécessitait plus de 150 millions de paramètres entraînables pour tenter la tâche, mais elle a échoué à se généraliser, obtenant un score de seulement 50 % sur les combinaisons inédites — ce qui revient essentiellement à deviner. En revanche, le modèle quantique a atteint une forte généralisation en utilisant seulement 426 paramètres entraînables. La version la plus performante de leur système, qui utilisait la méthode du collage combinée à l'encodage d'angle, a atteint une précision de plus de 72 % sur les cas de test inédits. Cette performance était nettement supérieure à celle d'un modèle quantique à étape unique qui tentait d'apprendre tout à la fois, prouvant que la séparation de l'apprentissage des objets et de l'apprentissage des relations était cruciale.

Les chercheurs ont découvert que le succès de leur modèle dépendait fortement de la manière dont les données étaient encodées. La méthode d'encodage d'angle, qui introduisait des transformations non linéaires, s'est avérée supérieure à la méthode d'encodage d'amplitude. Cela suggère que les données d'image originales, telles qu'elles sont traitées par les outils standards, ne séparaient pas clairement les relations spatiales nécessaires à la tâche. Le processus d'encodage quantique lui-même a aidé à restructurer l'information, rendant la distinction entre « gauche » et « droite » plus visible pour le modèle. Tandis que l'encodage d'amplitude préservait la forme originale des données, il maintenait les similitudes déroutantes entre les différents arrangements spatiaux, les rendant plus difficiles à distinguer.

Ces conclusions, dérivées entièrement de simulations informatiques, suggèrent que les représentations quantiques structurées offrent une voie prometteuse pour enseigner la compositionnalité aux machines. En imposant une séparation claire entre ce que sont les choses et la manière dont elles se rapportent les unes aux autres, et en utilisant des circuits quantiques pour remodeler les données dans une forme plus séparable, le modèle a atteint un niveau de généralisation que les systèmes classiques peinent à atteindre avec beaucoup plus de ressources. Ce travail ne prétend pas avoir résolu le problème de l'intelligence artificielle, mais il démontre qu'une approche de l'apprentissage structurée et spécifique — où les primitives sont apprises d'abord puis combinées — peut être extrêmement efficace lorsqu'elle est couplée aux propriétés uniques de l'informatique quantique. Les auteurs notent que les travaux futurs devront tester ces idées sur du matériel quantique réel et explorer si ces méthodes peuvent passer à l'échelle pour des scènes plus complexes et des vocabulaires plus riches, mais les résultats actuels constituent une preuve de concept convaincante pour une nouvelle façon de concevoir l'apprentissage automatique.

Noyé(e) sous les articles dans votre domaine ?

Recevez des digests quotidiens des articles les plus récents correspondant à vos mots-clés de recherche — avec des résumés techniques, dans votre langue.

Essayer Digest →