← Derniers articles
🤖 AI

Neuro-symbolic learning over OWL 2 DL via consequence-based compilation to differentiable circuits

Cet article introduit Baobab, un cadre d'apprentissage neuro-symbolique qui compile des ontologies OWL 2 DL complètes en diagrammes de décision sentenciels différentiables afin d'entraîner des réseaux de perception sous supervision partielle, surmontant efficacement les raccourcis de raisonnement et atteignant une performance bayésienne optimale dans les tâches de logique de description non-Horn.

Auteurs originaux : Olga Mashkova, Asaad Mohammedsaleh, Fernando Zhapa-Camacho, Robert Hoehndorf

Publié 2026-08-19
📖 9 min de lecture🧠 Analyse approfondie

Auteurs originaux : Olga Mashkova, Asaad Mohammedsaleh, Fernando Zhapa-Camacho, Robert Hoehndorf

Article original sous licence CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Ceci est une explication générée par l'IA de l'article ci-dessous. Elle n'a pas été rédigée ni approuvée par les auteurs. Pour une précision technique, consultez l'article original. Lire la clause de non-responsabilité complète

Dans le vaste paysage de l'intelligence artificielle, deux traditions distinctes s'affrontent depuis longtemps pour faire comprendre le monde aux machines. Une tradition, connue sous le nom d'apprentissage profond (deep learning), excelle dans la reconnaissance de motifs dans des données brutes, comme identifier un chat sur une photographie ou lire un chiffre écrit à la main. Elle apprend en ajustant des millions de curseurs internes jusqu'à obtenir la bonne réponse, mais elle le fait sans une compréhension claire des règles qui régissent le monde. L'autre tradition, ancrée dans la logique et la représentation des connaissances, construit des systèmes qui raisonnent avec des règles strictes, tel un encyclopédie numérique qui sait qu'un « caniche » est un type de « chien » et que les « chiens » sont des « mammifères ». Ce système est précis et fiable, mais il peine souvent à se connecter à la réalité désordonnée et non structurée des images et des sons. Pendant des années, les chercheurs ont tenté de fusionner ces deux approches, créant des systèmes « neuro-symboliques » capables à la fois de voir et de raisonner. Le défi résidait dans le fait que les langages logiques les plus puissants utilisés pour décrire des connaissances complexes sont incroyablement difficiles à traduire dans le langage mathématique utilisé par les réseaux de neurones pour apprendre.

Une équipe de chercheurs de l'Université des sciences et technologies de King Abdullah a développé une nouvelle méthode appelée Baobab qui comble avec succès ce fossé pour un type spécifique et hautement complexe de système logique. Ils ont créé un compilateur qui prend une description logique détaillée du monde — complète avec des règles sur la façon dont les choses sont liées, combien d'éléments peuvent exister et comment les catégories se chevauchent — et la traduit en une structure qu'un réseau de neurones peut utiliser pour apprendre. Contra matter aux tentatives précédentes qui simplifiaient trop les règles logiques ou les abandonnaient entièrement, cette méthode préserve toute la complexité des règles originales. Les chercheurs ont testé leur système en demandant à un réseau de neurones d'examiner des images de chiffres écrits à la main et de déterminer non seulement les nombres, mais aussi des propriétés logiques cachées comme si un nombre est premier ou pair, en se basant uniquement sur un ensemble de règles logiques fournies à la machine. Le système a appris à identifier ces concepts cachés avec une grande précision, même lorsque les images elles-mêmes ne fournissaient aucun indice direct à leur sujet.

Le cœur de cette réussite réside dans la manière dont les chercheurs ont géré le processus de traduction. Ils ont pris une base de connaissances logiques, qui est essentiellement une collection d'énoncés sur la façon dont les concepts sont liés les uns aux autres, et l'ont compilée en un type spécifique de diagramme de circuit. Ce diagramme agit comme un filtre, vérifiant si les prédictions faites par le réseau de neurones sont cohérentes avec les règles logiques. Si le réseau prédit qu'un nombre est à la fois pair et premier (ce qui n'est vrai que pour le chiffre deux), le circuit l'autorise. S'il prédit qu'un nombre est à la fois pair et impair, le circuit rejette cette possibilité. En exécutant cette vérification des millions de fois, le système peut guider le réseau de neurones pour qu'il apprenne les relations logiques correctes, même lorsque les images qu'il voit ne marquent pas explicitement ces relations. Les chercheurs ont prouvé que cette traduction est mathématiquement saine, ce qui signifie que le circuit reflète fidèlement les règles logiques originales sans perdre d'information ni introduire d'erreurs.

L'une des découvertes les plus significatives de l'étude concerne un problème courant dans ces systèmes hybrides appelé « raccourci de raisonnement ». Lorsqu'une machine est confrontée à une tâche présentant plusieurs réponses possibles, elle trouve souvent un moyen de résoudre le problème en choisissant simplement une seule réponse et en ignorant les autres, contournant ainsi efficacement le système logique. Par exemple, si une règle autorise plusieurs configurations différentes d'une scène, un réseau de neurones standard pourrait se verrouiller sur une seule configuration et échouer à reconnaître que d'autres configurations valides existent. Les chercheurs ont découvert que leur nouvelle méthode, lorsqu'elle est combinée à une technique spécifique consistant à amorcer le réseau avec toutes les configurations valides possibles, peut surmonter ce raccourci. Au lieu de s'effondrer sur une seule réponse potentiellement erronée, le système apprend à maintenir une distribution de probabilité sur toutes les possibilités correctes, atteignant un niveau de précision qu'aucune méthode précédente n'avait atteint pour ce type de logique complexe.

L'équipe a démontré la puissance de son approche en utilisant deux ensembles de données distincts. Dans une première expérience, ils ont utilisé des images de chiffres écrits à la main provenant de l'ensemble de données MNIST. Ils ont mis en place un système logique où les chiffres étaient liés dans une chaîne, de sorte que si un nombre était suivi d'un autre, une relation spécifique devait être respectée. Le réseau de neurones était confronté à des paires d'images mais ne lui était jamais communiqué les nombres réels. Au lieu de cela, il recevait quelques indices logiques, comme savoir qu'un nombre était pair et l'autre premier. Grâce au circuit logique, le réseau a appris à inférer l'identité exacte des chiffres avec une précision quasi parfaite, passant d'un taux de supposition aléatoire de 25 % à 99 %. Dans une seconde expérience, ils ont appliqué la même méthode à un ensemble de données d'images de pizzas synthétiques. Le système a appris à identifier des catégories cachées de pizzas, telles que « végétarienne » ou « épicée », en se basant sur les garnitures visibles dans l'image et les règles logiques définissant ces catégories, surpassant à nouveau les systèmes qui n'utilisaient pas le circuit logique.

Les chercheurs ont également montré que leur méthode fonctionne avec la version complète et complexe du langage logique utilisé dans les bases de données biomédicales et le Web sémantique, qui inclut des caractéristiques telles que des règles sur le nombre d'éléments pouvant être connectés et des règles sur la direction des relations. Les tentatives précédentes d'utilisation de réseaux de neurones avec ce niveau de complexité devaient simplifier les règles de manière telle qu'elles perdaient leur sens. Baobab, cependant, a géré la pleine complexité sans simplification. L'équipe a vérifié l'exactitude de son compilateur à l'aide d'un système de preuve formelle, un contrôle mathématique rigoureux qui garantit que la traduction de la logique vers le circuit est sans faille. Ils ont également comparé leur système aux méthodes existantes et ont constaté qu'une partie significative des règles logiques utilisées dans leurs expériences ne pouvait pas être gérée par ces anciennes méthodes, qui étaient limitées à des formes de logique plus simples et moins expressives.

Une partie critique de l'étude impliquait de traiter la question des multiples réponses valides. Dans de nombreux scénarios réels, l'information fournie n'est pas suffisante pour déterminer une solution unique. Par exemple, si une règle stipule qu'une personne est soit de sexe masculin, soit de sexe féminin, et que nous savons qu'elle est mariée à quelqu'un du sexe opposé, il existe toujours deux possibilités valides pour le genre du couple. Les réseaux de neurones standards échouent souvent ici, choisissant arbitrairement une possibilité et la traitant comme la seule vérité. Les chercheurs ont découvert qu'en utilisant un mélange de différents chemins logiques, chacun correspondant à une possibilité valide, leur système pouvait représenter toutes les bonnes réponses simultanément. Cela permettait au système de fournir une probabilité calibrée pour chaque résultat, reflétant l'incertitude réelle des données plutôt que de forcer une fausse certitude. Cette capacité est essentielle pour des applications dans des domaines comme la médecine, où comprendre l'éventail des diagnostics possibles est tout aussi important que d'identifier un diagnostic unique.

Le travail a également mis en évidence les limites pratiques de tels systèmes. Bien que la méthode soit puissante, la taille du circuit logique augmente rapidement à mesure que la complexité du problème croît. Dans un test impliquant une ontologie complète de types de pizzas, les chercheurs ont constaté que la compilation de l'ensemble complet des règles en un circuit nécessitait plus de mémoire que celle disponible sur un ordinateur standard, les obligeant à utiliser un sous-ensemble simplifié des règles pour l'entraînement final. Cela suggère que bien que la méthode soit théoriquement saine et efficace pour de nombreux problèmes, sa mise à l'échelle vers les bases de connaissances les plus vastes et les plus complexes nécessitera de nouvelles avancées en ingénierie. Néanmoins, l'application réussie à l'ensemble de données de pizzas simplifié et à la tâche de reconnaissance de chiffres prouve que l'approche est viable et efficace pour des données réelles.

Les implications de cette recherche vont au-delà de la simple reconnaissance d'images. Elle offre une voie pour que l'intelligence artificielle intègre les connaissances riches et structurées issues des bases de données scientifiques directement dans le processus d'apprentissage des réseaux de neurones. Cela signifie que les futurs systèmes d'IA pourraient apprendre à partir d'images tout en adhérant simultanément aux règles strictes et vérifiées de la biologie, de la chimie ou de la physique. En garantissant que les prédictions de la machine sont toujours cohérentes avec les connaissances scientifiques établies, cette approche pourrait conduire à une IA plus fiable et plus digne de confiance, particulièrement dans des domaines à enjeux élevés où les erreurs peuvent avoir de graves conséquences. Les chercheurs ont rendu leur code et leurs outils publics, invitant d'autres chercheurs à bâtir sur cette fondation et à explorer jusqu'où cette intégration de la logique et de l'apprentissage peut aller.

En fin de compte, l'étude démontre que l'écart entre la reconnaissance de formes et le raisonnement logique peut être comblé sans sacrifier les forces de l'une ou l'autre approche. En traduisant des règles logiques complexes dans un format que les réseaux de neurones peuvent traiter, les chercheurs ont créé un système qui apprend non seulement à partir des données, mais aussi de la structure même de la connaissance. La capacité de récupérer des concepts cachés, d'éviter les raccourcis de raisonnement et de gérer la pleine complexité des langages logiques modernes marque une étape importante dans la quête de construction de machines qui comprennent véritablement le monde qu'elles observent. Les résultats suggèrent qu'avec les bons outils, l'intelligence artificielle peut passer de la simple reconnaissance de motifs au raisonnement authentique sur les relations et les règles qui les régissent.

Noyé(e) sous les articles dans votre domaine ?

Recevez des digests quotidiens des articles les plus récents correspondant à vos mots-clés de recherche — avec des résumés techniques, dans votre langue.

Essayer Digest →