Bongards at the Boundary of Perception and Reasoning: Programs or Language?
Cet article introduit une approche neurosymbolique qui combine des modèles de langage de grande taille pour la génération de programmes paramétrés avec l'optimisation bayésienne pour l'ajustement des paramètres afin de résoudre les problèmes de Bongard, comblant ainsi le fossé entre la perception visuelle et le raisonnement abstrait.
Article original sous licence CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Ceci est une explication générée par l'IA de l'article ci-dessous. Elle n'a pas été rédigée ni approuvée par les auteurs. Pour une précision technique, consultez l'article original. Lire la clause de non-responsabilité complète
La vue d'ensemble : Le défi de l'« énigme visuelle »
Imaginez que l'on vous donne un ensemble de 12 dessins. Six d'entre eux sont « bons » (positifs) et six sont « mauvais » (négatifs). Votre tâche est de découvrir la règle secrète qui sépare les bons des mauvais.
C'est ce qu'on appelle un Problème de Bongard. Il ne s'agit pas de simples puzzles de type « trouver l'intrus ». Les règles peuvent être incroyablement complexes.
- Exemple : Peut-être que les images « bonnes » possèdent toutes une forme avec un « cou » horizontal, tandis que les « mauvaises » ont un cou vertical. Ou peut-être que les formes « bonnes » sont « sinueuses », alors que les « mauvaises » sont « lisses ».
L'article pose une grande question : L'intelligence artificielle (IA) peut-elle résoudre ces énigmes comme le font les humains ? Les humains excellent pour observer une situation inédite, inventer un nouveau concept à la volée (comme « cou horizontal ») et l'appliquer. L'IA actuelle est excellente pour reconnaître des choses qu'elle a déjà vues (comme « ceci est un chat »), mais elle a souvent du mal lorsqu'elle doit inventer un nouveau concept à partir de zéro.
Le problème : L'IA est soit trop rigide, soit trop vague
Les chercheurs ont découvert que l'IA possède deux principales façons de réfléchir, et que les deux présentent des défauts face à ces énigmes :
L'approche « Chatbot » (Langage naturel) :
- Comment ça marche : L'IA regarde les images et tente de décrire la règle en mots, comme un détective rédigeant un rapport.
- Le défaut : Elle est douée pour les idées générales, mais manque de précision. Elle peut dire : « Les formes bonnes sont plutôt pointues », mais elle ne peut pas faire la différence entre une forme « légèrement pointue » et une forme « très pointue ». C'est comme un chef qui sait que la recette demande « une pincée de sel », mais qui ne sait pas exactement quelle quantité cela représente.
L'approche « Programmeur » (Code) :
- Comment ça marche : L'IA écrit un programme informatique pour vérifier les images. Elle peut mesurer des distances, des angles et des comptes exacts.
- Le défaut : Elle est excellente pour la précision, mais manque de créativité. Si la règle est « la forme ressemble à un visage triste », un programme informatique peine à définir mathématiquement la « tristesse ». C'est comme un robot capable de mesurer une pièce au millimètre près, mais incapable de comprendre le concept de « douillet ».
La solution : L'équipe des « Traducteurs »
Les auteurs ont construit un nouveau système qui agit comme une équipe de deux spécialistes travaillant ensemble. Ils appellent cela une approche « neurosymbolique » (combinant les réseaux de neurones/IA et la logique symbolique/programmation).
Voici comment fonctionne leur équipe, étape par étape :
Étape 1 : Le générateur d'idées (Le « Chatbot »)
D'abord, ils demandent à une IA puissante (un modèle de vision-langage) de regarder l'énigme et de suggérer quelques règles possibles en langage courant.
- Analogie : Imaginez une séance de remue-méninges où un écrivier créatif suggère : « Peut-être que la règle concerne le "cou" de la forme ! »
Étape 2 : Le Traducteur (Le « Programmeur »)
Ensuite, le système prend ces suppositions en anglais (ou en langage naturel) et tente de les transformer en code informatique.
- Le rebondissement : L'IA ne se contente pas d'écrire le code ; elle laisse des « blancs » pour les chiffres délicats. Par exemple, si la règle est « des formes avec un cou plus long que X », l'IA écrit le code mais laisse X comme une variable mystère.
- Analogie : L'écrivain dit : « Le cou doit être plus long que [BLANK] ». Le programmeur prépare la machine pour mesurer le cou, mais attend la valeur exacte.
Étape 3 : Le Régleur (Optimisation Bayésienne)
C'est la recette secrète. Le système suit un processus de « tâtonnement » (essais et erreurs) pour trouver le chiffre parfait pour ces blancs. Il teste différents nombres (comme 5 pixels, 10 pixels, 15 pixels) pour voir lequel sépare parfaitement les images « bonnes » des images « mauvaises ».
- Analogie : Imaginez que vous réglez une radio. Vous savez que la station se trouve quelque part entre 90 et 100, mais vous ne connaissez pas la fréquence exacte. Vous tournez lentement le cadran jusqu'à ce que les parasites disparaissent et que la musique soit parfaite. Le système fait cela mathématiquement pour trouver le point de « coupure » exact de la règle.
Étape 4 : Le Juge (Le Vérificateur)
Enfin, le système vérifie : « Est-ce que ce code fonctionne réellement sur toutes les images d'entraînement ? »
- Si le code fonctionne parfaitement, le système accepte la règle.
- Si le code échoue, le système retourne vers le « Chatbot » et lui dit : « Cette idée n'a pas fonctionné, essaie encore », et le cycle recommence.
Qu'ont-ils découvert ?
Les chercheurs ont testé cette « Approche d'équipe » contre les meilleurs modèles d'IA disponibles (comme GPT-4o et Claude 3.7) et même contre la performance humaine moyenne.
- L'équipe gagne : En combinant la créativité du Chatbot avec la précision du Programmeur, leur système a résolu 51 des 100 problèmes de Bongard.
- Battre l'humain : L'humain moyen, dans des études précédentes, résolvait environ 47 problèmes. Leur équipe d'IA en a résolu 51, marquant la première fois qu'une IA surpasse la performance humaine moyenne sur ce test spécifique.
- Des forces différentes :
- Quand le problème portait sur la géométrie et les mathématiques (comme « ces lignes sont-elles parallèles ? »), la partie « Programmeur » de l'équipe était la héroïne.
- Quand le problème portait sur des concepts abstraits (comme « cette forme est-elle "ouverte" ou "fermée" ? »), la partie « Chatbot » était la héroïne.
- Lorsqu'ils utilisaient uniquement le Chatbot ou uniquement le Programmeur, ils obtenaient de moins bons résultats. Ils avaient besoin des deux.
Le test de la « Mémorisation »
Les chercheurs craignaient que l'IA ne soit pas en train de « tricher » en mémorisant les réponses d'Internet (puisque ces puzzles sont anciens et populaires). Pour tester cela, ils ont inversé les règles : ils ont dit à l'IA que les images « mauvaises » étaient en fait les « bonnes ». L'IA a tout de même bien performé, prouvant qu'elle ne se contentait pas de réciter des réponses mémorisées, mais qu'elle déduisait réellement la logique.
L'essentiel
Cet article montre que pour résoudre des puzzles visuels difficiles, l'IA ne doit pas seulement essayer de « penser » comme un humain ou de « calculer » comme un ordinateur. Elle doit faire les deux. En laissant une IA créative suggérer des idées et un ordinateur précis les vérifier avec des mathématiques exactes, nous pouvons construire des systèmes qui apprennent de nouveaux concepts visuels presque aussi bien que, et parfois mieux que, les humains.
Noyé(e) sous les articles dans votre domaine ?
Recevez des digests quotidiens des articles les plus récents correspondant à vos mots-clés de recherche — avec des résumés techniques, dans votre langue.