← Derniers articles
💻 computer science

Distilling Answer Set Programming Theories from Large Language Models

Cet article étudie la capacité des grands modèles de langage à distiller de manière autonome des théories de programmation par ensembles de réponses complètes et correctes pour des tâches de questions-réponses visuelles dans une limite d'une heure, démontrant que les modèles de pointe tels que Claude Sonnet 4.6, Claude Opus 4.7 et DeepSeek V4 Pro atteignent une précision quasi parfaite sur plusieurs bancs d'essai, tandis que GPT-5 présente une variabilité de performance significative et une sensibilité aux données de référence.

Auteurs originaux : Nelson Higuera Ruiz, Markus Hofmarcher, Claudiu Leoveanu-Condrei

Publié 2026-07-31
📖 5 min de lecture🧠 Analyse approfondie

Auteurs originaux : Nelson Higuera Ruiz, Markus Hofmarcher, Claudiu Leoveanu-Condrei

Article original sous licence CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Ceci est une explication générée par l'IA de l'article ci-dessous. Elle n'a pas été rédigée ni approuvée par les auteurs. Pour une précision technique, consultez l'article original. Lire la clause de non-responsabilité complète

Imaginez un monde où les ordinateurs sont incroyablement doués dans deux domaines très différents. D'un côté, ils sont comme des calculatrices super rapides capables de suivre des règles strictes pour résoudre des énigmes logiques, mais ils sont incapables de comprendre le monde complexe et flou qui les entoure. De l'autre côté, ils sont comme des conteurs brillants et créatifs, capables de lire presque tout et d'écrire de la poésie, mais ils inventent souvent des faits ou se perdent lorsqu'on leur demande de suivre un ensemble d'instructions rigides. Les scientifiques appellent le mariage de ces deux compétences l'informatique « neurosymbolique ». C'est comme essayer de construire un robot qui possède à la fois l'imagination d'un poète et la précision d'un mathématicien. La grande question que se posent les chercheurs est la suivante : pouvons-nous apprendre à un ordinateur super intelligent (un grand modèle de langage) à écrire son propre livre de règles strict à partir de zéro, afin qu'il puisse résoudre des énigmes complexes sans qu'un humain ait à écrire chaque règle à la main ? Cela est important car l'écriture de ces livres de règles est lente, ennuyeuse et difficile à réussir, mais si un ordinateur pouvait le faire, nous pourrions débloquer de nouvelles façons pour les machines de raisonner sur le monde.

Dans cet article, une équipe de chercheurs a tenté de voir si un grand modèle de langage pouvait agir comme un apprenti infatigable, apprenant à écrire un « livre de règles » complet pour un puzzle de type jeu vidéo appelé Visual Question Answering (VQA). Imaginez que vous montriez à un ordinateur une image d'une scène et que vous lui demandiez : « Le frisbee jaune est-il à gauche de la personne ? » Pour répondre à cela, l'ordinateur doit comprendre l'image, la décomposer et ensuite exécuter une vérification logique. Les chercheurs ont donné à l'ordinateur un fichier vide et un ensemble d'outils, incluant un « solveur » (un arbitre strict qui vérifie si les règles sont cohérentes). Le travail de l'ordinateur consistait à lire quelques exemples d'entraînement, à écrire des règles, à demander à l'arbitre de les vérifier, à voir là où il avait échoué, puis à réécrire les règles. Il disposait d'une heure pour continuer ainsi jusqu'à ce qu'il soit aussi performant qu'il le pouvait.

Les chercheurs ont testé cela sur trois différents « niveaux de puzzle » : CLEVR (formes simples générées par ordinateur), GQA (photos du monde réel avec beaucoup plus d'objets) et CLEVRER (courtes vidéos impliquant des relations de cause à effet). Ils ont testé cela avec neuf modèles informatiques différents, allant des modèles « frontières » les plus récents et les plus puissants aux modèles plus petits et plus anciens. Les résultats étaient un mélange de succès incroyables et d'échecs surprenants. Trois des quatre meilleurs modèles de pointe sont devenus des maîtres du jeu. Sur les puzzles simples de CLEVR, ils ont atteint un score parfait de 100 %. Sur les puzzles GQA, plus difficiles, ils ont obtenu des scores compris entre 92,8 % et 98,8 %, ce qui est même meilleur que les meilleurs livres de règles écrits par des humains disponibles pour ce jeu de données. Sur les puzzles vidéo (CLEVRER), ils ont obtenu des scores compris entre 92,7 % et 95,3 %.

Cependant, tous les modèles n'ont pas réussi. Un des modèles les plus célèbres, GPT-5, a excellé sur les puzzles simples (98,7 %), mais s'est effondré sur les puzzles de photos du monde réel, chutant à seulement 41,8 %. Les chercheurs ont découvert que ce n'était pas parce que le modèle était incapable de raisonner, mais parce qu'il n'écrivait simplement pas assez de règles pour couvrir tous les types de questions différents. Lorsque les chercheurs ont donné aux modèles une « fiche de triche » (un livre de règles de référence provenant d'un autre type de puzzle) pour les aider, les meilleurs modèles sont restés à peu près au même niveau, mais GPT-5 a en fait empiré, suggérant que regarder la fiche de triche pouvait le distraire ou consommer sa mémoire. Les modèles plus petits et moins puissants ont principalement échoué à écrire des règles fonctionnelles, se retrouvant souvent bloqués ou écrivant des règles que l'arbitre ne pouvait pas comprendre.

L'étude montre qu'avec la bonne configuration, un ordinateur peut effectivement s'enseigner à lui-même l'écriture d'un livre de règles logiques complet et de haute qualité, atteignant ou dépassant même la performance humaine sur plusieurs tests de référence. Mais elle suggère également que cette capacité n'est pas garantie ; elle dépend fortement du modèle spécifique utilisé, et parfois, donner plus d'informations à un modèle (comme un livre de référence) peut en réalité le confondre. Les chercheurs ont publié tout leur code et les livres de règles que les ordinateurs ont écrits, invitant d'autres personnes à essayer d'améliorer cet « apprentissage » neurosymbolique.

Noyé(e) sous les articles dans votre domaine ?

Recevez des digests quotidiens des articles les plus récents correspondant à vos mots-clés de recherche — avec des résumés techniques, dans votre langue.

Essayer Digest →