← Derniers articles
💬 NLP

Explaining Puzzle Solutions in Natural Language: An Exploratory Study on 6x6 Sudoku

Cette étude exploratoire évalue cinq grands modèles de langage sur des grilles de Sudoku 6x6 et constate que, bien qu'un modèle présente une capacité de résolution limitée, aucun ne peut fournir d'explications reflétant un raisonnement stratégique ou une résolution intuitive de problèmes, mettant ainsi en évidence des obstacles majeurs à une prise de décision collaborative efficace entre humains et IA.

Auteurs originaux : Anirudh Maiya, Razan Alghamdi, Maria Leonor Pacheco, Ashutosh Trivedi, Fabio Somenzi

Publié 2026-04-28
📖 5 min de lecture🧠 Analyse approfondie

Auteurs originaux : Anirudh Maiya, Razan Alghamdi, Maria Leonor Pacheco, Ashutosh Trivedi, Fabio Somenzi

Article original sous licence CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Ceci est une explication générée par l'IA de l'article ci-dessous. Elle n'a pas été rédigée ni approuvée par les auteurs. Pour une précision technique, consultez l'article original. Lire la clause de non-responsabilité complète

Imaginez que vous avez une équipe de robots très intelligents et bien informés. Vous leur demandez de résoudre un puzzle logique appelé Sudoku (plus précisément une version plus petite de 6×6) et, plus important encore, de vous enseigner comment ils l'ont résolu en anglais courant.

Ce papier est comme un bulletin de notes pour cinq de ces robots, vérifiant deux choses :

  1. Ont-ils obtenu la bonne réponse ?
  2. Ont-ils pu expliquer leur raisonnement d'une manière qui ait réellement du sens pour un humain ?

Voici la répartition de ce que les chercheurs ont découvert, en utilisant quelques analogies du quotidien.

Le Déroulement : Le « Test Sudoku »

Les chercheurs ont créé près de 2 300 de ces énigmes de 6×6. Considérez ces énigmes comme une salle de sport pour le cerveau. Elles ne sont pas les plus difficiles au monde (comme la version 9×9), mais elles sont assez piègeuses pour qu'on ne puisse pas simplement deviner ; il faut utiliser la logique et les règles pour déterminer où placer les chiffres.

Ils voulaient voir si les grands modèles de langage (LLM) — les cerveaux d'IA derrière les chatbots — pouvaient agir comme un bon tuteur. Un bon tuteur ne vous donne pas seulement la clé des réponses ; il vous guide à travers les étapes afin que vous compreniez pourquoi un mouvement a été effectué.

Les Résultats : Les « Solveurs » contre les « Explicateurs »

1. Les Robots Open Source (L'« Heure des Amateurs »)

Les chercheurs ont testé quatre modèles open source différents (comme Llama, Gemma et Mistral).

  • Le Résultat : Ces robots ont essentiellement échoué au test. Sur 2 293 énigmes, ils ont résolu l'énigme entière correctement moins de 1 % du temps.
  • L'Analogie : Imaginez demander à un groupe de personnes de remplir une grille de mots croisés. Ces robots étaient comme des gens qui devinent des mots au hasard. Ils pourraient obtenir quelques lettres correctes par chance, mais ils ne pouvaient pas maintenir l'ensemble de l'image cohérent. Ils oubliaient les règles dès qu'ils commençaient à écrire.

2. L'Élève Star : « o1-preview » d'OpenAI

Ensuite, il y avait un modèle spécifique d'OpenAI appelé o1-preview.

  • Le Résultat : Ce modèle était une étoile en matière de résolution. Il a obtenu l'énigme complète correctement environ 65 % du temps. Sur les énigmes plus faciles, il était parfait (100 %).
  • Le Problème : À mesure que les énigmes devenaient plus difficiles (le niveau « Diabolique »), ses performances chutaient. Il commençait à faire des erreurs, comme un élève excellent en devoirs de mathématiques mais qui se perd lorsque l'examen devient vraiment difficile.

3. Le Vrai Problème : Le « Mauvais Explicateur »

C'est ici que l'étude devient intéressante. Les chercheurs ont pris les 20 énigmes que o1-preview avait résolues correctement et lui ont demandé d'expliquer ses étapes à des experts humains.

  • Le Résultat : L'explication était un désastre.

    • Justification : Seulement 5 % du temps le robot expliquait réellement pourquoi il avait choisi un chiffre. La plupart du temps, il disait simplement : « J'ai mis un 5 ici », sans dire pourquoi.
    • Clarté : Les explications étaient confuses, sautaient d'un sujet à l'autre et utilisaient des termes incorrectement.
    • Valeur Éducative : Si vous essayiez d'apprendre à résoudre des Sudokus avec ce robot, vous n'apprendriez rien. Il n'enseignait aucune stratégie.
  • L'Analogie : Imaginez un chef étoilé capable de cuisiner un steak parfait. Vous lui demandez : « Comment avez-vous fait ça ? »

    • Une bonne explication : « Je l'ai saisi à feu vif pendant deux minutes, puis j'ai baissé la température... »
    • Ce que o1-preview a fait : Il vous a tendu le steak en disant : « C'est prêt. C'est bon. Voici le steak. » Il vous a donné le résultat mais a refusé de (ou n'a pas pu) partager la recette. C'était comme un magicien qui exécute un tour parfaitement, mais qui, lorsqu'on lui demande comment, répond simplement : « Je l'ai juste fait », puis invente une fausse raison qui ne correspond pas à ce qui s'est réellement passé.

La Grande Conclusion

Le papier conclut que si l'IA s'améliore pour faire le travail (résoudre l'énigme), elle est toujours terrible pour raconter l'histoire de la façon dont elle a fait le travail.

Les auteurs soutiennent que pour que l'IA devienne un véritable partenaire pour les humains — en particulier dans des métiers importants comme la médecine ou le droit — elle doit pouvoir montrer clairement son travail. Pour l'instant, même l'IA la plus intelligente est comme un élève qui obtient un « A » à l'examen mais ne peut pas expliquer la réponse au professeur.

Et Maintenant ?

Le papier suggère que, au lieu d'essayer de faire en sorte que l'IA « pense » comme un humain entièrement par elle-même, nous devrions combiner l'IA avec des outils logiques (comme des logiciels mathématiques spécialisés).

  • L'Idée : Laissez le logiciel logique effectuer les calculs mathématiques stricts et difficiles pour garantir que la réponse soit correcte à 100 %. Ensuite, laissez l'IA agir comme traducteur, prenant ces mathématiques strictes et ennuyeuses pour les transformer en une histoire amicale et facile à comprendre pour un humain.

En bref : L'IA peut résoudre l'énigme, mais elle ne peut pas encore vous apprendre comment la résoudre. C'est un excellent travailleur, mais un terrible enseignant.

Noyé(e) sous les articles dans votre domaine ?

Recevez des digests quotidiens des articles les plus récents correspondant à vos mots-clés de recherche — avec des résumés techniques, dans votre langue.

Essayer Digest →