← Derniers articles
🤖 AI

Analysis of Optimality of Large Language Models on Planning Problems

Cette étude démontre que les grands modèles de langage, grâce à une simulation algorithmique et une mémoire géométrique leur permettant de représenter la topologie des problèmes, surpassent les planificateurs classiques en atteignant une optimalité quasi parfaite sur des tâches de planification complexes comme Blocksworld, même en l'absence d'indices sémantiques.

Auteurs originaux : Bernd Bohnet, Michael C. Mozer, Kevin Swersky, Wil Cunningham, Aaron Parisi, Kathleen Kenealy, Noah Fiedel

Publié 2026-04-06
📖 5 min de lecture🧠 Analyse approfondie

Auteurs originaux : Bernd Bohnet, Michael C. Mozer, Kevin Swersky, Wil Cunningham, Aaron Parisi, Kathleen Kenealy, Noah Fiedel

Article original sous licence CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Ceci est une explication générée par l'IA de l'article ci-dessous. Elle n'a pas été rédigée ni approuvée par les auteurs. Pour une précision technique, consultez l'article original. Lire la clause de non-responsabilité complète

🏗️ Le Défi : Construire des Tours de Lego Parfaites

Imaginez un jeu où vous avez des centaines de blocs de Lego éparpillés sur une table. Votre mission ? Les empiler pour former une tour spécifique, mais avec une règle stricte : vous ne pouvez prendre un bloc que s'il est tout en haut de sa pile actuelle. Si un bloc est caché sous trois autres, vous devez d'abord retirer ces trois-là un par un.

C'est ce qu'on appelle le problème du "Blocksworld" (le monde des blocs). Pendant des années, les ordinateurs classiques (les "anciens architectes") étaient excellents pour cela, mais ils avaient un gros défaut : dès que le nombre de blocs augmentait, ils se perdaient dans un labyrinthe de possibilités et s'arrêtaient, épuisés.

🤖 Le Nouveau Héros : L'IA qui "Pense" avant d'Agir

Les chercheurs de Google DeepMind ont voulu tester les nouvelles intelligences artificielles (les LLM, comme Gemini 3.0) sur ce jeu. Ils ne voulaient pas juste savoir si l'IA réussissait, mais comment elle y arrivait. Est-ce qu'elle devine au hasard ? Est-ce qu'elle utilise une astuce ? Ou est-ce qu'elle fait vraiment du calcul ?

Pour le savoir, ils ont créé deux types de défis :

  1. Le défi classique : Des tours de Lego avec des noms comme "brique rouge", "brique bleue".
  2. Le défi abstrait : Ils ont caché les noms de Lego et ont transformé le problème en un pur jeu de graphes (des points reliés par des lignes), comme si on parlait d'un code secret sans aucun sens physique.

🔍 Les Découvertes Surprenantes

Voici ce qu'ils ont découvert, en utilisant des analogies simples :

1. Les Anciens Architectes vs. Les Nouveaux Architectes

  • Les anciens (LAMA) : Imaginez un architecte qui essaie de construire une tour en essayant toutes les combinaisons possibles de blocs. Dès que la tour devient un peu haute ou qu'il y a trop de tours à faire, son cerveau explose. Il s'arrête ou fait des erreurs grossières. C'est comme essayer de compter toutes les étoiles du ciel avec un stylo : trop long, trop compliqué.
  • Les nouveaux (Gemini 3.0) : Ces IA ne comptent pas tout. Elles semblent avoir une mémoire géométrique. Elles "voient" la structure globale du problème. Même quand on leur enlève les indices (comme le mot "Lego" ou "gravité") et qu'on leur donne un code abstrait, elles réussissent à construire la tour parfaite, même avec des centaines de blocs.

2. Le Secret : La "Simulation Algorithmique"

Comment font-elles ? Les chercheurs ont regardé les "pensées" de l'IA (les tokens de réflexion).

  • L'analogie du détective : Au lieu de deviner, l'IA agit comme un détective très méthodique. Elle dit : "Pour avoir le bloc B, je dois d'abord enlever A, qui est sur C, qui est sur D...". Elle trace le chemin à l'envers, bloc par bloc, dans sa tête, avant de donner la solution.
  • Le coût de la pensée : Ce qui est fascinant, c'est que le temps de réflexion de l'IA augmente exactement en ligne droite avec la difficulté. Si la tour est deux fois plus haute, elle réfléchit deux fois plus longtemps. C'est comme si elle exécutait un programme informatique parfait à l'intérieur de sa propre tête, pas à pas.

3. Le Mur de la "Zone d'Incertitude"

Il y a une limite. Quand les tours deviennent extrêmement complexes (des milliers de blocs), l'IA ne commence pas à faire des plans imparfaits. Non, elle bascule brutalement : soit elle réussit parfaitement, soit elle échoue complètement.

  • L'image : Imaginez un nageur qui traverse un océan. Tant qu'il a de l'oxygène, il nage parfaitement. Quand l'oxygène est fini, il ne nage pas "moins bien", il s'arrête net. L'IA a une "mémoire de travail" limitée. Tant qu'elle peut tout garder en tête, elle est un génie. Dès que c'est trop, elle s'effondre.

🌟 Pourquoi c'est important ?

Cette étude change notre vision de l'IA.

  • Avant, on pensait que les IA ne faisaient que "recopier" des réponses qu'elles avaient vues dans leur entraînement.
  • Maintenant, on voit qu'elles peuvent raisonner sur des structures abstraites qu'elles n'ont jamais vues, en simulant des étapes logiques. Elles ne sont pas juste des bibliothèques de connaissances, elles sont devenues des simulateurs de logique.

Même si elles ne sont pas parfaites (elles ont une limite de mémoire), elles surpassent les meilleurs algorithmes mathématiques classiques pour résoudre des problèmes de planification complexes, à condition qu'elles aient le temps de "réfléchir" (les tokens de pensée).

En résumé

C'est comme si on avait donné à un enfant un jeu de Lego géant. Au lieu de se perdre en essayant de tout assembler au hasard, il a appris à visualiser la tour finale, à déconstruire le chemin étape par étape dans sa tête, et à exécuter le plan avec une précision chirurgicale, même si le jeu est présenté sous forme de code secret. C'est une preuve que l'IA commence à vraiment "comprendre" la logique, pas juste à deviner.

Noyé(e) sous les articles dans votre domaine ?

Recevez des digests quotidiens des articles les plus récents correspondant à vos mots-clés de recherche — avec des résumés techniques, dans votre langue.

Essayer Digest →