← Derniers articles
🤖 AI

A complementary study on PlanGPT: Evaluation with defined Performance Metrics and comparison with a planner

Cet article présente une évaluation complémentaire du grand modèle de langage PlanGPT à l'aide de mesures de performance définies, révélant qu'il n'offre aucun avantage par rapport aux planificateurs traditionnels et ne performe pas mieux qu'une simple stratégie de recherche gloutonne.

Auteurs originaux : Youssef Abdelkader, Humbert Fiorino, Damien Pellier

Publié 2026-06-10
📖 5 min de lecture🧠 Analyse approfondie

Auteurs originaux : Youssef Abdelkader, Humbert Fiorino, Damien Pellier

Article original sous licence CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Ceci est une explication générée par l'IA de l'article ci-dessous. Elle n'a pas été rédigée ni approuvée par les auteurs. Pour une précision technique, consultez l'article original. Lire la clause de non-responsabilité complète

Imaginez que vous essayez de faire en sorte qu'un robot nettoie une pièce en désordre. Vous avez une liste de règles (comme « ramasser la chaussette », « mettre la chaussette dans le panier »), une image de départ de la pièce et une image d'objectif d'une pièce propre. Le robot doit trouver la séquence exacte d'étapes pour passer de l'état de désordre à l'état de propreté.

Dans le monde de l'intelligence artificielle, cela s'appelle la planification automatisée. Habituellement, nous utilisons des programmes informatiques spéciaux, hautement logiques, appelés Planificateurs pour résoudre ces énigmes. Ils sont comme des joueurs d'échecs de génie qui calculent chaque coup possible pour trouver le chemin parfait.

Récemment, un nouveau type d'IA appelé PlanGPT a été introduit. Considérez PlanGPT non pas comme une machine logique, mais comme un écrivain super créatif (un grand modèle de langage) qui a été entraîné à « écrire » ces instructions étape par étape plutôt qu'à les calculer. La grande question était : Est-ce que cet écrivain créatif peut réellement faire le travail d'une machine logique de génie, ou est-ce qu'il ne fait que deviner ?

Ce document est une « étude complémentaire », ce qui signifie que les auteurs ont décidé de revérifier le travail de PlanGPT parce que le rapport original ne racontait pas toute l'histoire.

L'expérience : Une course à trois coureurs

Pour voir si PlanGPT est performant, les auteurs ont organisé une course avec trois coureurs sur une piste de 7 différentes « pièces » (domaines) allant de l'empilement de blocs au déplacement de camions :

  1. PlanGPT (L'écrivain créatif) : La nouvelle IA qui essaie de deviner le plan basé sur les modèles qu'elle a appris.
  2. A (Le perfectionniste) :* Un planificateur traditionnel qui prend son temps pour trouver le chemin absolu le plus court et le meilleur, mais qui se retrouve parfois bloqué si la pièce est trop en désordre.
  3. Greedy (Le sprinteur) : Un planificateur traditionnel qui saisit le premier chemin valide qu'il voit. Ce n'est pas toujours le meilleur chemin, mais il est incroyablement rapide.

Les auteurs ont mesuré deux choses :

  • Coût du plan : Combien d'étapes le robot a-t-il dû effectuer ? (Moins d'étapes = meilleur).
  • Temps de planification : Combien de temps l'ordinateur a-t-il mis pour concevoir le plan ?

Les résultats : L'écrivain contre le sprinteur

Voici ce que les auteurs ont trouvé, en utilisant des analogies simples :

  • Le chemin « parfait » : PlanGPT a parfois été capable de trouver un chemin aussi bon que le Perfectionniste (A*), mais souvent, il ne l'était pas.
  • Le test de vitesse : Le Sprinteur (Greedy) était presque toujours le plus rapide pour concevoir un plan. PlanGPT était parfois plus rapide que le Perfectionniste, mais souvent plus lent que le Sprinteur.
  • La grande surprise : Lorsqu'ils ont regardé le score global, PlanGPT n'a pas été plus performant que le Sprinteur (Greedy). Dans de nombreux cas, le Sprinteur était en fait meilleur pour trouver de bons plans courts.

Le problème du « Un modèle pour tous, mais adapté à personne » :
Les auteurs ont souligné une faille majeure dans la conception de PlanGPT. Pour fonctionner, PlanGPT a besoin d'un « cerveau » (modèle) différent pour chaque type de pièce.

  • Si vous voulez empiler des blocs, vous avez besoin du Modèle A.
  • Si vous voulez déplacer des camions, vous avez besoin du Modèle B.
  • Si vous voulez faire voler des satellites, vous avez besoin du Modèle C.

C'est comme embaucher un spécialiste différent pour chaque tâche ménagère de votre maison. Une personne est excellente pour cuisiner, une autre pour le ménage, mais vous devez embaucher 8 personnes différentes pour 8 tâches différentes. Cela utilise une énorme quantité de puissance informatique (ressources). Les auteurs se sont demandé : Vaut-il la peine d'embaucher toute une équipe de spécialistes coûteux juste pour faire le même travail qu'un seul « Sprinteur » rapide ?

La conclusion

Le document conclut que, bien que PlanGPT soit une expérience intéressante, il n'est pas actuellement un planificateur « compétent ».

  • Il ne trouve pas systématiquement de meilleurs plans que les méthodes simples et rapides.
  • Il nécessite une quantité massive de ressources (8 modèles différents, beaucoup de puissance de calcul).
  • Il ne peut pas gérer des problèmes complexes qui nécessitent plus d'objets que ceux pour lesquels il a été entraîné.

Les auteurs suggèrent que les grands modèles de langage (comme PlanGPT) ne sont peut-être pas les bons outils pour ce travail spécifique. Ils pourraient être mieux adaptés pour écrire des histoires ou discuter, tandis que les programmes logiques traditionnels restent le meilleur choix pour la planification. Ils laissent entendre qu'un autre type d'IA, conçu pour le « raisonnement » plutôt que pour la simple « prédiction de mots », pourrait être l'avenir, mais pour l'instant, l'écrivain créatif n'a pas battu la machine logique.

Noyé(e) sous les articles dans votre domaine ?

Recevez des digests quotidiens des articles les plus récents correspondant à vos mots-clés de recherche — avec des résumés techniques, dans votre langue.

Essayer Digest →