← Derniers articles
🤖 AI

Can Vibe Coding Beat Graduate CS Students? An LLM vs. Human Coding Tournament on Market-driven Strategic Planning

Cet article présente un benchmark basé sur un tournoi évaluant les grands modèles de langage face à des étudiants de niveau master sur un problème complexe de logistique pilotée par le marché, révélant que les agents codés par l'humain surpassent significativement les solutions générées par les LLM, la plupart des agents LLM échouant à dépasser de simples bases de référence et dégradant même les stratégies humaines optimales lorsqu'ils sont sollicités pour les améliorer.

Auteurs originaux : Panayiotis Danassis, Naman Goel

Publié 2026-06-05
📖 5 min de lecture🧠 Analyse approfondie

Auteurs originaux : Panayiotis Danassis, Naman Goel

Article original sous licence CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Ceci est une explication générée par l'IA de l'article ci-dessous. Elle n'a pas été rédigée ni approuvée par les auteurs. Pour une précision technique, consultez l'article original. Lire la clause de non-responsabilité complète

La Grande Question : Le « Vibe Coding » peut-il battre un étudiant de master ?

Imaginez que vous avez un assistant robotique super intelligent (un grand modèle de langage, ou LLM) capable d'écrire du code simplement en lui parlant. Vous dites : « Construis-moi une application de livraison », et il tape le code en quelques secondes. C'est ce qu'on appelle le « Vibe Coding ».

La grande question posée par ce document est la suivante : Ce robot est-il réellement assez intelligent pour résoudre des problèmes commerciaux réels, complexes et à enjeux élevés, ou est-il simplement doué pour écrire du code qui semble correct mais qui échoue dès que les choses se compliquent ?

Pour le découvrir, les chercheurs ont mis en place un tournoi de codage géant.

L'Arène : Le jeu « Enchères, Ramassage et Livraison »

Au lieu de demander aux robots de résoudre de simples problèmes mathématiques (comme « combien font 2+2 ? »), ils les ont placés dans une simulation complexe appelée Problème d'Enchères, de Ramassage et de Livraison (APDP).

Considérez cela comme une partie de Échecs Logistiques à enjeux élevés :

  1. L'Enchère : Plusieurs entreprises (agents) misent sur des contrats de livraison. Les contrats sont vendus un par un. Vous devez deviner combien miser. Si vous misez trop haut, vous persez de l'argent. Si vous misez trop bas, vous pourriez gagner le contrat mais perdre de l'argent sur la livraison. Vous devez deviner ce que feront vos concurrents.
  2. La Planification : Une fois le contrat remporté, vous devez déterminer le meilleur itinéraire pour que vos camions ramassent et livrent les colis. Vous avez un espace limité dans les camions et vous ne pouvez pas enfreindre les règles.
  3. Le But : Le gagnant est l'entreprise qui réalise le plus de profits (Argent gagné des enchères moins le coût de la conduite).

Il ne s'agit pas seulement d'écrire du code qui ne plante pas ; il s'agit d'écrire du code qui réfléchit de manière stratégique, prédit l'avenir et surclasse ses adversaires.

Les Contestants

Les chercheurs ont opposé deux équipes :

  • L'Équipe Humaine : 17 agents écrits par des étudiants de master d'une université (EPFL) avant l'existence des outils de codage par IA. Ces étudiants ont passé des semaines à réfléchir, planifier et coder à la main.
  • L'Équipe IA : 40 agents écrits par les modèles d'IA les plus avancés au monde (comme GPT-5, Claude, Gemini) en utilisant le « Vide Coding ». Les chercheurs ont donné à l'IA exactement les mêmes instructions que celles reçues par les étudiants.

Les Résultats : Les Humains Gagnent, Haut la Main

Les résultats ont été surprenants et clairs :

  1. Le Top 5 est Humain : Dans chaque tournoi, les cinq premières places ont été prises par les étudiants humains. Les agents d'IA n'ont pas réussi à intégrer le top 5.
  2. L'IA face à la référence « évidente » : Les chercheurs ont créé un agent d'IA très simple et peu intelligent (basé essentiellement sur des suppositions aléatoires). 33 des 40 agents d'IA ont perdu contre cet agent simple. L'IA était si mauvaise en stratégie qu'une calculatrice de base l'a battue.
  3. Le désastre de l'« Amélioration » : Dans un test final, les chercheurs ont pris le code gagnant des humains et ont demandé à la meilleure IA d'« l'améliorer ». L'IA a tenté de modifier le code, mais au lieu de l'améliorer, elle l'a rendu pire. La version améliorée est passée de la 1ère à la 10ème place.

Pourquoi l'IA a-t-elle échoué ?

Le document explique que si l'IA est excellente en syntaxe (écrire du code sans fautes d'orthographe), elle peine avec le raisonnement (comprendre le « pourquoi » et le « comment » de stratégies complexes).

  • L'échec de l'« Heuristique Admissible » : Dans un test plus simple, l'IA devait utiliser une astuce mathématique spécifique (recherche A*) pour trouver le meilleur chemin. L'IA oubliait systématiquement la règle la plus basique de cette astuce, même lorsque les chercheurs le lui indiquaient explicitement. C'est comme demander à un chef de cuisiner un gâteau, mais qu'il oublie que les œufs sont un ingrédient essentiel, même après avoir été prévenu.
  • Le bug du « Temps de réflexion » : Les agents d'IA restaient souvent bloqués dans des boucles ou mettaient trop de temps à réfléchir, ce qui leur faisait perdre l'enchère car ils manquaient de temps. Le code humain ne faisait pas cela.
  • Manque de stratégie : Les agents d'IA misaient souvent aveuglément ou planifiaient des itinéraires qui gaspillaient du carburant. Ils ne savaient pas « lire la salle » ni prédire les actions de leurs concurrents.

L'Essentiel

Le document conclut que les LLM ne sont pas encore des « Codeurs de niveau Master ».

Ils sont excellents pour écrire du code qui fonctionne (pas d'erreurs de syntaxe), mais ils sont actuellement incapables d'écrire du code qui peut concurrencer des scénarios réels et complexes nécessitant une planification à long terme et de la stratégie.

L'Analogie :
Imaginez un robot capable d'écrire une recette parfaite pour un gâteau. Il sait exactement combien de tasses de farine utiliser. Mais si vous lui demandez de gérer une boulangerie dans une ville où les prix changent chaque minute, où les concurrents essaient de voler vos clients et où vous avez un budget limité, le robot fera probablement faillite. Il peut écrire la recette, mais il ne peut pas gérer l'entreprise.

Les chercheurs affirment qu'il est temps de cesser de simplement vérifier si le code « fonctionne » (passe un test) et de commencer à vérifier si le code peut réellement gagner dans le monde réel.

Noyé(e) sous les articles dans votre domaine ?

Recevez des digests quotidiens des articles les plus récents correspondant à vos mots-clés de recherche — avec des résumés techniques, dans votre langue.

Essayer Digest →