← Derniers articles
💬 NLP

SlopCodeBench: Benchmarking How Coding Agents Degrade Over Long-Horizon Iterative Tasks

Le benchmark SlopCodeBench révèle que les agents de codage actuels échouent systématiquement à maintenir la qualité du code sur des tâches itératives de longue durée, entraînant une dégradation progressive de la structure et une augmentation de la redondance, contrairement au code humain qui reste stable.

Auteurs originaux : Gabriel Orlanski, Devjeet Roy, Alexander Yun, Changho Shin, Alex Gu, Albert Ge, Dyah Adila, Frederic Sala, Aws Albarghouthi

Publié 2026-03-27
📖 5 min de lecture🧠 Analyse approfondie

Auteurs originaux : Gabriel Orlanski, Devjeet Roy, Alexander Yun, Changho Shin, Alex Gu, Albert Ge, Dyah Adila, Frederic Sala, Aws Albarghouthi

Article original sous licence CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Ceci est une explication générée par l'IA de l'article ci-dessous. Elle n'a pas été rédigée ni approuvée par les auteurs. Pour une précision technique, consultez l'article original. Lire la clause de non-responsabilité complète

🚗 Le Grand Défi : Pourquoi les voitures autonomes s'usent-elles si vite ?

Imaginez que vous engagez un architecte robot (une IA) pour construire une maison.

  • Le test habituel : On lui donne un plan pour une petite cabane. Il la construit, on vérifie qu'elle tient debout, et on dit : « Bravo, il est excellent ! ».
  • La réalité du SlopCodeBench : On lui demande de construire cette cabane, puis d'y ajouter une cuisine, ensuite une deuxième étage, puis un sous-sol, et enfin un toit en verre. À chaque étape, il doit modifier sa propre construction précédente.

Ce que les chercheurs ont découvert, c'est que si l'IA est très douée pour construire la première cabane, elle devient rapidement incompétente quand il faut l'agrandir. Au lieu d'ajouter des pièces propres, elle commence à coller du scotch, à empiler des briques n'importe où et à créer un désordre immense.

C'est ce qu'ils appellent le "Slop" (un mot anglais pour désigner de la nourriture molle et sans goût, ou ici, du code de mauvaise qualité, brouillon et inutile).


🧪 L'Expérience : Le "Banc d'Essai de la Saleté"

Les chercheurs ont créé un nouveau test, SlopCodeBench, pour mesurer exactement ce phénomène.

  1. Le scénario : Ils ont donné à 11 IA différentes (les plus intelligentes du moment) 20 problèmes de programmation.
  2. La règle du jeu : L'IA doit écrire le code pour la première étape. Ensuite, on lui donne une nouvelle exigence (ex: "Ajoute la possibilité de lire des fichiers en japonais"). Elle doit modifier son propre code pour intégrer ça, sans effacer ce qu'elle a déjà fait.
  3. Le résultat choc : Aucune IA n'a réussi à finir un seul projet du début à la fin sans faire d'erreurs. Plus elles avançaient, plus leur code devenait mauvais.

📉 Les Deux Monstres qui Détruisent le Code

Pour mesurer la "saleté" accumulée, les chercheurs ont inventé deux jaugeurs :

1. La Verbosité (Le "Bavardage inutile")

Imaginez que vous écrivez une lettre.

  • Code humain propre : "Je viens d'arriver."
  • Code IA "Slop" : "Je suis en train de venir d'arriver, et je suis en train d'arriver, et je suis arrivé, et voici mon arrivée."

L'IA a tendance à répéter les mêmes choses, à créer des variables inutiles et à écrire des lignes de code qui ne servent à rien. C'est comme remplir un livre avec du remplissage pour faire plus gros.

  • Résultat : Le code des IA est 2,2 fois plus bavard que celui des humains.

2. L'Érosion Structurelle (La "Tour de Pise")

Imaginez que vous construisez une tour.

  • Code humain : Chaque étage a ses propres piliers. Si vous voulez ajouter un étage, vous ajoutez des piliers solides.
  • Code IA "Slop" : À chaque fois qu'on demande un changement, l'IA ajoute une nouvelle brique directement sur la brique du bas, sans renforcer la structure.

Au bout de quelques étages, tout le poids de la tour repose sur un seul pilier central qui est en train de s'effondrer sous le poids. C'est ce qu'on appelle l'érosion. Le code devient si complexe et si "collé" dans une seule fonction qu'il est impossible de le modifier sans tout faire s'écrouler.

  • Résultat : Dans 80 % des cas, le code des IA devient de plus en plus fragile à chaque étape.

🆚 IA vs Humains : Qui gagne ?

Les chercheurs ont comparé le code des IA avec celui de vrais développeurs humains travaillant sur de grands projets (comme Django ou Scikit-learn).

  • Les humains : Quand ils ajoutent une fonctionnalité, ils nettoient souvent un peu derrière eux. Leur code reste stable dans le temps.
  • Les IA : À chaque nouvelle étape, leur code se dégrade. C'est comme si un enfant qui dessine sur un tableau : au début, c'est joli. Mais s'il doit ajouter des dessins chaque jour sans jamais effacer, le tableau devient une tache noire illisible.

🛠️ Peut-on réparer ça avec de bons conseils ?

Les chercheurs ont essayé de "pousser" les IA avec des instructions spéciales (des prompts) du type : "Sois élégant, ne répète rien, pense avant d'écrire".

  • Le résultat : Ça aide un tout petit peu au début. Le premier dessin est plus propre.
  • Mais : Dès que l'IA doit ajouter la deuxième étape, elle retombe dans ses vieux travers. Les conseils ne suffisent pas à changer l'habitude de construire des tours de Pise instables.

💡 La Conclusion en une phrase

Les tests actuels qui disent "Cette IA est géniale" ne mesurent que si elle peut faire un seul travail. Mais dans la vraie vie, le code doit évoluer. Aujourd'hui, les IA sont d'excellents débutants, mais elles sont de très mauvais architectes pour le long terme. Elles construisent des maisons qui s'effondrent dès qu'on essaie d'y ajouter une fenêtre.

Le message est clair : nous ne pouvons pas encore faire confiance à ces robots pour gérer des projets de logiciels complexes qui durent des années, car ils accumulent trop de "Slop" (de la saleté technique) à chaque étape.

Noyé(e) sous les articles dans votre domaine ?

Recevez des digests quotidiens des articles les plus récents correspondant à vos mots-clés de recherche — avec des résumés techniques, dans votre langue.

Essayer Digest →