← Derniers articles
💻 computer science

RepoZero: Can LLMs Generate a Code Repository from Scratch?

Cet article présente RepoZero, le premier benchmark pour la vérification entièrement automatisée et basée sur l'exécution des LLM générant des dépôts logiciels complets à partir de zéro via des spécifications d'API, ainsi que le cadre Agentic Code-Test Evolution (ACE), révélant que même les agents les plus avancés peinent à atteindre des taux de réussite élevés dans cette tâche complexe.

Auteurs originaux : Zhaoxi Zhang, Yiming Xu, Weikang Li, Jiahui Liang, Yunfang Wu

Publié 2026-05-12
📖 5 min de lecture🧠 Analyse approfondie

Auteurs originaux : Zhaoxi Zhang, Yiming Xu, Weikang Li, Jiahui Liang, Yunfang Wu

Article original sous licence CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Ceci est une explication générée par l'IA de l'article ci-dessous. Elle n'a pas été rédigée ni approuvée par les auteurs. Pour une précision technique, consultez l'article original. Lire la clause de non-responsabilité complète

L'idée principale : L'IA peut-elle construire une maison à partir d'un plan ?

Imaginez que vous avez un assistant robot très intelligent (une IA) qui est excellent pour réparer un robinet qui fuit ou peindre un seul mur. Mais maintenant, vous lui posez une question beaucoup plus difficile : « Peux-tu construire une maison entière à partir de zéro, en utilisant uniquement une liste d'instructions, sans regarder les plans originaux ni la maison terminée ? »

Ce papier, RepoZero, pose exactement cette question, mais au lieu de maisons, il s'agit de dépôts de code logiciel (un ensemble de fichiers qui constituent un programme informatique).

Le problème : Le piège du « Fais semblant jusqu'à ce que ça marche »

Auparavant, les chercheurs essayaient de tester ces robots IA en leur demandant de corriger de petits bugs ou d'écrire des fichiers uniques. Mais lorsqu'il s'agit de construire un programme entier à partir de zéro, il est difficile de savoir si l'IA a réellement compris comment le construire ou si elle a simplement mémorisé la réponse à partir de ses données d'entraînement (comme un élève qui a mémorisé les réponses du manuel scolaire au lieu d'apprendre les mathématiques).

La plupart des tests existants reposent sur des humains ou d'autres IA pour lire le code et dire : « Ça a l'air bien ! ». C'est comme un professeur qui corrige un test de mathématiques en jetant simplement un coup d'œil au résultat final sans vérifier le travail. Il est facile de tricher, et ce n'est pas très fiable.

La solution : Le défi « RepoZero »

Les auteurs ont créé un nouveau test, ultra-exigeant, appelé RepoZero. Voici comment il fonctionne, en utilisant une analogie culinaire :

  1. Le plat original (La source) : Imaginez qu'un chef célèbre possède une recette secrète pour un gâteau complexe. Nous savons exactement comment il a le goût et comment il se comporte.
  2. Le défi : Nous donnons au robot IA une liste d'ingrédients et une description de ce que le gâteau devrait faire (par exemple : « Il doit gonfler lorsqu'il est chauffé », « Il doit avoir un goût sucré »).
  3. La twist (Transfert de langue) : Le robot n'a pas le droit d'utiliser la recette originale. Pire encore, il doit cuisiner le gâteau dans une cuisine complètement différente avec des outils différents.
    • Si le gâteau original a été fait dans une cuisine Python, le robot doit le construire dans une cuisine JavaScript.
    • Si l'original était en C++, le robot doit le construire en Rust.
    • Pourquoi ? Cela empêche le robot de simplement copier la recette. Il force le robot à vraiment comprendre la logique et à la reconstruire à partir de zéro.
  4. Le test du goût (La vérification) : Le robot construit son propre gâteau. Nous goûtons ensuite les deux gâteaux côte à côte. Si le gâteau du robot se comporte exactement de la même manière que l'original (même gonflement, même goût, même texture), il réussit. S'il est légèrement différent, il échoue.

Le framework « ACE » : La boucle d'auto-correction du robot

Le papier introduit également une nouvelle façon pour le robot d'apprendre pendant qu'il travaille, appelée ACE (Agentic Code-Test Evolution).

Pensez-y comme à une séance d'entraînement avant un grand match :

  • Au lieu d'essayer simplement de construire la maison une fois et d'espérer le meilleur, le robot construit une petite partie, puis la teste immédiatement.
  • Si le test échoue (par exemple : « La porte ne s'ouvre pas »), le robot voit l'erreur, répare la porte, et reteste.
  • Il répète ce cycle : Construire -> Tester -> Réparer -> Construire.
  • Le papier a constaté que les robots utilisant cette « boucle d'entraînement » étaient beaucoup plus performants pour construire le produit final que ceux qui essayaient simplement de le construire d'un seul coup.

Que ont-ils découvert ?

Les résultats étaient surprenants et quelque peu déprimants :

  • Même les robots les plus « intelligents » peinent : Les modèles d'IA les plus avancés disponibles aujourd'hui (comme Claude, DeepSeek et Kimi) ne pouvaient construire avec succès la « maison » logicielle complète que dans environ 30 % à 55 % des cas.
  • L'écart est énorme : Bien que ces IA soient incroyables pour écrire des lignes de code uniques, elles sont encore loin de pouvoir construire de manière autonome des systèmes logiciels complexes et fonctionnels à partir de zéro.
  • L'auto-vérification est la clé : Les robots qui utilisaient la boucle « ACE » (testant et réparant leur propre travail) ont nettement mieux performé. Cela suggère que pour que l'IA devienne un véritable ingénieur logiciel, elle doit devenir meilleure pour vérifier son propre travail plutôt que de simplement deviner.

Résumé

RepoZero est une nouvelle salle de sport stricte pour les robots IA. Elle les force à reconstruire des logiciels complexes dans une autre langue pour prouver qu'ils ne trichent pas simplement en mémorisant des réponses. Le test montre que si l'IA s'améliore dans les petites tâches, elle a encore un long chemin à parcourir avant de pouvoir construire indépendamment des projets logiciels entiers. Le papier suggère que la clé pour y parvenir consiste à enseigner à l'IA de tester et de réparer ses propres erreurs au fur et à mesure qu'elle construit.

Noyé(e) sous les articles dans votre domaine ?

Recevez des digests quotidiens des articles les plus récents correspondant à vos mots-clés de recherche — avec des résumés techniques, dans votre langue.

Essayer Digest →