← Derniers articles
💬 NLP

Evaluating Agentic Optimization on Large Codebases

Ce papier présente FormulaCode, un nouveau benchmark évaluant la capacité des agents LLM à optimiser des bases de code réelles à grande échelle selon des critères multi-objectifs, et révèle que cette tâche complexe reste un défi majeur pour les modèles les plus avancés.

Auteurs originaux : Atharva Sehgal, James Hou, Akanksha Sarkar, Ishaan Mantripragada, Swarat Chaudhuri, Jennifer J. Sun, Yisong Yue

Publié 2026-03-18
📖 5 min de lecture🧠 Analyse approfondie

Auteurs originaux : Atharva Sehgal, James Hou, Akanksha Sarkar, Ishaan Mantripragada, Swarat Chaudhuri, Jennifer J. Sun, Yisong Yue

Article original sous licence CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Ceci est une explication générée par l'IA de l'article ci-dessous. Elle n'a pas été rédigée ni approuvée par les auteurs. Pour une précision technique, consultez l'article original. Lire la clause de non-responsabilité complète

🏎️ FORMULACODE : Le Grand Prix de l'Optimisation pour les IA

Imaginez que vous êtes le directeur d'une équipe de Formule 1. Votre objectif n'est pas seulement de construire une voiture rapide, mais d'optimiser l'ensemble du véhicule pour qu'elle gagne la course.

Aujourd'hui, les intelligences artificielles (les "agents" codés par des humains) sont devenues de très bons mécaniciens. Elles savent réparer un moteur, changer une roue ou ajuster un carburateur (ce qu'on appelle l'optimisation de petites fonctions de code).

Mais la vraie question est la suivante : Peut-on confier à une IA la tâche de réorganiser tout le garage, de repenser la suspension, de modifier l'aérodynamisme et de gérer l'équipe entière pour gagner la course ?

C'est exactement ce que le benchmark FORMULACODE vient tester.

1. Le Problème : Les anciens tests étaient trop "bébés"

Jusqu'à présent, pour tester les IA, on leur donnait des exercices scolaires : "Écris une fonction qui additionne deux nombres" ou "Répare ce bug simple". C'est comme demander à un pilote de F1 de faire des tours de manège dans un karting. Ça ne dit pas si le pilote sait gérer une vraie course sur un circuit complexe.

De plus, les anciens tests étaient binaires : soit ça marche, soit ça ne marche pas. Mais en optimisation, ce n'est pas si simple. Parfois, on gagne en vitesse mais on perd en stabilité. Il faut un test qui mesure ces compromis.

2. La Solution : FORMULACODE, le "Circuit Réel"

Les chercheurs ont créé FORMULACODE (inspiré par la Formule 1, d'où le nom). C'est un nouveau terrain de jeu pour les IA.

  • Le Circuit : Au lieu de petits exercices, l'IA doit travailler sur de vrais projets informatiques géants (comme Pandas, Scikit-learn ou SciPy, des outils utilisés par des millions de scientifiques).
  • Les Défis : L'IA reçoit un problème réel : "Cette partie du code est trop lente, elle fait ramer tout le système."
  • Les Juges : Ce n'est pas un simple "vrai/faux". L'IA est jugée sur des centaines de tests de performance différents (comme mesurer la consommation de carburant, la vitesse de pointe, l'usure des pneus) et doit garantir que la voiture ne se brise pas (le code doit rester correct).

3. Comment ça marche ? (L'analogie du Mécanicien IA)

Imaginez que vous donnez à une IA un moteur de voiture qui consomme trop d'essence.

  1. L'IA regarde le moteur : Elle lit des milliers de lignes de code.
  2. Elle propose une modification : "Je vais changer cette pièce pour aller plus vite."
  3. Le test : On lance la voiture sur le circuit avec 264 tests différents (simulant la pluie, la chaleur, des passagers lourds, etc.).
  4. Le verdict :
    • Si la voiture va plus vite sur tous les tests : Victoire !
    • Si elle va plus vite sur un test mais plus lente sur un autre : Compromis.
    • Si elle va plus vite mais que le moteur explose (bug) : Élimination.

4. Les Résultats : L'IA est bonne, mais pas encore championne du monde

Les chercheurs ont fait courir les meilleures IA actuelles (comme GPT-5, Claude, Gemini) sur ce circuit. Voici ce qu'ils ont découvert :

  • Les IA sont de bons mécaniciens locaux : Elles excellent pour optimiser une petite pièce précise (une fonction). C'est comme si elles savaient parfaitement polir un piston.
  • Mais elles perdent le fil global : Elles ont du mal à voir comment changer une pièce affecte tout le reste de la voiture. Elles font parfois des changements qui accélèrent une partie mais ralentissent l'ensemble.
  • L'humain reste le roi : Pour l'instant, les experts humains (les vrais ingénieurs) trouvent encore des solutions plus intelligentes et plus équilibrées que les IA. Les IA sont souvent en retard par rapport aux humains.
  • Le coût : Parfois, utiliser une IA très puissante coûte cher en temps et en argent pour un résultat qui n'est pas toujours meilleur.

5. Pourquoi c'est important ?

Ce papier nous dit deux choses essentielles :

  1. On ne peut pas encore faire confiance aveuglément aux IA pour réécrire tout un logiciel. Elles risquent de casser des choses en essayant d'accélérer.
  2. C'est un excellent outil pour s'améliorer. En mesurant précisément où les IA échouent (comme sur les gros projets complexes), les chercheurs peuvent créer de meilleures IA pour le futur.

En résumé

FORMULACODE, c'est comme un Grand Prix de la performance où l'on ne regarde pas seulement si l'IA a fini la course, mais si elle l'a finie plus vite que l'humain, sans casser la voiture, et en gérant des centaines de contraintes en même temps.

Pour l'instant, les IA sont des pilotes prometteurs qui apprennent encore à conduire sur ce circuit de Formule 1, mais elles n'ont pas encore battu les champions humains. Ce benchmark est la boussole qui va les guider vers la victoire.

Noyé(e) sous les articles dans votre domaine ?

Recevez des digests quotidiens des articles les plus récents correspondant à vos mots-clés de recherche — avec des résumés techniques, dans votre langue.

Essayer Digest →