← Derniers articles
💻 computer science

SWE-Together: Evaluating Coding Agents in Interactive User Sessions

Ce document présente SWE-Together, un benchmark multi-tours dérivé de sessions de codage réelles entre utilisateurs et agents, qui utilise un simulateur d'utilisateur réactif basé sur un LLM pour évaluer les agents de codage à la fois sur la correction finale du dépôt et sur le nombre de tours de rétroaction corrective nécessaires, révélant que les agents les plus performants atteignent des taux de réussite plus élevés avec moins d'interventions.

Auteurs originaux : Yifan Wu, Zhuokai Zhao, Songlin Li, Ho Hin Lee, Jiacheng Zhu, Shirley Wu, Tianhe Yu, Serena Li, Lizhu Zhang, Xiangjun Fan, Shengzhi Li

Publié 2026-06-30
📖 5 min de lecture🧠 Analyse approfondie

Auteurs originaux : Yifan Wu, Zhuokai Zhao, Songlin Li, Ho Hin Lee, Jiacheng Zhu, Shirley Wu, Tianhe Yu, Serena Li, Lizhu Zhang, Xiangjun Fan, Shengzhi Li

Article original sous licence CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Ceci est une explication générée par l'IA de l'article ci-dessous. Elle n'a pas été rédigée ni approuvée par les auteurs. Pour une précision technique, consultez l'article original. Lire la clause de non-responsabilité complète

Imaginez que vous recrutiez un nouvel ingénieur logiciel. Par le passé, pour le tester, vous lui remettiez un manuel d'instructions de 10 pages parfaitement rédigé et lui disiez : « Réalisez cette fonctionnalité. » Vous attendiez qu'il finisse, regardiez le code final et lui donniez une note. Si le code fonctionnait, il obtenait un A. S'il ne fonctionnait pas, il obtenait un F.

Le Problème : La vraie vie n'est pas comme ça. Dans un vrai travail, vous n'avez pas un manuel parfait. Vous partez d'une idée vague, l'ingénieur construit quelque chose, vous réalisez que vous avez oublié un détail crucial, vous corrigez une erreur qu'il a commise, et vous clarifiez votre objectif à mi-parcours. Les anciens tests ne mesuraient pas la capacité de l'ingénieur à gérer cette conversation désordonnée et interactive. Ils ne mesuraient que le produit final, ignorant tout le travail d'accompagnement dont l'ingénieur avait besoin pour y parvenir.

La Solution : SWE-Together
Les auteurs de ce document ont créé un nouveau terrain d'essai appelé SWE-Together. Voyez cela comme un « jeu vidéo rejouable » pour les agents de codage (les programmeurs IA).

Voici comment cela fonctionne, décomposé en parties simples :

1. La matière première : Des images de la vraie vie

Au lieu d'inventer de fausses questions de test, les chercheurs sont allés pêcher dans le monde réel. Ils ont examiné 11 260 conversations réelles entre des humains et des assistants de codage IA. À partir de cet énorme tas, ils ont soigneusement sélectionné 109 tâches spécifiques qui étaient parfaites pour un test.

  • Le Filtre : Ils ont jeté les conversations trop désordonnées, celles qui n'avaient pas d'objectif clair ou qui ne pouvaient pas être reproduites. Ils n'ont gardé que celles où l'humain avait un objectif clair, où l'IA effectuait un travail réel et où le résultat pouvait être vérifié.

2. Le simulateur de « Robot Utilisateur »

C'est la partie la plus ingénieuse. Pour tester une nouvelle IA, ils ne peuvent pas simplement rejouer les messages de l'ancien humain, car la nouvelle IA pourrait prendre un chemin différent. Si la nouvelle IA commet une erreur différente, le message suivant de l'ancien humain pourrait ne plus avoir de sens.

Ils ont donc construit un Robot Utilisateur Intelligent.

  • Comment ça marche : Imaginez un metteur en scène regardant une pièce de théâtre. Le metteur en scène sait exactement ce que l'humain original voulait accomplir. Pendant que le nouvel acteur IA joue sa scène, le Robot Utilisateur regarde. Si l'IA s'égare ou manque un point que l'humain original aurait remarqué, le Robot Utilisateur intervient et dit : « Attendez, je voulais dire X », ou « Vous avez oublié Y ».
  • Le But : Le Robot Utilisateur agit exactement comme l'humain original l'aurait fait, mais il adapte son timing à la performance de la nouvelle IA. Cela garantit que chaque IA est testée contre le même « intention », même si elles empruntent des routes différentes.

3. Le nouveau bulletin de notes

Dans les anciens tests, vous n'aviez qu'un seul score : Est-ce que le code fonctionne ?
Dans SWE-Together, ils utilisent un bulletin en deux parties :

  • Partie A : La Note Finale (Exactitude) : L'IA a-t-elle fini par construire ce qui était demandé ?
  • Partie B : Le score de « l'accompagnement » (Correction de l'utilisateur) : C'est la grande innovation. Ils comptent combien de fois le Robot Utilisateur a dû corriger l'IA.
    • Analogie : Imaginez deux élèves passant un examen de mathématiques. Tous deux obtiennent la bonne réponse.
      • L'élève A a trouvé la solution par lui-même.
      • L'élève B a obtenu la bonne réponse, mais seulement après que le professeur a dû le guider trois fois et corriger une erreur majeure.
    • Dans SWE-Together, l'élève A obtient une meilleure note parce qu'il a nécessité moins d'interventions. Le document appelle cela la « Correction de l'Utilisateur ».

Ce qu'ils ont trouvé

Les chercheurs ont testé sept des modèles d'IA les plus intelligents disponibles. Voici ce qui s'est passé :

  1. Une IA plus intelligente nécessite moins d'aide : Il y avait un schéma clair. Les modèles d'IA les plus « intelligents » (comme Claude Opus 4.8) obtenaient des scores finaux plus élevés et nécessitaient moins de corrections de la part du Robot Utilisateur. Les modèles les plus « faibles » obtenaient des scores plus bas et avaient besoin que le Robot Utilisateur les pousse ou les corrige constamment.
  2. Le Robot Utilisateur est convaincant : Ils ont testé si des humains pouvaient faire la différence entre le Robot Utilisateur et un véritable humain. Ils ne le pouvaient pas. La simulation était si bonne que les humains ne pouvaient pas les distinguer de manière fiable.
  3. Efficacité : Certains modèles étaient plus rapides et utilisaient moins de « tokens » (mots/puissance de calcul) pour accomplir la tâche, tandis que d'autres étaient plus lents mais plus précis.

L'essentiel

Le document soutient que nous devons cesser de tester les codeurs IA comme s'ils passaient un examen écrit avec un corrigé parfait. Nous devons les tester comme s'ils travaillaient dans un vrai bureau.

SWE-Together prouve que les meilleurs agents de codage ne sont pas seulement ceux qui finissent par corriger le code ; ce sont ceux qui savent écouter, comprendre des instructions vagues et corriger leurs propres erreurs sans avoir besoin qu'un humain intervienne constamment pour dire : « Non, ce n'est pas ce que je voulais dire. »

En bref : C'est un benchmark qui récompense l'IA pour être un bon collaborateur, et pas seulement un bon générateur de code.

Noyé(e) sous les articles dans votre domaine ?

Recevez des digests quotidiens des articles les plus récents correspondant à vos mots-clés de recherche — avec des résumés techniques, dans votre langue.

Essayer Digest →