← Derniers articles
💻 computer science

SWE-QA: Can Language Models Answer Repository-level Code Questions?

Ce papier présente SWE-QA, une évaluation de réponse aux questions sur le code au niveau d'un dépôt, dérivée de 77 100 problèmes GitHub, qui remédie aux limites des jeux de données existants basés sur des extraits en évaluant les LLM sur des tâches de raisonnement complexes impliquant plusieurs fichiers, grâce à un ensemble curaté de 576 questions et à un cadre agentique associé.

Auteurs originaux : Weihan Peng, Yuling Shi, Yuhang Wang, Xinyun Zhang, Beijun Shen, Xiaodong Gu

Publié 2026-04-28
📖 5 min de lecture🧠 Analyse approfondie

Auteurs originaux : Weihan Peng, Yuling Shi, Yuhang Wang, Xinyun Zhang, Beijun Shen, Xiaodong Gu

Article original sous licence CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Ceci est une explication générée par l'IA de l'article ci-dessous. Elle n'a pas été rédigée ni approuvée par les auteurs. Pour une précision technique, consultez l'article original. Lire la clause de non-responsabilité complète

Imaginez que vous essayez de comprendre le fonctionnement d'une immense bibliothèque de dix étages.

Le Problème : Le Piège du « Extrait »
Jusqu'à présent, la plupart des tests pour les « cerveaux de code » de l'IA ont consisté à leur montrer une seule page isolée d'un livre et à leur demander : « Que signifie cette phrase ? » Bien que l'IA puisse répondre correctement, les logiciels du monde réel ne sont pas des pages uniques. C'est toute la bibliothèque. Pour répondre à une question comme « Pourquoi la porte d'entrée se verrouille-t-elle automatiquement lorsque le soleil se couche ? », il faut traverser le sous-sol, vérifier le câblage dans le grenier et consulter les plans dans le bureau du directeur. Vous devez relier des points dispersés dans de nombreux fichiers différents.

Les tests précédents de l'IA ont échoué parce qu'ils n'ont pas forcé l'IA à effectuer cette « visite de la bibliothèque ». Ils se contentaient de tester si l'IA pouvait lire une seule page.

La Solution : SWE-QA (La Visite de la Bibliothèque)
Les auteurs de cet article ont conçu un nouveau test appelé SWE-QA. Considérez-le comme un examen rigoureux de « visite de bibliothèque » pour l'IA.

  • Le Matériel Source : Ils n'ont pas simplement inventé des questions. Ils se sont rendus dans 15 « bibliothèques » logicielles réelles et populaires (dépôts GitHub) et ont examiné 77 000 vraies questions que les développeurs humains se posaient réellement les uns aux autres.
  • La Taxonomie (La Carte) : Ils ont organisé ces questions dans une carte. Ils se sont demandé : Demandons-nous quoi est ceci ? Pourquoi a-t-il été construit ainsi ? se cache le code ? ou Comment cela fonctionne-t-il ?
  • La Construction : Ils ont créé 720 questions de haute qualité. Pour y répondre, l'IA ne peut pas se contenter de deviner. Elle doit :
    1. Trouver le bon fichier (comme trouver la bonne étagère).
    2. Lire le code dans ce fichier.
    3. Sauter vers un autre fichier pour voir comment ils sont connectés (raisonnement multi-sauts).
    4. Synthétiser une réponse qui explique l'ensemble du système.

L'Expérience : Tester les Bibliothécaires IA
Les chercheurs ont pris six des modèles d'IA les plus intelligents disponibles (comme GPT-5.1, Gemini et d'autres) et leur ont soumis cet examen de « visite de bibliothèque ». Ils les ont testés de trois manières différentes :

  1. Le « Mémorisateur » (Prompting Direct) : Ils ont simplement posé la question à l'IA sans lui donner les livres de la bibliothèque.
    • Résultat : L'IA a échoué lamentablement. C'était comme demander à quelqu'un de décrire une bibliothèque qu'il n'a jamais visitée.
  2. Le « Trouveur d'Index » (RAG) : Ils ont fourni à l'IA un outil pour rechercher les pages pertinentes avant de répondre.
    • Résultat : Beaucoup mieux ! L'IA pouvait trouver les bonnes pages, mais elle manquait parfois les connexions entre elles.
  3. L'« Agent Détective » (Cadres d'Agents) : Ils ont fourni à l'IA un « kit de détective » (outils comme OpenHands) lui permettant de réfléchir, de chercher, de lire, de chercher à nouveau et de relier les points par elle-même.
    • Résultat : C'était le gagnant. L'IA qui agissait comme un détective, explorant activement la base de code, a obtenu les scores les plus élevés (environ 70 sur 100).

Les Résultats : Ce que l'IA peut et ne peut pas faire

  • Les Bonnes Nouvelles : L'IA devient très bonne pour expliquer pourquoi les choses sont construites d'une certaine manière (Raison de conception) ou comment une fonctionnalité spécifique fonctionne, surtout si l'explication est clairement écrite dans les commentaires du code.
  • Les Mauvaises Nouvelles : L'IA continue de peiner avec les questions « Où » (trouver exactement où une variable spécifique est définie à travers 10 fichiers) et les questions complexes « Quoi » qui nécessitent de retracer une longue chaîne de dépendances. C'est comme si l'IA pouvait comprendre l'histoire de la bibliothèque, mais qu'elle se perdait parfois en essayant de trouver la clé spécifique de la porte de derrière.
  • Le Coût : L'approche « Détective » fonctionne le mieux, mais elle est coûteuse. Elle utilise 100 fois plus de puissance de calcul (tokens) que de simples devinettes. C'est la différence entre un coup d'œil rapide et une enquête forensique complète.

La Conclusion
Cet article introduit un nouveau test, plus difficile et plus réaliste pour l'IA. Il montre que, bien que l'IA soit prometteuse pour comprendre les logiciels, elle a encore besoin d'aide pour naviguer dans la nature complexe et interconnectée du code du monde réel. Les meilleurs résultats proviennent d'agents IA capables de « marcher » activement à travers les fichiers de code plutôt que de simplement lire un seul extrait.

En bref : Nous avons créé un test plus difficile pour voir si l'IA peut vraiment comprendre un projet logiciel entier, et non pas seulement un tout petit morceau. L'IA s'améliore, mais elle a encore besoin d'une bonne carte et d'un état d'esprit de détective pour résoudre les énigmes les plus difficiles.

Noyé(e) sous les articles dans votre domaine ?

Recevez des digests quotidiens des articles les plus récents correspondant à vos mots-clés de recherche — avec des résumés techniques, dans votre langue.

Essayer Digest →