← Derniers articles
🤖 AI

Multi-LCB: Extending LiveCodeBench to Multiple Programming Languages

Cet article introduit Multi-LCB, un benchmark sensible à la contamination qui étend l'ensemble de données LiveCodeBench à douze langages de programmation en transformant des tâches Python, permettant ainsi une évaluation rigoureuse des capacités de génération de code multi-langages des grands modèles de langage et révélant des disparités de performance significatives ainsi qu'un surapprentissage sur Python.

Auteurs originaux : Maria Ivanova, Pavel Zadorozhny, Rodion Levichev, Ivan Petrov, Adamenko Pavel, Ivan Lopatin, Alexey Kutalev, Dmitrii Babaev

Publié 2026-06-19
📖 5 min de lecture🧠 Analyse approfondie

Auteurs originaux : Maria Ivanova, Pavel Zadorozhny, Rodion Levichev, Ivan Petrov, Adamenko Pavel, Ivan Lopatin, Alexey Kutalev, Dmitrii Babaev

Article original sous licence CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Ceci est une explication générée par l'IA de l'article ci-dessous. Elle n'a pas été rédigée ni approuvée par les auteurs. Pour une précision technique, consultez l'article original. Lire la clause de non-responsabilité complète

Imaginez que vous ayez un robot assistant très intelligent qui a appris à cuisiner en lisant des millions de recettes. Mais voici le hic : 99 % de ces recettes étaient des pâtes italiennes.

Lorsque vous demandez à ce robot de préparer une spaghetti carbonara parfaite, c'est un génie. Il réussit presque à chaque fois. Mais si vous lui demandez de faire un maki, un taco ou un curry, il commence soudainement à avoir du mal. Il pourrait essayer de mettre de la sauce bolognaise sur le poisson ou d'utiliser une fourchette au lieu de baguettes.

C'est exactement le problème que les chercheurs de Multi-LCB ont découvert avec les assistants de codage IA les plus avancés d'aujourd'hui.

Le Problème : Le biais de la « Pâte Italienne »

Pendant un certain temps, la référence pour tester ces codeurs IA était un benchmark appelé LiveCodeBench (LCB). Considérez LCB comme une immense bibliothèque de casse-têtes de codage, constamment mise à jour. C'est un excellent outil car il ajoute de nouveaux casse-têtes que l'IA n'a pas encore vus, afin de savoir si l'IA ne triche pas simplement en mémorisant les réponses.

Cependant, il y avait une faille majeure : LiveCodeBench ne testait l'IA qu'en Python. Python est comme la « pâte italienne » du monde de la programmation : c'est populaire et facile. Mais dans le monde réel, les ingénieurs logiciels ne font pas que cuisiner des pâtes ; ils cuisinent de tout. Ils ont besoin du C++ pour les systèmes à haute vitesse, du Java pour les grandes applications d'entreprise et du JavaScript pour les sites web.

La grande question était : L'IA est-elle réellement intelligente en codage, ou est-elle simplement très douée en Python ?

La Solution : Multi-LCB (Le « Buffet International »)

Les auteurs ont créé Multi-LCB, ce qui revient à prendre cette même bibliothèque de casse-têtes de codage et à les traduire en 12 langues différentes (incluant le Python, le C++, le Java, le Rust, le Go et d'autres).

Ils n'ont pas seulement demandé à l'IA de « traduire » le code. Au lieu de cela, ils ont pris le casse-tête original (par exemple, « Calculez la somme de ces nombres ») et ont réécrit les instructions pour que l'IA doive le résoudre en utilisant les règles du C++, puis du Java, puis du Rust, et ainsi de suite.

Comment ça marche (L'analogie de la cuisine) :

  1. La Recette : Ils prennent un casse-tête provenant d'une compétition de codage (comme un problème mathématique).
  2. La Traduction : Ils convertissent les « cas de test » (la façon dont on vérifie si la réponse est correcte) dans un format universel. Imaginez changer une recette qui dit « ajoutez 2 tasses de farine » en un format qui fonctionne que vous utilisiez une tasse, une balance de précision ou une cuillère. Cela garantit que l'IA est testée sur la logique, et non sur sa capacité à deviner le bon format.
  3. Le Test : L'IA tente de résoudre le même casse-tête dans 12 langages différents.
  4. Le Verdict : Ils vérifient si le code s'exécute réellement et résout le problème sans planter.

Ce qu'ils ont trouvé (Les résultats du test de dégustation)

Les chercheurs ont testé 24 modèles d'IA différents. Voici ce que le « test de dégustation » a révélé :

  • Le Surapprentissage de la « Pâte » : De nombreux modèles qui étaient des champions en Python sont soudainement devenus moyens ou médiocres dans d'autres langages. C'est comme un chef qui peut faire une lasagne parfaite mais qui brûle ses toasts. Cela prouve qu'être bon en Python ne signifie pas automatiquement qu'une IA est bonne en codage en général.
  • La Fuite de l'« Ingrédient Secret » : Certains modèles ont obtenu des résultats suspectement bons sur des casse-têtes plus anciens dans des langages spécifiques. Cela suggère que ces modèles ont pu accidentellement « mémoriser » les réponses de leurs données d'entraînement (comme un élève qui mémorise le corrigé de l'examen) plutôt que d'apprendre réellement comment résoudre le problème.
  • L'Écart de Difficulté : L'IA a trouvé certains langages beaucoup plus difficiles que d'autres. Elle a le plus de mal avec les langages qui sont plus stricts ou moins courants (comme Scala ou Rust), tout comme un humain pourrait avoir du mal avec une langue qu'il utilise rarement.

Pourquoi cela importe

Avant ce papier, nous pensions qu'une IA qui réussissait haut la main le test Python était un « génie du codage ». Multi-LCB nous a montré que beaucoup de ces « génies » sont en réalité des spécialistes de Python.

L'article conclut que pour construire une IA véritablement utile pour le génie logiciel, nous devons arrêter de les tester uniquement sur la « pâte italienne » (Python) et commencer à les tester sur tout le menu. Multi-LCB fournit la cuisine, les recettes et les juges pour voir quelle IA peut réellement cuisiner un banquet international complet.

Noyé(e) sous les articles dans votre domaine ?

Recevez des digests quotidiens des articles les plus récents correspondant à vos mots-clés de recherche — avec des résumés techniques, dans votre langue.

Essayer Digest →