← Derniers articles
🤖 AI

SciCodePile: A 128GB Corpus and Executable Benchmark for Challenging Scientific Code Generation

Cet article présente SciCodePile, un corpus massif de code scientifique de 128 Go et un benchmark exécutable de 200 tâches, pour démontrer que les modèles de langage actuels éprouvent des difficultés significatives en génération de code scientifique tout en montrant que l'entraînement sur ce jeu de données améliore substantiellement leurs performances.

Auteurs originaux : Weifeng Sun, Ye Fan, Yuchen Chen, Gou Tan, Jieke Shi, Yuan Yidi, Swee Liang Wong, Jonathan Pan, David Lo

Publié 2026-07-22
📖 5 min de lecture🧠 Analyse approfondie

Auteurs originaux : Weifeng Sun, Ye Fan, Yuchen Chen, Gou Tan, Jieke Shi, Yuan Yidi, Swee Liang Wong, Jonathan Pan, David Lo

Article original sous licence CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Ceci est une explication générée par l'IA de l'article ci-dessous. Elle n'a pas été rédigée ni approuvée par les auteurs. Pour une précision technique, consultez l'article original. Lire la clause de non-responsabilité complète

Imaginez que vous essayez d'apprendre à un robot super intelligent comment écrire du code. Vous lui avez déjà appris les bases : comment construire un site web simple, comment fabriquer une calculatrice ou comment organiser une liste de lecture. Il est plutôt doué pour ces tâches « générales » car il a lu des millions de livres et de sites web à ce sujet. Mais maintenant, vous voulez voir si ce robot peut s'attaquer aux choses vraiment difficiles : écrire du code pour les scientifiques. Nous parlons de code qui simule la propagation d'un virus, calcule le repliement d'une protéine ou modélise le comportement des atomes dans un nouveau médicament. C'est du « code scientifique ». C'est différent du code ordinaire car il ne s'agit pas seulement de faire faire quelque chose par l'ordinateur ; il s'agit de s'assurer que les mathématiques et la logique de l'ordinateur correspondent aux lois réelles, désordonnées et complexes de la nature. Si le robot réussit la syntaxe mais se trompe sur la science, le résultat n'est pas seulement un bug — c'est une expérience ratée ou un calcul dangereux. La grande question est : nos robots d'IA actuels, qui sont excellents pour écrire du code standard, peuvent-ils réellement effectuer le travail de fond pour les scientifiques ?

Entrez dans SCICODEPILE, un nouveau projet massif qui agit comme un terrain d'entraînement géant et spécialisé et un examen final rigoureux pour ces robots d'IA. Les chercheurs derrière ce papier ont décidé que pour vraiment tester si l'IA peut gérer le codage scientifique, ils avaient besoin de deux choses : une immense bibliothèque de code scientifique réel pour étudier, et un test strict où le code doit réellement tourner et fonctionner, et non pas seulement avoir l'air correct sur le papier.

D'abord, ils ont construit la bibliothèque. Ils n'ont pas simplement ramassé du code au hasard ; ils sont partis à la chasse à travers 37 737 dépôts de code publics sur Internet, en cherchant spécifiquement des projets liés à la chimie, la biologie, la physique et d'autres sciences. Ils ont filtré les déchets et ont fini avec une collection massive de 128 Go de code scientifique. Voyez cela comme une bibliothèque contenant chaque manuel d'instructions, chaque plan et chaque morceau de code provenant de milliers de vrais laboratoires scientifiques. Ils ont organisé cette bibliothèque de quatre manières différentes : fichiers de code brut, résumés de ce que font les projets, instructions pour des fonctions spécifiques, et paires problème-solution. C'est comme prendre un garage en désordre rempli de pièces de voiture et l'organiser en un musée parfaitement étiqueté où vous pouvez voir le moteur, le manuel et un diagramme de la façon dont les pièces s'assemblent, tout cela en même temps.

Ensuite, ils ont construit l'examen. Ils ont créé un benchmark de 200 tâches. Mais voici le hic : ils n'ont pas seulement demandé à l'IA d'écrire du code et de vérifier s'il ressemblait à la réponse d'un humain. Ils ont placé le code de l'IA dans un « sandbox » — un terrain de jeu numérique sûr et isolé — et l'ont exécuté. Si le code plantait, donnait un mauvais chiffre ou échouait à un test, c'était un échec. C'était un test de réussite ou d'échec basé sur le fait que le code fonctionne réellement.

Alors, comment les robots s'en sont-ils sortis ? Les résultats ont été un certain rappel à la réalité. Même les modèles d'IA les plus intelligents, ceux qui réussissent habituellement les tests de codage, ont énormément lutté avec le contenu scientifique. Sur les tâches de type « texte à trous », les meilleurs modèles n'ont atteint qu'environ 38 % du chemin vers un score parfait. Mais sur l'examen « faire en sorte que ça marche », les chiffres étaient encore plus frappants. Le meilleur modèle n'a réussi à passer que 12,30 % du temps. Cela signifie que pour 100 problèmes de codage scientifique, l'IA en a raté 88. Cela suggère que, bien que l'IA devienne douée pour écrire du code qui semble correct, elle est encore loin d'écrire du code scientifiquement fiable.

Les chercheurs ont également montré que cette nouvelle bibliothèque est en fait utile pour enseigner aux robots. Lorsqu'ils ont pris un modèle d'IA plus petit et l'ont laissé étudier leur bibliothèque de 128 Go, ses performances ont bondi de manière significative. C'est comme donner à un étudiant une pile de manuels scolaires au lieu de seulement quelques fiches de révision ; soudain, il comprend beaucoup mieux la matière.

En bref, SCICODEPILE est un nouvel outil massif qui dit : « Hé, l'IA, tu es douée pour le codage, mais tu n'es pas encore prête à être un scientifique. » Il fournit les ressources pour mieux les entraîner et les tests rigoureux pour voir s'ils ont réellement appris. C'est un signal d'alarme qui montre que, bien que nous fassions de grands progrès, il existe encore un fossé énorme entre un robot capable d'écrire du code et un robot capable de faire de la vraie science.

Noyé(e) sous les articles dans votre domaine ?

Recevez des digests quotidiens des articles les plus récents correspondant à vos mots-clés de recherche — avec des résumés techniques, dans votre langue.

Essayer Digest →