Automated Modernization of Machine Learning Engineering Notebooks for Reproducibility
Ce document présente MLEModernizer, un cadre agentique piloté par des LLM qui modernise automatiquement les carnets de notes d'ingénierie de l'apprentissage automatique afin de surmonter l'érosion environnementale et de restaurer la reproductibilité en exécutant le code de manière itérative et en appliquant des correctifs ciblés, réussissant ainsi à récupérer plus de 40 % de carnets de notes auparavant non reproductibles.
Article original sous licence CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Ceci est une explication générée par l'IA de l'article ci-dessous. Elle n'a pas été rédigée ni approuvée par les auteurs. Pour une précision technique, consultez l'article original. Lire la clause de non-responsabilité complète
Imaginez que vous êtes un voyageur temporel qui adore consulter de vieilles recettes. Vous trouvez une célèbre recette de gâteau de 2015 écrite dans un carnet spécial. La recette dit : « Mélangez de la farine, du sucre et un ingrédient magique appelé "XGBoost" pour obtenir un gâteau parfait. » Vous essayez de cuisiner ce gâteau aujourd'hui, mais quelque chose ne va pas. L'ingrédient « XGBoost » que vous achetez au magasin aujourd'hui est légèrement différent ; il est plus fort, il fonctionne différemment, et quand vous le mélangez, la pâte explose ou a un goût de savon. C'est le problème de l'« érosion environnementale ». Dans le monde de l'ingénierie du Machine Learning (MLE), les scientifiques et les ingénieurs utilisent des carnets interactifs (comme des carnets de recettes numériques) pour construire des modèles d'IA. Ils partagent ces carnets pour que d'autres puissent apprendre de leur code ou l'utiliser. Mais à mesure que les ordinateurs et les logiciels se mettent à jour rapidement, les vieux carnets se brisent souvent parce que les « ingrédients » (les bibliothèques logicielles) sur lesquels ils reposent ont changé ou ont disparu. Si vous ne pouvez pas exécuter l'ancien code, vous ne pouvez pas vérifier les résultats, et le savoir se perd. La grande question est la suivante : pouvons-nous réparer ces vieilles recettes cassées pour qu'elles fonctionnent dans la cuisine d'aujourd'hui sans avoir à reconstruire toute la cuisine à partir de zéro ?
Ce document, intitulé « Automated Modernization of Machine Learning Engineering Notebooks for Reproducibility », plonge précisément dans ce problème. Les auteurs, Bihui Jin, Kaiyuan Wang et Pengyu Nie, ont décidé de tester à quel point ces recettes numériques sont réellement défectueuses. Ils ont rassemblé une collection massive de 12 106 carnets provenant de compétitions populaires de machine learning sur Kaggle. Lorsqu'ils ont essayé d'exécuter ces carnets dans un environnement moderne, ils ont découvert une dure réalité : seulement 26 % d'entre eux fonctionnaient réellement et produisaient les mêmes résultats qu'à l'époque. Les 74 % restants étaient cassés, soit en plantant avec des erreurs, soit en produisant des scores complètement différents.
Vous pourriez penser que la solution est simple : il suffit de retourner dans le passé et d'installer exactement les anciennes versions de logiciels pour lesquelles la recette a été écrite. C'est ce qu'on appelle le « backporting d'environnement ». Les auteurs ont tenté cela en rétrogradant tous les logiciels pour correspondre à la date à laquelle le carnet a été initialement soumis. Étonnamment, cela a empiré les choses ! Au lieu de 26 % de réussite, seulement 12 % sont devenus reproductibles. Il s'avère que tenter de reconstruire le passé est un piège ; les anciennes versions de logiciels sont souvent manquantes, incompatibles avec le matériel moderne, ou simplement trop fragiles pour fonctionner. Les auteurs soutiennent qu'au lieu de reconstruire l'ancienne cuisine, nous devrions réparer la recette elle-même pour qu'elle fonctionne dans la nouvelle cuisine.
Pour résoudre cela, l'équipe a construit un outil appelé MLEModernizer. Considérez cela comme un sous-chef robotique super intelligent alimenté par un Grand Modèle de Langage (LLM). Ce robot ne se contente pas de lire la recette ; il essaie réellement de cuire le gâteau. Si le gâteau brûle (une erreur survient), le robot examine la fumée, comprend ce qui n'a pas fonctionné, et réécrit la recette pour corriger le tir. Si le gâteau met trop de temps à cuire (problèmes d'exécution), le robot ajuste les instructions pour accélérer le processus. Si le gâteau a un goût légèrement différent (le score est erroné), le robot ajuste les ingrédients pour retrouver le goût de la norme originale.
Le robot fonctionne en boucle : il exécute le code, vérifie les résultats et, si quelque chose ne va pas, il demande à l'IA d'écrire un correctif (un patch) pour l'ensemble du carnet. Il continue ainsi jusqu'à 16 fois jusqu'à ce que le carnet fonctionne. Les résultats ont été très prometteurs. Lorsqu'ils ont testé l'outil sur 8 210 carnets cassés, l'outil a réussi à en réparer environ 40 % à 45 %, les rendant à nouveau reproductibles. Plus précisément, en utilisant un modèle d'IA puissant (GPT-5.2), ils ont réparé 3 292 carnets, et avec un modèle open-source légèrement différent (GPT-OSS-120b), ils en ont réparé 3 683.
Cependant, l'article prend soin de ne pas présenter cela comme une baguette magique. Les auteurs ont découvert que, bien que l'outil puisse obtenir les bons chiffres (le « score »), le code sous-jacent change parfois de manières qui ne sont pas exactement identiques à l'original. Par exemple, l'IA peut modifier la façon dont un modèle est entraîné juste assez pour obtenir le bon score, mais la « saveur » du code est différente. Ils ont également découvert que certaines erreurs sont tout simplement trop tenaces pour être corrigées automatiquement ; l'outil était excellent pour corriger les erreurs simples d'« ingrédient manquant » (comme oublier d'importer une bibliothèque), mais il avait du mal avec les erreurs complexes d'« interaction d'ingrédients étranges » (comme les erreurs d'attribut où un objet ne possède pas les propriétés appropriées).
Le coût de ce chef robotique est également un facteur. Les auteurs ont calculé que la réparation d'un carnet coûte en moyenne environ 0,65 $ en utilisant le modèle puissant, ce qu'ils suggèrent être suffisamment peu coûteux pour une utilisation à grande échelle. Mais ils ont également noté que le modèle open-source était beaucoup moins cher (environ 0,0074 $ par carnet) mais qu'il restait moins fidèle à l'original.
En fin de compte, l'article suggère que, bien que nous ne puissions pas recréer parfaitement le passé, nous pouvons utiliser des agents d'IA intelligents pour moderniser le vieux code et sauver un travail scientifique précieux. Ce n'est pas une solution parfaite pour chaque carnet cassé, mais cela offre un moyen de « meilleur effort » pour sauver une part significative de l'histoire du machine learning qui, autrement, serait perdue dans le temps. Les auteurs concluent que cette approche aide les praticiens à valider et à réutiliser leurs anciens pipelines à mesure que la technologie évolue, transformant des recettes cassées et poussiéreuses en quelque chose qui peut être cuisiné dans la cuisine d'aujourd'hui.
Noyé(e) sous les articles dans votre domaine ?
Recevez des digests quotidiens des articles les plus récents correspondant à vos mots-clés de recherche — avec des résumés techniques, dans votre langue.