← 最新论文
🤖 machine learning

Automated Modernization of Machine Learning Engineering Notebooks for Reproducibility

本文介绍了 MLEModernizer,这是一个由大语言模型驱动的智能体框架,它通过迭代执行代码并应用针对性修复,自动实现机器学习工程笔记本的现代化,以克服环境侵蚀并恢复可复现性,成功恢复了超过 40% 此前无法复现的笔记本。

原作者: Bihui Jin, Kaiyuan Wang, Pengyu Nie

发布于 2026-07-29
📖 1 分钟阅读☕ 轻松阅读

原作者: Bihui Jin, Kaiyuan Wang, Pengyu Nie

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下你是一名热爱研究旧食谱的时光旅行者。你发现了一本来自2015年的著名蛋糕食谱,写在一本特别的笔记本里。食谱上写着:“将面粉、糖和一种被称为‘XGBoost’的神奇食材混合在一起,即可得到一个完美的蛋糕。”你试图在今天烘焙它,但出了问题:你今天在商店买到的“XGBoost”成分略有不同;它更强力,运作方式也不同,当你把它混合进去时,面糊要么爆炸,要么吃起来有一股肥皂味。这就是“环境侵蚀”(environmental erosion)的问题。在机器学习工程(MLE)的世界里,科学家和工程师使用交互式笔记本(类似于数字食谱)来构建人工智能模型。他们分享这些笔记本,以便他人学习或使用他们的代码。但随着计算机和软件的快速更新,旧的笔记本经常会损坏,因为它们所依赖的“食材”(软件库)已经发生了变化或消失了。如果无法运行旧代码,你就无法验证结果,知识也会随之流失。大问题在于:我们能否修复这些旧的、损坏的食谱,让它们在今天的厨房里也能正常运作,而不需要从头开始重建整个厨房?

这篇题为《机器学习工程笔记本的自动化现代化以实现可复现性》(Automated Modernization of Machine Learning Engineering Notebooks for Reproducibility)的论文,深入探讨了这一问题。作者们决定测试这些数字食谱到底有多“破碎”。他们收集了来自 Kaggle 热门机器学习竞赛的 12,106 个笔记本的大规模集合。当他们尝试在现代环境中运行这些笔记本时,发现了一个残酷的现实:只有 26% 的笔记本实际上可以运行并产生与往年相同的结果。其余 74% 的笔记本都损坏了,要么因错误而崩溃,要么产生了完全不同的分数。

你可能会认为解决方案很简单:回到过去,安装与该食谱编写时完全一致的旧软件版本。这被称为“环境回溯”(environment backporting)。作者通过将所有软件降级以匹配笔记本最初提交时的日期进行了尝试。令人惊讶的是,这样做反而让情况变得更糟了!原本有 26% 的笔记本可以运行,降级后只有 12% 变得可复现。事实证明,试图重建过去是一个陷阱;旧版本的软件往往缺失、与现代硬件不兼容,或者运行起来过于脆弱。作者认为,与其试图重建旧厨房,不如修改食谱本身,使其适配新厨房。

为了解决这个问题,团队构建了一个名为 MLEModernizer 的工具。把它想象成一个由大语言模型(LLM)驱动的超级智能机器人副厨师。这个机器人不仅能读懂食谱,它还会尝试亲自去烤这个蛋糕。如果蛋糕烤焦了(发生错误),机器人会观察烟雾,弄清楚哪里出了错,然后重写食谱来修复它。如果蛋糕烤得太久(运行时问题),机器人会调整指令以提高速度。如果味道稍有不同(分数不对),机器人会调整配料以恢复到原始的标准。

这个机器人处于一个循环之中:它运行代码,检查结果,如果发现问题,它就会要求 AI 为整个笔记本编写一个补丁(修复程序)。它会重复这个过程,最多循环 16 次,直到笔记本可以正常工作。结果非常令人振奋。当他们在 8,210 个损坏的笔记本上进行测试时,该工具成功修复了大约 40% 到 45% 的笔记本,使它们重新具备了可复现性。具体而言,使用强大的 AI 模型(GPT-5.2),他们修复了 3,292 个笔记本;而使用另一种开源模型(GPT-OSS-120b),他们修复了 3,683 个。

然而,论文谨慎地指出,这并不是一根“魔法棒”。作者发现,虽然工具可以把数值(分数)调对,但有时底层代码的变化并不完全等同于原始状态。例如,AI 可能会微调模型的训练方式,使其刚好达到正确的得分,但代码的“风味”却变了。他们还发现,有些错误是极其顽固且无法自动修复的;该工具擅长修复简单的“缺失食材”类错误(比如忘记导入某个库),但在处理复杂的“奇怪的食材相互作用”类错误(比如对象不具备正确属性的属性错误)时则显得力不从心。

这位“机器人厨师”的成本也是一个因素。作者计算出,使用强大的模型修复一个笔记本平均成本约为 0.65 美元,他们认为这对于大规模使用来说足够便宜。但他们也指出,开源模型要便宜得多(每个笔记本约 0.0074 美元),但其对代码的忠实度较低。

最后,论文表明,虽然我们无法完美地重现过去,但我们可以利用智能 AI 代理来使旧代码现代化,从而挽救宝贵的科学成果。这并不是针对每一个损坏笔记本的完美方案,但它提供了一种“尽力而为”的方法,去拯救大量的机器学习历史,否则这些历史将会湮灭在时光中。作者总结道,这种方法有助于从业者在技术不断演进的过程中,验证并复用旧的流水线,将那些破碎、落满灰尘的食谱,转化为可以在今日厨房中烹饪的美味。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →