← 最新论文
🤖 machine learning

Evolving Executable Pipeline Programs for AutoML with Language Models

LACE 是一个新颖的 AutoML 框架,它采用由大语言模型引导的进化循环来生成并演化可执行的 Python 流水线程序,在 68 个 OpenML 任务上实现了具有竞争力的准确率,同时与传统系统相比,提供了卓越的透明度、可编辑性和搜索空间灵活性。

原作者: Sofoklis Kitharidis, Cor J. Veenman, Jan N. van Rijn, Thomas Bäck, Niki van Stein

发布于 2026-08-18
📖 1 分钟阅读☕ 轻松阅读

原作者: Sofoklis Kitharidis, Cor J. Veenman, Jan N. van Rijn, Thomas Bäck, Niki van Stein

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

在现代数据科学领域,机器正越来越多地被要求去理解混乱的现实世界信息:预测贷款申请人是否会还款、根据症状表进行疾病诊断,或根据过往趋势预测销售额。为了实现这一目标,研究人员构建了“流水线”(pipelines),即一套分步指令,用于清洗数据、选择数学模型并调整该模型,直到其表现出色。多年来,这项工作的最强有力工具是自动化系统,它们就像一位拥有固定食材的顶级大厨。这些系统可以混合搭配已知的预处理步骤和学习算法,通过调整用量来寻找最佳风味。然而,它们严格受限于所给的“食品库”;它们无法发明超出其预定义列表之外的新食材或新的烹饪技巧。这种局限性意味着,如果最佳解决方案需要一种该系统从未见过的结构,那么它将无法被发现。

莱顿大学的一个研究团队现在引入了一种不同的方法,这种方法不将数据流水线的创建视为从菜单中进行选择,而是将其视为从零开始编写一份全新的食谱。他们开发了一个名为 LACE 的系统,该系统使用大型语言模型(一种在海量文本和代码上训练的人工智能)作为进化引擎。LACE 不再是从固定的工具列表中进行选择,而是要求人工智能编写完整的、可执行的计算机程序,用以定义如何处理数据并做出预测。随后,系统会对这些程序进行测试,从错误中学习,并要求人工智能编写改进后的版本,不断重复这一循环,直到找到一个高效的解决方案。其结果是一个不仅能微调现有工具,还能创作出全新结构的系统,生成的代码人类专家可以直接阅读、理解并修改。

研究人员在 68 个不同的数据分类任务上测试了这种方法,涵盖了从只有几百条记录的小型数据集到接近五百万行的大规模集合。他们将 LACE 与几种成熟的自动化系统以及一组固定的预训练模型进行了对比。结果显示,当由特定的语言模型驱动时,LACE 的表现与现有的最强自动化系统不相上下,并且显著优于旧方法。至关重要的是,虽然一些较新的预训练模型在它们能够处理的具体任务上准确度略高,但它们在面对测试集中许多更大或更复杂的数据集时却失效了。相比之下,LACE 成功地为它接收到的每一个任务都生成了可运行的解决方案。

这项成就之所以特别值得关注,在于其输出的性质。传统的自动化系统通常返回一个“黑盒”——一个运行良好但难以被人通过深厚的软件框架知识进行检查或更改的复杂拟合对象。而 LACE 返回的是普通的 Python 代码。这意味着数据科学家可以查看最终的程序,确切地了解数据是如何清洗的、选择了哪些模型、以及如何将它们组合在一起,并可以进一步编辑代码以进行改进或适应新用途。研究人员发现,人工智能不仅仅是在复制现有的模式;它进化出了多样化的解决方案,经常以新颖的方式组合不同类型的模型,并编写自定义逻辑来融合它们的预测。在许多情况下,人工智能编写了自己的代码来混合多个模型的输出,这种灵活性是固定系统难以复制的。

该研究还解决了一个人工智能研究中的常见担忧:即人工智能可能只是因为在训练期间见过这些题目,从而在“背诵”测试答案。为了防止这种情况,研究人员向人工智能隐藏了数据集的名称和具体细节,仅给予其关于数据规模和类型的通用描述。尽管缺乏这些具体知识,系统仍然找到了高性能的解决方案,这表明它是在真正学习如何构建有效的流水线,而非回忆答案。研究人员进一步验证了人工智能遵循了严格的规则,例如没有使用隐藏的内部搜索来调整自身的设置,从而确保改进源自进化搜索过程本身。

最令人瞩目的发现之一是系统的改进速度。人工智能生成的第一个程序往往是有缺陷或不完整的,但随着系统的迭代,它学会了修复这些错误并完善逻辑。当过程结束时,最终的程序不仅有效,而且比最初的尝试要准确得多。研究人员观察到,系统倾向于选择某些类型的模型,例如基于树的集成模型,但它并没有陷入单一模式,而是探索了广泛的结构组合。这种多样性表明,该系统有能力发现人类可能想不到、或者刚性系统永远不会考虑到的解决方案。

这项工作证明,将自动化机器学习视为编写和进化代码的过程,开启了一个新的前沿。它超越了固定工具库的限制,允许系统根据具体问题调整其结构。虽然运行这些实验的计算成本很高,需要大量时间来生成和测试数千个候选程序,但结果表明,产生透明、可编辑且高效代码的能力是一种极具价值的权衡。研究人员总结道,这种方法提供了一条充满前景的路径,即寻找最佳数据流水线的过程是由代码本身的创造力所定义的,而非受限于一组预选组件。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →