想象你是一名侦探,试图利用一堆线索(数据)来破解一个谜团。通常,你必须手动筛选这些线索,以巧妙的方式将它们组合起来,并创造出新的“超级线索”,以帮助你更快地破案。这个过程被称为特征工程。在机器学习领域,手动执行这一过程既缓慢又枯燥,而且需要人类专家确切地知道哪些线索组合可能奏效。
本文介绍了一种名为LLM-FE的新工具,它利用一种“超级智能”的人工智能(大型语言模型)作为创意伙伴,将上述侦探工作自动化。
以下是其工作原理,分解为简单的概念:
1. 问题:一场“猜谜游戏”
传统的自动化工具试图通过基于固定规则列表,盲目地混合和匹配数字(例如将 A 列加到 B 列)来解决这个问题。它们就像一个只知道左转或右转的机器人,从未意识到有时你需要跳过栅栏。它们常常错过那些源于理解数据背后“故事”的“顿悟”时刻(例如,知道“胰岛素”和“葡萄糖”与糖尿病相关)。
2. 解决方案:一位“进化大厨”
作者提出了LLM-FE,它将特征工程视为一场烹饪比赛,而人工智能则是主厨。人工智能不再仅仅遵循食谱,而是被赋予了:
- 食材:原始数据(例如,患者年龄、血糖水平)。
- 菜单:需要解决的具体问题(例如,“预测患者是否患有糖尿病”)。
- 食谱书:人工智能自身对世界的内部知识(例如,“我知道高糖和低胰岛素对健康有害”)。
3. 工作原理:四步循环
本文描述了一个不断重复的循环,类似于自然界进化物种以更好地生存的过程:
步骤 A:创意火花(生成)
人工智能审视数据和问题。它会想:“嗯,如果我将胰岛素水平除以葡萄糖水平,或许能告诉我们身体处理糖分的方式。”它会编写一个小型计算机程序(食谱)来创建这个新的“超级线索”。
- 类比:主厨根据食材和试图制作的菜肴,发明一种新酱汁。
步骤 B:品尝测试(评估)
将新食谱应用于数据。然后,一个预测模型(一项简单测试)尝试利用这些新数据来解决问题。
- 类比:主厨将新酱汁端给评委品尝。如果评委喜欢(得分上升),则该食谱是好的;否则,它将被丢弃。
步骤 C:记忆库(经验管理)
这是 LLM-FE 的秘诀所在。该系统不会仅仅忘记失败的食谱。它会保留一个“名人堂”,收录它曾经制作过的最佳食谱。
- 类比:想象一位主厨保留着一本笔记,记录着他最棒的 10 道菜。当他需要发明新菜时,他不会从头开始,而是查看他过去最好的菜肴,并思考:“如果我把第 3 道菜最好的部分和第 7 道菜最好的部分混合在一起会怎样?”
步骤 D:进化(优化)
人工智能利用“名人堂”来创建食谱的更优版本。它尝试对最佳食谱进行“变异”(轻微改变),看看它们是否能变得更好。
- 类比:这就像自然选择。最强、最美味的食谱得以生存并进化,而弱小的食谱则被淘汰。
4. 为何它优于其他方法
本文将 LLM-FE 与其他方法进行了比较,发现它在以下三个主要原因上胜出:
- 它了解上下文:与其他仅仅进行数学运算的机器人不同,该人工智能理解数据意味着什么。它知道“年龄”和“体重指数(BMI)”与健康相关,因此它创建的特征不仅是一堆数字,而是对人类有意义的特征。
- 它不会陷入僵局:其他方法常常陷入试图改进单一想法的困境。LLM-FE 同时运行多个“想法岛屿”。如果一个岛屿陷入死胡同,另一个岛屿可能会找到捷径。
- 它从错误中学习:通过保留以往成功经验的记忆,它在每一次尝试中都变得更聪明,而不是仅仅随机猜测。
5. 结果
研究人员在许多不同的数据集(如预测心脏病、房价和汽车销售)上测试了该方法。他们发现,LLM-FE 始终使预测模型比旧方法更准确。它不仅适用于一种类型的人工智能,还帮助不同类型的模型更好地完成工作。
简而言之:LLM-FE 是一个系统,它利用智能人工智能来发明新的、有意义的方式来审视数据。它就像一位富有创意的主厨,从过去最棒的菜肴中学习,利用其对世界的知识,并不断实验,直到找到解决某个问题的完美食谱。
技术摘要:LLM-FE:利用大语言模型作为进化优化器的表格数据自动化特征工程
问题陈述
特征工程是表格机器学习工作流中至关重要却劳动密集型的环节。虽然设计良好的特征能显著提升基于树的模型的性能(在结构化数据上往往优于深度学习方法),但探索庞大的特征变换组合空间的过程既耗时又耗资源。传统的自动化特征工程方法依赖于预定义的、人工设计的搜索空间和固定变换,往往未能融入有价值的领域知识。相反,近期基于大语言模型(LLM)的方法试图整合领域知识,但通常依赖于直接提示或简单的验证分数。这些现有的 LLM 方法往往未能利用先前发现实验中的见解,缺乏特征生成与数据驱动性能之间的有意义的推理,并且由于 LLM 预训练中的固有偏差,倾向于生成简单且重复的特征。
方法论:LLM-FE 框架
作者提出了 LLM-FE,这是一个新颖的框架,将特征工程表述为程序搜索问题,结合了 LLM 的领域知识与推理能力、进化搜索以及数据驱动的反馈。该框架作为一个迭代循环运行,包含四个主要阶段:
新特征生成(提示):
LLM 充当知识引导的进化优化器。它接收包含以下内容的结构化提示:
- 任务描述与元数据: 关于下游任务和特征描述的具体细节。
- 数据样本: 数据集的序列化示例,以提供上下文。
- 评估函数: 定义如何衡量特征质量的代码片段(训练模型并在验证集上评分)。
- 上下文演示: 从先前迭代中选择的高性能特征变换程序。
LLM 被明确指示生成复杂、新颖的特征变换程序(Python 代码),而非简单的算术运算,利用其嵌入的领域知识来推理特征的相关性。
特征工程(执行):
生成的 Python 程序在底层数据集上执行。此步骤应用所提出的变换以创建增强数据集。为确保鲁棒性,系统强制执行时间和内存限制,丢弃易出错或低效的程序。
特征评估(数据驱动反馈):
增强后的数据集用于训练下游预测模型(例如 XGBoost、MLP、TabPFN)。模型在保留验证集上的性能作为特征变换程序的适应度分数。该分数提供了引导搜索所需的数据驱动反馈。
经验管理(进化搜索):
为避免局部最优并保持多样性,LLM-FE 采用多群体“岛屿”模型。
- 多岛屿记忆: 搜索空间被划分为 m 个独立的岛屿。每个岛屿维护一个高分程序的缓冲区。
- 聚类与采样: 岛屿内的程序根据其验证分数进行聚类。系统使用玻尔兹曼采样来选择用于上下文示例的聚类,以平衡探索(低分聚类)与利用(高分聚类)。
- 迭代优化: 在每次迭代中,LLM 从记忆缓冲区采样以生成新候选项,通过基于提示条件的生成有效地执行隐式变异和交叉。
主要贡献
该论文概述了三个主要贡献:
- 新颖框架: 引入 LLM-FE,将特征工程表述为 LLM 引导的进化优化问题。它独特地整合了领域知识、数据驱动评估和用于迭代优化的长期记忆。
- 实证有效性: 实验结果表明,LLM-FE 在多样化的表格数据集、任务和预测模型上,始终优于最先进的方法(包括 OpenFE/AutoFeat 等经典方法和 CAAFE/FeatLLM 等基于 LLM 的方法)。
- 组件分析: 通过全面的消融研究,作者强调了领域知识、进化搜索、数据驱动反馈和数据样本在引导 LLM 高效探索特征空间并发现具有影响力的特征方面的关键作用。
实验结果
作者使用 GPT-3.5-Turbo 和 Llama-3.1-8B-Instruct 作为骨干网络,在 19 个分类数据集和 10 个回归数据集上评估了 LLM-FE。该框架使用 XGBoost、MLP 和 TabPFN 作为下游预测器,与基线方法进行了测试。
- 性能: LLM-FE 在分类和回归任务中均实现了最低的平均排名(表明整体性能最佳)。它始终比原始数据基线和其他特征工程方法提高了预测性能。
- 泛化性: 该框架展示了在不同 LLM 骨干网络和预测模型架构上的鲁棒性。由 LLM-FE 生成的特征提升了基于树的模型、神经网络和基于 Transformer 的表格模型的性能。
- 复杂性与偏差缓解: 与倾向于偏好简单运算符(加法、减法)的朴素 LLM 提示不同,LLM-FE 中的进化优化成功发现了复杂的变换(例如分组聚合、残差、Sigmoid 函数)。约 45% 的已发现特征被归类为复杂特征,而基线 LLM 方法中此类特征的数量可忽略不计。
- 效率: 性能与运行时间的帕累托分析显示,LLM-FE 位于帕累托前沿,以相当或更低的计算成本实现了比 CAAFE 和 OCTree 等竞争对手更高的准确率。
- 消融研究: 移除领域知识导致性能显著下降(准确率从约 0.687 降至约 0.626),凸显了其重要性。同样,移除进化优化导致了最大的下降(降至约 0.587),突显了迭代数据驱动反馈的必要性。
- 记忆化: 在 LLM 训练截止日期之后发布的数据集上进行的实验表明,LLM-FE 提供了持续且适度的提升,这表明改进源于真正的推理和进化选择,而非数据记忆。
意义与主张
该论文将 LLM-FE 定位为自动化以数据为中心的管道的重要一步。其意义在于弥合了领域知识指导的推理与优化之间的差距。通过将 LLM 不仅视为生成器,而且视为进化优化器,该框架克服了静态搜索空间的局限性以及直接提示中固有的对简单特征的偏差。
作者声称,LLM-FE 为表格学习提供了一种稳健且可泛化的解决方案,在减少人工努力的同时提高了预测性能。他们强调,该框架旨在增强而非取代领域专家,提供可解释的、基于假设的特征,这些特征可供审查和验证。这项工作表明,将 LLM 与进化搜索机制相结合是发现高质量、可解释特征的一条可行途径,而这些特征很难通过人工方式设计。
每周获取最佳 machine learning 论文。
受到斯坦福、剑桥和法国科学院研究人员的信赖。
请查收邮箱确认订阅。
出了点问题,再试一次?
无垃圾邮件,随时退订。