SIGMA: SHAP-Guided Implicit-Trajectory Generation for Metadata-Free LLM-Based AutoFE
SIGMA 是一个可扩展、无需元数据的自动特征工程(AutoFE)框架,它利用 SHAP 值和一种暴露特征隐式轨迹(EXIT)方法,在恒定上下文窗口的指导下进行特征生成,从而有效地减少特征重复并提高效率,同时达到最先进的性能水平。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
在数据科学领域,计算机经常被赋予海量的数字表格,用以解决从预测贷款违约到诊断疾病等各种问题。然而,仅靠这些原始数字往往是不够的。为了获得最佳结果,专家必须执行一个被称为“自动化特征工程”的过程,这涉及通过组合或转换现有的数据列来创建新的、更智能的列。想象一位厨师,他不仅使用储藏室里的食材,还会发明新的风味组合,让菜肴的味道更上一层楼。几十年来,计算机一直试图通过盲目地混合和匹配数字来完成这项工作,但这种方法速度缓慢,且往往产生令人困惑的结果。最近,科学家们开始使用大语言模型——一种能够进行推理并从语境中学习的强大人工智能系统——来充当这些富有创造力的“厨师”。这些人工智能系统被认为是解锁更好预测能力的钥匙,但它们面临着一个重大障碍:它们通常需要关于每个数字含义的详细描述才能正常工作。在现实世界中,由于隐私规则或仅仅是因为数据来自不使用人类语言的传感器,这类描述往往是缺失的。此外,当这些人工智能系统试图通过学习过去的尝试来改进数据时,它们的历史记录列表变得如此之长,以至于压垮了计算机的内存,导致系统陷入重复错误循环的泥潭。
来自横滨国立大学的一个研究小组开发了一种名为 SIGMA 的新方法来解决这些问题,使人工智能无需任何关于数字代表意义的描述即可进行更好的数据工程。SIGMA 并不依赖人类语言来理解数据,而是使用一种名为 SHAP 的数学工具来衡量每条信息对最终预测的实际重要程度。可以将这个工具想象成一束聚光灯,它照亮最重要的数字,并调暗那些不太有用的数字,从而在不需要知道这些数字名称的情况下,为人工智能提供清晰的方向感。研究人员随后将这些数字分为三类:最重要的、中等有用的和较弱的。他们要求人工智能通过在这些组内混合数字,或者利用弱项来连接强项,从而创建新的数据列,这实际上是在教导系统将创造力集中在最关键的地方。
这项工作最显著的创新是研究人员称之为“暴露特征隐式轨迹”(exposed-feature implicit trajectory)的技术。在之前的尝试中,人工智能系统会保留一份所有已创建特征的书面列表,以避免产生重复,但这个列表很快就会变得过长,无法放入计算机内存中。SIGMA 采用了不同的方法。它不是记录一份历史,而是简单地在短时间内将已经使用过的特征从人工智能的视野中隐藏起来。如果人工智能试图使用当前处于隐藏状态的数字来创建一个特征,它将被迫转向其他地方。这种“隐藏与揭示”的简单行为就像一个无声的向导,引导人工智能远离重复自身,而无需存储长期的历史日志。这使得系统可以运行更长时间,在许多步骤中不断精炼其工作,而不会因为内存限制或陷入反复生成同样无用特征的循环而停滞不前。
这种新方法的测试结果令人瞩目。在对 16 个不同的真实世界数据集进行测试时,SIGMA 的表现与依赖详细描述的最佳现有 AI 方法不相上下,证明了该系统不需要人类标签也能保持高效。更重要的是,它解决了重复问题。在早期的系统中,近 37% 生成的特征是重复的,浪费了宝贵的计算能力。通过 SIGMA 的隐藏已使用特征的方法,重复率大幅下降至不足 7%。该系统还表现出了极高的效率。传统方法通常需要生成数百个新特征才能找到其中几个好的,而 SIGMA 平均每个数据集仅使用 5 个新特征就达到了顶尖性能。这意味着系统能够快速找到最有价值的改进点,让剩余的数据保持整洁且易于管理。
研究人员还发现,这种方法允许人工智能构建以前难以企及的复杂、多层数据结构。在某些测试中,系统成功地将特征进行链式组合,将一步的输出作为下一步的输入,创建了一个能显著提高预测能力的深度关系网络。这种能力使 SIGMA 能够超越那些依赖僵化、预定义规则的旧式非 AI 方法。这项研究证实,通过用数学重要性信号取代对人类语言的需求,并结合巧妙的“隐藏与揭示”机制,人工智能可以成为一种更强大、更实用的工具,用于改进数据分析,即使在没有任何人类描述的情况下也是如此。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。