One Pipeline, Many Transformers: Pattern-Specific Imputation Specialists for Tabular Missing Data
本文介绍了一种统一的预训练流水线,用于为表格数据生成特定模式的基于 Transformer 的填补专家,证明了仅在完全随机缺失(MCAR)数据上训练的单一模型(TabImpute)在多种缺失模式下均能实现稳健性能,并在此类目标场景中超越了 14 个已有的基准模型。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
在浩瀚的数据世界中,信息很少是完美的。无论是医生在审查病历,经济学家在分析市场趋势,还是工程师在监控工厂传感器,他们所依赖的数据集往往都存在漏洞。数字缺失、测量未进行或条目在传输过程中丢失。这种数据的缺失造成了一个显著的问题:大多数统计和机器学习工具无法处理空白空间。它们需要一个完整的图景才能运行。为了解决这个问题,科学家们长期以来一直使用一种称为“插补”(imputation)的过程,即通过有根据的推测来填补空白。几十年来,该领域一直陷入了一个艰难的选择:从业者可以使用一种通用的工具,它试图填补任何缺失的数字,但在处理特定的、棘手的案例时表现往往不佳;或者,他们可以等待研究人员为他们的确切问题设计一种高度专门化的算法,而这个过程需要深厚的专业知识和大量的时间。现实情况是,数据的缺失很少是随机的;通常,数据缺失的原因与数值本身直接相关,这使得这场“猜谜游戏”变得更加困难。
来自哥伦比亚大学和康奈尔大学的一个研究小组提出了一种打破这一僵局的方法。他们开发了一个灵活的系统,该系统就像一个能够创建定制数据填充专家的“工厂”,而无需每次都重新设计机器。他们并没有为每一种类型的缺失数据构建一个新算法,而是构建了一个单一的流水线,可以为任何缺失模式生成一个专门的“插补器”。其工作的核心是一种方法,该方法将表格中的每一个缺失数字都视为一个独特的拼图碎片,通过观察它所属的行和列,以及它周围的值来进行预测。通过在数百万个合成表(模拟现实世界场景的计算机生成数据)上训练该系统,他们创建了一个能够瞬间适应的模型。如果用户确切知道数据为何缺失,系统可以生成一个针对该特定模式的专家;如果用户不知道数据为何缺失,系统则提供一个稳健的默认模型,该模型几乎可以在任何情况下表现良好。
研究人员在他们创建的一个名为 MissBench 的新基准测试上测试了这种方法,该测试包含来自医学、金融和工程等领域的 42 个真实数据集。他们模拟了 11 种不同的数据缺失方式,从简单的随机缺口到复杂的场景(即缺失情况取决于隐藏值本身)。在这些测试中,他们的专门化模型始终优于此前被认为适用于特定任务的 14 种成熟方法。值得注意的是,仅在最简单的缺失类型上进行过训练的默认模型,在处理最复杂的模式时,表现甚至优于许多为这些模式设计的专门化工具。这表明该系统很好地学习了数据的底层结构,以至于它不需要被告知缺失的具体规则就能做得很好。
该过程首先生成一个庞大的伪数据表库。这些表格是使用一种数学框架创建的,该框架假设现实世界的数据通常遵循隐藏的模式,类似于少数潜在因素可能会影响许多不同的测量值。研究人员随后应用不同的“缺失模块”来模拟数据消失的不同方式。一个模块可能会完全随机地移除数字,而另一个模块可能会隐藏过高或过低的数值,或者根据同一行中的其他数值来隐藏数据。系统随后训练一个基于 Transformer 的模型——一种以识别模式能力著称的类型人工智能——根据周围数字的上下文来预测缺失值。至关重要的是,模型的架构永远不会改变,唯一改变的是训练阶段使用的缺失模块。这意味着用户可以通过更换训练条件,在短短几小时内创建一个新的专家,而无需重写代码或重新设计模型。
其中一个最引人注目的发现是,该系统并不需要记住缺失的具体规则就能取得成功。当研究人员仅在随机缺失的数据上训练该模型时,它成为了一个通用的专家,即使在缺失数据遵循复杂、非随机规则的情况下也能表现出色。这挑战了长期以来的观点,即必须为每种特定类型的缺失数据问题设计独特的算法。该系统似乎学习了一种对数据如何与其自身相关联的通用理解,从而能够准确地填补空白,无论缺失的原因是什么。对于那些缺失原因已知且高度特定的罕见情况,该流水线可以产生一个定制的模型,其表现甚至能超越现有的最佳专门化方法。
研究人员还解决了速度问题。传统的尝试填补数据的方法通常一次只处理一列,这不仅速度慢,而且可能会忽略不同部分之间的联系。他们的新方法同时查看表中的每一个条目,使其能够利用整个数据集的信息来进行单次、快速的预测。这种并行处理使该系统比以往的方法显著更快,能够在极短的时间内处理中小规模的表格。虽然目前的系统是为能够放入标准计算机内存的表格而设计的,但研究人员承认,将其扩展到大规模数据集将需要进一步的工程化工作。然而,对于科学和商业领域中的绝大多数实际应用而言,该系统提供了一个强大的新工具。
通过向公众开放他们的代码、模型和基准测试,该团队希望改变从业者处理缺失数据的方式。用户不再需要等待一个完美的算法,也不必满足于一个平庸的通用者,现在他们可以生成一个符合其特定需求的工具,或者依靠一个在几乎任何地方都适用的强大默认模型。这项工作表明,只要拥有正确的训练策略,单一的系统就可以掌握填补空白的艺术,将令人沮丧的缺失数据问题转化为一个可解的谜题。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。