Localized TabICLv2: Scaling Tabular In-Context Learning through k-NN
本文介绍了 Localized TabICLv2,这是一种通过为每个查询仅检索 k 个最近训练邻居,从而显著降低了最先进的 TabICLv2 模型在表格数据上的推理成本并提高了其可扩展性的方法,在保留原模型 98% 以上准确度的同时实现了大幅度的加速。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
在数据世界中,信息通常以整齐的矩形网格形式呈现:客户的行、交易的列,以及填满了数字或类别的单元格。几十年来,在这些网格中寻找模式最可靠的方法是使用一种被称为梯度提升决策树的特定类型计算机程序。这些程序就像是一支专家团队,通过提出一系列简单的“是”或“否”的问题来对数据进行分类,从而逐步构建出一个复杂的决策结构。它们非常有效,但有一个显著的局限性:每遇到一个新数据集,都必须从头开始进行训练。如果一家公司想要预测一款产品的客户流失,然后转而预测另一款产品的贷款违约,模型必须重新训练,这个过程需要耗费时间、计算能力并进行精细的参数调优。
最近,一种借鉴了语言研究技术的新方法脱颖而出。这些新系统不再为每个任务训练一个新模型,而是使用一个单一的、预训练好的基础模型,该模型可以从即时提供的示例中学习。这种被称为“上下文学习”(in-context learning)的方法,允许模型通过观察解决问题所需的少量示例,然后在不改变其内部设置的情况下对新案例做出预测。虽然这为开发通用的表格数据工具提供了一条充满希望的路径,但一个主要的障碍仍然存在。随着模型需要考虑的历史数据量不断增加,做出单次预测所需的时间会呈爆炸式增长。模型必须将每一个新问题与它所见过的每一条过往数据进行对比,这造成了计算瓶ال瓶颈,使得在大规模实时应用中变得不切实际。
剑桥大学的研究人员通过一种他们称为 Localized TabICLv2 的方法解决了这一瓶颈。他们的工作聚焦于一种被称为 TabICLv2 的特定版本上下文学习模型,该模型已经在各种分类任务中展示了顶尖的性能。原始模型的核心问题在于,在最后的预测阶段,它强制要求每一个新数据点同时关注整个训练数据集。如果一个数据集包含数十万行,模型在处理每一个查询时都必须处理海量的信息,从而导致响应速度变慢且能耗极高。研究人员提出了一个简单的疑问:模型真的需要查看每一个过去的示例才能做出好的预测吗?还是说它可以找到一小组更具相关性的示例,从中获取必要的线索?
为了回答这个问题,团队引入了一个在最终预测之前起到过滤作用的检索步骤。该系统不再将整个历史数据输入模型,而是首先将每一行数据转换为捕捉其本质特征的数学表示。当一个新查询到达时,系统会在存储的历史记录中搜索,找到与新案例最相似的几十行数据。随后,它只将这些最接近的匹配项,而非整个数据集,输入到预测引擎中。这种方法类似于人类解决问题的方式:通过回忆起少数相关的过往经历,而不是试图记住生命中的每一个事件。通过将上下文限制在这些“最近邻”内,研究人员大幅减少了模型一次需要处理的信息量。
然而,仅仅减少数据量并不足以维持原系统的超高准确度。因为模型在训练时习惯于处理完整的上下文,所以最初移除大部分数据会导致其性能下降。为了解决这个问题,研究人员对模型的内部机制进行了微调。他们调整了模型创建数据表示的方式,以及利用这些表示进行预测的方式,特别针对这种更小、更局部的视角进行了训练。这一过程确保了模型学会了如何仅从极少数示例中提取最关键的信息,而不是依赖于数据的庞大体量来寻找模式。
该方法的成果在涵盖信用卡欺诈检测到客户流失等广泛的现实世界数据集上进行了衡量。当研究人员在包含三十八个不同数据集的标准基准测试中测试该局部化模型时,他们发现经过微调的版本保留了原模型几乎所有的准确度。具体而言,它保留了原性能的 98.64%,这意味着它做出的正确预测次数与运行缓慢的完整上下文版本几乎持平。作为代价,它获得了巨大的速度提升。在处理批量数据的场景下,它的运行速度提高了两倍以上;而在处理单个问题的场景下,提速效果更为显著,中位数提升达到了原系统的 249 倍。
研究还表明,数据集的大小对这些速度增益有着显著影响。训练集越大,局部化的收益就越高。对于较小的数据集,寻找正确“邻居”所花费的时间有时会抵消掉处理更少数据所节省的时间。但随着训练行数增长到数十万级别,局部化方法变得越来越高效,证明了该方法能够很好地扩展到那些通常会拖慢此类模型的超大规模数据。此外,研究人员还将他们的方法与更简单的替代方案进行了比较,例如仅针对检索到的邻居使用标准决策树,或者使用基础的投票系统。他们的局部化模型始终优于这些简单的基准模型,这证明了“智能检索”与“专门化预测引擎”的结合才是成功的关键。
这项工作表明,表格机器学习的未来可能不在于构建消耗更多能量的更大模型,而在于让现有模型对所需信息变得更加“聪明”。通过教会强大的基础模型仅关注最相关的示例,研究人员证明了在不牺牲效率的前提下,实现高准确度的预测是可能的。研究结果表明,这些模型可以被应用于实际部署,因为在实际应用中,速度和效率与预测能力同样重要。尽管该方法依赖于“最相似的过往示例是最具信息量”这一假设,但结果显示,这一假设在各种类型的数据中均成立。研究结论指出,只要进行适当的调整,表格数据的上下文学习之潜力便可以在不牺牲大规模应用所需的效率的情况下得以实现。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。