Contextual Token Rotation Ensembles for Tabular Learning
本文介绍了上下文标记旋转集成(Contextual Token Rotation Ensembles, CTRE),这是一种新颖的表格学习框架,通过将基于 Transformer 的上下文标记表示与数据自适应、交互感知的特征旋转相结合,增强了集成的多样性与鲁棒性,在处理高维及不平衡数据集时表现优于经典方法。
原始论文采用 CC BY 4.0 许可(https://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
在数据科学领域,有些问题可以通过观察图像或聆听声音来解决,但许多在金融、医学和工程领域最关键的决策却依赖于数字表格。这些被称为“表格数据”的表格,包含了不同类型的各种信息:有些列包含连续的测量值,如温度或收入;而另一些列则持有类别信息,如颜色或职业头衔。计算机面临的挑战在于,这些不同类型的数据并不自然地契合在一起。除非教会计算机去理解它们之间的隐藏联系,否则它很难理解特定的数值如何与特定的类别相关联。几十年来,研究人员一直试图构建更好的读取这些表格的方法,通常是通过将许多简单的预测模型组合成一个更智能的团队。这种被称为“集成学习”(ensemble learning)的方法,通过确保团队中的每个成员都以略微不同的方式观察数据,从而使他们的个体错误能够相互抵消。然而,一种用于创建这种多样性的长期存在的方法,依赖于一种略显随机且缺乏章法的策略:将数据的列随机切分成若干组并进行打乱。虽然这创造了多样性,但它往往忽略了某些列在本质上是相互关联的,而另一些列则是完全无关的。
来自新南威尔士大学的一个研究小组开发了一种名为“上下文标记旋转集成”(Contextual Token Rotation Ensembles,简称 CTRE)的新方法,它用一种更智能、具备上下文感知能力的流程取代了这种随机打乱。CTRE 不再将数据的每一列视为孤立的事实,而是首先学习这些列是如何相互交流的。想象一下,在一个挤满了人、每个人都在同时说话的房间里;传统的方法可能会随机挑选一群人来倾听,希望能捕捉到一段有用的对话。而新方法则会先倾听整个房间,以了解谁实际上正在与谁交谈,然后根据这些真实的对话来形成分组。研究人员通过使用一种被称为“Transformer”的人工智能技术实现了这一点,这种技术因其理解语言的能力而闻名。他们调整了这项技术,将其应用于将数据表的列视为句子中的单词。通过训练系统根据周围的列来预测缺失的数据片段,计算机学会了一张关于哪些特征相互依赖的地图。
一旦学习到了这张关系图,系统就会利用它来构建其预测模型团队。在旧有的随机方法中,两个深度关联的列可能会被分隔到不同的组中,而两个无关的列可能会被强行凑在一起。在新的 CTRE 方法中,系统利用学习到的地图来引导分组过程。它会让具有强关联性的列更有可能被放在同一个组内,但仍会保留一定的随机性以确保团队保持多样性。在这些更智能的组内,系统会执行一种数学变换,在过滤掉噪声的同时突出最重要的模式。至关重要的是,研究人员增加了一个步骤,以确保在一个组中学习到的信息不会意外地泄露到另一个组中。他们针对每个组分别独立地重新处理数据,因此最终的预测仅取决于分配给该组的具体变量,从而保留了每个团队成员的独特视角。
这种新方法的测试结果涵盖了从医疗记录到房价以及工业传感器读数等各种现实世界的数据集。在处理拥有数百个不同特征且混合了多种不同类型数据的复杂高维问题时,新方法表现优于现有的最佳技术。例如,在一个涉及具有 384 个不同特征的 CT 扫描切片的数据库中,新方法比之前的顶尖模型显著降低了预测误差。它在处理严重不平衡的数据(例如,只有极小部分条目代表罕见故障或特定疾病的数据集)方面也展现出了卓越的能力。在这些困难的情况下,旧模型往往会完全忽略这些稀有事件,但新方法成功识别了与它们相关的微妙模式。然而,研究人员发现,这种先进的方法并非万能良药。在特征较少或数据非常均匀的简单数据集上,学习列之间关系的额外复杂性有时会引入比价值更多的噪声,此时简单的模型表现得同样好甚至更好。
这项研究表明,表格学习的未来在于尊重数据的底层结构,而不是将其视为随机的数字集合。通过教会计算机在尝试做出预测之前理解特征是如何相互作用的,研究人员创造了一个工具,对于现实世界中那些混乱、复杂且异构的数据而言,该工具特别强大。这项工作并不声称解决了所有的数学问题,但它证明了当数据丰富且复杂时,一种能够倾听变量间联系的方法可以构建出一个更加准确且可靠的预测团队。这种从随机分组向引导式、上下文感知分组的转变,代表了机器如何学习驱动我们现代决策过程的结构化表格方面迈出的重要一步。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。