想象一下,你正在试图教一台计算机如何在满筐的好苹果中识别出一个“坏苹果”。这被称为离群点检测(Outlier Detection)。无论是发现虚假的信用卡交易、故障的机器零件,还是罕见的疾病,计算机都需要学习什么是“正常”,以便能够标记出那些异常的东西。
长期以来,试图构建这些“坏苹果检测器”的科学家们一直拿着一个非常小且有些残缺的工具箱在工作。这篇名为 macrOData 的论文引入了一个巨大的、全新的工具箱来解决这个问题。
以下是作者所做工作的拆解,使用了简单的类比:
1. 问题所在:“玩具小盒”
多年来,测试这些检测器的标准工具是一个名为 ADBench 的集合。
- 类比: 想象 ADBench 是一个只有 57 辆玩具小汽车 的玩具盒。
- 问题: 如果你只在 57 辆微小的玩具车上测试你那台崭新的高级汽车引擎,你无法判断它是否能在真正的卡车、摩托车或宇宙飞船上运行。
- 隐藏的陷阱: 作者发现这 57 辆玩具车看起来都极其相似。它们大多只是“噪声”(就像收音机里的静电)。正因如此,简单的、老派的技巧(比如测量距离)表现得几乎和最复杂的现代 AI 一样好。这就像是在一条泥泞的土路上测试法拉利,结果只能衡量你的车在土路上开得如何,而不是衡量它的速度,因为在这种环境下,三轮车也能赢。
2. 解决方案:“超级购物中心”(macrOData)
作者构建了 macrOData,这是一个包含 2,446 个数据集 的庞大全新测试场。他们并非只是简单的复制粘贴,而是精心策划了三个不同的“侧翼”:
- 侧翼 1:OddBench(现实世界的犯罪现场)
- 定义: 790 个真实的表格数据,其中的“坏苹果”是具有实际意义的问题(如欺诈、设备故障或疾病)。
- 类比: 这就像是一个真实案件博物馆。它教会计算机在人群中识别小偷,而不仅仅是识别一个模糊的像素。
- 侧翼 2:OvRBench(“一比多”健身房)
- 定义: 856 个取自标准分类任务(通常用于将事物分为不同类别)的数据集,并将其转化为了离群点任务。
- 类比: 想象把一个分类游戏(比如按红蓝弹珠进行分类)变成这样:说,“好了,现在找出那个不属于任何颜色的弹珠。”它测试了计算机处理变化规则的能力。
- 侧翼 3:SynBench(虚拟实验室)
- 定义: 800 个由计算机生成的带有特定模式和特定类型“坏苹果”的数据集。
- 类比: 这是一个视频游戏模拟器。科学家可以创造出不可能发生的场景(比如重力向侧面作用的世界)来观察检测器是否会崩溃。
3. 新的游戏规则
作者不仅增加了更多数据,还改变了游戏规则以确保公平:
- 标准化划分: 每个数据集都预先切分为“训练”堆和“测试”堆。不再有通过偷看答案来作弊的行为。
- “盲测”机制: 他们保留了 200 个数据集作为“私有”数据。他们拥有答案,但公众没有。这允许建立一个在线排行榜,让研究人员在不知道正确答案的情况下进行公平竞争。
- 元数据标签: 每个数据集都附带一个描述其属性的标签(例如“医疗”、“金融”),以便研究人员明确知道他们在测试什么。
4. 大实验:谁是赢家?
作者在这一超级购物中心中测试了 14 种不同的“侦探”(算法)。这些算法涵盖了:
- 老派方法: 简单的数学技巧(如 KNN)。
- 深度学习: 复杂的神经网络。
- 基础模型(Foundation Models): 最新的、在海量数据上训练过的巨型 AI 模型。
实验结果:
- 老卫兵 vs. 新势力: 令人惊讶的是,复杂的“深度学习”模型表现往往不如简单的模型。为什么?因为它们对参数设置过于敏感(就像一辆只要收音机音量调大就会熄火的汽车)。
- 冠军: 基础模型(特别是 OutFormer 和 FoMo-0D)是明显的赢家。
- 原因: 它们速度快、准确度高,且不需要手动进行“调优”。它们实现了“即插即用”。
- 隐喻: 如果说旧的方法像是需要修理师调整 50 个螺丝才能让车跑起来,那么基础模型就像是一辆只要踩下油门就能自动驾驶的汽车。
5. 总结
这篇论文在说:“别再用那个微小的、残缺的玩具盒来测试你的新想法了。”
通过提供一个庞大、多样且公平的测试场(macrOData),他们证明了基础模型是目前识别表格数据中离群点的最佳工具。它们比统治该领域多年的复杂深度学习模型更快、更准确,也更容易使用。
作者已经开源了所有 2,446 个数据集和排行榜,邀请全世界来参与、测试并改进这些新标准。
技术摘要:macrOData —— 数千个数据集的新基准,用于表格异常检测
问题陈述
表格数据上的异常检测(OD)对于欺诈检测、医疗保健和环境监测等应用至关重要。然而,该领域缺乏大规模、多样化且标准化的基准测试,导致难以评估科学进展或做出明智的方法论选择。目前的默认标准 ADBench 仅限于 57 个数据集。作者认为,这种小规模限制了统计效力,降低了多样性,并使得经验比较高度依赖于数据集的选择。
此外,本文指出 ADBench 存在一个特定的结构性局限:它主要捕捉类似于高斯噪声的全局异常值(global outliers)。这一特性无意中有利于简单的基于全局距离的方法(如 KNN)以及近期在合成高斯混合模型上预训练的基座模型(如 FoMo-0D),这可能会掩盖它们处理更复杂、具有语义性或局部异常的能力。由于异常检测的无监督性质以及对超参数的高度敏感性,这些评估问题进一步加剧,因为调优选择可以在缺乏稳健统计验证的情况下剧烈影响性能。
方法论:macrOData 套件
为了解决这些差距,作者引入了 macrOData,这是一个由 2,446 个数据集组成的综合基准套件,这些数据集是从三个不同组件中策划而来的。数据主要来源于 Tablib(6.27 亿张表格)和各种分类存储库。
1. OddBench(语义异常)
- 来源: 来自 Tablib 的精选子集,其中的表格包含具有语义含义的异常(例如“欺诈”、“故障”、“缺陷”)。
- 策划过程: 作者应用了严格的五步过滤流程:
- 初步过滤: 移除了具有高空值/无穷大比例、单调特征或规模不足(样本量 <1,000,数值特征 <3 个)的表格。
- 基于目标的过滤: 选择带有明确识别异常的类别特征(如“攻击”、“错误”)的表格。
- 哈希与可分性检查: 移除重复项,并确保异常值与正常值是可分的(随机森林分类器 ROC-AUC > 0.6)。
- 人工质量控制: 通过人工检查以验证语义相关性并移除剩余的重复项。
- 质量提升: 添加了标准化的训练/测试拆分,丰富了元数据,并创建了一个代表性子集。
- 规模: 790 个数据集(690 个公开,100 个私有)。
2. OvRBench(统计异常)
- 来源: 源自过滤后的 Tablib 剩余部分以及已建立的分类基准(OpenML-CC18, TabZilla, TabRepo 等)。
- 方法论: 使用 One-vs-Rest (OvR) 方法,将单个类别指定为正常值(inlier),而将所有其他类别视为异常值(outlier)。这捕捉了概念漂移和分布外(OOD)检测场景。
- 目标选择: 对于没有预定义目标的 Tablib 数据,作者筛选了名称为 "label" 或 "target" 且基数在 2 到 10 之间的特征。
- 规模: 856 个数据集(756 个公开,100 个私有)。
3. SynBench(合成先验)
- 来源: 800 个合成生成的数据集,旨在涵盖多样的数据先验和异常原型。
- 生成器:
- 高斯混合模型 (GMM): 捕捉多模态结构;通过在子空间中扩大方差来生成异常值。
- 结构因果模型 (SCM): 生成非线性、非高斯分布;通过测量噪声增加或结构图修改来创建异常值。
- Copulas: 模拟多样化的边缘分布和依赖关系;通过将坐标推向边界或破坏联合结构来创建异常值。
- 规模: 800 个数据集(全部公开)。
基准测试特性
- 标准化: 所有数据集都包含标准化的训练/测试拆分(50% 正常值用于训练;50% 正常值 + 所有异常值用于测试)。
- 公开/私有划分: 每个现实世界基准包含 100 个私有数据集,其测试标签已被脱敏,以支持盲测的在线排行榜,实现公平评估。
- 元数据: 数据集通过大语言模型(LLM)生成了语义标签、领域关键词和来源链接等注释。
实验评估
作者进行了广泛的实验,在所有 2,446 个数据集上评估了 14 种 OD 方法,涵盖了经典方法、深度学习方法和基座模型。
- 评估的方法:
- 经典方法: OCSVM, KNN, LOF, CBLOF, IForest, EGMM, DTE-NP。
- 深度学习方法: GOAD, ICL, DTE-C, NPT-AD。
- 基座模型: FoMo-0D, OutFormer, TabPFN-OD。
- 超参数 (HP) 策略: 为确保公平评估,作者针对广泛的 HP 配置对方法进行了测试。经典模型在全网格上进行测试;深度模型从预定义的空间中采样;基座模型则无需调优。
- 指标: 性能通过 AUROC 和 AUPRC 进行衡量,并通过平均排名(Average Rank)、ELO 分数、胜率(Win Rate)、重缩放 AUC(rescaled AUC)和冠军增量(Champion Delta)进行聚合。通过置换检验(permutation tests)确定统计显著性。
关键结果
- 基座模型占据主导地位: 基座模型(特别是 OutFormer 和 FoMo-0D)在检测性能(AUPRC)和运行时间方面显著优于所有经典和深度学习方法。它们占据了性能-时间权衡的帕累托前沿(Pareto front)。
- 经典方法 vs. 深度学习方法: 经典方法通常优于深度学习模型,这主要是因为后者对超参数选择高度敏感。在经典方法中,EGMM、DTE-NP 和 LOF 展示了最佳的性能-运行时间权衡。
- 超参数敏感性: 深度模型在不同超参数配置下的性能表现出高方差。相比之下,集成方法(如 EGMM)和基座模型展示了更强的鲁棒性,其中基座模型完全消除了调优的需求。
- 证实了 ADBench 的局限性: 实验结果验证了作者的假设,即 ADBench 对类高斯噪声和全局异常值的偏好,使得简单的算法(如 KNN)和经过高斯预训练的基座模型能够获得最先进的效果(SOTA),但这可能无法泛化到更复杂的现实世界语义异常中。
意义与贡献
本文声称的贡献如下:
- “揭秘” ADBench: 本研究批判性地分析了当前标准基准的局限性,揭示了其对高斯噪声和全局异常值的偏见,这种偏见扭曲了现代算法的实际有效性感知。
- 全新的大规模基准: 引入了 macrOData,这是首个具备如此规模(2,446 个数据集)、拥有多样化语义和统计异常、且具有标准化拆分及公开/私有划分的基准套件。
- 全面的评估与指南: 广泛的评估确立了基座模型是目前表格 OD 最有效且最高效的方法,具有“即插即用”的能力,且无需超参数调优。
- 研究赋能: 通过提供一个稳健且多样化的测试平台,macrOData 旨在促进 OD 领域在元学习和基座模型方面的未来研究,推动该领域超越小规模、低多样性数据集的限制。
作者强调,macrOData 已开源,包括用于策划、数据集构建和单个性能结果的代码,并配有公开访问的排行榜,以追踪未来的进展。
每周获取最佳 machine learning 论文。
受到斯坦福、剑桥和法国科学院研究人员的信赖。
请查收邮箱确认订阅。
出了点问题,再试一次?
无垃圾邮件,随时退订。