Revisiting Energy-based Tabular Anomaly Detection: Energy and Reconstruction are Complementary
本文证明了经典的基于能量的模型(特别是深度玻尔兹曼机)为用于表格数据异常检测的基于重构的方法提供了一个非冗余且互补的视角,通过将其能量分数与自动编码器输出进行融合,显著提升了性能。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你是一名正在试图从成千上万个真硬币中找出一个假硬币的侦探。在数据科学的世界里,这被称为“异常检测”。通常情况下,这些“硬币”是电子表格中的一行行数字——比如银行的客户名单或计算机网络的流量日志。棘手之处在于,这些数字并不像猫的照片或书中的句子那样具有自然的形状;它们只是一堆杂乱无章、互不相关的各种事实。为了找到那个假硬币,当今大多数侦探使用两种主要的技巧。第一种是“重构”技巧:他们构建一个机器,试图记住一个“真”硬币看起来是什么样子的。如果机器尝试复制一个假硬币却惨败了,它就知道出问题了。第二种是“密度”技巧:他们寻找那些独自站在人群中、远离主群体的硬币。这两种方法都很出色,但它们都是间接的;它们是通过观察缺失了什么或哪里过于拥挤来猜测哪里不对劲,而不是理解使硬币变得“真实”的深层、隐藏的规则。
这篇论文进入了那个侦探室,并提出了一个大胆的问题:如果我们请回一个名为“能量模型”(Energy-Based Model)的古老且略带尘埃的工具来帮忙,情况会怎样?具体来说,作者重新审视了一种经典的机器学习结构——深度玻尔兹曼机(Deep Boltzmann Machine, DBM)。你可以把它想象成不是一个试图复制图片的机器,而是一个能为每种可能的数据组合分配“舒适度评分”的机器。如果数据感觉“舒适”(低能量),它很可能是真实的。如果数据感觉“不舒服”(高能量),它很可能是假的。作者想看看这种旧式的“舒适度评分”是否能比现代的“复制机器”表现得更好,更重要的是,如果将两者结合使用,是否会让侦探变得更加敏锐。
旧工具的新工作
故事始于一个假设:“重构”方法(复制机器)和“能量”方法(舒适度评分)是从两个完全不同的角度观察数据的。复制机器检查是否可以逐件重建数据,就像一台 3D 打印机试图重塑一个玩具。然而,能量模型则是观察全局,检查所有碎片之间的关系是否在整体上逻辑自洽。作者新美纯一郎(Junichiro Niimi)想知道,这两种视角是否如此不同,以至于它们能够完美地互补,而不是仅仅重复相同的信息。
为了测试这一点,他们使用两个截然不同的数据集进行了一场大规模实验。第一个是银行营销名单(Bank Marketing),试图识别哪些客户会真正购买定期存款;第二个是网络安全日志(NSL-KDD),试图识别计算机攻击。他们将这个“能量”侦探与另外八位著名的侦探进行了对决,其中包括像自动编码器(Autoencoders,即复制机器)以及几种现代非参数评分器在内的当前冠军。他们使用不同的随机种子运行了 20 次测试,以确保结果不仅仅是运气使然。
结果:令人惊讶的平局与强大的团队
结果非常引人入胜。当 DBM “能量”侦探单独作战时,它的表现极其出色。在银行营销数据上,它在准确性上与表现最好的复制机器(自动编码器)打成了平手,达到了顶尖水平。在网络安全数据上,它的表现甚至超过了自动编码器,得分略高。这是一个重大发现,因为 DBM 是一个要古老的模型,它在没有针对表格数据进行任何特殊调整的情况下,竟然能与现代重量级选手竞争。
但真正的魔力发生在他们合力之时。作者将“能量”评分与“重构”评分结合在一起,并将它们融合。结果显示,这个团队在统计学上比任何一个单独工作的侦探都要强大。在银行数据上,该团队将准确率提升了一个微小但显著的幅度。在网络安全数据上,尽管大家已经做得近乎完美,该团队仍然设法榨出了哪怕一点点额外的准确率。
这里是故事最关键的部分:作者测试了是否任何两种不同的方法组合在一起都能发挥作用。他们尝试将自动编码器与另外七种方法(如孤立森林或 LOF)配对。几乎每次,团队的表现都会变差或保持不变。只有当他们将自动编码器与 DBM(或源自 DBM 的重构评分)配对时,团队才变得更强。这证明了 DBM 不仅仅是另一个做着同样事情的侦探;它带来了一个其他方法根本无法提供的独特视角。
为什么这很重要
论文得出结论,虽然“重构”方法是目前表格异常检测中的王者,但它有一个盲点。它逐个坐标地观察数据,就像检查墙上的每一块砖是否形状正确。而 DBM 的“能量”方法则观察整面墙,检查这些砖块是否以一种符合结构逻辑的方式组合在一起。因为它们的观察视角不同,所以它们不仅是简单的叠加,而是实现了优势的乘数效应。
作者还发现了使用 DBM 的一个巧妙技巧。通常,这些模型计算的是包含“不确定性”(熵)项的“自由能”评分。然而,他们发现对于识别异常而言,忽略这个不确定性项并直接使用原始的“舒适度”评分反而更好。事实证明,不确定性项实际上掩盖了一些用于捕捉伪造数据的线索。
最后,这篇论文表明,我们不应该丢弃那些古老的、经典的行业工具。通过重新审视深度玻尔曼机,并将其“能量”视角与现代的“重构”视角相结合,我们可以构建一个更稳健的系统,用于在数据中寻找异类。这提醒我们,有时,前进的最佳方式是回头看看不同的角度。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。