Handling mild outliers and unobserved values in compositional datasets using finite mixtures of mean-parametrised Dirichlet models
本文提出了一种基于期望最大化的凸性均值参数化狄利克雷混合模型,用于稳健地处理异质成分数据中同时存在的缺失值和轻微异常值,并证明了其在聚类性能和异常值检测方面优于传统方法。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,试图通过观察一个饼图来理解人们是如何度过一天的:其中的切片代表了工作、睡眠、照顾家人或放松的时间。在统计学中,这种各部分必须相加等于一个整体的数据被称为成分数据(compositional data)。它无处不在,从岩石的化学成分到人们从事不同活动的各种时间。然而,现实世界的数据很少是完美的。通常,由于某人忘记报告某项活动或数据丢失,饼图中的某些切片会缺失。与此同时,一些报告可能显得奇怪或异常,例如有人工作了二十个小时,或者只睡了两个小时。这些被称为“离群值”(outliers)的奇特条目可能会扭曲整体图像,使得人们难以看清一个群体行为的真实模式。几十年来,统计学家一直致力于研究如何在不破坏“部分之和必须等于整体”这一基本规则的前提下,去分析这种由缺失数据和异常点组成的混乱混合物。
一组研究人员开发出了一种处理这一特定问题的新方法。他们创建了一个数学模型,该模型能够观察不完整、混乱的数据,并依然能找到具有相似行为的清晰群体,同时识别出哪些条目因过于奇特而不属于这些群体。他们的研究方法建立在狄利克雷分布(Dirichlet distribution)的概念之上,这是一种天然适用于受限于一个整体(如饼图)的数据的工具。以往的方法通常试图将这类数据强行转化为另一种形状以便于分析,但这可能会引入误差;而这种新方法则直接作用于原始形状。它并不将缺失的信息和奇特的离群值视为需要忽略的障碍,而是将其视为可以理解的特征。研究人员证明,他们的模型可以找到数据最可能的解释,并且这种解释是唯一的,这意味着对于他们正在解决的谜题,存在且仅存在一个最佳答案。
为了测试他们的想法,研究人员进行了数千次计算机模拟。他们创建了模拟现实生活的虚构数据集,其中包含了从几乎没有到高达百分之九十的数据缺失,并加入了不同程度的奇特离群点。他们发现,即使在数据非常不完整的情况下,他们的新模型也能成功地将数据分类到正确的组别中,并识别出那些异常条目。有趣的是,他们发现适度的缺失数据有时反而有助于模型的表现。当数据完全完整但充满噪声时,模型有时难以将真实的群体与混乱区分开来;但当部分数据缺失时,模型会变得不再那么容易被噪声干扰,从而能更清晰地专注于潜在的模式。这表明存在一个“甜点区”,在这个区间内,缺失的信息实际上能帮助模型忽略最糟糕的错误。
随后,研究人员将他们的方法应用于来自《美国时间利用调查》(American Time Use Survey)的真实世界数据集,该调查追踪了美国人如何度过每一天。这个数据集极具挑战性,因为近一半的活动记录缺失,且很大一部分记录包含异常的时间利用模式。当使用传统的旧方法分析这些数据时,模型将人们分成了四个截然不同的组别,但这种划分看起来很牵强,主要是由那些奇特的离群值驱动的。相比之下,他们的新模型识别出了两个清晰且合理的组别:一组人的生活以工作和个人护理为主,而另一组人的生活则以家庭生活、休闲和照顾家人为特征。该模型还将约百分之十六的记录标记为离群值,识别出这些人的日常作息非常特殊,无法整齐地归入这两个主要组别。通过将分析保持在数据的原始尺度上,研究人员能够用直白的语言来描述这些群体,例如“以工作为中心”或“以家庭为中心”,而无需将结果从扭曲的数学空间中转换回来。
这项工作的意义在于它能够尊重数据的自然约束,同时应对现实的复杂性。该方法并非强迫数据适应僵化的模具,而是顺应数据本身,允许缺失值和奇特点与主要模式共存。这意味着研究人员现在可以更有信心地研究复杂的现实世界行为,因为他们知道其结论不会被数据的缺口或少数异常条目所误导。这种方法提供了一种更诚实、更准确的方式,让我们通过人们如何分配时间的视角(或任何其他比例数据的视角)来看待世界,从而揭示隐藏在噪声之下的真实结构。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。