Clustering data with values missing at random using scale mixtures of multivariate skew-normal distributions
本文通过将多元偏正态分布的有限混合尺度混合模型进行扩展,以同时处理偏度、重尾和不完全观测问题,提出了一种用于处理随机缺失数据的基于模型的聚类的增强型 EM 类算法。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你是一名正在试图通过对嫌疑人的习惯进行分组来破解谜团的侦探。在数据科学的世界里,这被称为“聚类”。通常情况下,侦探们面对的是一个完美的阵容,每个嫌疑人都有一份信息完整的档案。但在现实世界中,文件往往会缺失页面、墨迹模糊,或者证人遗忘了细节。这就是“缺失数据”。如果你试图通过忽略这些缺失的文件来破解谜题,你可能会错过最重要的线索;如果你试图猜测缺失的部分,你可能会不小心凭空创造出一个从未存在的嫌疑人。
为了理清混乱且不完整的信息,科学家们经常使用一种叫做“混合模型”的工具。把它想象成一袋不同颜色的弹珠。如果你伸手抓出一个,你不知道它是哪种颜色,但你知道袋子里混合了红色、蓝色和绿色。目标是弄清楚袋子里有多少种颜色,以及“平均”一颗红弹珠是什么样子的。长期以来,科学家们假设这些弹丸是完美圆润且对称的,就像标准的骰子一样。但现实世界中的数据往往是不对称的——有些弹珠被拉长了,或者具有极端值聚集的重尾。为了处理这种情况,科学家们开发了“偏正态”(skew-normal)分布,它们就像是具有伸缩性、不对称的弹珠,可以弯曲以适应奇特的形状。
然而,这里有一个问题:这些高级的、具有伸缩性的弹珠在数据完整时表现出色,但当文件出现缺失页面时,它们就会崩溃。你不能只是忽略缺失的部分,而简单的猜测又充满了风险。这篇论文正是为了填补这一空白。它采用了强大的、具有伸缩性的“偏正态”弹珠,并教会它们如何在不破坏游戏规则的情况下处理缺失信息。
作者们是一个由来自南非、美国和意大利的统计学家组成的团队,他们构建了一个名为“有限偏正态多元混合比例混合模型”(FMSMSN)家族的新型数学引擎。想象一下,这个家族是一个包含四种不同类型的伸缩性、不对称弹珠的工具箱:标准的偏正态(skew-normal)、偏t分布(skew-t,用于处理极端异常值)、偏斜分布(skew-slash,用于处理更狂野的异常值),以及偏方差伽马分布(skew-variance-gamma,其中最具灵活性)。
这篇论文的重大突破在于,他们弄清楚了如何即使在数据不完整的情况下也能使用整个工具箱。他们通过假设缺失的数据是“随机缺失”(Missing At Random, MAR)来实现这一点。用侦探的话来说,这意味着文件缺失的原因并不是因为嫌疑人隐瞒了关于自己的某些特定信息,而是因为文件在邮寄过程中丢失了,或者证人当时正忙于其他事情。缺失情况并不取决于那个秘密数值本身。在这一假设下,作者们推导出一套新的规则(一种改进的算法),允许计算机在确定分组的同时进行数学上的“填补空白”,而不是仅仅进行猜测或丢弃数据。
为了测试这个新引擎是否有效,团队进行了一系列计算机模拟。他们创建了带有两组数据的虚假数据集,其中一些组别靠得很近,另一些则相距较远。然后,他们故意随机抹去了0%、20%、40%、60%甚至80%的信息。他们测试了工具箱中的所有四种类型的弹珠,以观察哪一种仍能正确找到分组并准确推测出弹珠的形状。
结果显示,随着缺失数据的增加,所有模型寻找分组的难度都会增大,这是符合预期的。然而,更复杂、更灵活的模型(如偏方差伽马分布)通常在恢复数据真实形状方面做得更好,即使在缺失高达80%信息的情况下也是如此。团队发现,虽然在数据缺失时没有模型是完美的,但他们的新方法远优于简单地删除不完整的行,因为如果采用那种方法,他们将几乎没有任何数据可用。
最后,研究人员将这种新方法从模拟实验室带到了现实世界的数据应用中:全球二氧化碳(CO2)排放量。他们研究了全球七个不同部门(如电力、制造业和运输业)的排放情况。问题在于,该数据集中超过84%的行都是不完整的。如果他们使用旧有的“删除缺失值”法,他们将不得不丢弃几乎整个数据集。相反,他们使用了这个新算法。
该算法成功地将各国分为两个截然不同的集群。一组包括排放量普遍较低的国家,例如北非部分地区、加拿大和日本。另一组则包括高排放国家,包括美国、中国、印度以及许多全球南方国家。分析表明,经济增长(GDP)的提升与二氧化碳排放量的增加之间存在联系,这凸显了发展中经济体在增长与环境影响之间往往面临着权衡。这项研究得出结论,通过使用这种灵活且对缺失数据友好的方法,科学家现在可以揭示以往无法看到的混乱现实世界数据中的模式,从而在无需丢弃宝贵信息的情况下,为全球趋势提供更清晰的图景。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。