Handling Missingness and Censoring in Dirichlet Mixture Models
本文提出了一种用于直接在单纯形上拟合狄利克雷分布有限混合模型的创新期望最大化算法,以处理缺失和受限的成分数据,并通过模拟实验和实际应用证明,该方法在保持数据可解释性的同时,在聚类准确度和模型选择方面优于传统的案例删除法。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你正试图描述一款奶昔,但你只能尝到其中几种水果的味道。也许你知道里面有草莓和香蕉,但搅拌机把芒果和奇异果给隐藏了。在数据科学的世界里,这被称为“成分数据”(compositional data)。它描述的是部分如何构成整体的信息,比如食谱中的配料,或是岩石中的化学成分。棘手之处在于,这些部分是相互锁定的:如果你增加了一种配料,其他配料的数量会自动减少,因为它们必须始终相加等于 100%。科学家利用这类数据来理解从山脉如何形成到空气为何变得浑浊的一切事物。但这里有一个大问题:现实世界的数据是杂乱无章的。有时传感器会损坏,有时化学物质太微小而无法被观测到,有时数据就这么莫名其妙地丢失了。每当这种情况发生时,常规的数学工具就会陷入混乱,因为它们无法处理这些“缺失”的部分,否则要么会丢弃整个“奶昔”,要么会以一种让原配方变得无法辨认的方式改变配方。
这篇论文解决的正是一个这样的头痛问题。作者 Jason Pillay 及其团队发明了一种新的数学处理方式,它不会丢弃那些缺失的部分。他们没有强行将数据塞入一个不匹配的形状,而是构建了一个特殊的“侦探”算法,该算法可以在对数据进行分类的同时,推测出可能缺失的部分。你可以把它想象成一个拼图游戏,其中一些碎片丢失了;与其放弃,不如让这位侦探利用周围碎片的形状,精准地推断出缺失的部分应该放在哪里,同时确保拼图的画面依然忠于原作。他们用带有缺失部分的模拟数据和关于岩石及空气污染的真实数据测试了这位“侦探”。结果发现,与那种仅仅通过删除杂乱数据来处理的方法相比,他们的方法在寻找正确类别和确定正确类别数量方面表现得更为出色。这是一种在不丢失主线剧情的情况下,理清残缺故事的方法。
问题所在:“缺失碎片”的谜题
在科学研究中,我们经常处理通过部分来描述整体的数据。想象一块由不同矿物组成的岩石,或者一团充满了不同化学物质的空气。规则很简单:所有部分必须相加等于 100%。如果岩石含有 50% 的石英,那么剩下的所有东西加起来也只能是 50%。这就是所谓的“成分数据”。
问题在于数据是不完整的。也许是机器未能测量出某种特定的矿物,或者是某种化学物质过于微弱而无法被观测到,导致数值被隐藏了。在过去,科学家面临两个糟糕的选择:
- 丢弃: 因为缺少一个部分就删除整个样本。这会浪费大量的信息。
- 伪造: 在进行数学计算前,先猜测缺失的数值并将其填补上去。这可能会误导结果,使分类看起来出现偏差。
本文的作者希望寻找第三条路:一种能够留在“单纯形”(simplex,即那个 100% 规则的数学名称)上,并且能直接处理缺失部分的方法,而不是删除或伪造它们。
解决方案:一个聪明的侦探算法
作者开发了一个基于著名的数学工具——期望最大化(EM)算法的新版本。你可以把这个算法想象成一个超级聪明的侦探,正试图将一堆凌乱的线索分类到不同的组别中。
以下是这位侦探在这种新方法中是如何工作的:
- 设定: 侦探知道存在不同“类型”的岩石或空气样本(称为聚类/clusters),但目前还不知道每个样本具体属于哪一类。
- 猜测(E步): 当侦探看到一个带有缺失部分的样本时,他不会惊慌。他会观察已有的部分,并询问:“如果这个样本属于 A 组,那么缺失的部分最可能是什么?”他会根据该组的规则来计算缺失部分的概率。
- 更新(M步): 利用这些猜测,侦探会更新他对 A 组和 B 组实际特征的理解。
- 循环: 他会反复执行这个过程。随着每一次循环,猜测会变得越来越准,组别也会变得越来越清晰。
神奇之处在于,这一切是同时发生的。算法在对样本进行分类的同时,也在推算缺失值,并且始终遵循着所有部分之和为 100% 的规则。
测试:模拟实验与现实世界的谜团
为了验证这位侦探是否足够优秀,作者进行了两种类型的测试。
1. 模拟实验室(虚构数据)
他们创建了 1,000 个虚构数据集,在已知真实分组的情况下,人为隐藏了不同程度的数据(缺失比例从 0% 到 90% 不等)。
- 结果: 即使有 90% 的数据缺失,他们的方法仍能以惊人的准确度对样本进行分类。
- 对比: 他们将此方法与传统的“直接删除不完整样本”的方法进行了对比。当数据缺失时,旧方法无法找到正确的组别数量;而新方法即使在数据非常稀疏的情况下,也能更频繁地找到正确的组别数量(在他们的测试中为四个)。
- 截断数据(Censoring): 他们还测试了“截断”数据,即某个数值因为太小而无法测量(例如低于检测限的化学物质)。新方法处理这类数据表现同样出色。
2. 现实世界的谜团
他们将该方法应用于两个真实数据集,以观察它能否解决实际的科学难题。
谜团 1:地球的地幔(捕虏体/Xenoliths)
他们分析了 1,256 个来自地球深处的岩石样本。由于这些岩石采集自不同地点且使用了不同的工具,其中 33% 的测量值是缺失的。- 发现: 算法将这些岩石分成了四个截然不同的组。这些组完美契合了真实的地理类型。例如,一组富含镁和硅(橄榄岩),来自地壳古老的稳定部分;而另一组则含有更多的铁和铬。该方法在不需要丢弃那些杂乱样本的情况下,成功识别出了这些岩石类型。
谜团 2:我们呼吸的空气(PM2.5)
他们研究了来自美国空气质量系统的监测数据,追踪空气中的微小颗粒。这些数据既包含缺失值,也包含“截断”值(即因太小而无法测量的化学物质)。- 发现: 算法找到了四种明显的空气污染类型。
- 第一组: 寒冷空气,含有大量的硫酸盐和硝酸盐(通常来自工业排放)。
- 第二组: 碳和硝酸盐的混合物。
- 第三组: 热空气,其中很大一部分污染是“未知”的(“残余部分”巨大),这表明存在一些不易吸收光的隐形颗粒。
- 第四组: 以有机碳为主(如烟雾或尾气)的温暖空气,这在城市中很常见。
- 洞察: 该方法表明,在温暖天气下,污染物的组成会发生变化,且很大一部分是由传感器无法观测到的物质构成的。这为科学家提供了关于“空气中到底有什么”的新线索。
- 发现: 算法找到了四种明显的空气污染类型。
为什么这很重要
这篇论文表明,我们不必在“丢弃坏数据”和“伪造数字”之间做二选一。通过构建一个理解游戏规则(即 100% 总和规则)并能处理缺失部分的模型,科学家可以从杂乱的数据中获得更清晰的答案。
作者发现,在寻找正确组别数量和对样本进行正确分类方面,他们的方法比传统的“删除坏数据”法更有效。虽然这篇论文并未声称它能解决世界上所有的难题,但它展示了对于岩石和空气质量研究而言,这位新“侦探”是一个强大的工具。它让研究人员即使在部分信息隐藏在黑暗之中时,也能看清全貌。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。