Handling Missingness and Censoring in Dirichlet Models
本文提出了一种用于狄利克雷参数最大似然估计与基于模型的插补的期望最大化算法,以处理成分数据中的缺失与截断成分,并通过模拟实验和汞形态分布案例研究,证明了该方法在保持成分结构方面比现有方法具有更优越的性能。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你正试图描述一个披萨,但你只能谈论配料,而不能谈论整个饼底。在统计学领域,这被称为“成分数据”(compositional data)。它是指任何代表整体中各部分的数值集合,比如岩石中不同矿物质的百分比、森林中物种的构成,或是公司不同部门的预算。因为这个规则,所有的部分都必须精确地相加等于 100%(或 1)。由于这条规则的存在,各个部分是相互锁定的:如果奶酪增加了,意式腊肠就必须减少。这创造了一种复杂的数学舞蹈,其中的数字以一种会让标准计算机程序产生误导的方式相互依赖。
通常情况下,统计学家处理缺失信息的方法要么是如果哪怕缺了一片,就扔掉整个披萨;要么是将数据挤压成另一种形状(比如一条直线)以便于分析。但挤压数据会扭曲其“风味”,而扔掉数据则是浪费。大问题在于:我们如何在不破坏食谱或假装知道我们并不知晓的事情的前提下,填补披萨缺失的部分?当缺失的部分不仅仅是“消失了”,而是被“审查”(censored)时——这意味着我们知道它们存在于某个特定范围内,但不知道确切的数值——这个问题会变得尤为棘手。
本文介绍了一种利用称为“期望最大化”(EM)算法的巧妙新方法来解决这一谜题,该算法专门针对“狄利克雷分布”(Dirichlet distribution)。你可以将狄利克雷分布想象成这些“部分组成整体”数据集的完美数学食谱书。作者们与比勒陀利亚大学及其他机构合作,构建了一个像超级聪明侦探一样的工具。该算法并没有随机猜测缺失的数值,也没有扔掉那些杂乱的数据,而是反复进行一场“猜想与校验”的游戏。它先对缺失值做一个猜测,然后根据这个猜测计算出最佳可能的配方(参数),接着再利用这个新配方做出更好的缺失值猜测。它不断重复这个过程,直到配方和猜测都不再发生变化为止。
论文表明,这种方法即使在数据非常混乱的情况下也表现得非常出色。在测试中,作者模拟了高达 90% 的数据缺失或仅部分已知的场景,而他们的方法仍然能比旧方法更好地恢复出真实的底层配方。他们还将此方法应用于人类血液中汞水平的真实世界数据。在这个数据集中,某些类型的汞由于含量过低而无法被测量(被审查),且有些完全缺失。新算法成功填补了空白,表明甲基汞(通常来自鱼类)是最常见的类型,同时也揭示了血液中可能存在尚未被测量的未知类型的汞。
至关重要的是,作者发现他们的方法比其他方法能更好地保留数据的自然“形状”。虽然其他方法可能会强行将数据塑造成不合适的形状,但这个新工具始终保持在“单纯形”(simplex,即所有部分之和为 1 的数学空间)之内。研究结果表明,对于处理不完整混合物(无论是血液样本、土壤成分还是调查结果)的科学家来说,这种新方法为理解整体图景提供了一种更可靠的方式,即使在某些部分隐藏起来时也是如此。它并不声称自己是魔法,但在所呈现的模拟实验和现实测试中,它在处理缺失部分方面始终优于现有的标准方法。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。