← 最新论文
📊 statistics

Testing for a common subspace in compositional datasets with structural zeros

本文提出了一种新型统计检验,其具有参数和非参数两种形式,用于确定具有不同结构零模式的两个成分数据集是否共享一个共同的主子空间,同时保持与 Aitchison 几何的兼容性。

原作者: Francesco Porro, Fabio Rapallo, Sara Sommariva

发布于 2026-08-24
📖 1 分钟阅读☕ 轻松阅读

原作者: Francesco Porro, Fabio Rapallo, Sara Sommariva

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

在人体这个隐秘的世界里,生命往往并非以单一有机体的形式存在,而是作为一个繁忙的微型居民社区。研究这些群落(例如生活在我们肠道或皮肤上的细菌)的科学家并不通过它们的总重量或细胞计数来进行测量。相反,他们观察的是比例:某一类细菌占整个群落的百分比与其他类型的比例。这种所有部分的总和始终等于一个整体的数据类型被称为成分数据(compositional data)。由于关注点在于各部分之间的关系而非其绝对大小,标准的统计工具往往会失效,导致研究人员必须使用遵循这些独特数学规则的专门方法。然而,在研究这些群落时出现了一个持久的问题:某些类型的细菌在特定的身体部位是完全缺失的。这些细菌的缺失并非仅仅因为采样误差;它们是结构性缺失,意味着该环境根本无法支持它们。当研究人员试图比较两组数据,且其中一组完全缺失了另一组所拥有的不同组成部分时,他们用来可视化和分析数据的标准数学地图就会崩溃,使他们无法观察到这两组数据是否具有任何潜在的相似性。

热那亚大学的一个研究团队开发了一种解决这一谜题的新方法,允许科学家对比这些破碎的群落,并确定它们是否具有共同的结构。他们的核心工作解决了微生物组分析中的一个特定挑战:如何测试两个不同的样本组(每组都有其独特的缺失细菌模式)是否仍然围绕着同一个中心变异轴旋转。想象一下,你试图比较两朵云的形状,但一朵云缺少左侧,而另一朵云缺少右侧;传统方法会认为你无法进行比较,因为它们处于不同的空间。研究人员创建了一种统计检验方法,能够有效地将这两个不同的组置于一个统一的框架内,而无需对缺失值进行猜测。他们并没有用微小的数值来替换这些结构性零值——作者明确拒绝了这种做法,因为这会扭曲数据——而是构建了一种尊重数据几何特性的方法,将缺失的部分视为一种有意义的特征,并利用数学算子将不同的子空间映射到一个共同的坐标系中进行比较。

为了证明其方法的有效性,作者使用不同类型的数据分布进行了数千次计算机模拟,包括那些模拟现实世界生物样本不可预测特性的数据。他们将这种新程序与现有方法进行了对比,发现其方法非常稳健,特别是在数据不遵循完美的平滑钟形曲线的情况下。在这些更复杂的场景中,他们的新测试在避免误报的同时,仍能正确识别出两个组是否真正共享共同结构,表现得更为出色。研究人员随后将该方法应用于来自人类微生物组项目的真实数据,对比了人体不同部位的细菌群落。他们比较了鼻前部与肘部内侧的样本,以及粪便与唾液的样本。在第一种比较中,测试显示,尽管鼻子和肘部拥有不同的缺失细菌集合,但存在的群落共享一种共同的潜在变构模式。分析强调,特定稀有细菌的存在或缺失是导致样本间差异的主要驱动因素,即使这些细菌并不丰沛。

相比之下,当研究人员比较肠道和口腔时,测试表明这两个环境有着本质的区别。粪便和唾液中的群落并不共享共同的结构骨架;它们的组织方式完全不同。这种区别至关重要,因为它告诉科学家,管理肠道细菌群落的规则与口腔中的规则并不相同,不能将它们视为同一系统的变体来进行分析。研究人员还展示了如何使用一种特定类型的图表来可视化这些发现,该图表可以显示哪些细菌群体驱动了地点之间的相似性或差异。通过识别哪些细菌对共享模式的贡献最大,该方法为观察塑造这些群落的生物力量提供了一个清晰的窗口。这项工作为研究人员提供了一个可靠的工具,帮助他们在复杂的缺失数据景观中航行,确保不同身体部位或不同人群之间的比较是基于坚实的数学基础,而非错误的假设。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →