Cluster Analysis with Resampling for Validation and Exploration (CARVE)
本文介绍了 CARVE,这是一个开源的 Python 和 R 软件包,它通过利用基于重采样的稳定性与泛化性诊断,在处理复杂的、高维度的生物医学数据方面超越了传统的几何验证指标,从而解决了聚类分析中的复现性危机。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你是一名侦探,正试图将一大堆杂乱无章的证据(比如成千上万种不同类型的叶子,或者成千上万个独特的指纹)分类到不同的组别中。你想找到隐藏在混乱之中的“自然”分组。这就是科学家们所说的聚类(Clustering)。
然而,有一个巨大的问题:你如何知道自己分得对不对?
如果你请五位不同的专家来对同一堆叶子进行分类,他们可能会得出五种完全不同的分组方式。一位专家可能会说:“这些都是‘橡树’叶子”;而另一位可能会说:“不,这是‘枫树’和‘桦树’。”在数据科学领域,这是一场噩梦。如果仅仅因为你微调了一个设置或选择了一个不同的排序算法,结果就会发生变化,那么你还能信任这项发现吗?
旧方法:“完美球体”规则
长期以来,科学家们使用一套被称为**聚类验证指数(Clustering Validation Indices, CVIs)**的规则来决定哪种分类方式更好。你可以把这些指数想象成一份僵化的清单,它只在证据看起来像完美的圆球时才有效。
- 问题所在: 现实世界的数据(如生物细胞或社会行为)是杂乱无章的。它们具有重尾性、非线性且形状不规则。它们不是一个完美的球体,而是一个弯弯曲曲的面条或一块参差不齐的岩石。
- 结果: 当你将这些旧的“完美球体”规则应用于杂乱的数据时,它们往往会失效。它们可能会告诉你只有 2 个组,而实际上有 10 个;或者它们可能会凭空创造出并不存在的组。这就像是用尺子去测量一朵云;工具的形状根本无法匹配测量对象。
新方案:CARVE
本文的作者引入了一个名为 CARVE(基于重采样的聚类分析验证与探索)的新工具。
CARVE 不再问:“这看起来像不像一个完美的球体?”,而是问:“如果我们重新洗牌并重新发牌,我们还能得到相同的分组吗?”
以下是 CAR_VE 的工作原理,我们用一个简单的类比来说明:
1. “洗牌与发牌”测试(重采样)
想象你有一副代表你的数据的扑克牌。
- 旧方法: 你只看一眼整副牌,然后做一个猜测。
- CARVE 的方法: 你洗牌,发出一小手牌,对这些牌进行分类,看看你会得到什么样的分组。然后你再次洗牌,发出另一手不同的牌,再次进行分类。你重复这个过程数百次。
- 目标: 如果一组牌(比如所有的“K”)无论你怎么洗牌都会始终聚在一起,那么这个组就是稳定的(Stable)。如果这些“K”总是被随机拆散,那么这个组就是不稳定的(Unstable),很可能不是真实存在的。
2. “预测”测试(泛化性)
CARVE 还会检查这些分组对于新数据是否有效。
- 想象你教一个机器人去对你发出的第一手牌进行分类。
- 然后,你给机器人展示一入手它从未见过的全新牌。
- 问题在于: 机器人能否正确猜出这些新牌属于哪个组?
- 如果机器人猜对了,说明这些分组具有泛化性(Generalizable)。如果机器人感到困惑,那么这些分组可能只是那次特定洗牌产生的偶然现象。
为什么 CARVE 更好
论文通过两种类型的测试,将 CARVE 与旧的“完美球体”规则进行了对比:
模拟数据(合成基准): 他们创建了具有已知“真实”分组的计算机生成数据。
- 结果: 当数据变得杂乱、具有重尾特征或呈现扭曲带状(非线性)时,旧的规则表现糟糕。然而,CARVE 即使在数据噪声非常大的情况下,也能一致地找到正确的组别。
真实的生物数据: 他们将 CARVE 应用于真实的科学数据,特别是:
- 小鼠干细胞: 他们观察了随时间变化的细胞。旧规则认为只有 2 个大的细胞组。而 CARVE 发现了 4 个截然不同的阶段,这与细胞发育的实际生物学时间线相吻合。旧规则完全忽略了中间的步骤。
- 白血病细胞: 他们分析了白血病患者的血液细胞。旧规则将三种截然不同的免疫细胞归为一个巨大的、混乱的类别。CARVE 则正确地将它们分成了 10 个不同的组,揭示了更清晰的疾病图景。
核心结论
CARVE 就像是数据分类的质量控制检测员。
- 它不在乎你的数据看起来是否像一个完美的球体。
- 它关心的是你的分组是否可靠(无论如何洗牌都会出现)以及是否有用(能够预测新数据)。
- 它不仅能为整个数据集提供报告单,还能为每个特定的组和每个特定的项目提供报告单,告诉你是哪些部分是稳固的,哪些部分是摇摆不定的。
作者已将此工具作为免费软件(支持 Python 和 R)发布,以便科学家们不再靠猜测来确定哪种分类方法是正确的,而是开始信任他们所发现的分组。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。