← 最新论文
📊 statistics

A novel k-means clustering approach using two distance measures for Gaussian data

本文提出了一种针对高斯数据的创新 k-means 聚类算法,该算法结合了簇内与簇间距离度量以及 Calinski-Harabasz 指标,旨在实现比传统方法更稳健的收敛性并提升对离群值的处理能力。

原作者: Naitik Gada (Rochester Institute of Technology)

发布于 2026-07-31
📖 1 分钟阅读☕ 轻松阅读

原作者: Naitik Gada (Rochester Institute of Technology)

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正走进一个规模宏大、混乱不堪的派对,成千上万的人在其中交错往来,但没有人知道谁该和谁在一起。这里没有名牌,没有领队,也没有指向不同桌位的指示牌。你的任务是弄清楚哪些人自然地聚在一起。这就是无监督学习的世界,它是计算机科学的一个分支,算法试图在没有预先告知答案的情况下,从杂乱的数据中寻找隐藏的模式。其中一个最流行的工具叫做 k-means 聚类。把它想象成一场抢座位的游戏,计算机试图通过为每个组找到一个“中心”并将每个人拉向该中心,从而将相似的项归为一类。目标是确保同一组内的每个人都非常相似,而与其他组的人非常不同。然而,这个游戏有一个棘手的缺陷:由于计算机是从关于中心位置的随机猜测开始的,它经常会陷入一个局部“足够好”的解中。如果它选错了起始点,整个分组过程就可能出错。这至关重要,因为在现实世界中,从组织客户数据到分析医学图像,准确获取这些分组对于做出明智决策至关重要。

本文介绍了一种针对经典 k-means 游戏的新型变体,旨在使其更加可靠。作者 Naitik H. Gada 指出,传统方法仅关注人们距离自己组中心的距离(称为簇内距离)。新方法增加了一条规则:它还会检查不同组之间彼此之间的距离(称为簇间距离)。想象一下,如果你在为派对宾客分组时,不仅问:“你离你的朋友近吗?”还问:“你离其他的桌子够远吗?”通过平衡这两个测量指标,该算法试图创造出不仅联系紧密、而且彼此界限清晰的组。

研究人员使用两种类型的数据测试了这一想法。首先,他们创建了看起来像整齐、圆润的点云(模拟高斯数据)的伪造数据集,并设置了不同的“混乱程度”或方差。他们还在真实的基准数据集上测试了该算法,包括著名的 Iris(鸢尾花)数据、Wine(葡萄酒)化学分析数据以及 Breast Cancer(乳腺癌)医学数据集。结果显示,使用这两种距离测量的方法始终比传统的 k-means 表现得更好。在伪造数据测试中,新算法在数据杂乱或起始点棘手时,其准确性和出错率表现得更优。例如,在一个具有高方差的二维数据集上,新方法达到了 0.9801 的准确度,而传统方法为 0.9508。在 Iris 数据集上,它达到了 0.8420 的准确度,而旧方法为 0.7751

论文还强调,新方法在处理“离群值”方面表现更好——即那些站在离大家稍远一点的派对宾客。在 Wine 数据集中,传统方法有时会误分类这些远离中心的点,而新方法则能正确识别它们。然而,作者也谨慎地指出,虽然新方法是一种改进,但它并不是解决所有问题的灵丹妙药。它在处理组的初始起始位置时仍然略显吃力,且在处理高维数据(如 9 维的乳腺癌数据集)时,其表现仅比传统方法略好。研究表明,增加第二个距离测量值使聚类变得“更加稳固和鲁棒”,但这仍是一个正在进行中的工作,为未来更复杂的深入研究开启了大门。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →