How to Achieve the Intended Aim of Deep Clustering Now, without Deep Learning
本文证明了通过利用聚类分布信息,可以在不使用深度学习的情况下,有效解决 -means 聚类的基本局限性(如处理任意形状和密度的问题),从而挑战了深度表示对于深度聚类之必要性的假设。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
在现代数据科学的广阔版图中,存在着一种持久的信念,即工具越复杂,就越擅长发现隐藏的模式。这种观念推动了深度聚类(deep clustering)的兴起,这是一种利用强大的神经网络将数据点组合在一起的技术。多年来,研究人员一直假设这些复杂的系统——它们学习如何将信息压缩成新的、简化的形式——优于旧有的、更简单的方法。其目标始终如一:将混乱的数据混合物分类为不同的组别,无论是具有相似习惯的客户、具有相似功能的基因,还是构成可识别物体的像素。普遍的观点认为,为了寻找形状不规则、大小差异大或密度水平不同的组别,必须使用这些先进的深度学习系统。
然而,一项新的调查挑战了这一长期存在的假设。研究人员发现,深度聚类的复杂性本身可能掩盖了一个更简单的真相。他们发现,这些先进系统往往无法实现其预定目标:识别任何形状、大小或密度的簇(clusters)。相反,它们往往会退回到最古老、最简单方法的同样僵化限制中,强行将数据塑造成整齐的球形,而这并不反映现实。研究表明,解决方案并不需要更强大的计算机或更深的神经网络。通过将一组数据视为一个单一的概率分布,而非一组需要进行比较的个体点集合,一种更简单的方法可以在深度学习挣扎的地方取得成功。这种方法依赖于直观的数学逻辑而非复杂的训练,无需先学习一个隐藏的表示(representation),即可揭示数据的真实结构。
研究人员首先对“簇”的根本定义提出了质疑。几十年来,标准的定义一直是寻找一组内部点彼此相似且与外部点不同的组别。这种定义依赖于测量每对点之间的距离。作者指出,问题在于这种方法迫使算法寻找圆形的、分布均匀的组别,就像试图把方榫头塞进圆孔里一样。即使使用深度学习系统将数据转换到新的空间,它们也往往会重新创造出这些相同的圆形、僵硬的形状。研究通过向深度聚类系统输入形成新月形、具有极大小差异以及不同密度的簇的数据进行了测试。结果很明确:深度学习方法,包括著名的深度嵌入聚类(Deep Embedded Clustering)及其改进版本,未能识别出这些复杂的结构。它们产生的结果并不比它们本应超越的基础非深度方法更好。
核心问题在于这些系统的设计方式。它们试图学习一种观察数据的新方式,即“潜在表示”,希望这种新视角能让簇更容易被分离。研究人员认为,这个学习过程就是瓶颈。这些系统被训练去最小化点与中心点之间的距离,这种方法本质上偏好圆形形状。无论数据如何转换,系统都无法逃脱其自身设计的几何约束。研究显示,深度学习模型实际上并没有学习到一种能够看到数据真实不规则形状的表示。相反,它们陷入了一个循环,试图将复杂的数据强行塞入简单的球形模具中。
相比之下,研究人员提出了另一种思考问题的方式,他们称之为“簇即分布”(Cluster-as-Distribution)。与其询问一个点与另一个点的相似程度,不如询问一组点是否表现得像一个单一的统计分布。想象一下数据点云;与其测量每一对点之间的距离,这种方法会观察整个云团的形状和分布情况。通过使用一种衡量这些完整云团之间相似性的数学工具,该方法可以识别任何形状、大小或密度的组别,而无需学习一种新的观察数据的方式。这种方法不需要训练神经网络或寻找隐藏表示。它只是按照数据的原貌进行观察,并根据点的底层分布进行分组。
这种更简单方法的证据是令人信服的。在深度学习失败的同样困难的数据集上进行测试时,这种基于分布的方法成功识别了复杂的形状、大小和密度。它在旨在欺骗算法的合成数据上表现出色,在图像和生物基因数据等现实世界的高维数据上也表现异常优异。在许多情况下,它的表现显著优于深度学习方法。例如,在一个拥有数千个维度的单细胞基因表达数据集中,深度学习方法难以找到任何有意义的结构,而基于分布的方法却找到了清晰、准确的组别。研究人员发现,深度学习方法不仅是稍逊一筹,而且由于忽略了数据中固有的分布信息,它们从根本上无法实现其设计的目标。
研究还检查了深度学习在处理高维空间时是否仍具有优势,这是使用深度学习的一个常见论据。结果显示,即使在这些复杂的高维场景下,基于分布的方法依然能保持竞争力,且通常超越了深度学习方法。深度学习系统并未展现出性能上的突破;事实上,它们经常发生崩溃,产生比最简单的基准方法更差的结果。研究人员得出结论,认为深度学习对于复杂数据聚类是必要的这一观点是一个误解。寻找任意形状和密度的能力并非来自模型的复杂性,而是来自于对“簇”定义的正确理解。
这项工作表明,领域的研究重点应该发生转变。研究人员认为,重点应从尝试学习更好的表示,转向利用数据中已经存在的分布信息。他们建议,应当更新聚类的定义,以反映出“簇是一组源自特定分布的点集”,而不仅仅是一组相似的点。这种视角的转变使得方法不仅更准确,而且更快、更容易理解。研究证明,深度聚类的初衷——寻找任何形状、大小和密度的组别——现在无需深度学习,只需尊重数据的统计特性即可实现。研究结果挑战了业界对复杂神经网络用于无监督任务的依赖,并表明,有时最有效的工具是那些不对数据进行预先改变、而是直接观察数据本质的工具。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。