Why Can't I See My Clusters? A Precision-Recall Approach to Dimensionality Reduction Validation
本文引入了精确率(precision)和召回率(recall)指标来评估降维的关系阶段,使用户能够诊断为何预期的聚类结构未能出现在投影中,从而指导更高效的超参数调优和伪影检测。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,试图通过一张单一的平面地图来理解一座宏大而隐形的城市。这座城市拥有数以百万计的街道、建筑和连接,但你的地图只能展示两个维度。这就是科学家处理复杂数据时面临的日常挑战。他们经常使用一种称为“降维”的技术,将高维信息(其中每个数据点可能拥有数百个特征)压缩成一张人类可以直观看到的简单二维图像。其目标通常是发现模式,例如让相似的项目聚集在一起形成簇。但有时,地图会失效。预期的分组没有出现,或者看起来混乱且破碎。当这种情况发生时,研究人员会面临一个令人沮丧的问题:究竟是数据本身杂乱无章、缺乏结构,还是用于绘制地图的方法未能展现真相?
多年来,能够回答这一问题的工具一直非常有限。现有的方法可以告诉你地图对距离的保留程度如何,或者簇的整洁程度如何,但它们无法解释为什么某个簇会缺失。它们将整个过程视为一个“黑箱”,无法区分是糟糕的地图还是混乱的领地。现在,一组研究人员引入了一种观察这个问题的新方法。他们不再仅仅评判最终的图像,而是决定去检查用于绘制它的“蓝图”。通过将建模关系的过程与绘制地图的行为分离,他们创造出一种方法,可以在最终图像生成之前,衡量数据的真实结构是否已被捕捉。
研究人员专注于两种用于创建这些地图的流行方法,被称为 t-SNE 和 UMAP。这两者都是先根据数据点之间的相似程度构建一个连接网络,然后利用该网络将点放置在平面上。团队意识到,如果最终的地图令人困惑,问题可能在于最初的那个连接网络。为了测试这一点,他们借鉴了信息检索领域的两个概念,在信息检索中,系统根据能否找到相关信息来接受评估。他们将这些想法改编成了两个新指标:精确率(precision)和召回率(recall)。在这种语境下,精确率提出了一个简单的问题:“在所有被该方法判定为相互连接的点中,有多少实际上属于同一个组?”如果答案很高,说明连接是纯净的。召ло率则提出了相反的问题:“在所有应该连接以形成一个组的点中,该方法实际连接了多少?”如果答案很高,说明该组是完整的。
通过将这两个指标应用于绘图前的连接网络,研究人员能够清晰地诊断问题。他们发现,如果网络本身存在缺陷,那么无论如何调整最终的地图都无济于事。例如,在一次使用脑纤维数据集的测试中,他们发现绘图工具的默认设置创建了一个不同组别之间几乎没有连接的网络。新指标显示,这些连接过于稀疏,无法形成稳固的簇,这解释了为什么最终的地图看起来是破碎的。在另一种场景中,他们发现一组数据点在最终图像中被拆分了,这并不是因为数据本身破碎,而是因为映射过程无意中将它们推开了。指标显示,底层的连接实际上是强大且正确的,这直接指向了绘图阶段而非数据本身的问题。
这种方法还解决了科学家面临的一个常见难题:如何选择这些工具的正确设置。这些方法需要用户选择一个“邻域大小”(neighborhood size),这是一个决定每个点在构建网络时考虑多少个邻居的设置。设置太小,组就会瓦解;设置太大,一切都会混成一个模糊的团块。研究人员展示了通过使用这些新指标来扫描不同的设置,他们可以找到让网络最能反映数据真实分组情况的“甜点位”(sweet spot),而无需生成最终的视觉图。这节省了时间并消除了猜测。在一次使用人类活动记录数据集的测试中,他们利用这些指标意识到,数据中标记的六个类别在底层结构中实际上并没有形成六个截然不同的组。指标显示,数据自然地仅形成了三个组,而这一事实在仅观察最终图像时是被隐藏起来的。
这项工作表明,可视化中缺乏清晰的簇并不总是数据或工具的失败,而往往是两者之间的不匹配。通过首先检查关系的质量,科学家现在可以辨别自己看到的是一张错误的地图,还是一个错误的领地。研究人员证明,这些新度量标准可以引导参数调优,揭示绘图过程中的隐藏错误,甚至揭示预期的类别在数据中是否根本不存在。虽然该方法需要对数字进行一些谨慎的解读,但它为这个往往依赖视觉直觉引导的领域提供了一个急需的清晰度层级。它将理解复杂数据的过程从一场试错游戏转变为一种更可靠、循序渐进的调查。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。