Cluster and then Embed: A Modular Approach for Visualization
本文提出了一种透明且模块化的可视化框架,该框架通过对数据进行顺序聚类、分别对每个簇进行嵌入,并随后对其进行对齐以同时保留局部结构和全局几何结构,从而改进了 t-SNE 和 UMAP 等方法。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你有一个装满 3D 乐高雕塑的巨大且杂乱无章的盒子。其中有些是微小、精巧的城堡;另一些则是规模宏大、平坦的城市。你的目标是为所有的雕塑拍照,并将它们铺在一张平坦的 2D 桌子上,以便观察它们之间的相互关系。
问题在于?如果你试图一次性把整个盒子里的东西都挤压到桌子上,那些平坦的城市会被压扁,而城堡则会重叠在一起,变成一个巨大且混乱的团块。这就是困扰着 t-SNE 和 UMAP 等流行工具的“拥挤问题”(crowding problem)。这些工具擅长将每个城堡的微小细节保留在一起,但它们往往会扭曲地图,使得原本遥远的城堡看起来紧挨在一起。
由此,Cluster+Embed (C+E) 方法应运而生,这是由 Elizabeth Coda、Ery Arias-Castro 和 Gal Mishne 提出的一种新方法。请不要将这种方法仅仅视为一个神奇的单体相机,而要将其视为一条三步走的流水线,它将你的数据视为一系列不同的“社区”。
第一步:社区分类(The Neighborhood Sort)
首先,该方法并不试图一次性拍摄整个盒子。相反,它像一位超级有序的图书管理员,根据形状将乐高雕塑分类到不同的堆中。如果你有一堆城堡和一堆城市,它们会被分到不同的箱子里。作者指出,你可以使用任何你喜欢的排序方法(例如流行的 Leiden 或 DBSCAN 算法),但关键在于你在拍照之前就定义好了这些组。
第二步:个体照片(The Individual Photos)
接下来,该方法会对每一堆进行单独拍照。因为图书管理员一次只看一堆城堡,他们可以完美地排列这些城堡,以展示其精细的细节,而不必担心城市会干扰到它们。这一步使用标准工具(如 PCA 或 TriMap)来仅对该特定组进行扁平化处理。结果是?你得到了一张关于城堡的高质量、清晰的照片,以及另一张同样清晰的城市照片。
第三步:全局地图(The Global Map)
这是最巧妙的部分。现在你拥有了一叠完美的、分开的照片。最后一步是将这些照片粘贴在一面巨大的墙上,制作成一张大地图。但与其随机粘贴,该方法使用了一种“刚性变换”——想象一下拿起一整张城堡堆的照片,对其进行平移、旋转或翻转,但绝不拉伸或挤压照片本身。
目标是使这些堆在墙上的位置与它们在原始盒子中的距离相匹配。为了解决拥挤问题(即墙上空间不足以容纳所有东西),该方法引入了一个“缩放旋钮”(称为 )。如果这些堆靠得太近并可能发生重叠,作者建议转动这个旋钮,轻轻地将堆推开,从而创造出足够的空间让每个人都能被清晰地看到,而不会扭曲照片内部的细节。
该方法对什么说“不”
作者非常明确地表达了他们在反对什么。他们认为,试图用一个单一的、全能的工具(如 t-SNE 或 UMAP)同时完美实现两件相互矛盾的事情是不现实的:既保持微小的局部细节完美,又保持全局距离准确。他们证明了虽然 t-SNE 在分离簇方面表现出色,但它往往会过度扭曲“地图”,导致你无法信任组与组之间的距离。他们还明确反驳了那种认为可以在没有结构化过程的情况下,直接将层次树强加于地图之上的观点;他们的这种方法是一个刻意的、透明的三步流程,而非黑盒。
他们有多大的把握?
作者并不声称这是一种能永远解决一切问题的灵丹妙药。相反,他们通过模拟和真实数据提供了有力的证据。
- 在合成数据上: 他们在包含 5,000 个点的 10 维高斯混合模型上测试了该方法。在这些模拟中,他们展示了通过使用缩放因子 ,其方法避免了困扰其他方法的重叠问题,创建了一个看起来与 t-SNE 非常相似的环状簇,但这是通过一个透明且可控的过程实现的。
- 在真实数据上: 他们将此方法应用于三个真实数据集:
- MNIST(手写数字): 一个包含 60,000 张图像的数据集。在这里,C+E 成功地将数字分成了不同的组(例如让 4 和 9 靠近),并且比倾向于将所有东西均匀分布的 t-SNE 更好地保留了全局结构。
- 人类大脑类器官(Human Brain Organoids): 一个包含 20,272 个细胞的数据集。该方法揭示了一个清晰的“发育轨迹”(随时间增长的路径),这在他们的地图中是可见的,而在 t-SNE 和 UMAP 中则显得更加“离散”。
- 小鼠皮层(Mouse Cortex): 一个包含 23,823 个细胞的数据集。在这里,C+E 揭示了一种“从粗糙到精细”的结构(大组分解为更小的组),而其他方法则忽略了这一点。
作者承认存在权衡。虽然 C+ E 在保留全局距离和局部形状方面表现优异,但有时在匹配 t-SNE 对极近邻(kNN recall)的完美保持能力(对于较小的 值)方面会遇到困难。他们认为这是因为 t-SNE 有一种神秘的方式可以将数据分解成微小的碎片,而 C+E 并没有复制这种方式。然而,他们认为,对于一个既透明又忠实于数据整体形状的可视化方案,C+E 是一个非常有竞争力的、且更易于理解的替代方案。
简而言之,该论文表明,通过将问题分解为“分类、扁平化、再对齐”,我们可以得到一张不会在位置上撒谎的地图,即使到达那里需要更多的步骤。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。