想象一下,试图通过一张单一的平面地图来理解一座庞大而复杂的城市。你可以看到主要的标志性建筑以及各个街区之间的关系,但一旦你试图将三维世界压平到一个二维表面上,总会有一些东西丢失。这就是科学家处理高维数据时面临的日常挑战,在这些数据中,每一件信息都由数十个甚至数百个特征来描述。为了理解这些数据,他们使用了一种称为“降维”的技术,它就像一位制图师,将复杂的数据压缩成人类可以读懂的简单散点图。在众多可用工具中,有一种方法因其在保留数据簇局部细节方面的能力而成为了行业标准:一种被称为 t-SNE 的技术。它以保持原始数据中距离较近的点在图像中依然靠近而闻名,这使得它在从细胞类型到手写数字等各种领域的模式识别中都具有极高的价值。然而,即使是这个强大的工具也有缺陷:虽然它非常擅长将最亲近的邻居聚集在一起,但有时却难以维持邻里关系的更广泛结构,且地图的质量在图像的不同部分可能会发生剧烈变化。
根特大学的一个研究小组着手调查为什么会发生这种情况,以及是否可以提高该工具展示全貌的能力。他们将注意力集中在 t-SNE 过程的核心——一个被称为“亲和矩阵”(affinity matrix)的数学结构上。你可以将这个矩阵看作是一套指令,告诉计算机在最终图像中两个点之间应该产生多强的吸引力。在标准版本的工具中,这些指令是使用一种特定的规则生成的,该规则确保每个点都拥有相同的“困惑度”(perplexity),这个概念大致可以转化为一个点所关注的有效邻居数量。研究人员注意到,在实践中,这种规则往往会生成过于极端的指令。对于许多点来说,指令过度偏向于仅有的几个最近邻居,忽略了那些虽然稍远但仍属于同一个局部群组的点。这就像制图师决定只有站在你身边的人才重要,而站在你三步之外的人则是隐形的。
为了测试这种极端的关注是否就是问题所在,研究人员引入了一种他们称为“幂变换”(power transform)的简单调整。这是一种受控的方式,可以用来锐化或平滑亲和矩阵中的指令。如果他们锐化了指令,工具会更加强烈地专注于最靠近的邻居。如果他们平滑了指令,工具会将注意力更均匀地扩散,在不改变谁更接近的顺序的前提下,赋予一个更广泛的邻居圈以有意义的权重。他们在包括手写数字图像和来自小鼠大脑细胞的遗传数据在内的真实世界数据集上运行了数千次实验,以观察这些调整如何改变最终的地图。
结果揭示了一个取决于所观察邻里规模的明确权衡。当研究人员锐化指令时,工具在保持绝对最近邻居在一起方面表现得异常出色,但失去了维持更广泛局部群组的能力。相反,当他们平滑指令时,工具提高了保护这些更广泛局部邻里的能力。平滑后的地图显示出不同数据簇之间更清晰的分离,防止了不同的组别合并成图像中心的一个混乱团块。至关重要的是,研究人员发现,这种改进无法通过仅仅通过增加 perplexity 设置来让标准工具观察更多邻居来实现。改变 perplexity 会以同样的方式影响每个点,但平滑技术允许工具为每个点进行不同的自适应调整,从而创造出一种更细致、更准确的数据局部结构表示。
这项研究表明,t-SNE 如何权衡其邻居是影响其可视化效果的一个关键但经常被忽视的因素。通过平滑亲和矩阵,研究人员证明了在不牺牲工具的速度或可扩展性的情况下,提高对中程局部结构的保留是可能的。这并不意味着标准方法是错误的,而是它对最亲近的邻居存在一种可以调节的特定偏差。对于需要检查簇内子结构微观细节,或者希望观察不同组别在更大规模上如何相互关系的科学家来说,这种平滑技术提供了一种轻量级的方法来转移视觉焦点。这项工作证实了这些数据地图的质量不仅在于算法的优化,还在于数据点之间初始关系的定义方式,为研究人员在需要地图讲述更完整的故事时提供了一个新的杠杆。
技术摘要:平滑亲和矩阵如何影响 t-SNE 的邻域保持能力
问题陈述
t-分布随机邻近嵌入(t-SNE)是一种广泛使用的降维技术,以保持局部邻域结构而闻名。然而,尽管其广受欢迎,t-SNE 嵌入通常表现出较低的绝对邻域保持得分,且误差分布往往是不均匀的。虽然已有大量研究致力于改进 t-SNE 的全局结构保持能力或优化其优化过程(例如初始化、学习率),但对于通过修改高维亲和矩阵本身来提高 t-SNE 局部结构保持能力的研究却非常有限。
作者观察到,在标准 t-SNE 中,条件概率分布(亲和矩阵行)通常是非常“尖锐”的,这意味着少数最近邻占据了主要的概率质量。此外,这些分布的尖锐程度在不同数据点之间存在差异。本文研究了这些亲和分布的“尖锐度”如何影响不同尺度的邻域保持,以及修改这种尖锐度是否能比标准 t-SNE 或其他多尺度方法获得更好的嵌入效果。
方法论
本研究对标准 t-SNE 的亲和矩阵构建引入了一种受控的扰动:一种应用于条件概率 pj∣i 的行向幂变换(row-wise power transform)。
变换公式: 对于给定的点 i,条件概率通过参数 γ≥0 进行变换:
p~j∣i=∑m=ipm∣iγpj∣iγ
- γ=1:恢复标准 t-SNE。
- γ<1(平滑):降低大概率值相对于小概率值的比例,将质量重新分配给低概率的邻居。
- γ>1(锐化):使质量进一步集中在最大的概率值上。
- γ=0:导致邻居呈现均匀分布(丢弃秩次顺序)。
理论特征:
- 作者证明,这种幂变换在数学上等同于对原始核函数的 高斯带宽(σi)进行重缩放。具体而言,新的有效带宽变为 σ~i=σi/γ。
- 至关重要的是,与改变全局困惑度参数 ρ(这会强制每个点拥有相同的有效邻居数)不同,应用固定的 γ 会产生依赖于点的有效困惑度。有效困惑度会根据每个特定点的原始分布形状而变化。
实验设置:
- 该方法在
openTSNE 中实现,并在 MNIST、UCI Adult 和 Mouse Cortex 数据集上进行了评估。
- 主要评估指标是 k 阶邻域重叠度(NO@k),用于衡量在高维空间中被保留的 k-最近邻的比例。
- 对照组包括标准 t-SNE、变化的全局困惑度以及其他亲和矩阵构建方式(多尺度 Multiscale、固定 σ Fixed Sigma、均匀分布 Uniform 以及 tt-SNE)。
关键结果
实验揭示了由 γ 控制的清晰的尺度相关权衡:
- 锐化 (γ>1): 提高了极近邻(较小的 k)的保持能力。然而,随着 k 的增加,性能会迅速下降。
- 平滑 (γ<1): 提高了较宽局部邻域(中等范围 k)和全局结构的保持能力。
- 具体而言,当 γ≈0.7 时的平滑处理在“中局部”范围(k≈25–90)内优于标准 t-SNE 和多尺度方法。
- 平滑处理还提高了全局结构保持能力(通过距离的 Spearman 秩相关性衡量),特别是在较高的困惑度下。
- 与全局困惑度调优的比较: 仅仅增加标准 t-SNE 中的全局困惑度 ρ 并不能复制平滑带来的益处。平滑创建了点与点之间异质的有效邻域大小分布,而增加 ρ 则会统一移动所有点的尺度。因此,在特定的中等范围 k 值下,平滑后的 t-SNE 达到了比具有匹配或更高困惑度的标准 t-SNE 更高的 NO@k 得分。
- 与其他方法的比较: 在中局部范围内,平滑变体(γ=0.7)优于多尺度混合(Multiscale Mixture)和多尺度(Multiscale)方法,后者结合了多个带宽尺度。锐化变体(γ=1.5)在极小 k 时占优,而均匀分布(γ=0)在极大 k 时占优。
意义与主张
论文声称,**亲和锐度(affinity sharpness)**是一个有意义且此前未被充分探索的 t-SNE 行为维度。其主要贡献在于:
- 解耦邻域大小与分布: 研究表明,邻居的数量(由困惑度控制)和概率质量在邻居间的分布(由 γ 控制)是两个不同的因素。
- 轻量化调优: 参数 γ 为从业者提供了一个简单的、轻量化的机制来转移嵌入的侧重点:
- 如果目标是实现极近邻的高保真度,请使用更锐利的亲和力(γ>1)。
- 如果目标是改善更宽局部结构的保持和全局拓扑,请使用更平滑的亲和力(γ<1)。
- 局限性: 作者谦虚地指出,虽然改进是持续的,但在绝对数值上是适度的。该研究专注于单一质量度量(NO@k),且关于这些度量改进如何转化为具体的领域洞察仍是一个开放性问题。此外,针对特定 k 值的最优超参数(ρ,γ)在本研究中并未进行详尽的优化。
总之,论文认为标准 t-SNE 可能会过度集中概率质量于前几个邻居,从而限制了其保持更宽局部结构的能力。通过平滑亲和矩阵,可以将这些质量重新分配给中等排名的邻居,从而在不改变优化过程或计算可扩展性的情况下,增强簇子结构和全局布局的可靠性。
每周获取最佳 machine learning 论文。
受到斯坦福、剑桥和法国科学院研究人员的信赖。
请查收邮箱确认订阅。
出了点问题,再试一次?
无垃圾邮件,随时退订。