← 最新论文
🤖 machine learning

SPORT: Structure-Aware Prototype Disentanglement for Incomplete Multi-View Clustering

本文提出了 SPORT,一种用于不完整多视图聚类的创新框架,该框架通过将原型解耦为共享组件和视图特定组件、采用结构感知对比学习以保留聚类级关系,并利用结合了全局原型与局部邻域结构的混合插补策略来实现准确的缺失视图恢复,从而提升了性能。

原作者: Yaoyuan Guo, Zhibin Gu, Songhe Feng, Yuhui Zheng, Bing Li

发布于 2026-07-14
📖 1 分钟阅读☕ 轻松阅读

原作者: Yaoyuan Guo, Zhibin Gu, Songhe Feng, Yuhui Zheng, Bing Li

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下你正在尝试拼凑一个巨大的拼图,但有人从不同的部分偷走了半数的碎片。有些人手里只有天空的碎片,有些人手里只有草地的碎片,没有人拥有完整的图像。这就是在数据不完整的情况下进行“多视图聚类”(multi-view clustering)时发生的情况:样本(拼图碎片)由不同的特征(视图)描述,但这些特征是缺失的。

长期以来,科学家们试图通过构建一个完美的“平均”碎片来代表每个组来解决这个问题。他们认为:“如果我们能确保每个人对这组中心点的看法达成一致,我们就能填补缺失的部分。”

但本文的作者——由 Yaoyuan Guo 和 Zhibin Gu 领导的团队——却说:“等等。这样做实际上会让情况变得更糟!”他们将这个错误称为原型过度对齐问题(Prototype Over-alignment Problem)

问题所在:“过于相似”的陷阱

想象一下你有一群朋友:一位画家、一位厨师和一位程序员。如果你强迫他们所有人必须达成共识,去描述一个统一的“平均朋友”,那么最终得到的会是一个既有点像画家、又有点像厨师、还带点程序员特征的人,但却失去了他们各自独特的才华。旧的方法正是这样做的:它们强迫所有的“原型”(即各组的平均描述)在不同的视图中看起来完全一致。

论文指出,这种做法排除了每个视图所带来的独特且特别的风味。通过强迫一切都变得相同,你会丢失那些让小组变得有趣的互补信息。这就像是试图通过只关注“果味”来描述一份水果沙拉,却忽略了其中一碗装的是草莓,而另一碗装的是奇异果。

解决方案:SPORT

该团队提出了一个名为 SPORT 的新框架(Structure-aware PrOtotype disentanglement foR incomplete multi-view clusTering,即面向不完整多视图聚类的结构感知原型解耦框架)。你可以把 SPORT 想象成一位聪明的拼图大师,他知道如何在不破坏画面的情况下处理缺失的碎片。

以下是 SPORT 的工作原理,分为三个有趣步骤:

1. “人格分裂”的小技巧(原型解耦)
与其强迫一个组的平均值成为一个乏味的、统一的东西,SPORT 将“平均值”拆分为两个部分:

  • 共享部分(The Shared Part): 这是所有人达成共识的部分(比如水果沙拉的“果味”)。
  • 视图特定部分(The View-Specific Part): 这是独特的风味(比如草莓对比奇异果)。

SPORT 对齐了所有视图中的“共享部分”,使大家在基础层面达成一致,但它保持了“视图特定部分”的独立与差异。这样,模型就能记住画家是画家,程序员是程序员,从而保留了有助于解决拼图的独特细节。

2. “集体拥抱”(结构感知对比学习)
旧的方法只观察不同视图中完全相同的样本,并说:“你们两个必须是一样的!”它们忽略了同一组内的样本通常也是邻居这一事实。

SPORT 引入了一种结构感知的方法。想象一个教室,老师不仅说:“你和你的双胞胎是一样的,”还会说:“你和你旁边坐着的最好的朋友也非常相似。”SPORT 使用一种特殊的权重系统,轻轻地将相似的样本拉拢在一起,即使它们并不是完全相同的实例。这保留了组的“形状”,确保属于同一组的拼图碎片能够保持接近。

3. “双重检查”插补(混合策略)
当一个碎片缺失时,旧的方法只会抓取最近的“平均”碎片并将其粘贴进去。但“平均值”可能会很模糊并丢失细节。

SPORT 做的是一份混合工作。它既观察“平均”碎片(全局原型),也观察缺失位置周围的特定邻居(局部几何结构)。它结合了这两个信息源。这就像是通过查看包装盒上的图案,同时检查紧挨着空缺处的碎片形状,来填补缺失的拼图块。这创造了一个更加清晰、更准确的重建过程。

它真的有效吗?

作者并不仅仅是凭直觉猜测;他们在 6 个不同的基准数据集(包括动物图像、数字和人脸等)上,将 SPORT 与 14 种顶尖方法进行了对比测试。

结果非常明确:

  • 更好的性能: SPORT 始终优于其他方法。例如,在缺失率为 50% 的“动物(Animal)”数据集上,SPORT 比排名第二的方法提高了 17.7% 的准确率。
  • 鲁棒性: 即使在缺失率变得非常高(高达 70% 缺失数据)时,SPORT 依然表现强劲。当其他方法的性能像坠落一样暴跌时,SPORT 的性能表现得相对平稳且平滑。
  • 可靠性: 团队证明了其系统的每一个部分都至关重要。如果移除“人格分裂”的小技巧或“集体拥抱”的逻辑,性能都会显著下降。

结论

论文表明,通过停止对原型的“过度对齐”,转而尊重每个视图的共同秘密和独特特质,我们可以更好地恢复缺失的数据。

他们通过广泛的实验证明了这一点,展示了 SPORT 在各种缺失率下,在准确率 (ACC)调整兰德指数 (ARI)F-Score 方面均取得了卓越的性能。这不仅仅是一个理论;它是一种已被测量并证明比现有最先进技术更能有效解决“不完整拼图”问题的方法。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →