← 最新论文
📊 statistics

IOCC: Aligning Semantic and Cluster Centers for Few-shot Short Text Clustering

本文提出了 IOCC,一种新型的小样本对比学习框架,通过两个关键模块——用于生成伪标签的交互增强最优传输(IEOT)和用于优化文本表示的中心感知对比学习(CACL),将聚类中心与语义中心进行对齐,从而增强了短文本聚类,并在八个基准数据集上实现了卓越的性能和稳定性。

原作者: Zhihao Yao

发布于 2026-06-05
📖 1 分钟阅读☕ 轻松阅读

原作者: Zhihao Yao

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

想象一下,你正试图将一大堆乱七八糟的明信片按类别分装到不同的箱子里。每张明信片上都写着一段非常短的信息(比如“买牛奶”或“5点开会”)。你的目标是将相似的信息完美地归为一类。

这个问题,正如论文中所解释的,在于这些短信息就像是微小且模糊的快照。因为它们太短了,仅凭肉眼观察很难准确判断它们的真实含义。传统的分类方法经常会产生混乱,因为它们无法找到这组信息的“真正核心”,从而导致分类错误。它们最终会制造出混乱的堆叠,其中心点并不能代表该组信息的真实主旨。

解决方案:IOCC
作者提出了一种名为 IOCC 的新方法来解决这个问题。你可以将 IOCC 想象成一个专门为这些棘手的短笔记设计的智能两步分类机。它的主要目标是确保每个堆叠的“中心”(即该组信息的平均概念)能完美契合其中笔记的“真实含义”。

以下是 IOCC 两个主要部分的运作方式,我们使用一个简单的类比:

1. “智能媒人”(交互增强的最优传输)

想象你有一群学生(文本样本),你需要将他们分配到不同的学习小组中。

  • 旧方法: 你只是根据匆匆一瞥来猜测他们属于哪个小组。
  • IOCC 的方式 (IEOT): 这个模块充当了一个超级聪明的媒人。它不再孤立地观察每一个学生,而是观察学生之间是如何互动的。它会询问:“如果学生 A 正在和学生 B 交谈,而学生 B 正在和学生 C 交谈,那么他们是否都属于同一个圈子?”
  • 通过分析这些联系,它创建了一份“草案名单”(伪标签),标明了谁属于哪里。随后,它会从这些草案中挑选出最自信的学生,以此为每个小组构建一个“原型”或伪中心(Pseudo-Center)。你可以把这想象成寻找那个能够代表该学习小组最佳版本的“理想学生”。

2. “磁铁训练师”(中心感知对比学习)

现在你已经有了这些“理想原型”(伪中心),第二个模块便开始发挥作用了。

  • 想象每条文本笔记都是一个小金属球,而伪中心则是一个强力磁铁。
  • CACL 扮演着训练师的角色,它将金属球(文本表示)拉向与之匹配的磁铁。
  • 随着训练的进行,属于同一组的笔记会被紧紧拉向各自的特定小组,而其他组的笔记则会被推开。

结果:一场完美的舞蹈

神奇之处在于,这两个模块像舞伴一样协同工作。

  1. “智能媒人”建议了分组的位置。
  2. “磁铁训练师”将笔记拉向这些位置。
  3. 随着笔记的移动,“媒人”能看得更清楚,从而再次优化小组中心。

这种往复循环的过程逐渐缩小了数据实际分布位置与它们“应当在的位置”(即真实的语义含义)之间的差距。最终,这些堆叠变得极其清晰且界限分明。

证明

作者在八个不同的数据集(例如整理医疗笔记、新闻标题等)上测试了这个系统。他们发现,在处理这些短文本方面,IOCC 比以往的方法表现得要好得多。

  • 在一个特别困难的医疗笔记数据集(Biomedical 数据集)上,它的准确率提升了 7.34%
  • 它也更加稳定(不太容易产生随机错误)且高效。

简而言之,IOCC 通过不断将数据的物理分组与词汇的真实含义对齐,解决了短文本“模糊”的问题,从而实现了更清晰、更准确的聚类。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →