HiTeC: Hierarchical Contrastive Learning on Text-Attributed Hypergraph with Semantic-Aware Augmentation
本文介绍了 HiTeC,这是一种两阶段分层对比学习框架,通过整合结构感知文本预训练、语义感知数据增强和多尺度对比目标,以捕捉局部相关性和长程依赖,从而解决现有方法在文本属性超图上的局限性。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你正在试图理解一个庞大而复杂的社会网络,在这个网络中,人们不仅仅拥有一对一的友谊,而是同时属于许多不同的群体——比如同时属于一个读书俱乐部、一个徒步团队和一个编程研讨会。在数据科学领域,这被称为超图。
现在,想象这个网络中的每个人都拥有一份长长的传记,或者有一叠关于他们的评论。这就构成了一个文本属性超图(TAHG)。挑战在于:如何在不依赖老师批改作业的情况下,教会计算机既理解这些人所在的群体,又理解他们写下的文字?
本文介绍了HiTeC(分层对比学习),这是一种新方法,它像一个非常聪明、自学成才的学生来解决这个问题。以下是其工作原理的简单分解步骤:
旧方法的缺陷
以往尝试教会计算机理解这些网络的方法存在三个主要缺陷:
- “盲读者”:旧方法阅读文本(传记)时,并不关注人们所属的群体。这就像阅读一本关于厨师的书,却不知道他们实际上是在厨房里工作。它们忽略了文字与社会结构之间的联系。
- “随机打乱者”:为了让计算机学习,旧方法会随机删除单词或打散群体。这就像试图通过随机划掉句子中的单词来学习一门语言;这往往会混淆含义,而非提供帮助。
- “短视观察者”:旧方法只关注直接邻居(即当前在同一个群体中的人)。它们忽略了“长距离”连接,例如未能意识到两个人之所以相连,是因为他们共同属于一个由三个不同群体组成的链条,即使他们从未直接见过面。
HiTeC 解决方案:两阶段训练营
HiTeC 通过一个两阶段的训练过程解决了这些问题,就像为人工智能举办的训练营一样。
第一阶段:“情境阅读者”(文本编码器预训练)
在计算机查看群体之前,它首先学习在考虑群体的情况下阅读文本。
- 类比:想象你在阅读一篇电影评论。HiTeC 不是在仅仅阅读评论,而是在顶部贴上一张便签,上面写着:“这个人属于科幻迷俱乐部和恐怖迷俱乐部。”
- 工作原理:它将原始文本包裹在关于该人邻居和整体网络结构的“情境线索”中。这教会了计算机:词语的含义会根据该人与谁交往而发生变化。
第二阶段:“智能侦探”(超图编码器预训练)
现在计算机已经理解了文本,它开始学习绘制复杂群体的地图。
- “智能”增强:HiTeC 不使用随机破坏,而是采用语义感知增强。
- 文本:它通过添加结构上下文(如第一阶段中的便签)来创建文本的新版本,而不是删除单词。
- 群体:它根据成员的紧密程度决定要“丢弃”(隐藏)哪些群体。如果一群朋友都写类似的内容,HiTeC 会保持该群体完整,因为这是有意义的。如果一个群体是陌生人的随机混合,它可能会丢弃它以减少噪声。
- “长距离”视野(s-walks):这是本文的秘诀。
- 类比:想象你想在一个巨大的城市中找出谁与谁相连。普通方法是从 A 屋走到 B 屋。HiTeC 则使用s-walk。
- 工作原理:s-walk 是一种特殊的路径,它从一个群体跳转到另一个群体,但前提是这些群体至少共享s个成员。这就像从一个读书俱乐部走到一个徒步俱乐部,前提是两个俱乐部至少共享 3 名成员。这使得计算机能够追踪网络中漫长而曲折的路径,从而发现其他方法会错过的深层隐藏连接。
结果
本文在六个真实世界数据集(如学术引用网络和电子商务产品群体)上测试了 HiTeC。
- 成绩单:HiTeC 始终胜过所有其他方法。它更擅长预测一个人属于哪个群体,也更擅长仅通过查看其文本和群体成员身份来对其身份进行分类。
- 获胜原因:它没有单独查看文本或群体,而是学习了它们如何相互影响。它没有只关注直接邻居,而是查看了连接人们的整个“群体链条”。它没有使用随机噪声来学习,而是利用了对数据的智能、有意义的改变。
总结
将 HiTeC 想象成一名侦探,它不会单独阅读嫌疑人的日记(文本)或查看其地址簿(群体)。相反,它在阅读日记的同时,确切地知道嫌疑人属于哪些社交圈,并沿着这些圈子中漫长而曲折的路径追踪以发现真相。它通过建立智能、逻辑的联系而非随机猜测来学习,使其在理解复杂、文本密集的网络方面表现更佳。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。