Multi-View Dual-Contrastive Graph Learning with Adaptive Agreement for Semi-Supervised Text Classification
本文提出了一种轻量级框架——多视图双重对比图学习(MDCGA),该框架通过增强的双重对比目标,整合了基于词汇、语义和关键词的关系信号,旨在通过缓解假负例和不可靠增强问题,实现仅需少量标注样本的鲁棒半监督文本分类。
原始论文采用 CC BY 4.0 许可(https://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
在人工智能的广袤领域中,教计算机理解人类语言往往感觉就像试图为一个没有标题的书库填满书籍。虽然机器可以阅读数百万份文档,但当仅被给予极少数示例进行学习时,它们很难将这些文档归入有意义的类别。这就是半监督文本分类的核心挑战:如何构建一个智能系统,而老师能用来解释规则的时间却非常有限。传统方法通常依赖于需要巨大计算能力的庞大预训练模型,或者将文档视为孤立的词汇列表,从而忽略了连接一篇著作与另一篇著作之间的微妙联系。为了解决这个问题,研究人员转向了图学习技术,该技术将文档映射为网络中的节点,并根据它们的相似程度将它们连接起来。这使得计算机可以通过观察文本之间的关系来进行学习,就像一个人通过观察新概念与已知事物之间的联系来理解新概念一样。然而,现有的这些图方法在尝试通过比较文档来进行自我改进时经常会遇到困难,有时仅仅因为缺乏标签,就会错误地将两篇相似的文本视为对立面,从而干扰了学习过程。
一组研究人员开发了一种名为“多视图双对比图学习与自适应一致性”(MDCGA)的新方法,旨在无需超级计算机的情况下规避这些陷阱。该系统并非依赖单一的相似性度量方式,而是为同一组文档构建了三张截然不同的地图。第一张地图连接那些具有深层语义意义的文本,理解词汇背后的普遍含义;第二张地图链接使用相同特定词汇的文档,侧重于作者选择的精确用词;第三张地图则将共享核心概念或短语的文本联系在一起,捕捉它们讨论的核心主题。通过构建这三张独立但相关的视图,该系统模拟了人类读者接触新话题时的处理方式:通过把握整体含义、注意到使用的特定语言以及识别中心主题。研究人员随后训练计算机,以确保单个文档在所有三张地图中都保持一致,从而强化了这些不同视角正在描述同一个现实这一观点。
这项工作的最显著创新在于一种能够过滤掉学习过程中自然产生的错误的新方法。在标准训练中,计算机通常假设任何它未被告知具有相似性的两个文档都是不同的。这种假设经常导致错误,即系统试图推开两篇实际上相关的文档,仅仅是因为它尚未看到它们的标签。为了解决这个问题,研究人员引入了一种自适应一致性机制。系统会检查两个文档是否在三张地图中至少出现在两张中;如果是,系统就会将它们视为可能相关的文档,并停止尝试分离它们。它还会观察计算机在学习过程中的内部理解,暂停分离那些系统已经学会将其视为相似的文档。这种双重检查系统起到了安全网的作用,确保计算机不会丢失它已经发现的联系。
在针对从电影评论、新闻文章到医学摘要等四种不同现实世界数据集的测试中,这一新框架表现得异常出色。在计算机可以使用所有标签的全监督设置下,它取得了很高的准确率,在新闻分类任务中达到了 97.40%,并在一个拥有 23 个不同类别的复杂医学数据集中达到了 70.49%。更令人印象深刻的是,当标签极其稀缺时,该系统表现出了卓越的性能,而在这种场景下大多数其他方法都会失效。在测试中,当计算机仅能获得不到 1% 的可用标签进行学习时,MDCGA 的表现优于比它大数百万倍的大型语言模型。例如,在医学数据集中,这种新方法在样本极少的情况下实现了 55% 的准确率,而最大的竞争模型仅能达到 42%。而这一切是在更新不足 60 万个参数的情况下完成的,这只是大型模型所需资源的极小部分,证明了一个结构良好的小型系统通常可以比庞大的系统更高效地完成繁重的工作。
研究人员还探讨了系统的不同部分是如何促成这一成功的。他们发现,同时使用文档的三种视图是至关重要的;移除其中任何一个视图都会导致准确率下降。他们发现该系统具有鲁棒性,这意味着它不需要对设置进行精确调优即可良好运行,并且文档连接的具体方式比底层数学的复杂程度更为重要。通过将多种观察数据的视角与智能的错误过滤器相结合,该团队展示了构建一个既轻量又可靠的高效文本分类器是完全可能的。这项工作表明,在教机器理解语言的竞赛中,关键并不总是构建更大的模型,而是设计更聪明的方法,让它们从数据中已存在的关系中进行学习。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。