Class-Aware Semantic Hybrid Data Augmentation for Imbalanced Sentiment Classification Using Multiple Transformer Models
本文提出了一种类感知语义混合数据增强(CSHDA)框架,该框架通过向少数类有选择地应用多样化且经过语义验证的增强技术,有效地缓解了类别不平衡问题,并显著提升了多种基于 Transformer 的模型在不平衡情感分类任务上的性能与鲁棒性。
原始论文采用 CC BY 4.0 许可(https://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
在广阔的互联网数字景观中,人们不断地分享着他们的观点,从对当地餐厅的评论到对航班延误的抱怨。计算机已经变得非常擅长阅读这些文本,并判断其背后的情感是快乐、悲伤还是介于两者之间。这种被称为“情感分析”的能力,帮助企业了解其客户,并让组织追踪公众情绪。然而,为了让计算机学会这项技能,它需要经过大量实例的训练。当这些实例分布不均时,一个显著的障碍便出现了。想象一个教室里有九十名学生正在学习识别红色物体,但只有十名学生在学习识别蓝色物体。被红色示例淹没的老师可能会开始猜测所有东西都是红色的,仅仅因为这是他们看到最频繁的东西。在数据领域,这被称为“类别不平衡”(class imbalance),它会导致计算机模型为了迎合多数派而忽略少数派的观点,例如中性或负面的感受。
为了解决这个问题,研究人员通常尝试为少数群体创造更多示例,这一过程被称为“数据增强”(data augmentation)。他们通过对现有句子进行微小的改动,比如将一个词替换为同义词,或者删除几个字母,希望能生成新的、有效的训练数据。虽然这在过去有所帮助,但一项新的研究表明,如果改动是盲目的,那么仅仅增加副本是不够的。研究人员发现,对每种类型的句子应用相同的随机改动,实际上会干扰计算机,产生听起来与原始情感完全不符的例子,或者更糟的是,只是在重复同一个句子。
由 Prashant Upadhyaya、G.L. Saini 和 Atul Makrariya 领导的研究团队提出了一种更聪明的方法来处理这个问题。他们开发了一个被称为“类别感知语义混合数据增强”(Class-Aware Semantic Hybrid Data Augmentation)的系统。该系统并不对所有观点一视同仁,而是像一位理解每个群体特定需求的细心编辑。当系统遇到少数派情感(例如在大量正面评论中出现的罕见中性观点)时,它不会只是随机地切割或替换单词。相反,它会根据该特定类型的句子需要保持其含义的需求,选择特定的技术。对于某些句子,它可能会使用强大的语言模型以不同的方式重写句子,同时保持完全相同的感受。对于另一些句子,它可能只是删除一个词或插入一个新词。至关重要的是,系统会将生成的每一个新句子与原句进行对比,以确保含义没有发生偏移。如果一个新句子听起来与原句差异过大,或者只是已经制作过的句子的重复,系统就会将其丢弃。
研究人员在两组截然不同的真实世界数据上测试了这种方法:一组是来自大学美食广场的评论集合,另一组是关于航空公司的海量推文数据集。在这两种情况下,数据都呈现出严重的倾斜,即一种情感占据了主导地位。他们训练了四种不同的先进计算机模型,即“Transformer”,它们是目前理解语言的最前沿工具。首先,他们在原始的不平衡数据上训练这些模型,以观察它们的表现。正如预期的那样,这些模型在正确识别少数派观点方面表现挣扎,经常将负面或中性的评论误标为正面。随后,他们将这种新的增强方法应用于训练数据,仅针对少数派群体生成高质量且多样化的示例。
结果令人瞩目。当模型在这些改进后的数据上进行重新训练时,它们识别少数派情感的能力大幅提升。在美食评论数据集上,模型的整体准确率有了大幅提升,识别负面评论的能力从极低的水平上升到了强有力的多数水平。在航空推文数据集上(由于其简短和非正式的性质,该数据集极具挑战性),某些模型的提升甚至更加剧烈。其中一个此前几乎无法识别中性推文的模型,开始能够正确识别其中一半以上的推文。研究人员确认,这些改进不仅仅是幸运的猜测,而是具有统计学意义的,这意味着结果是可靠且可重复的。
这项工作的价值在于,它不需要改变计算机模型本身。它作为一个准备步骤,在学习开始之前对数据进行清洗和丰富。研究还表明,这种方法适用于不同类型的模型,无论是规模庞大、复杂的模型,还是较小、较快的模型。通过仔细平衡新数据的创建与确保含义完整的严格检查,研究人员证明了质量远比数量重要。他们证明了,通过给计算机提供一些更多、但更好的关于稀有观点的例子,它可以学会倾听每一个人,而不仅仅是房间里声音最大的人。这种方法为使人工智能在理解人类情感的全谱系方面变得更加公平和准确提供了一条切实可行的路径。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。