How Annotator Agreement Affects Sentiment Classification Performance for Indonesian Coastal Tourism Reviews
本研究表明,在规模更大、采用多数票决制的印度尼西亚沿海旅游评论数据集上训练情感分类器,其性能优于严格采用一致共识的数据集,尽管结果表明,数据量的增加和类别平衡,而非仅仅保留模糊实例,可能是性能提升的主要驱动因素,同时 IndoBERT 有效减少了对中性评论的系统性误分类。
原始论文采用 CC BY 4.0 许可(https://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
在数字时代,旅行者的声音已成为一个庞大的、非结构化的人类观点库。数以百万计的人撰写关于海滩、酒店和餐厅的评论,将他们的希望、失望和观察倾注于这些通常带有非正式用语、俚语且富有深层细微差别的文本之中。对于企业和研究人员而言,理解这一洪流是一项挑战。他们不仅需要知道一条评论是好是坏,还需要准确了解作者的情感。这就是情感分析的领域——它是计算机科学的一个分支,旨在教会机器阅读情绪。多年来,标准方法是让人类为这些评论贴上简单的标签,如“正面”、“负面”或“中性”,然后训练计算机识别这些模式。然而,人类的判断很少是完美的。当三个人阅读同一条评论时,他们可能会在评论究竟是真正中性还是略带负面情绪上产生分歧。这种分歧为科学家们制造了一个谜题:是应该丢弃那些令人困惑的评论,以仅保留那些所有人达成共识的评论,还是应该保留那些混乱、有争议的评论,从而为计算机提供更多的学习实例?
印度尼西亚迪波内格罗大学(Diponegoro University)的一组研究人员致力于利用海岸旅游目的地评论来解决这个特定的谜题。他们专注于印尼语,这种语言富含非正式表达和地域变体,使得它成为一个特别困难的计算机测试案例。研究人员从谷歌地图中收集了涵盖整个群岛海滩的数十万条公开评论。在清洗数据并过滤掉重复或非印尼语文本后,他们选择了大约 22,000 条经过平衡抽样的评论,由三名人工标注员进行阅读。每个人独立决定一条评论是正面的、负面的还是中性的。这一过程揭示了一个自然的现实:人类并不总是达成一致。有些评论非常清晰,三名标注员都选择了相同的标签;而另一些评论则具有模糊性,导致两人意见一致而一人不同,或者三人各选了不同的标签。
随后,研究人员将数据分为两个截然不同的组别,以观察这种分歧如何影响计算机的学习。第一组被称为“一致”集,其中仅包含三名人类达成共识的评论。这是一个规模较小、更干净的集合,包含 15,527 条评论,但缺失了那些棘手的、具有歧义的案例。第二组是“多数”集,它保留了一致性的评论,并加入了其中两人达成共识的评论。这个更大的集合包含 21,235 条评论,包含了更多原本会让计算机感到困惑的中性、混合情感或模糊不清的文本。接着,他们在这两个组别上训练了三种不同类型的计算机程序。其中两个程序使用了基于词频的传统方法,而第三个程序则使用了名为 IndoBERT 的现代先进系统,该系统旨在理解印尼语中单词的上下文和关系,就像人类读者一样。
结果清晰且有些令人惊讶。与“计算机只能通过完美达成共识的例子来学习得最好”这一观点相反,每种程序在接受包含争议评论的更大、更混乱的组别训练时,表现都更好。最先进的系统 IndoBERT 在使用“多数票”组进行学习时,比使用“一致”组时获得了更高的评分。这表明,如果通过丢弃具有歧义的评论来确保完美的共识,研究人员实际上是在丢弃宝贵的教训。争议性的评论往往包含了旅行者表达的复杂、混合的情感,拥有更多此类示例有助于计算机理解人类情感的全貌。研究发现,最大的进步在于正确识别“中性”评论的能力。当计算机仅在干净的一致性数据上进行训练时,它很难区分一条真正的中性评论与一条略带正面或负面情绪的评论。但当它被允许学习“多数票”数据(其中包含更多此类中性案例)时,它在识别中性评论方面变得出色得多。
然而,研究人员谨慎地指出,这种提升可能不仅仅是因为分歧本身。较大的组别仅仅是因为拥有更多的数据以及更好的中性样本平衡,而中性样本在自然界中比极端的正面或负面样本更难寻找。这项研究并未证明分歧本身是有益的,而是说明过滤掉分歧会移除过多的有用信息。计算机仍然在处理某些复杂的写作类型时面临挑战,例如那些一方面赞扬海滩的一部分、另一方面又批评另一部分的评论,或是使用微妙、间接语言来表达失望的评论。即使是最先进的模型,面对这些困难案例依然感到棘手。最终,这项工作表明,在人类语言的混乱世界中,训练数据中存在一点点分歧,对于教会计算机真正理解旅行者的细微差别是必要的。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。