Detection of Emotions in Hindi-English Code Mixed Text Data
本文介绍了一个新的印地语-英语代码混合文本标注语料库,并提出了一种辅音约束归一化方法以改进情绪检测,证明了在对愤怒、恐惧、快乐和悲伤进行分类的五种基准模型对比中,子词 LSTM 模型实现了最高的准确率(76.6%)。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,互联网就像一个巨大且繁忙的全球市场,来自不同国家的人们正向数字空间中倾诉着他们的想法、笑话和感受。在印度,这种交流中的很大一部分是通过一种独特的混合语言——“Hinglish”进行的。它就像一种语言的“奶昔”,将印地语和英语融合在同一个句子中。问题在于,因为每个人都在手机上使用拉丁字母(即我们用于英语的字母)来输入这些内容,所以对于如何拼写印地语单词并没有严格的规则。一个人可能会把“love”写成 pyaar,另一个人写成 pyar,第三个人则写成 pyr。对于计算机来说,这些看起来是三个完全不同的单词,这使得软件很难理解人们到底在表达什么。
这就是“自然语言处理”(NLP)发挥作用的地方。把 NLP 想象成教计算机阅读并理解人类语言的过程。虽然计算机在判断一个句子整体是“快乐”还是“悲伤”方面已经做得相当不错了(情感分析),但它们在检测特定且复杂的感受(如愤怒、恐惧或兴奋)时仍会感到吃力,尤其是在文本杂乱无章且混合在一起的时候。理解这些特定的情绪至关重要,因为这有助于计算机判断一个人只是心情不好,还是真的处于危险之中,这对于网络安全和心理健康监测等领域至关重要。
这时,一位来自印度斋浦尔 LNMIIT 的研究人员决定挑战这个混乱的混合语言难题。他们想要教会计算机识别 Hinglish 文本中的四种特定情绪——愤怒、恐惧、悲伤和快乐。为了实现这一目标,他们首先必须建立自己的“情感词典”。他们从 Twitter 和视频评论区收集了 1,589 个句子,那里是人们自由交流的地方。两位精通印地语且英语流利的母语使用者阅读了每一个句子并标注了情绪。他们几乎完美地达成了一致,从而创建了一个高质量的训练集。
这位研究人员面临着一个棘手的障碍:拼写上的混乱。由于人们用多种不同的方式拼写印地语单词,计算机经常会感到困惑。为了解决这个问题,研究人员发明了一个聪明的“归一化”技巧。想象一下,你有一堆袜子,有些标签写着“Red”,有些是“Redd”,还有些是“Rd”。与其试图猜测哪一个是正确的,不如让计算机观察单词的“骨架”(辅音)以及该单词在类似语境中出现的频率。然后,它将所有奇特的拼写组合在一起,并用最常见的版本进行替换。这样可以清理数据,使计算机不会被拼写错误所干扰。
接着,他们测试了五种不同的计算机“大脑”(算法),以观察哪一个能最好地预测情绪。他们将简单的统计方法与更复杂的神经网络进行了对比。大惊喜出现了:那个专注于观察单词微小组成部分(子词)而非完整单词的模型赢得了比赛。它的准确率达到了 76.6%,相比之下,如果你只是通过猜测出现频率最高的某种情绪,准确率仅为 30.8%。这表明,将单词分解成更小的碎片有助于计算机更好地处理杂乱的拼写变化。
然而,研究人员并未急于宣布彻底的胜利。他们发现,一种被称为“朴素贝叶斯”(本质上是统计特定单词出现频率的方法)的简单旧方法,表现得几乎与高级神经网络一样出色。这表明在简短的社交媒体帖子中,情绪往往由一两个关键词承载,因此一个简单的单词计数器就能做得出奇之好。论文结论指出,虽然子词模型是目前的冠军,但由于数据集规模较小(1,589 个句子),很难断定一种方法是否真的优于另一种。他们认为最大的障碍不是算法,而是数据的匮乏;如果拥有更庞大的示例库,这些计算机读懂我们数字心灵的能力可能会变得更加敏锐。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。