Expert-Guided Multimodal Fusion for Unified Emotion and Sentiment Analysis
本文介绍了 EGMF,这是一个统一的框架,它利用专家引导的多尺度网络和结合参数高效微调的大语言模型,在多种语言和数据集上的离散情感识别及连续情感分析方面均达到了最先进的性能。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你正试图仅通过观察来理解一位朋友的情绪。你不仅在听他们说了什么,还在观察他们的面部表情、聆听他们说话的语调,并留意他们的肢体语言。在计算机科学领域,这被称为“多模态情感理解”。这是人工智能的一个分支,致力于通过结合文本、音频和视频,教机器去感受人类的感觉。长期以来,计算机在这方面表现得很糟糕。它们可以阅读一个句子并猜测它是快乐还是悲伤,但它们经常会错过声音中的讽刺或隐藏在微笑背后的忧伤。它们将这些不同的线索视为互不相连的拼图碎片,而不是一个单一且复杂图像的一部分。这一点至关重要,因为如果我们希望计算机能够更好地辅助心理健康、与我们自然地聊天或分析社交媒体,它们就需要理解完整的情感语境,而不仅仅是文字本身。
现在,有一支新的研究团队构建了一个名为 EGMF(专家引导的多模态融合)的系统。把这个系统想象成一个在巨大的语言大脑内部工作的超级智能侦探小队。他们并没有简单地将音频、视频和文本粘合在一起,而是创建了一个特殊的“融合厨房”,其中三位不同类型的专家大厨协同工作,共同烹饪出完美的情感理解。一位大厨是“局部专家”,他会聚焦于微小的细节,比如轻微的皱眉或颤抖的声音。另一位是“语义专家”,他观察声音和面部表情如何与文字相匹配。第三位是“全局专家”,他会退后一步,观察整个对话的大局。这些专家并不仅仅是喊出自己的意见;他们使用一种智能的“门控系统”来根据当前的情况决定谁该发言。如果对话很混乱,全局专家就会主导;如果是一个安静时刻,局部专家就会大放异彩。
研究人员发现,这种团队协作的方法效果极其出色。他们在四个不同的数据集上测试了他们的系统,其中包括英语和中文对话。在名为 MELD 的英语情感数据集上,他们的系统获得了 65.57% 的加权 F1 分数,超过了之前的最佳方法 0.06%。在中文数据集 CHERMA 上,他们看到了巨大的飞跃,将分数提高了 3.36%,达到了 73.90%。对于情感分析(衡量正面或负面程度),他们在英语 MOSEI 数据集上达到了 87.09%,在中文 SIMS-V2 数据集上达到了 82.43%。
更令人印象深刻的是他们的实现方式。他们没有重新训练整个庞大的大脑(那将耗时极长且成本高昂),而是使用了一个巧妙的技巧,叫做 LoRA(低秩自适应)。想象一下,那个巨大的语言模型是一座宏大的图书馆。他们并没有重写每一本书,而只是添加了一些带有新指令的便利贴。这使得他们能够在不需要像城市规模的超级计算机的情况下,教会系统理解情感。他们还发现,他们的系统在处理中文方面表现得尤为出色,这表明这个“专家团队”特别擅长解码中文中复杂的视觉和音频线索。虽然该系统并不完美——它在处理诸如“厌恶”或极端强烈的情感等非常微妙的情绪时仍有些吃力——但它证明了这种统一的、专家引导的方法是帮助机器理解人类情感那混乱而美丽之复杂性的强大新途径。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。