← 最新论文
💻 computer science

LG-GER: Language-Guided Group Emotion Recognition via Multimodal Evidence Distillation

该论文提出了 LG-GER,这是一个语言引导的框架,它利用多模态大语言模型将密集且具有空间定位能力的情感证据生成并蒸馏到单一的视觉-语言骨干网络中,从而实现高效、无需检测器的群体情绪识别,并在基准数据集上超越了现有的多流方法。

原作者: Ahmed Shehab Khan, Zhiyuan Li, Yan Tong

发布于 2026-08-26
📖 1 分钟阅读☕ 轻松阅读

原作者: Ahmed Shehab Khan, Zhiyuan Li, Yan Tong

原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

人类对于感知人群的情绪温度有着非凡的敏锐度。我们不仅仅是在计数微笑的面孔,我们还在权衡举起的拳头中的紧张感、肩膀的耷拉、庆典或抗议的背景,以及人们站立的方式及其相互关系。一个单一的视觉线索,比如一束鲜花,可以预示着婚礼上的喜悦,也可以预示着葬礼上的哀伤。从一张照片中判断一个群体的集体情绪是一个复杂的谜题,被称为群体情绪识别(group emotion recognition)。对于计算机而言,这项任务一直非常困难,因为机器往往难以理解同一个物体或手势在不同的场景下可能意味着截然相反的含义。虽然人类能够直觉地将这些零散的线索融合成一种整体的感觉,但人工智能传统上依赖于僵化的、多步骤的过程,这往往会导致“只见树木不见森林”。

南卡罗来纳大学的研究人员开发了一种解决这一问题的新方法,这种方法教会计算机像人类一样观察人群,而无需依赖传统检测系统那样的沉重机械装置。他们的方法被称为 LG-GER,它绕过了首先识别并隔离图像中每一个单独的人或物体的需求。相反,它使用一个强大的、经过预训练的语言模型作为“老师”,来生成一份详细的情绪证据图谱。这个“老师”模型会观察图像并写下具体的观察结果,例如“一个带着喜悦表情拿着奖杯的人”或“抗议现场的一个举起的拳头”,并附带一个置信度分数,说明该线索在多大程度上暗示了某种特定的情绪。研究人员随后利用这些书面描述及其位置来训练一个更小、更快的计算机模型。这个“学生”模型通过学习老师的笔记,学会如何观察图像并自行寻找这些情绪线索,直到它能够在无需运行检测器或再次咨询大型语言模型的情况下,准确预测群体的氛围。

其核心创新在于研究人员处理训练数据的方式。传统教授计算机识别群体情绪的方法依赖于一个流水线:系统首先检测人脸,然后检测身体,接着检测物体,最后尝试融合所有这些信息。这种方法速度缓慢,如果初始检测失败则容易出错,并且需要大量的计算能力。新框架完全摒弃了这种多步骤的流水线。相反,研究人员使用大型语言模型充当“离线标注员”。该模型检查了数千张训练图像,并为每张图像生成了结构化的证据。对于每一张图像,它都会产生一系列特定的区域,描述该处正在发生什么、它传达了什么情绪,以及它对该信号的信心程度。这创造了一个丰富的、具有空间定位能力的数据库,使计算机不仅学习最终答案,还学习了为什么图像中某个特定区域具有重要意义的具体原因。

为了教导学生模型如何使用这些证据,研究人员设计了一个专注于四种不同类型学习的训练过程。首先,模型学习对图像的整体情绪进行分类。其次,它学习将特定区域的视觉特征与老师提供的文本描述进行匹配,确保计算机理解特定的像素块对应的是“微笑的女性”,而不仅仅是一个通用的脸部。第三,它学习预测该特定区域的情绪信号,区分喜悦、中性或愤怒。最后,它学习估计该信号的强度,理解一个清晰、张开的微笑比一个部分遮挡的微笑是更强的情绪线索。通过结合这四个学习目标,该模型发展出了一种精妙的能力,能够专注于图像中最相关的部分,同时忽略噪声。

当在既定的基准测试中进行测试时,该方法的表现令人瞩目。在用于评估群体情绪识别的两大主要数据集上,该新方法实现的性能达到了匹配甚至超过现有最先进系统水平。在 GAF 3.0 数据集上,它的准确率达到了 84.08%,超越了之前的最佳方法。在规模更大的 GroupEmoW 数据集上,它实现了 92.39% 的准确率,仅次于表现最好的方法,但有一个关键区别:新方法在实际测试阶段不需要任何检测,也不需要对多个数据流进行复杂的融合。虽然表现最好的竞争对手需要运行多个检测算法并结合它们的输出才能得出结果,但新方法只需观察图像即可给出答案。这使得该系统显著更快,且更适用于计算资源和速度受限的现实应用场景。

研究人员还通过分析训练过程中计算机注意力的转移情况,研究了为什么他们的方法如此有效。在专门化训练之前,模型倾向于在整个图像上广泛地分配注意力,经常被墙壁或家具等无关的背景细节所干扰。在学习了语言引导的证据后,模型学会了将注意力集中在承载情绪重量的具体区域,例如人与人之间中心性的互动,或一个特别富有表现力的面孔。在某些情况下,这种聚焦的注意力使得模型能够正确识别出一个标准模型误判为“中性”的场景中的“庆祝”氛围。然而,研究也揭示了一个局限性:当人群中包含相互抵消的冲突情绪时,模型倾向于关注单一强信号的特性有时会导致它将中性场景误解为负面情绪。这表明,尽管该方法擅长寻找清晰的情绪信号,但在面对最具模糊性和平衡性的场景时,仍然面临挑战。

最终,这项工作证明了通往更优人工智能的路径并不总是需要构建更大、更复杂的系统。通过使用大型语言模型生成高质量、结构化的训练数据,并将这些知识蒸馏到一个更简单的单流模型中,研究人员创建了一个既高精度又高效的系统。该方法证明,计算机可以通过学习寻找特定的、由语言描述的证据,而不是仅仅依靠原始的视觉模式,来理解群体动态的细微差别。这种方法为在实时环境中部署情绪识别提供了实用的蓝图——无论是监控公共安全还是理解观众反应——而无需承担以往限制这些技术的沉重计算负担。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →