← 最新论文
💻 computer science

Robust Multimodal Sentiment Recognition Using Facial Expressions, Heart Rate Variability and Speech Signals

本文提出了一种鲁棒的多模态深度学习框架,该框架利用卷积神经网络(CNN)、双向长短期记忆网络(BiLSTM)和ECAPA-TDNN,通过自组织映射进行特征融合,将面部表情、心率变异性和语音信号相结合,在识别七种情绪状态方面达到了98.6%的准确率,并显著优于单模态基准模型。

原作者: Nithya T, Vasuki C, Kavitha Venkatachalam, Mohanasaranya S

发布于 2026-08-24
📖 1 分钟阅读☕ 轻松阅读

原作者: Nithya T, Vasuki C, Kavitha Venkatachalam, Mohanasaranya S

原始论文采用 CC BY 4.0 许可(https://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明

在现代视频游戏那广阔且沉浸式的世界中,玩家不再仅仅是在按下按钮,他们正在经历一场场强烈的情感旅程。多年来,游戏设计师一直依赖问卷调查或简单的指标来猜测玩家的感受,但这些方法往往难以精准到位,只能捕捉到体验结束后的一个瞬间快照。为了真正实时理解人类的体验,科学家们转向了一个被称为“情感计算”的领域,该领域旨在教机器识别人类的情感。这项努力依赖于这样一个观点:情绪并非单一的存在;它们是复杂的信号,通过我们的面部、声音甚至身体流露出来。微笑可能是伪装的,但心率的突然飙升或声音中的一丝颤抖往往会揭示真相。通过结合这些不同的信息流,研究人员希望构建出能够看见、听见并感知一个人正在经历什么的系统,从而提供比任何单一方法都更清晰的人类情感图景。

一组研究人员将这一概念直接应用于充满混沌与快节奏的游戏环境中。他们开发了一种新系统,旨在通过观察玩家的面部、聆听其声音并同时监测其心率,来读取玩家的情感状态。团队意识到,仅依赖其中一种信号是有风险的。明亮的屏幕可能会冲淡面部表情,背景噪音可能会淹没呐喊,而传感器可能会误读心跳。为了解决这个问题,他们构建了一个像“三脚凳”一样的框架;如果其中一条腿晃动了,另外两条仍能保持稳固。他们训练人工智能模型,利用一种擅长识别图像模式的网络来分析面部动作,使用专门的音频处理器来解读语音的节奏与语调,并追踪预示压力或兴奋的心率细微波动。这三路截然不同的数据流随后被编织在一起,形成对玩家情绪单一且连贯的理解。

研究人员在一组海量数据上测试了他们的创造物,其中包括数千张图像、数小时的录音以及玩家在进行不同类型游戏时的广泛心率日志。他们专注于七种核心情感状态:快乐、悲伤、愤怒、恐惧、厌恶、惊讶以及中性状态。当他们进行实验时,结果令人瞩目。通过融合所有三种信号,该系统正确识别玩家情绪的准确率达到了98.6%。这一表现显著高于系统仅尝试使用面部、仅使用声音或仅使用心率时的表现。该系统还证明了其极高的可靠性,即使在音频嘈杂或光线较差的情况下,也能保持高准确度,而这些情况往往会让单信号系统感到困惑。事实上,该系统在区分不同情感方面非常有效,它能以近乎完美的连贯性分辨出恐惧与惊讶这类微妙的情绪。

这项成就之所以特别值得关注,在于它如何处理现实生活的复杂性。在典型的游戏过程中,玩家可能会远离摄像头,在巨大的爆炸声中大喊,或者因为惊吓而非愤怒导致心跳加速。一个只观察其中一个线索的系统可能会产生混乱。然而,由于这个新框架同时倾听三种信号,它可以进行交叉验证。如果面部被遮挡,但声音在颤抖且心率在飙升,系统仍能自信地识别出恐惧。研究人员发现,这种方法使系统能够同样出色地检测到罕见且困难的情绪以及常见的情绪,确保没有任何一种感觉被忽视。整个过程发生不到十分之一秒,速度足以跟上视频游戏的快速节奏而不使其变慢。

这项工作表明,交互式技术的未来在于能够实时适应用户的系统。研究人员证明,通过结合视觉、听觉和生理数据,有可能创建一个即使在挑战性环境下也能工作的鲁棒情感检测器。虽然这项研究专门针对游戏领域,但其影响延伸到了任何人类情感理解至关重要的场景,从心理健康监测到更直觉的人机交互。该团队已经展示了,当我们不再通过单一的视角来看待情绪,而是将人类表达的全光谱汇聚在一起时,我们就能构建出比以往任何时候都更懂我们的机器。

您所在领域的论文太多了?

获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。

试用 Digest →