Speech Emotion Recognition Using MFCC Features and LSTM-Based Deep Learning Model
本文提出了一种语音情感识别系统,该系统将梅尔频率倒谱系数(MFCC)特征提取与长短期记忆(LSTM)深度学习模型相结合,在TESS数据集上实现了99%的准确率,并优于经典的SVM基线。
原始论文采用 CC BY 4.0 许可(http://creativecommons.org/licenses/by/4.0/)。 这是对下方论文的AI生成解释。它不是由作者撰写或认可的。如需技术准确性,请参阅原始论文。 阅读完整免责声明
想象一下,你正试图仅通过聆听朋友的声音来猜测他们的情绪。你不需要听懂他们说的话;你只需要听到语调、节奏和能量。如果声音听起来颤抖,他们可能感到害怕。如果声音听起来尖锐而响亮,他们可能正在生气。
本文讲述的是如何教会计算机做到这一点。研究人员构建了一个系统,能够聆听一个人的声音并判断其情绪是快乐、悲伤、愤怒还是中性,而无需理解语言本身。
以下是他们如何实现这一点的简明解释:
1. 原料:“声音指纹”(MFCC)
首先,计算机需要将声波转化为它能读取的形式。研究人员使用了一种名为MFCC(梅尔频率倒谱系数)的工具。
将 MFCC 想象成声音指纹。正如你的指纹拥有独特的脊线和图案以识别你的身份一样,MFCC 将声音分解为一组特定的数字,描述其音高、音色和质感。计算机通过观察这些数字来理解声音的“形状”。
2. 导师:“穿越时间的学生”(LSTM)
真正的魔力出现在他们所使用的计算机大脑类型上,即LSTM(长短期记忆网络)。
想象一名正在参加考试的学生。
- 旧式计算机就像只盯着故事最后一句话来猜测结局的学生。他们忽略了上下文。
- LSTM则像一名记住了整个故事的学生。它知道,如果声音起初平静,随后突然变得响亮且急促,这种随时间的变化就是愤怒的迹象。如果声音起初高昂而后转低,那可能是悲伤。
LSTM 之所以特殊,是因为它在聆听当下发生的情况时,能够记住几秒钟前发生的事情。这至关重要,因为情绪不仅仅是单张快照;它们是随时间展开的旅程。
3. 演练场:“表演课”(TESS 数据集)
为了训练这台计算机,研究人员使用了一个名为TESS(多伦多情感语音集)的数据集。
- 演员:他们使用了两位专业女演员的录音。
- 剧本:女演员们朗读同一份单词列表(例如"take up"),但用七种不同的情感“戏服”来说出它们:愤怒、厌恶、恐惧、快乐、愉悦的惊喜、悲伤和中性。
- 目标:计算机必须聆听这些录音,并学会辨别声音穿着哪种“戏服”。
4. 训练:学习模式
研究人员将成千上万条这样的语音片段输入计算机。
- 准备:他们将音频切割成整齐的 3 秒片段,并将其转化为那些“声音指纹”(MFCC)。
- 课程:计算机观察指纹序列。它学会了:“哦,当数字以这种模式快速上下波动时,通常意味着‘快乐’。”
- 测试:他们在计算机从未见过的语音片段上测试了它。
5. 结果:近乎完美的分数
结果令人印象深刻:
- 旧方法:他们首先尝试了一种更简单、更旧的方法(称为 SVM),该方法仅查看声音指纹的平均值,而忽略了时间因素。它的准确率达到了98%。这已经非常棒了!
- 新方法:新的 LSTM 系统记住了声音的时间和流动,其准确率达到99%。
该论文表明,通过关注声音随时间变化的方式(就像旋律一样),计算机在猜测情绪方面比仅仅观察声音的静态快照略胜一筹。
6. 这意味着什么(以及不意味着什么)
论文得出结论,这种特定设置在它们所使用的“表演课”数据上表现非常出色。
- 可能的应用(根据论文):作者建议,这有助于构建更好的虚拟助手(例如知道何时你感到沮丧的 Siri 或 Alexa)和心理健康监测工具(用于检测声音中的痛苦)。
- 局限性:论文承认,这是在受控环境中使用清晰录音和专业演员完成的。在现实世界中,面对背景噪音、不同的口音或人们自发的言语,该系统可能还远未达到如此完美的程度。
简而言之:研究人员教会计算机聆听声音的“音乐”,而不仅仅是词语。通过使用一种能够追踪随时间变化的智能记忆系统,他们构建了一种工具,在其测试数据上能以 99% 的准确率猜测人类情绪。
您所在领域的论文太多了?
获取与您研究关键词匹配的最新论文每日摘要——附技术摘要,使用您的语言。