← Neueste Arbeiten
💻 computer science

Speech Emotion Recognition Using MFCC Features and LSTM-Based Deep Learning Model

Dieser Beitrag stellt ein Spracherkennungssystem vor, das die Merkmalsextraktion mittels Mel-Frequenz-Cepstrum-Koeffizienten (MFCC) mit einem Deep-Learning-Modell auf Basis von Long Short-Term Memory (LSTM) kombiniert, auf dem TESS-Datensatz eine Genauigkeit von 99 % erreicht und eine klassische SVM-Baseline übertrifft.

Ursprüngliche Autoren: Adelekun Oluwademilade, Ademola Adedamola, Abiola Abdulhakeem, Akinpelu Azeezat, Eraiyetan Israel, Omotosho Oluwadunsin, Ibenye Ikechukwu, Ayuba Muhammad, Olusanya Olamide, Kamorudeen Amuda

Veröffentlicht 2026-04-30
📖 4 Min. Lesezeit☕ Kaffeepausen-Lektüre

Ursprüngliche Autoren: Adelekun Oluwademilade, Ademola Adedamola, Abiola Abdulhakeem, Akinpelu Azeezat, Eraiyetan Israel, Omotosho Oluwadunsin, Ibenye Ikechukwu, Ayuba Muhammad, Olusanya Olamide, Kamorudeen Amuda

Originalarbeit lizenziert unter CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/). Dies ist eine KI-generierte Erklärung des untenstehenden Papers. Sie wurde nicht von den Autoren verfasst oder gebilligt. Für technische Genauigkeit konsultieren Sie das Originalpaper. Vollständigen Haftungsausschluss lesen

Stellen Sie sich vor, Sie versuchen herauszufinden, wie sich ein Freund fühlt, indem Sie nur auf seine Stimme hören. Sie müssen die Worte, die er sagt, nicht verstehen; Sie müssen nur den Ton, den Rhythmus und die Energie hören. Wenn er zittrig klingt, könnte er Angst haben. Wenn er scharf und laut klingt, könnte er wütend sein.

Dieser Artikel handelt davon, einem Computer beizubringen, genau das zu tun. Die Forscher entwickelten ein System, das die Stimme einer Person hören und herausfinden kann, ob sie glücklich, traurig, wütend oder neutral ist, ohne die Sprache selbst verstehen zu müssen.

So haben sie es getan, einfach erklärt:

1. Die Zutaten: Der „Stimmfingerabdruck" (MFCC)

Zuerst muss der Computer Schallwellen in etwas umwandeln, das er lesen kann. Die Forscher verwendeten ein Werkzeug namens MFCC (Mel-Frequency Cepstral Coefficients).

Stellen Sie sich MFCCs wie einen Stimmfingerabdruck vor. Genau wie Ihr Fingerabdruck einzigartige Rillen und Muster hat, die Sie identifizieren, zerlegen MFCCs eine Stimme in eine spezifische Reihe von Zahlen, die ihre Tonhöhe, ihren Klang und ihre Textur beschreiben. Der Computer betrachtet diese Zahlen, um die „Form" des Sounds zu verstehen.

2. Der Lehrer: Der „Zeitreisende Schüler" (LSTM)

Die eigentliche Magie geschieht mit der Art von Computerhirn, das sie verwendeten, genannt LSTM (Long Short-Term Memory).

Stellen Sie sich einen Schüler vor, der eine Prüfung schreibt.

  • Alte Computer sind wie Schüler, die nur den allerletzten Satz einer Geschichte betrachten, um das Ende zu erraten. Ihnen entgeht der Kontext.
  • Das LSTM ist wie ein Schüler, der sich an die ganze Geschichte erinnert. Es weiß, dass sich eine Stimme, die ruhig beginnt und dann plötzlich laut und schnell wird, über die Zeit hinweg verändert – ein Zeichen von Wut. Wenn die Stimme hoch beginnt und tief wird, könnte das Traurigkeit bedeuten.

Das LSTM ist besonders, weil es sich daran erinnern kann, was vor ein paar Sekunden passiert ist, während es zuhört, was gerade passiert. Das ist entscheidend, weil Emotionen nicht nur ein einzelnes Schnappschuss sind; sie sind eine Reise, die sich im Laufe der Zeit entfaltet.

3. Der Übungsplatz: Die „Schauspielklasse" (TESS-Datensatz)

Um diesen Computer zu unterrichten, verwendeten die Forscher einen Datensatz namens TESS (Toronto Emotional Speech Set).

  • Die Schauspieler: Sie verwendeten Aufnahmen von zwei professionellen Schauspielerinnen.
  • Das Skript: Die Schauspielerinnen lasen dieselbe Liste von Wörtern (wie „take up"), sprachen sie aber in sieben verschiedenen emotionalen „Kostümen": Wütend, Ekel, Angst, Glücklich, Angenehme Überraschung, Traurig und Neutral.
  • Das Ziel: Der Computer musste diese Aufnahmen hören und lernen, welches „Kostüm" die Stimme trug.

4. Das Training: Die Muster lernen

Die Forscher fütterten Tausende dieser Sprachclips in den Computer.

  1. Vorbereitung: Sie zerschnitten das Audio in ordentliche 3-Sekunden-Teile und verwandelten sie in diese „Stimmfingerabdrücke" (MFCCs).
  2. Die Lektion: Der Computer betrachtete die Sequenz der Fingerabdrücke. Er lernte: „Ah, wenn die Zahlen in diesem Muster schnell hoch und runter gehen, bedeutet das normalerweise 'Glücklich'."
  3. Der Test: Sie testeten den Computer mit Sprachclips, die er noch nie gesehen hatte.

5. Die Ergebnisse: Eine fast perfekte Punktzahl

Die Ergebnisse waren beeindruckend:

  • Der alte Weg: Sie versuchten zuerst eine einfachere, ältere Methode (genannt SVM), die nur den Durchschnitt der Stimmfingerabdrücke betrachtete und den Zeitfaktor ignorierte. Sie lag 98 % richtig. Das ist bereits sehr gut!
  • Der neue Weg: Das neue LSTM-System, das sich an den Zeitverlauf und den Fluss der Stimme erinnerte, lag 99 % richtig.

Der Artikel zeigt, dass der Computer, indem er darauf achtet, wie sich die Stimme im Laufe der Zeit verändert (wie eine Melodie), die Emotion etwas besser erraten konnte als nur durch einen statischen Schnappschuss des Sounds.

6. Was das bedeutet (und was nicht)

Der Artikel kommt zu dem Schluss, dass dieses spezifische Setup für die „Schauspielklassen"-Daten, die sie verwendeten, sehr gut funktioniert.

  • Wo es eingesetzt werden könnte (laut dem Artikel): Die Autoren schlagen vor, dass dies helfen könnte, bessere virtuelle Assistenten zu entwickeln (wie Siri oder Alexa, die wissen, wann Sie frustriert sind) und Tools zur Überwachung der psychischen Gesundheit (zur Erkennung von Not in einer Stimme).
  • Der Haken: Der Artikel gibt zu, dass dies in einer kontrollierten Umgebung mit sauberen Aufnahmen und professionellen Schauspielern durchgeführt wurde. In der realen Welt, mit Hintergrundgeräuschen, verschiedenen Akzenten oder Menschen, die spontan sprechen, ist das System vielleicht noch nicht ganz so perfekt.

Kurz gesagt: Die Forscher brachten einem Computer bei, auf die „Musik" einer Stimme zu hören, nicht nur auf die Worte. Durch die Verwendung eines intelligenten Speichersystems, das Veränderungen im Laufe der Zeit verfolgt, entwickelten sie ein Werkzeug, das menschliche Emotionen mit einer Genauigkeit von 99 % auf ihren Testdaten erraten kann.

Ertrinken Sie in Arbeiten in Ihrem Fachgebiet?

Erhalten Sie tägliche Digests der neuesten Arbeiten passend zu Ihren Forschungsbegriffen — mit technischen Zusammenfassungen, in Ihrer Sprache.

Digest testen →