Voice Tone-Based Emotion Detection Using Deep Learning: A Hybrid Transformer–CNN–BiLSTM Framework with Multi-Feature Fusion
Diese Arbeit präsentiert ein hybrides Deep-Learning-Framework, das CNN-, Transformer- und BiLSTM-Schichten mit Multi-Feature-Fusion integriert, um eine State-of-the-Art-Leistung bei der Sprachemotionserkennung über fünf Benchmark-Datensätze hinweg zu erreichen, wobei eine robuste Generalisierung und signifikante Genauigkeitsverbesserungen gegenüber bestehenden Baselines demonstriert werden.