Voice Tone-Based Emotion Detection Using Deep Learning: A Hybrid Transformer–CNN–BiLSTM Framework with Multi-Feature Fusion
Dit artikel presenteert een hybride deep learning-framework dat CNN-, Transformer- en BiLSTM-lagen integreert met multi-feature fusie om de state-of-the-art prestaties voor spraakemotieherkenning over vijf benchmark-datasets te bereiken, wat robuuste generalisatie en significante nauwkeurigheidsverbeteringen ten opzichte van bestaande baselines aantoont.