Voice Tone-Based Emotion Detection Using Deep Learning: A Hybrid Transformer–CNN–BiLSTM Framework with Multi-Feature Fusion
Questo articolo presenta un framework di deep learning ibrido che integra strati CNN, Transformer e BiLSTM con una fusione multi-caratteristica per raggiungere prestazioni allo stato dell'arte nel riconoscimento delle emozioni nel parlato attraverso cinque dataset benchmark, dimostrando una robusta generalizzazione e miglioramenti significativi dell'accuratezza rispetto ai baseline esistenti.