Voice Tone-Based Emotion Detection Using Deep Learning: A Hybrid Transformer–CNN–BiLSTM Framework with Multi-Feature Fusion
Cet article présente un cadre d'apprentissage profond hybride qui intègre des couches CNN, Transformer et BiLSTM avec une fusion de caractéristiques multiples pour atteindre des performances de reconnaissance des émotions de la parole de pointe sur cinq ensembles de données de référence, démontrant une généralisation robuste et des améliorations de précision significatives par rapport aux bases existantes.