Voice Tone-Based Emotion Detection Using Deep Learning: A Hybrid Transformer–CNN–BiLSTM Framework with Multi-Feature Fusion
Este artigo apresenta um framework de aprendizado profundo híbrido que integra camadas de CNN, Transformer e BiLSTM com fusão de múltiplas características para alcançar um desempenho de estado da arte em reconhecimento de emoção de fala através de cinco conjuntos de dados de referência, demonstrando generalização robusta e melhorias significativas de acurácia em relação às bases de comparação existentes.