Voice Tone-Based Emotion Detection Using Deep Learning: A Hybrid Transformer–CNN–BiLSTM Framework with Multi-Feature Fusion
Este artículo presenta un marco de aprendizaje profundo híbrido que integra capas de CNN, Transformer y BiLSTM con fusión de características múltiples para lograr un rendimiento de vanguardia en el reconocimiento de emociones en el habla a través de cinco conjuntos de datos de referencia, demostrando una generalización robusta y mejoras significativas de precisión sobre las líneas base existentes.