Voice Tone-Based Emotion Detection Using Deep Learning: A Hybrid Transformer–CNN–BiLSTM Framework with Multi-Feature Fusion
本論文は、CNN、Transformer、およびBiLSTM層をマルチフィーチャー・フュージョン(多機能融合)と統合したハイブリッド深層学習フレームワークを提案し、5つのベンチマークデータセットにおいて最先端の音声感情認識性能を達成し、既存のベースラインに対する堅牢な汎化性能と大幅な精度向上を実証するものである。