Multimodal Self-Attention Network with Temporal Alignment for Audio-Visual Emotion Recognition
تقترح هذه الورقة إطار عمل يعتمد على نموذج "ترانسفورمر" للتعرف على العواطف عبر الصوت والصورة، يعالج عدم التوافق في معدل الإطارات من خلال تضمينات الموضع الدوارة المتوافقة زمنياً وفقدان المطابقة عبر الزمن لتعزيز محاذاة ودمج الميزات متعددة الوسائط.