Multimodal Self-Attention Network with Temporal Alignment for Audio-Visual Emotion Recognition
यह शोधपत्र एक ट्रांसफॉर्मर-आधारित फ्रेमवर्क प्रस्तावित करता है जो ऑडियो-विजुअल इमोशन रिकग्निशन के लिए है, जो मल्टीमॉडल फीचर अलाइनमेंट और फ्यूजन को बढ़ाने के लिए टेम्पोरली-अलाइन्ड रोटरी पोजीशन एम्बेडिंग्स और एक क्रॉस-टेम्पोरल मैचिंग लॉस के माध्यम से फ्रेम-रेट विसंगतियों को संबोधित करता है।