MuVAP: Multimodal Multiparty Voice Activity Projection for Turn-taking Prediction in the Wild
MuVAP एक कॉज़ल मल्टीमॉडल फ्रेमवर्क है जो केवल मोनाउरल ऑडियो और एक सिंगल कैमरा व्यू का उपयोग करके मल्टीपार्टी इंटरैक्शन में स्पीकर-अवेयर टर्न-टेकिंग प्रेडिक्शन को सक्षम बनाता है, जो स्पीकर मॉडलिंग को सरल बनाने के लिए रोल-रिलेटिव प्रोजेक्शन और अनएडिटेड ट्रेनिंग डेटा प्रदान करने के लिए ऑडियो-विजुअल कन्वर्सेशन कॉर्पस को पेश करता है।