MAVL: A Multilingual Audio-Video Lyrics Dataset for Animated Song Translation
यह शोध पत्र MAVL प्रस्तुत करता है, जो एनिमेटेड गीत अनुवाद के लिए पहला बहुभाषी ऑडियो-वीडियो बेंचमार्क है, और SylAVL-CoT मॉडल का प्रस्ताव करता है जो गाए जाने योग्य और प्रासंगिक रूप से सटीक बोल (lyrics) उत्पन्न करने में केवल टेक्स्ट-आधारित दृष्टिकोणों से काफी बेहतर प्रदर्शन करने के लिए मल्टीमॉडल संकेतों और शब्दांश संबंधी बाधाओं का लाभ उठाता है।