MulTTiPop: A Multitrack Transcription Dataset for Pop Music
यह शोध पत्र MulTTiPop प्रस्तुत करता है, जो 572 विविध पॉप संगीत खंडों का एक डेटासेट है जो मल्टीट्रैक MIDI रिकॉर्डिंग के साथ संरेखित है, जिसका उपयोग अत्याधुनिक ऑटोमैटिक म्यूजिक ट्रांसक्रिप्शन मॉडलों में महत्वपूर्ण प्रदर्शन अंतराल का मूल्यांकन करने और प्रदर्शित करने के लिए किया जाता है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आप एक रोबोट को कान से संगीत पढ़ना सिखाने की कोशिश कर रहे हैं। आप चाहते हैं कि वह एक पूरा पॉप गाना सुने—ड्रम्स, बास, गिटार, वोकल्स सब एक साथ मिक्स होकर—और लिख दे कि हर एक वाद्य यंत्र (instrument) बिल्कुल क्या बजा रहा है। सुनने में बहुत बढ़िया लगता है, है ना? लेकिन यहाँ एक समस्या है: अब तक, हमारे पास कोई अच्छा "उत्तर कुंजी" (answer key) नहीं था जिससे हम यह जाँच सकें कि रोबोट सही कर रहा है या नहीं। मौजूदा उत्तर कुंजियाँ या तो केवल पियानो के लिए थीं (जो बहुत आसान है), या कंप्यूटर द्वारा बनाई गई थीं (जो बहुत सटीक/परफेक्ट हैं), या फिर उनमें केवल मुख्य धुन और कॉर्ड्स का उल्लेख था (जो बहुत सरल है)।
यहाँ आता है MulTTiPop, जो कार्नेगी मेलन यूनिवर्सिटी के शोधकर्ताओं द्वारा बनाया गया एक नया डेटासेट है ताकि इस समस्या को ठीक किया जा सके। MulTTiPop को एक विशाल 3.5-घंटे की प्लेलिस्ट के रूप में समझें जिसमें 1930 से लेकर 2000 के दशक तक के असली पॉप हिट्स हैं, और इसके साथ एक "जादुई शीट म्यूज़िक" भी है जो आपको बताता है कि हर एक वाद्य यंत्र मिलीसेकंड के स्तर तक क्या कर रहा है।
महान मिलान का खेल (The Great Matching Game)
उन्होंने इसे कैसे बनाया? यह "मैच ढूँढने" के एक हाई-स्टेक्स गेम जैसा था।
- सुराग (The Clues): उन्होंने YouTube वीडियो की एक विशाल सूची (TheoryTab नामक डेटाबेस से) और डिजिटल शीट म्यूज़िक की एक बड़ी लाइब्रेरी (Lakh MIDI Dataset से) से शुरुआत की।
- पहला फ़िल्टर: उन्होंने गाने के शीर्षक और कलाकार के नाम मिलाने के लिए कंप्यूटर मैजिक का उपयोग किया। यदि नाम लगभग समान थे, तो उन्होंने उस जोड़ी को रख लिया। इससे लगभग 1,164 संभावित मिलान मिले।
- टेम्पो का ट्विस्ट (The Tempo Twist): यहाँ मामला पेचीदा हो जाता है। भले ही गाना एक ही हो, लेकिन डिजिटल शीट म्यूज़िक का "ताल" (beat) वास्तविक YouTube वीडियो की तुलना में थोड़ा तेज़ या धीमा हो सकता है। यह वैसा ही है जैसे दो लोग एक ही गाने पर नाचने की कोशिश कर रहे हों, लेकिन एक व्यक्ति थोड़ा पीछे चल रहा हो।
- मानवीय स्पर्श (The Human Touch): टाइमिंग को ठीक करने के लिए, शोधकर्ताओं ने एक चतुर तरकीब का इस्तेमाल किया। उन्होंने एक विशिष्ट "एंकर बीट" (एक ऐसा क्षण जहाँ संगीत निश्चित रूप से मेल खाता है) ढूँढा और फिर डिजिटल शीट म्यूज़िक को वास्तविक वीडियो की लय के साथ पूरी तरह से मिलाने के लिए खींचा या सिकोड़ा। लेकिन कंप्यूटर इन एंकर बीट्स को चुनने में परफेक्ट नहीं होते। इसलिए, उन्होंने मानव एनोटेटर्स (वे छात्र जो संगीत और तकनीक से प्यार करते हैं) से वीडियो को सुनने और डिजिटल शीट म्यूज़िक को साथ-साथ देखकर सही संरेखण (alignment) चुनने के लिए कहा।
अंत में, उन्होंने संगीत के 572 खंडों (segments) को सफलतापूर्वक संरेखित किया। यह लगभग 3.5 घंटे का ऑडियो है, जिसमें 263 अलग-अलग कलाकारों के 374 अनूठे गाने शामिल हैं।
वास्तविकता की जाँच: रोबोटों को अभी लंबा रास्ता तय करना है
शोधकर्ताओं ने केवल डेटासेट ही नहीं बनाया; उन्होंने तुरंत बेहतरीन रोबोट संगीतकारों को टेस्ट पर लगा दिया। उन्होंने दो शीर्ष-स्तरीय AI मॉडल (जिन्हें MT3 और YourMT3+ कहा जाता है) से इन MulTTiPop क्लिप्स को सुनने और नोट्स लिखने के लिए कहा।
परिणाम? रोबोटों को संघर्ष करना पड़ा।
- सबसे अच्छे मॉडल ने केवल 38% नोट स्टार्ट्स को सही पहचाना (एक मीट्रिक जिसे "Onset F1" कहा जाता है)।
- जब संगीत घना (dense) हो जाता था, तो रोबोट अक्सर भ्रमित हो जाते थे। वे शायद धुन (melody) सुन लेते थे लेकिन बास (bass) को मिस कर देते थे, या वे एक ही वाद्य यंत्र पर अटक जाते थे और बाकी को अनदेखा कर देते थे।
- एक मॉडल ने वोकल्स (vocals) का अनुमान लगाने की कोशिश की लेकिन उन्हें सैक्सोफोन (saxophone) के रूप में लेबल किया (जो मज़ेदार तो है, लेकिन गलत है)।
पेपर सुझाव देता है कि इन रोबोटों के विफल होने का कारण यह है कि उन्हें ज्यादातर नकली, कंप्यूटर-जनरेटेड संगीत (जैसे Slakh2100 डेटासेट) पर प्रशिक्षित किया गया था, न कि वास्तविक, जटिल व्यावसायिक पॉप रिकॉर्डिंग पर। यह एक शेफ को केवल प्लास्टिक के खाने के मॉडल दिखाकर खाना सिखाने जैसा है, और फिर उससे एक असली, गरमागरम स्टेक की उम्मीद करने जैसा है।
यह डेटासेट क्या है (और क्या नहीं है)
लेखक खेल के नियमों को लेकर बहुत स्पष्ट हैं:
- यह टेस्टिंग के लिए है: MulTTiPop एक "फाइनल एग्जाम" है संगीत ट्रांसक्रिप्शन AI के लिए। इसे यह दिखाने के लिए डिज़ाइन किया गया है कि रोबोट कहाँ विफल हो रहे हैं ताकि हम उन्हें ठीक कर सकें।
- यह ट्रेनिंग के लिए नहीं है: शोधकर्ता स्पष्ट रूप से इस डेटासेट का उपयोग रोबोटों को सिखाने के लिए करने से मना करते हैं। क्योंकि ये गाने कॉपीराइट वाले व्यावसायिक हिट्स हैं और डेटासेट अपेक्षाकृत छोटा है, इसलिए इसका उपयोग मॉडल को प्रशिक्षित करने के लिए करना अनुचित और कानूनी रूप से संदिग्ध होगा।
- इसमें एक पूर्वाग्रह (bias) है: पेपर स्वीकार करता है कि चुने गए गाने ज्यादातर पश्चिमी पॉप संगीत (अमेरिकी कलाकार, पश्चिमी हार्मनी) से हैं। यह सुझाव देता है कि यदि कोई रोबोट MulTTiPop पर अच्छा प्रदर्शन करता है, तो वह पश्चिमी पॉप में अच्छा है, लेकिन हम यह सुनिश्चित नहीं कर सकते कि वह दुनिया के अन्य हिस्सों या विभिन्न परंपराओं के संगीत पर भी अच्छा करेगा।
निष्कर्ष (The Bottom Line)
MulTTiPop एक महत्वपूर्ण नया टूल है जो अंततः जटिल पॉप संगीत के लिए एक वास्तविक "उत्तर कुंजी" प्रदान करता है। यह साबित करता है कि हालांकि हमारे AI संगीत ट्रांसक्राइबर्स सरल कार्यों में बेहतर हो रहे हैं, फिर भी एक वास्तविक पॉप बैंड की अव्यवस्थित और अद्भुत अराजकता को समझने से पहले उन्हें काफी सुधार की आवश्यकता है। रोबोट वर्तमान में इस टेस्ट में "C-" प्राप्त कर रहे हैं, और शोधकर्ता आशावादी हैं कि इस नए डेटासेट के साथ, वे उन्हें कड़ी मेहनत करने और अगली बार "A" प्राप्त करने में मदद कर सकते हैं।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।