BMdataset: A Musicologically Curated LilyPond Dataset
यह शोध पत्र BMdataset प्रस्तुत करता है, जो बारोक पांडुलिपियों से विशेषज्ञों द्वारा प्रतिलेखित लिलीपॉन्ड (LilyPond) स्कोर का एक संगीतशास्त्रीय रूप से क्यूरेट किया गया संग्रह है, और यह प्रदर्शित करता है कि अनुकूलित लिलीबर्ट (LilyBERT) मॉडल को इस उच्च-गुणवत्ता वाले, छोटे डेटासेट पर फाइन-ट्यून करना, प्रतीकात्मक संगीत समझ कार्यों के लिए विशाल शोरयुक्त कॉर्पोरा (massive noisy corpora) पर प्रशिक्षण देने की तुलना में बेहतर प्रदर्शन करता है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आप एक कंप्यूटर को संगीत समझना सिखाने की कोशिश कर रहे हैं। वर्षों से, शोधकर्ता मुख्य रूप से कंप्यूटर को MIDI फाइलों के माध्यम से प्रशिक्षित करते आए हैं। MIDI को एक डिजिटल पियानो रोल की तरह समझें: यह कंप्यूटर को बताता है कि कौन सी कुंजियाँ कब दबानी हैं और कब दबानी हैं, लेकिन यह शीट संगीत के बारे में लगभग बाकी सब कुछ भूल जाता है, जैसे कि सुंदर लिखावट, वायलिन वादक के लिए विशिष्ट निर्देश, या एक सिम्फनी के विभिन्न खंड कैसे व्यवस्थित होते हैं।
यह शोध पत्र कंप्यूटर को संगीत सिखाने का एक नया तरीका पेश करता है, जिसमें LilyPond का उपयोग किया गया है, जो एक टेक्स्ट-आधारित प्रणाली है जो कंप्यूटर कोड की तरह अधिक दिखती है बजाय एक पियानो रोल के। यह इस बात की कहानी है कि उन्होंने इसे कैसे किया, जिसे सरल रूप में नीचे विभाजित किया गया है:
1. समस्या: "शोर भरी लाइब्रेरी" बनाम "क्यूरेटेड म्यूजियम"
आज के अधिकांश AI मॉडल को संगीत के विशाल, अव्यवस्थित पुस्तकालयों (जैसे कि PDMX डेटासेट) पर प्रशिक्षित किया जाता है। यह इटली बोलने के लिए अरबों घंटों के रेडियो स्टैटिक, पॉडकास्ट और रैंडम बातचीत सुनने जैसा है। यह बहुत बड़ा है (संगीत के 15 बिलियन "शब्द"), लेकिन यह शोर भरा है और अक्सर पुरानी फाइलों को मशीनों द्वारा परिवर्तित करने से उत्पन्न होता है, जिससे त्रुटियां आ सकती हैं।
लेखकों ने कुछ अलग बनाने का निर्णय लिया: BMdataset।
- उपमा: एक विशाल, शोर भरी लाइब्रेरी के बजाय, उन्होंने एक छोटी, शुद्ध म्यूजियम (संग्रहालय) बनाई।
- संग्रह: उन्होंने संगीत के 347 टुकड़े एकत्र किए (मुख्य रूप से बारोक युग के, जैसे विवलडी और बाख) जिन्हें संगीत विशेषज्ञों द्वारा मूल, धूल भरी पांडुलिपियों से सीधे ट्रांसक्राइब किया गया था।
- गुणवत्ता: प्रत्येक टुकड़े को सटीक मेटाडेटा के साथ टैग किया गया है (किसने लिखा, कौन सा वाद्य यंत्र, कौन सी शैली)। यह छोटा है (केवल लगभग 90 मिलियन "शब्द"), लेकिन यह विशेषज्ञों द्वारा क्यूरेट किया गया है।
2. टूल: LilyBERT (संगीत-प्रेमी अनुवादक)
इस टेक्स्ट-आधारित संगीत को पढ़ने के लिए, वे एक मानक AI का उपयोग नहीं कर सकते थे। उन्हें एक ऐसे अनुवादक की आवश्यकता थी जो संगीत कोड के "व्याकरण" को समझ सके।
- आधार: उन्होंने CodeBERT से शुरुआत की, जो एक AI मॉडल है जिसे पहले से ही प्रोग्रामिंग भाषाओं (जैसे पायथन या C++) को समझने के लिए प्रशिक्षित किया गया है।
- अपग्रेड: चूंकि LilyPond काफी हद तक कोड जैसा दिखता है (यह
\relativeया\clefजैसे कमांड का उपयोग करता है), इसलिए यह AI एक अच्छा विकल्प था। हालांकि, मानक AI इन संगीतमय कमांड्स को छोटे, अर्थहीन टुकड़ों में काट देते हैं (जैसे "violin" शब्द को "vi", "ol", "in" में काटना)। - समाधान: टीम ने AI को एक नया शब्दकोश दिया जिसमें 115 विशेष संगीतमय टोकन थे। अब, जब AI
\trillया\crescendoदेखता है, तो वह उन्हें एकल, परमाणु अवधारणाओं के रूप में देखता है, ठीक वैसे ही जैसे एक मानव संगीतकार करता है। उन्होंने इस अपग्रेड किए गए मॉडल को LilyBERT नाम दिया।
3. प्रयोग: छोटा और स्मार्ट बनाम बड़ा और शोर भरा
शोधकर्ता यह देखना चाहते थे कि क्या उनका छोटा, सटीक म्यूजियम (BMdataset) उनके AI को एक विशाल, शोर भरी लाइब्रेरी (PDMX) की तुलना में बेहतर तरीके से सिखा सकता है।
उन्होंने AI का परीक्षण संगीत के एक पूरी तरह से नए सेट (Mutopia कॉर्पस) पर किया ताकि यह देखा जा सके कि वह अनुमान लगा सकता है या नहीं:
- यह रचना किसने लिखी? (कंपोजर)
- इसकी शैली क्या है? (बारोक, क्लासिकल, आदि)
परिणाम आश्चर्यजनक थे:
- "छोटा म्यूजियम" जीतता है: भले ही BMdataset विशाल लाइब्रेरी की तुलना में बहुत छोटा था, फिर भी केवल विशेषज्ञ-क्यूरेटेड डेटा पर प्रशिक्षित AI ने विशाल, शोर भरी लाइब्रेरी पर प्रशिक्षित AI की तुलना में बेहतर प्रदर्शन किया।
- "परफेक्ट कॉम्बो": सबसे अच्छा परिणाम एक दो-चरणीय प्रक्रिया से आया:
- पहले, AI को LilyPond कोड के बुनियादी "वर्णमाला" को सीखने के लिए विशाल लाइब्रेरी को पढ़ने दें।
- फिर, इसे सूक्ष्म, उच्च-गुणवत्ता वाली संगीतमय बारीकियों को सीखने के लिए छोटे, विशेषज्ञ म्यूजियम पर फाइन-ट्यून करें।
- उपमा: यह सड़क के लाखों रैंडम साइनबोर्ड (व्यापक प्री-ट्रेनिंग) को पढ़कर एक भाषा सीखने और फिर एक मूल कवि के साथ मास्टरक्लास लेने (डोमेन-विशिष्ट फाइन-ट्यूनिंग) जैसा है। इस संयोजन ने उन्हें कंपोजर्स का अनुमान लगाने में 84.3% सटीकता दी।
4. यह क्यों महत्वपूर्ण है
यह शोध पत्र यह सिद्ध करता है कि संगीत जैसी जटिल कार्यों के लिए, मात्रा से अधिक गुणवत्ता मायने रखती है। एक छोटा, स्वच्छ, मानव-सत्यापित डेटासेट एक विशाल, अव्यवस्थित डेटासेट की तुलना में AI को अधिक प्रभावी ढंग से सिखा सकता है।
हम इस पर क्या कर सकते हैं?
अब जब हमारे पास एक ऐसा मॉडल है जो वास्तव में संगीत के "कोड" को समझता है, तो हम ऐसे उपकरण बना सकते हैं जो:
- डिजिटल शीट संगीत में त्रुटियों को स्वचालित रूप से ठीक कर सकें (संगीत के लिए स्पेल-चेकर की तरह)।
- किसी विशिष्ट कंपोजर की शैली के आधार पर अगली नोट (स्वर) का सुझाव दे सकें।
- संगीतकारों को उनके स्कोर को अधिक सटीकता के साथ संपादित करने में मदद कर सकें।
संक्षेप में, लेखकों ने एक उच्च-गुणवत्ता वाला संगीत पुस्तकालय और एक विशेष अनुवादक बनाया है ताकि यह दिखाया जा सके कि जब कला के बारे में AI को सिखाने की बात आती है, तो मानवीय विशेषज्ञता का थोड़ा सा अंश भी बहुत दूर तक जाता है।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।