← नवीनतम पेपर
💬 NLP

BMdataset: A Musicologically Curated LilyPond Dataset

यह शोध पत्र BMdataset प्रस्तुत करता है, जो बारोक पांडुलिपियों से विशेषज्ञों द्वारा प्रतिलेखित लिलीपॉन्ड (LilyPond) स्कोर का एक संगीतशास्त्रीय रूप से क्यूरेट किया गया संग्रह है, और यह प्रदर्शित करता है कि अनुकूलित लिलीबर्ट (LilyBERT) मॉडल को इस उच्च-गुणवत्ता वाले, छोटे डेटासेट पर फाइन-ट्यून करना, प्रतीकात्मक संगीत समझ कार्यों के लिए विशाल शोरयुक्त कॉर्पोरा (massive noisy corpora) पर प्रशिक्षण देने की तुलना में बेहतर प्रदर्शन करता है।

मूल लेखक: Matteo Spanio, Ilay Guler, Antonio Rodà

प्रकाशित 2026-04-14
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Matteo Spanio, Ilay Guler, Antonio Rodà

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक कंप्यूटर को संगीत समझना सिखाने की कोशिश कर रहे हैं। वर्षों से, शोधकर्ता मुख्य रूप से कंप्यूटर को MIDI फाइलों के माध्यम से प्रशिक्षित करते आए हैं। MIDI को एक डिजिटल पियानो रोल की तरह समझें: यह कंप्यूटर को बताता है कि कौन सी कुंजियाँ कब दबानी हैं और कब दबानी हैं, लेकिन यह शीट संगीत के बारे में लगभग बाकी सब कुछ भूल जाता है, जैसे कि सुंदर लिखावट, वायलिन वादक के लिए विशिष्ट निर्देश, या एक सिम्फनी के विभिन्न खंड कैसे व्यवस्थित होते हैं।

यह शोध पत्र कंप्यूटर को संगीत सिखाने का एक नया तरीका पेश करता है, जिसमें LilyPond का उपयोग किया गया है, जो एक टेक्स्ट-आधारित प्रणाली है जो कंप्यूटर कोड की तरह अधिक दिखती है बजाय एक पियानो रोल के। यह इस बात की कहानी है कि उन्होंने इसे कैसे किया, जिसे सरल रूप में नीचे विभाजित किया गया है:

1. समस्या: "शोर भरी लाइब्रेरी" बनाम "क्यूरेटेड म्यूजियम"

आज के अधिकांश AI मॉडल को संगीत के विशाल, अव्यवस्थित पुस्तकालयों (जैसे कि PDMX डेटासेट) पर प्रशिक्षित किया जाता है। यह इटली बोलने के लिए अरबों घंटों के रेडियो स्टैटिक, पॉडकास्ट और रैंडम बातचीत सुनने जैसा है। यह बहुत बड़ा है (संगीत के 15 बिलियन "शब्द"), लेकिन यह शोर भरा है और अक्सर पुरानी फाइलों को मशीनों द्वारा परिवर्तित करने से उत्पन्न होता है, जिससे त्रुटियां आ सकती हैं।

लेखकों ने कुछ अलग बनाने का निर्णय लिया: BMdataset

  • उपमा: एक विशाल, शोर भरी लाइब्रेरी के बजाय, उन्होंने एक छोटी, शुद्ध म्यूजियम (संग्रहालय) बनाई।
  • संग्रह: उन्होंने संगीत के 347 टुकड़े एकत्र किए (मुख्य रूप से बारोक युग के, जैसे विवलडी और बाख) जिन्हें संगीत विशेषज्ञों द्वारा मूल, धूल भरी पांडुलिपियों से सीधे ट्रांसक्राइब किया गया था।
  • गुणवत्ता: प्रत्येक टुकड़े को सटीक मेटाडेटा के साथ टैग किया गया है (किसने लिखा, कौन सा वाद्य यंत्र, कौन सी शैली)। यह छोटा है (केवल लगभग 90 मिलियन "शब्द"), लेकिन यह विशेषज्ञों द्वारा क्यूरेट किया गया है।

2. टूल: LilyBERT (संगीत-प्रेमी अनुवादक)

इस टेक्स्ट-आधारित संगीत को पढ़ने के लिए, वे एक मानक AI का उपयोग नहीं कर सकते थे। उन्हें एक ऐसे अनुवादक की आवश्यकता थी जो संगीत कोड के "व्याकरण" को समझ सके।

  • आधार: उन्होंने CodeBERT से शुरुआत की, जो एक AI मॉडल है जिसे पहले से ही प्रोग्रामिंग भाषाओं (जैसे पायथन या C++) को समझने के लिए प्रशिक्षित किया गया है।
  • अपग्रेड: चूंकि LilyPond काफी हद तक कोड जैसा दिखता है (यह \relative या \clef जैसे कमांड का उपयोग करता है), इसलिए यह AI एक अच्छा विकल्प था। हालांकि, मानक AI इन संगीतमय कमांड्स को छोटे, अर्थहीन टुकड़ों में काट देते हैं (जैसे "violin" शब्द को "vi", "ol", "in" में काटना)।
  • समाधान: टीम ने AI को एक नया शब्दकोश दिया जिसमें 115 विशेष संगीतमय टोकन थे। अब, जब AI \trill या \crescendo देखता है, तो वह उन्हें एकल, परमाणु अवधारणाओं के रूप में देखता है, ठीक वैसे ही जैसे एक मानव संगीतकार करता है। उन्होंने इस अपग्रेड किए गए मॉडल को LilyBERT नाम दिया।

3. प्रयोग: छोटा और स्मार्ट बनाम बड़ा और शोर भरा

शोधकर्ता यह देखना चाहते थे कि क्या उनका छोटा, सटीक म्यूजियम (BMdataset) उनके AI को एक विशाल, शोर भरी लाइब्रेरी (PDMX) की तुलना में बेहतर तरीके से सिखा सकता है।

उन्होंने AI का परीक्षण संगीत के एक पूरी तरह से नए सेट (Mutopia कॉर्पस) पर किया ताकि यह देखा जा सके कि वह अनुमान लगा सकता है या नहीं:

  1. यह रचना किसने लिखी? (कंपोजर)
  2. इसकी शैली क्या है? (बारोक, क्लासिकल, आदि)

परिणाम आश्चर्यजनक थे:

  • "छोटा म्यूजियम" जीतता है: भले ही BMdataset विशाल लाइब्रेरी की तुलना में बहुत छोटा था, फिर भी केवल विशेषज्ञ-क्यूरेटेड डेटा पर प्रशिक्षित AI ने विशाल, शोर भरी लाइब्रेरी पर प्रशिक्षित AI की तुलना में बेहतर प्रदर्शन किया।
  • "परफेक्ट कॉम्बो": सबसे अच्छा परिणाम एक दो-चरणीय प्रक्रिया से आया:
    1. पहले, AI को LilyPond कोड के बुनियादी "वर्णमाला" को सीखने के लिए विशाल लाइब्रेरी को पढ़ने दें।
    2. फिर, इसे सूक्ष्म, उच्च-गुणवत्ता वाली संगीतमय बारीकियों को सीखने के लिए छोटे, विशेषज्ञ म्यूजियम पर फाइन-ट्यून करें।
    • उपमा: यह सड़क के लाखों रैंडम साइनबोर्ड (व्यापक प्री-ट्रेनिंग) को पढ़कर एक भाषा सीखने और फिर एक मूल कवि के साथ मास्टरक्लास लेने (डोमेन-विशिष्ट फाइन-ट्यूनिंग) जैसा है। इस संयोजन ने उन्हें कंपोजर्स का अनुमान लगाने में 84.3% सटीकता दी।

4. यह क्यों महत्वपूर्ण है

यह शोध पत्र यह सिद्ध करता है कि संगीत जैसी जटिल कार्यों के लिए, मात्रा से अधिक गुणवत्ता मायने रखती है। एक छोटा, स्वच्छ, मानव-सत्यापित डेटासेट एक विशाल, अव्यवस्थित डेटासेट की तुलना में AI को अधिक प्रभावी ढंग से सिखा सकता है।

हम इस पर क्या कर सकते हैं?
अब जब हमारे पास एक ऐसा मॉडल है जो वास्तव में संगीत के "कोड" को समझता है, तो हम ऐसे उपकरण बना सकते हैं जो:

  • डिजिटल शीट संगीत में त्रुटियों को स्वचालित रूप से ठीक कर सकें (संगीत के लिए स्पेल-चेकर की तरह)।
  • किसी विशिष्ट कंपोजर की शैली के आधार पर अगली नोट (स्वर) का सुझाव दे सकें।
  • संगीतकारों को उनके स्कोर को अधिक सटीकता के साथ संपादित करने में मदद कर सकें।

संक्षेप में, लेखकों ने एक उच्च-गुणवत्ता वाला संगीत पुस्तकालय और एक विशेष अनुवादक बनाया है ताकि यह दिखाया जा सके कि जब कला के बारे में AI को सिखाने की बात आती है, तो मानवीय विशेषज्ञता का थोड़ा सा अंश भी बहुत दूर तक जाता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →