SLEEPING-DISCO 9M: A large-scale pre-training dataset for generative music modeling
यह शोध पत्र Sleeping-DISCO 9M को प्रस्तुत करता है, जो वास्तविक लोकप्रिय संगीत और विश्व प्रसिद्ध कलाकारों से बना एक नवीन बड़े पैमाने का ओपन-सोर्स डेटासेट है, जिसे जनरेटिव म्यूजिक मॉडलिंग के लिए मौजूदा सिंथेटिक या गैर-प्रतिनिधि डेटासेट्स की सीमाओं को दूर करने के लिए डिज़ाइन किया गया है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आप एक रोबोट को इंसान की तरह गाना सिखाना चाहते हैं। ऐसा करने के लिए, आपको उसे गानों, गीतों और संगीत के बारे में कहानियों की एक विशाल लाइब्रेरी देनी होगी। लंबे समय तक, "बिग टेक" कंपनियों (जैसे Jukebox के पीछे की कंपनियां) ने अपनी गुप्त लाइब्रेरी को एक तिजोरी में बंद रखा, जबकि छोटे शोधकर्ताओं को बहुत छोटे, घर के बने संग्रहों या नकली संगीत से काम चलाना पड़ा।
Sleeping-DISCO 9M एक नई, विशाल लाइब्रेरी है जिसे लेखकों ने बनाया है और सभी के उपयोग के लिए खोल दिया है। यहाँ उन्होंने जो किया और यह क्यों महत्वपूर्ण है, इसका सरल विवरण दिया गया है, जिसमें रोजमर्रा के उपमाओं का उपयोग किया गया है:
1. समस्या: "खाली पेंट्री" बनाम "गुप्त तिजोरी"
सोचिए कि AI संगीत अनुसंधान की दुनिया नए व्यंजन बनाने की कोशिश कर रहे शेफों के एक समूह की तरह है।
- बड़े शेफ (Big Tech): उनके पास दुनिया के सबसे प्रसिद्ध सामग्रियों (प्रसिद्ध कलाकारों के लोकप्रिय गाने) से भरी गुप्त पेंट्री है, लेकिन वे किसी और को उन्हें देखने नहीं देते।
- छोटे शेफ (शोधकर्ता): वे छोटी, कृत्रिम सामग्रियों (सिंथेटिक संगीत) या बहुत छोटे, विशिष्ट संग्रहों (जैसे केवल चीनी पॉप गाने) के साथ खाना पकाने की कोशिश कर रहे हैं।
- "रैंडम" लाइब्रेरी: अन्य बड़ी लाइब्रेरी उपलब्ध थीं (जैसे DISCO-10M), लेकिन वे बिना लेबल वाले बक्सों से भरे गोदाम की तरह थीं। आप जानते थे कि उनमें संगीत है, लेकिन आप यह नहीं जानते थे कि इसे किसने गाया, गाना किस बारे में था, या वह संगीत असली था या सिर्फ एक रैंडम क्लिप। वे गंभीर कुकिंग के लिए बहुत अव्यवस्थित थे।
2. समाधान: एक "सुपर-ऑर्गनाइज्ड" संगीत विश्वकोश
लेखकों ने Sleeping-DISCO 9M बनाया। इसे केवल MP3 फाइलों के ढेर के रूप में नहीं, बल्कि एक विशाल, पूरी तरह से व्यवस्थित संगीत विश्वकोश के रूप में सोचें।
- पैमाना (Scale): इसमें 648,000 से अधिक विभिन्न कलाकारों के लगभग 9 मिलियन गाने शामिल हैं। यह एक ऐसी लाइब्रेरी रखने जैसा है जिसमें पिछले दशक के लगभग सभी हिट गाने हों।
- गुणवत्ता: ऊपर बताए गए अस्त-व्यस्त गोदामों के विपरीत, यह लाइब्रेरी व्यवस्थित है। प्रत्येक गाने के साथ एक विस्तृत "ID कार्ड" (मेटाडेटा) आता है। आप गाने को कलाकार, एल्बम, रिलीज के वर्ष या यहाँ तक कि विशिष्ट शैली (genre) के आधार पर खोज सकते हैं।
- विविधता: यह केवल अंग्रेजी पॉप नहीं है। यह एक वैश्विक मिश्रण है, जिसमें 169 भाषाएँ (अंग्रेजी और जापानी से लेकर स्वाहिली और हौसा तक) शामिल हैं। यह एक ही डेटासेट में एक वर्ल्ड टूर जैसा है।
3. उन्होंने इसे कैसे बनाया: "डिजिटल लाइब्रेरियन"
टीम ने केवल रैंडम फाइलें डाउनलोड नहीं कीं। उन्होंने एक डिजिटल रोबोट लाइब्रेरियन (एक पायथन स्क्रेपर) बनाया जो Genius वेबसाइट (गीत और संगीत तथ्यों के लिए एक प्रसिद्ध साइट) पर गया।
- रोबोट ने सावधानीपूर्वक लाखों पेजों को पढ़ा, गाने के शीर्षक, कलाकार के नाम, एल्बम का विवरण और बोल (lyrics) को कॉपी किया।
- इसके बाद वह इन गानों के वास्तविक वीडियो लिंक खोजने के लिए YouTube पर गया, जिसमें एक "स्मार्ट मैच" सिस्टम का उपयोग किया गया ताकि यह सुनिश्चित हो सके कि वीडियो का शीर्षक वास्तव में उस गाने से मेल खाता हो जिसे वे ढूंढ रहे थे।
- कैच (Catch): वे वास्तविक बोल (lyrics) या गहरे "एनोटेशन" (Genius संपादकों द्वारा लिखे गए मजेदार तथ्य) साझा नहीं कर सकते क्योंकि वे कॉपीराइट के अधीन हैं। हालाँकि, उन्होंने गानों के लिंक और बोलों का "फिंगरप्रिंट" (एम्बेडिंग्स) साझा किया है, जो कंप्यूटर को कच्चे टेक्स्ट की आवश्यकता के बिना अर्थ समझने में मदद करता है।
4. यह एक बड़ी बात क्यों है
इससे पहले, यदि कोई शोधकर्ता AI को वास्तविक दुनिया के संगीत को समझने के लिए प्रशिक्षित करना चाहता था, तो उसे अपना स्वयं का अस्त-व्यस्त संग्रह बनाना पड़ता था या एक बहुत ही सीमित संग्रह का उपयोग करना पड़ता था।
- Sleeping-DISCO पहली बार है जब इस आकार और गुणवत्ता का डेटासेट (जिसमें Maroon 5 और Shakira जैसे वास्तविक प्रसिद्ध कलाकार शामिल हैं) ओपन-सोर्स बनाया गया है।
- यह "बड़ी कंपनियों की गुप्त तिजोरियों" और "स्वतंत्र शोधकर्ताओं की छोटी रसोई" के बीच के अंतर को पाटता है।
5. लाइब्रेरी के नियम
लेखक इस लाइब्रेरी को एक विशिष्ट सेट के नियमों (CC-BY-NC-ND 4.0) के तहत साझा कर रहे हैं।
- आप इसका उपयोग अपने स्वयं के संगीत मॉडल को अध्ययन करने और बनाने के लिए कर सकते हैं।
- आप इस डेटासेट का उपयोग करके खुद को बेच नहीं सकते या इससे पैसा नहीं कमा सकते।
- आप डेटासेट को बदल नहीं सकते और दावा नहीं कर सकते कि यह आपका है।
- गीत (Lyrics): गानों के वास्तविक बोल अभी भी सुरक्षित हैं (कॉपीराइट के कारण), लेकिन लेखक इसे उन विश्वविद्यालयों और शोधकर्ताओं के साथ साझा करेंगे जो वादा करते हैं कि वे इसका उपयोग सख्ती से विज्ञान के लिए करेंगे।
संक्षेप में: लेखकों ने एक विशाल, साफ और विविध संगीत लाइब्रेरी बनाई है जिसे शोधकर्ता अंततः AI को वास्तविक संगीत को समझने और उत्पन्न करने के लिए सिखाने के लिए उपयोग कर सकते हैं, जिससे उस कमी को पूरा किया गया है जो वर्षों से मौजूद थी।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।