MIDI-LLM: Improving Text-to-MIDI Music Generation via Adapting Large Language Models
यह शोध पत्र MIDI-LLM को प्रस्तुत करता है, जो एक दो-चरणीय प्रशिक्षण ढांचा है जो लार्ज लैंग्वेज मॉडल्स को उच्च गुणवत्ता वाले, टेक्स्ट-नियंत्रित मल्टीट्रैक MIDI संगीत और लीड शीट्स उत्पन्न करने के लिए अनुकूलित करता है, जो व्यापक एब्लेशन अध्ययनों और एक बड़े पैमाने पर वास्तविक दुनिया के ब्लाइंड मूल्यांकन के माध्यम से मौजूदा बेसलाइन्स की तुलना में बेहतर प्रदर्शन और उपयोगकर्ता स्वीकृति प्रदर्शित करता है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि एक ऐसी दुनिया है जहाँ आप एक कंप्यूटर से बात कर सकते हैं और उससे अपने लिए एक गाना लिखने को कह सकते हैं। आर्टिफिशियल इंटेलिजेंस के क्षेत्र में, इसे "टेक्स्ट-टू-म्यूजिक" (text-to-music) कहा जाता है। कुछ समय के लिए, ऐसा करने का सबसे अच्छा तरीका कंप्यूटर से कच्ची ध्वनि तरंगें (raw sound waves) उत्पन्न करवाना था, जैसे कि एक डिजिटल रिकॉर्डिंग। लेकिन यहाँ एक पेंच है: एक बार जब वह ध्वनि बन जाती है, तो यह कैनवास पर एक पेंटिंग की तरह होती है। आप पूरे चित्र को खराब किए बिना आसानी से एक एकल ब्रशस्ट्रोक को मिटा नहीं सकते या केवल ड्रमबीट की गति (tempo) को नहीं बदल सकते। संगीतकारों को कुछ अधिक लचीलेपन की आवश्यकता होती है, कुछ ऐसा जिसे वे नोट-दर-नोट संपादित कर सकें। यहीं पर "MIDI" काम आता है। MIDI को ध्वनि के रूप में नहीं, बल्कि डिजिटल शीट म्यूजिक या निर्देशों के एक सेट के रूप में सोचें जो एक वर्चुअल पियानो को ठीक से बताता है कि कौन सी कुंजियाँ दबानी हैं, कितनी जोर से, और कितनी देर के लिए। यह एक तैयार रिकॉर्डिंग और लेगो (Lego) सेट के बीच का अंतर है; आप लेगो को अलग कर सकते हैं और कुछ नया बना सकते हैं।
अब, इन सुपर-स्मार्ट लैंग्वेज मॉडल्स (वह AI जो निबंध लिखता है और सवालों के जवाब देता है) को यह संगीत की भाषा बोलने के लिए सिखाने की कल्पना करें। यही इस नए शोध के पीछे का बड़ा विचार है। वैज्ञानिकों ने देखना चाहा कि क्या वे एक टेक्स्ट विशेषज्ञ को संगीत विशेषज्ञ में बदल सकते हैं, जिससे लोग "एक तेज़ ड्रम के साथ एक उदास जैज़ गाना" जैसी चीजें टाइप कर सकें और बदले में एक पूरी तरह से संपादन योग्य म्यूजिकल स्कोर प्राप्त कर सकें। वे केवल एक सुंदर शोर बनाने की कोशिश नहीं कर रहे थे; वे एक ऐसा टूल बनाना चाहते थे जो मानव रचनाकारों को विचार मंथन करने और AI के साथ सहयोग करने में मदद करे जो स्वाभाविक और नियंत्रणीय महसूस हो।
द पेपर: MIDI-LLM
इस पेपर के पीछे के शोधकर्ताओं ने, जो MIT, Hooktheory और Carnegie Mellon University की एक टीम है, एक नया नुस्खा तैयार किया है जिसे MIDI-LLM कहा जाता है। इसे एक मानक लार्ज लैंग्वेज मॉडल (LLM)—वह प्रकार का AI जो कहानियाँ लिखता है और गणित की समस्याओं को हल करता है—को अपग्रेड करने के एक तरीके के रूप में समझें ताकि वह संगीत भी लिख सके।
आमतौर पर, ये AI मॉडल उन शेफ की तरह होते हैं जो केवल शब्दों के साथ खाना बनाना जानते हैं। वे "सेब" और "पाई" को समझते हैं, लेकिन वे नहीं जानते कि "C-sharp नोट" कैसा सुनाई देता है या इसे कैसे लिखा जाता है। टीम का पहला कदम AI को एक नया शब्दकोश देना था। उन्होंने मॉडल के शब्दकोश का विस्तार किया ताकि इसमें विशेष "MIDI टोकन" शामिल किए जा सकें। एक नोट को लंबे वाक्य के रूप में लिखने के बजाय जैसे "10 सेकंड पर शुरू करें, 0.5 सेकंड तक चलें, एक हाई C बजाएं," अब मॉडल इसे एक एकल, संक्षिप्त प्रतीक के रूप में देखता है, जैसे कि एक गुप्त कोड। यह एक शेफ को एक नई भाषा पढ़ने में सिखाने जैसा है जहाँ एक अकेला शब्द का अर्थ है "नमक डालें," जिससे खाना बनाने की प्रक्रिया बहुत तेज़ और अधिक कुशल हो जाती है।
लेकिन मॉडल को केवल एक नया शब्दकोश देना ही काफी नहीं है; उसे यह सीखना भी होगा कि इसका उपयोग कैसे किया जाए। टीम ने AI को दो अलग-अलग चरणों में प्रशिक्षित किया, जैसे कि एक संगीत छात्र पहले संगीत सिद्धांत सीखता है और फिर एक बैंड में बजता है।
चरण 1: सोलो प्रैक्टिस (यूनिमोडल प्रीट्रेनिंग)
सबसे पहले, उन्होंने AI को अकेले अभ्यास करने दिया। उन्होंने इसे दो प्रकार का डेटा दिया:
- संगीत से संबंधित टेक्स्ट: संगीत सिद्धांत (जैसे "माइनर कॉर्ड क्या है?") के बारे में लेख, प्रश्न और उत्तर।
- स्वतंत्र MIDI फाइलें: बिना किसी टेक्स्ट विवरण के हजारों कच्चे म्यूजिकल स्कोर।
यह चरण AI को संगीत के "सिंटैक्स" (syntax) सिखाने के बारे में था। इसने सीखा कि नोट्स एक साथ कैसे फिट होते हैं, लय (rhythms) कैसे काम करती है, और एक गाने की संरचना कैसी होती है, और यह सब बिना किसी इंसान के बताए। यह एक संगीतकार के शांत कमरे में स्केल और शीट म्यूजिक पढ़ने के अभ्यास जैसा है।
चरण 2: द डुएट (मल्टीमॉडल सुपरवाइज्ड फाइनट्यूनिंग)
इसके बाद, उन्होंने AI को एक साथी के साथ जोड़ा। उन्होंने AI को टेक्स्ट और संगीत के जोड़े दिए: एक प्रॉम्प्ट जैसे "एक खुशहाल पॉप गाना" और उसके तुरंत बाद संबंधित MIDI स्कोर। इसने AI को मानवीय विचारों को संगीत के निर्देशों में अनुवाद करना सिखाया। यदि आपने "जैज़" कहा, तो इसने जैज़ नोट्स लिखना सीखा। यदि आपने "उदास" कहा, तो इसने धीमी, माइनर कॉर्ड्स लिखना सीखा। यह वह क्षण है जब AI आपके अनुरोध को सुनना सीखता है और वास्तव में वही बजाता है जो आपने मांगा है।
उन्हें क्या मिला
परिणाम काफी प्रभावशाली थे। जब उन्होंने अपने नए MIDI-LLM का परीक्षण हाल ही के प्रतिस्पर्धी जिसे Text2midi कहा जाता है, के मुकाबले किया, तो उनका मॉडल दो प्रमुख तरीकों से शीर्ष पर रहा:
- बेहतर गुणवत्ता: इसके द्वारा उत्पन्न संगीत अधिक वास्तविक लग रहा था और संगीत के नियमों का बेहतर पालन कर रहा था।
- बेहतर नियंत्रण: इसने टेक्स्ट निर्देशों को अधिक बारीकी से सुना। यदि आपने किसी विशिष्ट मूड या शैली के लिए पूछा, तो इसने वास्तव में उसे पूरा किया।
- गति: क्योंकि उन्होंने एक मानक AI आर्किटेक्चर (Llama 3.2 पर आधारित) का उपयोग किया था, इसलिए वे मौजूदा, सुपर-फास्ट कंप्यूटर टूल्स का उपयोग करके मॉडल को चला सकते थे। उनका मॉडल प्रतिस्पर्धी की तुलना में 7 से 13 गुना तेज़ था, भले ही यह थोड़ा बड़ा था।
उन्होंने "इन्फिलिंग" (infilling) नामक एक विशेष सुविधा का भी परीक्षण किया। कल्पना कीजिए कि आपके पास एक गाना है जो आधा अधूरा है, और आप चाहते हैं कि AI बीच का हिस्सा लिखे। टीम ने पाया कि AI इसमें बहुत अच्छा था, लेकिन इसमें एक पेचीदा संतुलन था। यदि AI आपके द्वारा टाइप किए गए टेक्स्ट पर बहुत अधिक केंद्रित था, तो यह उस संगीत को अनदेखा कर सकता था जो आपने पहले ही लिख लिया था। यदि यह मौजूदा संगीत पर बहुत अधिक केंद्रित था, तो यह आपके नए टेक्स्ट निर्देशों को अनदेखा कर सकता था। इसे ठीक करने के लिए, उन्होंने एक "नॉब" (जिसे क्लासिफायर-फ्री गाइडेंस कहा जाता है) पेश किया जो उपयोगकर्ताओं को यह समायोजित करने की अनुमति देता है कि AI को टेक्स्ट बनाम मौजूदा संगीत में से किसे कितना सुनना चाहिए।
वास्तविक दुनिया का परीक्षण: "इन-द-वाइल्ड" अध्ययन
यह देखने के लिए कि क्या यह वास्तव में लोगों की मदद करता है, टीम ने केवल कंप्यूटर परीक्षण नहीं किए; वे वास्तविक दुनिया में गए। उन्होंने Hookpad के साथ साझेदारी की, जो एक ऐसी वेबसाइट है जहाँ गीतकार संगीत बनाते हैं। उन्होंने 58 वास्तविक उपयोगकर्ताओं (जो पहले से ही सब्सक्राइबर थे) को अपने नए AI को-पायलट को आज़माने दिया।
उपयोगकर्ताओं को शून्य से या गानों के छूटे हुए हिस्सों को भरने के लिए बनाया गया था। वे तीन अलग-अलग AI मॉडलों में से चुन सकते थे:
- पुराना मॉडल (जो केवल संगीत को देखता था, टेक्स्ट को अनदेखा करता था)।
- नए मॉडल का एक संस्करण जो टेक्स्ट को अनदेखा करता था।
- पूर्ण नया MIDI-LLM (जो टेक्स्ट सुनता था)।
परिणामों ने दिखाया कि जब उपयोगकर्ता शून्य से एक गाना शुरू कर रहे थे ("zero-to-one"), तो पूर्ण MIDI-LLM स्पष्ट विजेता था। इसकी स्वीकृति दर (acceptance rate) अन्य मॉडलों की तुलना में लगभग दोगुनी थी। यह सुझाव देता है कि जब लोग एक नया विचार शुरू करने की कोशिश कर रहे होते हैं, तो "इसे 90 के दशक के रॉक गाने जैसा बनाएं" टाइप करने की क्षमता अविश्वसनीय रूप से मूल्यवान होती है।
हालाँकि, जब उपयोगकर्ता पहले से चल रहे गाने में एक छोटा सा अंतराल भर रहे थे, तो परिणाम मिले-जुले थे। कभी-कभी, उपयोगकर्ता उस पुराने मॉडल को पसंद करते थे जो टेक्स्ट को अनदेखा करता था। शोधकर्ता सुझाव देते हैं कि ऐसा इसलिए हो सकता है क्योंकि, जब आप पहले से ही एक गाने में गहराई तक होते हैं, तो आप चाहते हैं कि AI बस वहां मौजूद चीज़ों के साथ "फिट" हो जाए, बजाय इसके कि वह एक नया विचार थोपे जो मौजूदा धुन के साथ टकरा सकता है।
निष्कर्ष
पेपर यह निष्कर्ष निकालता है कि लार्ज लैंग्वेज मॉडल्स को संगीत के लिए अनुकूलित करना एक शक्तिशाली नुस्खा है। इन मॉडल्स को "टेक्स्ट" और "MIDI" दोनों बोलना सिखाकर, उन्होंने एक ऐसा टूल बनाया जो मनुष्यों और AI को अधिक प्रभावी ढंग से सहयोग करने में मदद करता है। यह केवल शोर उत्पन्न करने के बारे में नहीं है; यह रचनाकारों को एक लचीला, तेज़ और बुद्धिमान साथी देने के बारे में है जो एक साधारण वाक्य को एक पूर्ण म्यूजिकल स्कोर में बदल सकता है, जिसे वे अपनी इच्छानुसार सुधार और परिष्कृत कर सकें। टीम इसे पहले से ही अधिक उपयोगकर्ताओं तक रोल आउट कर रही है, इस उम्मीद में कि यह भविष्य में लोगों के संगीत लिखने के तरीके को कैसे बदलता है।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।