Merge and Conquer: Instructing Multilingual Models by Adding Target Language Weights
यह शोध पत्र यह प्रदर्शित करता है कि निर्देश-अनुरूप (instruction-tuned) LLMs को भाषा-विशिष्ट बेस मॉडल्स के साथ मिलाना कम-संसाधन वाली भाषाओं में निर्देश-अनुसरण क्षमताओं को सक्षम करने के लिए एक गणनात्मक रूप से कुशल और प्रभावी रणनीति है, जो महंगे फाइन-ट्यूनिंग या बड़े निर्देश डेटासेट्स की आवश्यकता को समाप्त करती है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
द बिग प्रॉब्लम: "इंग्लिश-ओनली" शेफ
कल्पना कीजिए कि आपके पास एक विश्व प्रसिद्ध शेफ (एक लार्ज लैंग्वेज मॉडल, या LLM) है जो अंग्रेजी व्यंजन बनाने में माहिर है। वे जटिल रेसिपी पढ़ सकते हैं, मेनू लिख सकते हैं, और आदेश पर नए व्यंजन भी बना सकते हैं।
हालाँकि, इस शेफ के साथ एक समस्या है: उन्हें बास्क (Basque), गैलिशियन (Galician), कैटलन (Catalan) या गैलिशियन खाना बनाना शायद ही आता है। यदि आप उनसे एक पारंपरिक बास्क स्टू बनाने के लिए कहते हैं, तो वे आपको ऐसी अजीब चीजों का मिश्रण परोस सकते हैं जिसका स्वाद असली चीज़ जैसा बिल्कुल नहीं होगा।
इसे ठीक करने के लिए, पारंपरिक तरीकों में आमतौर पर शेफ को उस विशिष्ट क्षेत्र के कुलीन पाक विद्यालय में वर्षों तक भेजना पड़ता है। उन्हें करना होता है:
- उस भाषा में हजारों कुकबुक्स पढ़नी होती हैं (कंटीन्यूअल प्री-ट्रेनिंग)।
- विशिष्ट स्थानीय व्यंजनों का पालन करने का अभ्यास करना होता है (इंस्ट्रक्शन ट्यूनिंग)।
द कैच (चुनौती): यह अविश्वसनीय रूप से महंगा है, इसमें बहुत अधिक समय लगता है, और इसके लिए एक विशाल रसोई (कंप्यूटेशनल पावर) की आवश्यकता होती है। इन भाषाओं को बोलने वाले छोटे समुदायों के लिए, वे हर बार एक नया और बेहतर शेफ आविष्कार होने पर अपने शेफ को स्कूल भेजने का खर्च नहीं उठा सकते।
द सोल्यूशन: द "मॉडल मर्ज" स्मूदी
यह पेपर मॉडल मर्जिंग (Model Merging) नामक एक चतुर शॉर्टकट का प्रस्ताव देता है। शेफ को स्कूल भेजने के बजाय, हम बस उनके दिमाग को एक स्थानीय विशेषज्ञ के दिमाग के साथ मिला देते हैं।
इसे एक स्मूदी बनाने की तरह समझें:
- इन्ग्रीडिएंट A: एक प्रसिद्ध अंग्रेजी बोलने वाला शेफ (द "इंस्ट्रक्टेड मॉडल")। वे आदेशों का पालन करने में माहिर हैं लेकिन उन्हें स्थानीय भाषा नहीं पता।
- इन्ग्रीडिएंट B: एक स्थानीय भाषा विशेषज्ञ जो स्थानीय भाषा को पूरी तरह से जानता है लेकिन जटिल निर्देशों का पालन करना नहीं जानता (द "बेस मॉडल")।
एक नया शेफ शुरू से प्रशिक्षित करने के बजाय, शोधकर्ता प्रसिद्ध शेफ और स्थानीय विशेषज्ञ के वेट्स (weights) (मस्तिष्क के कनेक्शन) को लेते हैं और उन्हें गणितीय रूप से आपस में मिला देते हैं।
परिणाम: एक नया शेफ जो जटिल निर्देशों का पालन कर सकता है और प्रामाणिक स्थानीय व्यंजन भी बना सकता है, वह भी बिना कभी कुलीन पाक विद्यालय गए।
उन्होंने यह कैसे किया (द रेसिपी)
शोधकर्ताओं ने चार इबेरियन भाषाओं (बास्क, गैलिशियन, कैटलन और स्पेनिश) पर दो अलग-अलग "किचन" परिवारों (Llama 3.1 और Qwen 3) का उपयोग करके इसका परीक्षण किया।
- सेटअप: उन्होंने एक मानक, इंस्ट्रक्शन-ट्यून्ड मॉडल (अंग्रेजी विशेषज्ञ) और एक मॉडल लिया जिसे केवल स्थानीय भाषा (स्थानीय विशेषज्ञ) पर प्रशिक्षित किया गया था।
- मिक्स (मिश्रण): उन्होंने दोनों दिमागों को मिलाने के लिए विभिन्न ब्लेंडिंग तकनीकों (जैसे "लीनियर मर्जिंग" या "टास्क अरिथमेटिक") का उपयोग किया।
- एनालॉजी (उपमा): कल्पना कीजिए कि आप स्थानीय विशेषज्ञ की "जानकारिता" को अंग्रेजी विशेषज्ञ के मस्तिष्क में धीरे से इंजेक्ट कर रहे हैं, ताकि यह सुनिश्चित हो सके कि अंग्रेजी विशेषज्ञ आदेशों का पालन करना न भूल जाए।
- टेस्ट (परीक्षण): उन्होंने जांचा कि क्या नया "मर्ज किया हुआ" शेफ:
- स्थानीय भाषा में सवालों के सही जवाब दे सकता है।
- टेक्स्ट का सटीक अनुवाद कर सकता है।
- सख्त निर्देशों का पालन कर सकता है (जैसे, "एक बिल्ली के बारे में कहानी लिखें, लेकिन 'e' अक्षर का उपयोग न करें")।
परिणाम: एक स्वादिष्ट सफलता
परिणाम आश्चर्यजनक रूप से अच्छे थे!
- भाषा कौशल: मर्ज किए गए मॉडल स्थानीय भाषाओं में बोलने में बहुत बेहतर हो गए, और अक्सर उन मॉडलों को भी पीछे छोड़ दिया जिन्होंने पारंपरिक, महंगे तरीके से प्रशिक्षण लिया था।
- इंस्ट्रक्शन फॉलोइंग (निर्देश पालन): महत्वपूर्ण रूप से, मर्ज किए गए मॉडल्स ने निर्देश पालन करने की अपनी क्षमता को नहीं भुलाया। उन्होंने मूल अंग्रेजी मॉडल की "आज्ञाकारिता" को बनाए रखते हुए स्थानीय भाषा का "स्वाद" प्राप्त किया।
- द "सुपर स्मूदी": उन्होंने एक ही मॉडल में कई स्थानीय विशेषज्ञों को मिलाने की भी कोशिश की। यह एक बास्क विशेषज्ञ, एक कैटलन विशेषज्ञ और एक गैलिशियन विशेषज्ञ को एक ही शेफ में मिलाने जैसा था। परिणाम एक बहुभाषी शेफ था जो तीनों भाषाओं को काफी अच्छी तरह से संभाल सकता था, हालांकि एकल-भाषा विशेषज्ञों की तरह पूरी तरह से नहीं।
यह क्यों मायने रखता है (द "आहा!" मोमेंट)
यह कम संसाधन वाली भाषाओं के लिए गेम-चेंजर है क्योंकि इसके तीन कारण हैं:
- यह सस्ता है: आपको सुपरकंप्यूटर फार्म की आवश्यकता नहीं है। मॉडल्स को मर्ज करना एक ब्लेंडर में सामग्री मिलाने जैसा है; यह तेज़ है और इसमें मॉडल को शुरू से प्रशिक्षित करने की तुलना में बहुत कम ऊर्जा लगती है।
- यह तेज़ है: यदि अगले साल एक बेहतर अंग्रेजी मॉडल आता है, तो स्थानीय समुदाय को उसे अपनाने के लिए वर्षों इंतजार करने की आवश्यकता नहीं है। वे बस अपने स्थानीय विशेषज्ञ के साथ नए मॉडल को कुछ ही घंटों में "मर्ज" कर सकते हैं।
- यह सुलभ है: अब छोटे शोध समूह या समुदाय लाखों डॉलर की फंडिंग की आवश्यकता के बिना अपनी भाषाओं के लिए उच्च-गुणवत्ता वाले AI उपकरण बना सकते हैं।
एक चेतावनी (द वन कैविएट)
पेपर नोट करता है कि हालांकि मर्ज किए गए मॉडल भाषा बोलने में बेहतरीन हैं, लेकिन वे बहुत सख्त निर्देशों के प्रति मूल अंग्रेजी मॉडल की तुलना में थोड़े कम आज्ञाकारी हो सकते हैं। यह ऐसा है जैसे नया शेफ एक शानदार रसोइया तो है लेकिन यदि आप उसे याद न दिलाएं तो वह कभी-कभी चूल्हा बंद करना भूल जाता है। लेकिन कुल मिलाकर, यह ट्रेड-ऑफ (समझौता) सार्थक है।
सारांश
"मर्ज एंड कॉंकर" (Merge and Conquer) एक स्मार्ट, आज्ञाकारी AI जो अंग्रेजी बोलता है, उसे एक स्थानीय विशेषज्ञ से "लैंग्वेज ट्रांसप्लांट" देने के बारे में है। उनके दिमागों को बस मर्ज करके, हम शक्तिशाली, बहुभाषी AI असिस्टेंट बना सकते हैं जो उन भाषाओं के लिए हैं जिन्हें अक्सर अनदेखा किया जाता है, जिससे समय, पैसा और कंप्यूटिंग पावर की बचत होती है। यह AI के संदर्भ में यह कहने जैसा है कि, "एक नया घर बनाने के बजाय, आप मौजूदा घर का नवीनीकरण क्यों नहीं कर सकते?"
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।