MeRoTune: RoPE-Safe Merging with a Tunable Dial
MeRoTune एक मॉडल मर्ज़िंग तकनीक पेश करता है जो RoPE-युक्त मॉडल्स में अटेंशन सबस्पेस मिसअलाइनमेंट को हल करने के लिए सीमित, RoPE-कम्यूटिंग करेक्शन मैट्रिसेस को सीखता है, जिससे बेस वेट्स को संशोधित किए बिना फाइन-ट्यून्ड मॉडल्स के पोस्ट-हॉक ट्यूनेबल ब्लेंडिंग को सक्षम बनाया जा सके।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने नहीं लिखा है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
आर्टिफिशियल इंटेलिजेंस की दुनिया में, शोधकर्ता अक्सर एक दुविधा का सामना करते हैं: उनके पास एक शक्तिशाली, सामान्य उद्देश्य वाला कंप्यूटर मस्तिष्क है, और उन्होंने इसके अलग-अलग, विशिष्ट संस्करणों को विशिष्ट कार्यों में उत्कृष्ट होने के लिए प्रशिक्षित किया है, जैसे कि एक भाषा में कोड लिखना या दूसरी भाषा में प्रश्नों के उत्तर देना। लक्ष्य इन विशेषज्ञों को एक ही, बहुमुखी मॉडल में संयोजित करना है, बिना एक साथ कई प्रोग्राम चलाने की लागत के। इसे करने का मानक तरीका बस दोनों मॉडलों के गणितीय भार (weights) को आपस में मिला देना है, जैसे दो रंगों के बैचों को मिलाना। हालाँकि, यह सरल मिश्रण यह मान लेता है कि दोनों मॉडलों का आंतरिक तर्क पूरी तरह से संरेखित (aligned) है। यदि एक मॉडल किसी अवधारणा के बारे में एक थोड़े अलग आंतरिक समन्वय प्रणाली (coordinate system) का उपयोग करता है, तो उन्हें सीधे मिलाने से एक भ्रमित परिणाम उत्पन्न हो सकता है जो मूल मॉडलों में से किसी के भी परिणाम से बदतर होता है। यह आधुनिक मॉडलों में विशेष रूप से कठिन है जो शब्दों के क्रम को समझने के लिए एक विशिष्ट तंत्र का उपयोग करते हैं, एक ऐसी प्रणाली जो स्थिति के आधार पर सूचना को घुमाती (rotate) है। यदि मिश्रण प्रक्रिया इस रोटेशन की अनदेखी करती है, तो यह मॉडल की संदर्भ समझने की क्षमता को चुपचाप तोड़ देती है, जो अक्सर प्रशिक्षण के दौरान अदृश्य रहता है।
एक शोधकर्ता ने इस समस्या को हल करने के लिए 'MeRoTune' नामक एक नई विधि विकसित की है। दोनों मॉडलों को अंधाधुंध औसत निकालने के बजाय, वे पहले प्रत्येक मॉडल को अपने स्वयं के आंतरिक समन्वय तंत्र को समायोजित करने के लिए सिखाते हैं ताकि वे आपस में मिलने से पहले शब्द क्रम को संभालने के तरीके पर सहमत हो सकें। उन्होंने पाया कि इस समायोजन को मॉडल को तोड़े बिना काम करने के लिए, परिवर्तन बहुत ही विशिष्ट, संकीर्ण नियमों का पालन करने चाहिए। उन्होंने गणितीय रूप से सिद्ध किया कि मॉडलों को ठीक करने का एकमात्र सुरक्षित तरीका एक विशिष्ट प्रकार का रोटेशन लागू करना है जो स्थिति को संभालने के मॉडल के अनूठे तरीके का सम्मान करता है। उन्होंने एक ऐसी प्रणाली बनाई जहाँ दो विशिष्ट मॉडल स्वयं इन सटीक समायोजनों को सीखते हैं, और फिर उन्हें उपयोगकर्ता की इच्छा के अनुसार किसी भी अनुपात में संयोजित किया जा सकता है, जो एक निश्चित मिश्रण के बजाय एक ट्यूनेबल डायल की तरह कार्य करता है।
उन्होंने इस दृष्टिकोण का परीक्षण एक भाषा मॉडल के दो अलग-अलग संस्करणों पर किया: एक जिसे इंडोनेशियाई और कोडिंग में विशेषज्ञ होने के लिए प्रशिक्षित किया गया था, और दूसरा जो जापानी में विशेषज्ञ होने के लिए प्रशिक्षित किया गया था। उन्हें मर्ज करने से पहले, उन्होंने एक सख्त गणितीय जांच लागू की ताकि यह सुनिश्चित किया जा सके कि दोनों मॉडल वास्तव में इतने भिन्न हैं कि जटिल प्रक्रिया की आवश्यकता हो। उन्होंने सत्यापित किया कि प्रत्येक मॉडल वास्तव में अपनी विशेषज्ञता में बेहतर था और दूसरी विशेषज्ञता में कमतर था, जिससे पुष्टि हुई कि एक वास्तविक संघर्ष मौजूद था जिसे हल करने की आवश्यकता थी। उन्होंने अन्य कई संभावित जोड़ों को खारिज कर दिया जो इस मानदंड को पूरा नहीं करते थे, जिससे यह सुनिश्चित हुआ कि वे केवल एक वास्तविक समस्या पर काम कर रहे हैं। एक बार जब उन्होंने उपयुक्त जोड़ा सुनिश्चित कर लिया, तो उन्होंने मॉडलों को अपने अनूठे सुधार कारकों (correction factors) को सीखने के लिए प्रशिक्षित किया। ये कारक सरल रोटेशन के रूप में डिज़ाइन किए गए थे, यह सुनिश्चित करने के लिए कि मॉडल स्थिर रहें और इस प्रक्रिया के दौरान विकृत न हों।
जब उन्होंने अपने नए तरीके का उपयोग करके मॉडलों को संयोजित किया, तो परिणाम मौजूदा तकनीकों की तुलना में बेहतर थे। उन्होंने मिश्रित मॉडल का विभिन्न मिश्रण अनुपातों (blending ratios) के माध्यम से परीक्षण किया, जिसमें ज्यादातर इंडोनेशियाई से लेकर ज्यादातर जापानी तक शामिल था, और पाया कि उनका दृष्टिकोण कभी भी अन्य शोधकर्ताओं द्वारा उपयोग की जाने वाली मानक विधियों से खराब प्रदर्शन नहीं करता है। वास्तव में, अधिकांश परीक्षणों में, उनकी विधि ने सांख्यिकीय विश्वसनीयता के उच्च स्तर को पार किया, जबकि एक प्रतिस्पर्धी विधि ने कम से कम एक कार्य पर मूल, बिना मर्ज किए गए बेस मॉडल से भी खराब प्रदर्शन किया। उन्होंने यह भी पता लगाया कि क्या मिश्रण अनुपात को दो स्वतंत्र नियंत्रणों में विभाजित किया जा सकता है, जिससे प्रत्येक मॉडल अधिक स्वतंत्र रूप से योगदान दे सके। उन्होंने पाया कि ऐसा करने से प्रदर्शन ढह गया, जिससे यह सिद्ध हुआ कि मिश्रण अनुपात को एक साथ रखना इस पद्धति के काम करने के लिए आवश्यक था।
अध्ययन ने यह भी खुलासा किया कि मॉडलों ने वास्तव में इस प्रक्रिया के दौरान क्या सीखा। अधिकांश समायोजन बहुत छोटे थे, केवल कुछ डिग्री के सूक्ष्म रोटेशन, जो यह सुझाव देते हैं कि मॉडल शुरू से ही काफी हद तक संरेखित थे। हालाँकि, मॉडलों के कुछ विशिष्ट हिस्सों को बहुत बड़े बदलावों की आवश्यकता थी, जो अस्सी-छह डिग्री तक थे, और इन हिस्सों का परिमाण भी सिकुड़ गया। यह इंगित करता है कि जबकि सामान्य संरचना समान थी, कुछ विशिष्ट, गहरे मतभेद थे कि कैसे मॉडलों ने कुछ अवधारणाओं को संभाला, जिसके लिए महत्वपूर्ण पुनर्संरेखण की आवश्यकता थी। उन्होंने उल्लेख किया कि यह विधि हर संभावित जोड़ी के लिए जादुई समाधान नहीं है; यह केवल तभी काम करती है जब मॉडल वास्तव में परस्पर विरोधी तरीकों से विशिष्ट हों और जब मॉडल की आंतरिक संरचना में वह विशिष्ट स्थिति-संभालने वाला तंत्र शामिल हो जिसे उन्होंने संबोधित किया है।
अंततः, यह कार्य यह प्रदर्शित करता है कि एआई मॉडलों को मर्ज करना केवल संख्याओं का औसत निकालना नहीं है। इसके लिए इस बात की समझ की आवश्यकता है कि मॉडल सूचना को कैसे संसाधित करता है, इसकी छिपी हुई ज्यामिति (geometry) क्या है। शब्द क्रम को संभालने के इन मॉडलों के विशिष्ट नियमों का सम्मान करके, उन्होंने एक ऐसा उपकरण बनाया है जो उपयोगकर्ताओं को किसी भी विशेषज्ञ क्षमता को खोए बिना, दोनों के बीच सुचारू रूप से डायल करने की अनुमति देता है। यह विधि विशिष्ट एआई मस्तिष्क को संयोजित करने का एक विश्वसनीय तरीका प्रदान करती है, यह सुनिश्चित करती है कि अंतिम परिणाम एक सुसंगत, उच्च-प्रदर्शन वाला मॉडल हो, न कि एक भ्रमित मिश्रण। इस कार्य का कोड और डेटा सार्वजनिक रूप से उपलब्ध है, जिससे अन्य लोग अपने निष्कर्षों को सत्यापित कर सकते हैं और अपने स्वयं के मॉडल संयोजनों पर वही सावधानीपूर्वक, गणितीय रूप से आधारित दृष्टिकोण लागू कर सकते हैं।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।