Scaling Linear Mode Connectivity and Merging to Billion Parameter Pretrained Transformers
यह शोध पत्र एक नवीन द्वैत-शिक्षण ढांचे (dual-learning framework) का प्रस्ताव करता है जो स्वतंत्र रूप से प्रशिक्षित बिलियन-पैरामीटर ट्रांसफॉर्मर्स को संरेखित करने के लिए कार्यक्षमता-संरक्षण भार रूपांतरणों (functionality-preserving weight transformations) को लागू करता है, जिससे भाषा और दृष्टि दोनों डोमेन में लगभग बाधा-मुक्त रैखिक मोड कनेक्टिविटी (linear mode connectivity) और प्रभावी मॉडल विलय सक्षम होता है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
यहाँ एक सरल भाषा और रचनात्मक उपमाओं का उपयोग करके पेपर का स्पष्टीकरण दिया गया है।
मुख्य विचार: दो अलग-अलग रेसिपी को मिलाना
कल्पना कीजिए कि आपके पास दो मास्टर शेफ हैं जिन्होंने एक ही डिश: चॉकलेट केक बनाने में सालों बिताए हैं। दोनों जानते हैं कि इसे स्वादिष्ट कैसे बनाना है। हालाँकि, उन्होंने अपने कौशल अलग-अलग रसोईघरों में सीखा है, अलग-अलग मापने वाले कपों का उपयोग किया है, और अपनी सामग्री को पूरी तरह से अलग-अलग तरीकों से व्यवस्थित किया है।
- शेफ A आटे को बाईं ओर के कटोरे में रखता है और चीनी को दाईं ओर।
- शेफ B आटे को दाईं ओर रखता है और चीनी को बाईं ओर।
यदि आप उनकी रेसिपी को बीच में ही "मिलाने" (जिसे लीनियर इंटरपोलेशन कहा जाता है) की कोशिश करते हैं, तो परिणाम विनाशकारी होता है। हो सकता है कि आपको एक ही कटोरे में आधा कप आटा और आधा कप चीनी मिले, लेकिन क्योंकि उनके निर्देश मेल नहीं खाते, इसलिए केक ढह जाता है। AI की दुनिया में, इसे लॉस बैरियर (loss barrier) कहा जाता है—एक ऐसा बिंदु जहाँ संयुक्त मॉडल काम करना बंद कर देता है और त्रुटि दर (error rate) आसमान छूने लगती है।
समस्या: "छिपे हुए" अंतर
लंबे समय तक, वैज्ञानिकों ने सोचा कि ये दोनों शेफ वास्तव में अलग-अलग केक बना रहे हैं। लेकिन यह पेपर तर्क देता है कि वे वास्तव में एक ही केक बना रहे हैं; बस उनके सिमिट्री (symmetry/सममिति) अलग हैं।
AI में, "सिमिट्री" का अर्थ है कि आप परिणाम बदले बिना चीजों को इधर-उधर व्यवस्थित कर सकते हैं।
- परम्यूटेशन (Permutation): आप चरणों के क्रम को बदल सकते हैं (जैसे दूध से पहले अंडे मिलाने के बजाय दूध के बाद अंडे मिलाना) जब तक कि आप दूसरे चरणों को उसके अनुरूप समायोजित करें।
- स्केलिंग (Scaling): आप एक बड़े चम्मच या एक छोटे चम्मच का उपयोग कर सकते हैं, जब तक कि आप मात्रा को उसके अनुसार समायोजित करें।
समस्या यह है कि जब दो AI मॉडल अलग-अलग प्रशिक्षित किए जाते हैं, तो वे स्वाभाविक रूप से अलग-अलग "क्रमों" में गिर जाते हैं। यदि आप इन क्रमों को ठीक करने के बिना उन्हें मिलाने की कोशिश करते हैं, तो AI भ्रमित हो जाता है।
पुराना समाधान: एकतरफा समायोजन
पिछले तरीकों ने शेफ B की रेसिपी को लेकर उसे शेफ A जैसा दिखने के लिए मजबूर करने की कोशिश की। वे कहते थे, "ठीक है, शेफ B, अपनी चीनी को बाईं ओर ले जाओ ताकि वह शेफ A से मेल खा सके।"
यह थोड़ा मदद करता है, लेकिन यह एक चौकोर लकड़ी को गोल छेद में जबरदस्ती डालने जैसा है। शेफ B को शेफ A के विशिष्ट किचन लेआउट में फिट होने के लिए अपनी पूरी शैली को बदलना पड़ता है। यह काम करता है, लेकिन परिणामी "बीच वाली" रेसिपी में विफलता का उच्च जोखिम बना रहता है।
नया समाधान: "दोहरा नृत्य" (LMC-DM)
यह पेपर एक नई विधि पेश करता है जिसे डुअल लर्न्ड मैचिंग (Dual Learned Matching) कहा जाता है। एक शेफ को दूसरे की नकल करने के लिए मजबूर करने के बजाय, वे दोनों बीच में मिलने के लिए सहमत होते हैं।
एक डांस फ्लोर की कल्पना करें। शेफ A के स्थिर खड़े होने और शेफ B के उसके कदमों से मेल खाने की कोशिश करने के बजाय, दोनों शेफ एक-दूसरे की ओर नृत्य करते हुए बढ़ते हैं।
- वे दोनों अपनी सामग्री को व्यवस्थित करने के नए तरीके सीखते हैं (अपने "सिमिट्री" को समायोजित करते हैं)।
- वे एक साझा, तटस्थ किचन लेआउट की ओर बढ़ते हैं जहाँ उनके कदम पूरी तरह से मिल जाते हैं।
- एक बार जब वे संरेखित (align) हो जाते हैं, तो वे अपनी रेसिपी को सुचारू रूप से मिला सकते हैं।
चूंकि दोनों शेफ लचीले हैं और एक साझा लक्ष्य की ओर बढ़ रहे हैं, इसलिए "बीच का" बिंदु अब आपदा क्षेत्र नहीं रह जाता। यह एक सुचारू, सुरक्षित पथ बन जाता है जहाँ केक का स्वाद मूल की तरह ही अच्छा होता है।
उन्होंने वास्तव में क्या पाया
शोधकर्ताओं ने विशाल AI मॉडलों पर इसका परीक्षण किया (कुछ अरबों पैरामीटर्स वाले, जो लाखों सामग्रियों वाले किचन की तरह हैं)।
- परिणाम: जब उन्होंने इस "दोहरे नृत्य" (Dual Dance) पद्धति का उपयोग किया, तो "आपदा क्षेत्र" (लॉस बैरियर) लगभग पूरी तरह से गायब हो गया।
- विज़न मॉडल्स (Vision Models): उन्होंने इमेज-रिकग्निशन मॉडलों (जैसे कि बिल्ली और कुत्ते की पहचान करने वाले मॉडल) पर परीक्षण किया। दो अलग-अलग मॉडलों को मिलाने के बावजूद, संयुक्त मॉडल ने अपनी सटीकता (69% से अधिक) को पूरे समय बनाए रखा।
- लैंग्वेज मॉडल्स (Language Models): उन्होंने टेक्स्ट-जेनरेटिंग मॉडलों (जैसे कि कहानियाँ लिखने वाले मॉडल) पर परीक्षण किया। मध्यम आकार के मॉडलों के लिए, त्रुटि दर (error rate) व्यावहारिक रूप से शून्य थी। यहाँ तक कि विशाल बिलियन-पैरामीटर वाले मॉडलों के लिए भी, त्रुटि बहुत कम थी।
निष्कर्ष
यह पेपर सिद्ध करता है कि बड़े AI मॉडल अलग-थलग द्वीप नहीं हैं। वे वास्तव में छिपे हुए रास्तों से जुड़े हुए हैं। यदि आप एक मॉडल को दूसरे की नकल करने के लिए मजबूर करने के बजाय, दोनों मॉडलों को खुद को समायोजित करने और बीच में मिलने के लिए छोड़ देते हैं, तो आप उन्हें सहजता से मिला सकते हैं।
इसका अर्थ है कि हम दो अलग-अलग, अत्यधिक प्रशिक्षित AI मॉडलों को एक शक्तिशाली मॉडल में मिला सकते हैं, बिना उन्हें फिर से शुरू से प्रशिक्षित किए या जटिल नई संरचनाएं बनाए। यह समझने जैसा है कि दो अलग-अलग भाषाएँ वास्तव में एक ही भाषा के अलग-अलग बोलियाँ हैं, और यदि आप थोड़े लचीलेपन के साथ दोनों को बोलते हैं, तो आप एक-दूसरे को पूरी तरह से समझ सकते हैं।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।