Generalizing the Geometry of Model Merging Through Frechet Averages
यह शोध पत्र समरूपता अपरिवर्तनीयता (symmetry invariance) सुनिश्चित करने के लिए उपयुक्त मैनिफोल्ड्स पर फ्रेचेट एवरेजिंग (Fréchet averaging) पर आधारित मॉडल विलय (model merging) के लिए एक सामान्य ढांचे का प्रस्ताव करता है, जो फिशर मर्जिंग (Fisher merging) जैसे मौजूदा तरीकों को समाहित करने की अपनी क्षमता को प्रदर्शित करता है और लो-रैंक एडेप्टर्स (LoRA) को मर्ज करने के लिए एक व्यावहारिक एल्गोरिदम प्रदान करता है जो वर्तमान दृष्टिकोणों की सीमाओं का समाधान करता है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आपके पास विशेषज्ञ शेफ की एक टीम है। प्रत्येक शेफ ने एक विशिष्ट व्यंजन में महारत हासिल की है: एक उत्तम लाज़ानिया बनाता है, दूसरा आदर्श सुशी, और तीसरा बेहतरीन सूफ़ले। अब, आप एक "सुपर शेफ" बनाना चाहते हैं जो इन तीनों व्यंजनों को पूरी तरह से बना सके, लेकिन आपके पास एक नए शेफ को शुरू से प्रशिक्षित करने का समय नहीं है। आप बस मौजूदा शेफ के ज्ञान को मिलाना चाहते हैं।
AI की दुनिया में, इसे मॉडल मर्जिंग (Model Merging) कहा जाता है। आप विभिन्न AI मॉडलों के "वेट्स" (उनके आंतरिक सेटिंग्स) को लेते हैं और उन्हें एक में मिलाने की कोशिश करते हैं।
समस्या: "गलत नक्शा" (The "Wrong Map")
यह पेपर तर्क देता है कि इसे करने का पुराना तरीका ऐसा है जैसे इन शेफ की रेसिपी को कागज पर केवल उनके नंबरों को औसत (average) निकालकर मिलाने की कोशिश करना। यह तब ठीक काम करता है जब हर कोई एक ही भाषा और एक ही इकाइयों का उपयोग कर रहा हो।
लेकिन AI मॉडल में एक छिपा हुआ गुण है: सिमिट्री (Symmetry)।
इसे इस तरह सोचें: शेफ A लिख सकता है "2 कप मैदा," जबकि शेफ B लिख सकता है "1 कप मैदा + 1 कप मैदा।" दोनों का अर्थ बिल्कुल एक ही है, लेकिन नंबर अलग दिखते हैं। या, शेफ C ने अपने नोटबुक में सामग्रियों का क्रम बदल दिया है, लेकिन व्यंजन का स्वाद समान है।
AI में, एक ही "रेसिपी" (मॉडल) को लिखने के कई तरीके होते हैं। यदि आप केवल नंबरों का औसत (Naive Averaging) लेते हैं, तो आपको ऐसी रेसिपी मिल सकती है जो कहती है "0 कप मैदा" क्योंकि सकारात्मक और नकारात्मक नंबर एक-दूसरे को काट देते हैं। आपने एक टूटा हुआ मॉडल बना दिया है जो कुछ भी नहीं पका सकता।
लेखक इसे "ऑर्बिट से बाहर कदम रखना" (stepping off the orbit) कहते हैं। कल्पना कीजिए कि "सच्ची" रेसिपी एक गोलाकार ट्रैक (एक ऑर्बिट) पर मौजूद है। यदि आप केवल दो बिंदुओं के बीच एक सीधी रेखा खींचते हैं, तो आप वृत्त के बीच से होकर गुजरते हैं और कीचड़ में गिर जाते हैं (एक टूटा हुआ मॉडल), बजाय इसके कि आप उस ट्रैक पर बने रहें जहाँ अच्छी रेसिपी रहती हैं।
समाधान: "स्मार्ट कंपास" (GeoMerge)
प्रस्तावित नया तरीका GeoMerge कहलाता है। केवल नंबरों का औसत निकालने के बजाय, वे AI मॉडलों के स्थान को एक घुमावदार परिदृश्य (Riemannian manifold) की तरह मानते हैं।
- नक्शा (The Map): वे महसूस करते हैं कि सिमिट्री के कारण (एक ही रेसिपी को लिखने के विभिन्न तरीके), "सच्चा" नक्शा एक सपाट कागज की शीट नहीं है। यह एक मुड़ी हुई, घुमावदार सतह है जहाँ अलग-अलग बिंदु वास्तव में एक ही चीज़ का प्रतिनिधित्व करते हैं।
- कंपास (The Compass): वे Fréchet Average नामक एक गणितीय उपकरण का उपयोग करते हैं। इसे केवल एक साधारण औसत के रूप में नहीं, बल्कि एक घुमावदार सतह पर "गुरुत्वाकर्षण के केंद्र" को खोजने के रूप में समझें।
- अलाइनमेंट (Alignment): मॉडलों को मिलाने से पहले, वे उन्हें पहले "अलाइन" करते हैं। यह सुनिश्चित करने जैसा है कि शेफ A और शेफ B दोनों एक ही मापने वाले कप का उपयोग कर रहे हैं और एक ही क्रम में लिख रहे हैं। वे प्रत्येक शेफ की रेसिपी का वह विशिष्ट संस्करण ढूंढते हैं जो दूसरों के सबसे करीब है, संख्याओं के लिखे जाने के कॉस्मेटिक अंतरों को अनदेखा करते हुए।
- पथ (The Path): कीचड़ के बीच से सीधा कटने के बजाय, वे उस घुमावदार पथ (geodesic) पर चलते हैं जो "अच्छी रेसिपी" के ट्रैक पर रहता है।
"LoRA" (विशेषज्ञ शेफ) के लिए यह क्यों महत्वपूर्ण है?
यह पेपर एक लोकप्रिय तकनीक पर बहुत अधिक ध्यान केंद्रित करता है जिसे LoRA (Low-Rank Adaptation) कहा जाता है। कल्पना कीजिए कि ये पूर्ण शेफ नहीं, बल्कि विशेष 'सू-शेफ' (sous-chefs) हैं जो केवल किसी व्यंजन को बेहतर बनाने के लिए कुछ विशिष्ट सामग्रियों में बदलाव करते हैं।
लेखकों ने पाया कि जब आप इन विशेष बदलावों को पुराने तरीकों का उपयोग करके मर्ज करने की कोशिश करते हैं, तो "सिमिट्री" की समस्या और भी बदतर हो जाती है। इन विशेष सहायकों के नोट्स इतने लचीले होते हैं कि उन्हें हजारों अलग-अलग तरीकों से लिखा जा सकता है जो सब एक ही बात का अर्थ रखते हैं।
- पुराना तरीका (KnOTS): यह नोट्स को अलाइन करने के लिए एक कठोर, चरण-दर-चरण गणितीय ट्रिक (SVD) का उपयोग करके उन्हें जबरदस्ती संरेखित करने की कोशिश करता है। यह ठीक-ठाक काम करता है, लेकिन यह चौकोर खांचों को गोल छेदों में जबरदस्ती फिट करने जैसा है।
- GeoMerge: यह पहचानता है कि नोट्स स्वाभाविक रूप से एक घुमावदार सतह पर रहते हैं। यह एक कठोर आकार में मजबूर किए बिना समूह के वास्तविक केंद्र को खोजने के लिए "स्मार्ट कंपास" का उपयोग करता है।
परिणाम
शोधकर्ताओं ने एक बड़े AI मॉडल (Llama 3) पर परीक्षण किया जिसे विभिन्न प्रकार की भाषाई पहेलियों (Natural Language Inference) के लिए विशेष रूप से तैयार किया गया था।
- परिणाम: GeoMerge ने एक ऐसा "सुपर शेफ" बनाया जो पिछले सर्वश्रेष्ठ तरीके (KnOTS) से बेहतर प्रदर्शन करता है।
- दक्षता (Efficiency): इससे भी बेहतर, GeoMerge ने यह करते हुए भी रेसिपी के "आकार" को छोटा रखा। पुराना तरीका एक विशाल, फूला हुआ रेसिपी (high rank) बना देता था, जबकि GeoMerge ने इसे लीन और कुशल रखा, जिससे सिद्ध हुआ कि यह समस्या की ज्यामिति (geometry) को बेहतर समझता है।
संक्षेप में
पेपर कहता है: केवल नंबरों का औसत न निकालें। AI मॉडल ऐसी रेसिपी की तरह हैं जिन्हें कई भाषाओं में लिखा जा सकता है। यदि आप उन्हें मर्ज करना चाहते हैं, तो आपको पहले उन्हें एक सामान्य भाषा में अनुवादित करना होगा (अलाइनमेंट) और फिर एक ऐसे नक्शे का उपयोग करके समूह का केंद्र खोजना होगा जो दुनिया के आकार का सम्मान करता हो (ज्यामिति), न कि एक सपाट रूलर का। यह "सुपर शेफ" को एक टूटे हुए मलबे में बदलने से रोकता है।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।