Transport and Merge: Cross-Architecture Merging for Large Language Models
यह शोध पत्र ऑप्टिमल ट्रांसपोर्ट पर आधारित एक क्रॉस-आर्किटेक्चर मर्जिंग फ्रेमवर्क का प्रस्ताव करता है जो विषम मॉडलों के बीच पत्राचार (correspondences) का अनुमान लगाने के लिए एक्टिवेशन्स को संरेखित करता है, जिससे सीधे वेट-स्पेस फ्यूजन के माध्यम से बड़े हाई-रिसोर्स LLMs से छोटे लो-रिसोर्स लक्ष्यों तक प्रभावी ज्ञान हस्तांतरण सक्षम होता है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
यहाँ "Transport and Merge: Cross-Architecture Merging for Large Language Models" पेपर का सरल भाषा और रचनात्मक उपमाओं (analogies) के साथ विवरण दिया गया है।
बड़ी समस्या: AI दिमागों के बीच "भाषा की बाधा" (Language Barrier)
कल्पना कीजिए कि आपके पास दो जीनियस हैं:
- सुपर-जीनियस (सोर्स मॉडल): एक विशाल, उच्च शिक्षित AI जिसे पूरे इंटरनेट पर प्रशिक्षित किया गया है। वह सब कुछ जानता है लेकिन एक साधारण फोन पर चलाने या एक छोटी कंपनी के लिए बहुत बड़ा और महंगा है।
- लोकल एक्सपर्ट (टारगेट मॉडल): एक छोटा, सस्ता AI जिसे विशेष रूप से कम-संसाधन वाली भाषाओं (जैसे मलय या कैंटोनीज़) या किसी विशिष्ट कार्य (जैसे चिकित्सा निदान) के लिए प्रशिक्षित किया गया है। यह कुशल है लेकिन इसमें सुपर-जीनियस जैसा गहरा और व्यापक ज्ञान नहीं है।
लक्ष्य: हम चाहते हैं कि लोकल एक्सपर्ट को सुपर-जीनियस का ज्ञान मिल जाए, बिना उसे शुरू से फिर से प्रशिक्षित (retrain) किए (जिसमें बहुत समय लगता है और भारी खर्च आता है)।
पुरानी समस्या: आमतौर पर, आप दो दिमागों को तभी "मर्ज" कर सकते हैं जब वे बिल्कुल एक ही तरह से बनाए गए हों (कमरों की संख्या और लेआउट समान हो)। यदि सुपर-जीनियस में न्यूरॉन्स की 32 परतें (layers) हैं और लोकल एक्सपर्ट में केवल 12 हैं, या यदि उनकी आंतरिक वायरिंग अलग है, तो पारंपरिक तरीके कहते हैं, "क्षमा करें, आप इन्हें मिला नहीं सकते।" वे ऐसे हैं जैसे आप एक चौकोर कप से पानी निकालकर गोल छेद में डालने की कोशिश कर रहे हों; पानी हर जगह बिखर जाएगा।
समाधान: "ट्रांसपोर्ट एंड मर्ज" (Transport and Merge)
यह पेपर इन बेमेल दिमागों को मर्ज करने का एक चतुर नया तरीका प्रस्तावित करता है। वे इसे ऑप्टिमल ट्रांसपोर्ट (Optimal Transport) पर आधारित क्रॉस-आर्किटेक्चर मर्जिंग (Cross-Architecture Merging) कहते हैं।
यह कैसे काम करता है, चरण-दर-चरण यहाँ दिया गया है:
1. "विचार प्रयोग" (एक्टिवेशन अलाइनमेंट - Activation Alignment)
दोनों मॉडलों को एक जैसा दिखने के लिए मजबूर करने के बजाय, शोधकर्ता उनसे एक ही सरल वाक्य (जैसे "The cat sat on the mat") के बारे में सोचने के लिए कहते हैं।
- वे देखते हैं कि सुपर-जीनियस इस वाक्य को कैसे प्रोसेस करता है।
- वे देखते हैं कि लोकल एक्सपर्ट उसी वाक्य को कैसे प्रोसेस करता है।
भले ही उनकी आंतरिक वायरिंग अलग हो, वे अक्सर समान पैटर्न में सक्रिय होते हैं। हो सकता है कि सुपर-जीनियस "बिल्ली" (cat) को समझने के लिए "न्यूरॉन #500" का उपयोग करता है, और लोकल एक्सपर्ट उसी चीज़ के लिए "न्यूरॉन #12" का उपयोग करता है।
2. "मूविंग कंपनी" (ऑप्टिमल ट्रांसपोर्ट - Optimal Transport)
यही वह जादुई गणित वाला हिस्सा है। शोधकर्ता ऑप्टिमल ट्रांसपोर्ट नामक अवधारणा का उपयोग करते हैं।
- उपमा (Analogy): कल्पना कीजिए कि सुपर-जीनियस के पास ज्ञान (पैकेज) से भरा एक गोदाम है और लोकल एक्सपर्ट के पास खाली अलमारियाँ हैं। पैकेज पर "फीचर्स" (जैसे "बिल्ली", "प्यार", "गणित") के लेबल लगे हैं।
- समस्या यह है कि अलमारियों के आकार और साइज अलग-अलग हैं।
- ऑप्टिमल ट्रांसपोर्ट एक अत्यंत बुद्धिमान मूविंग कंपनी की तरह है। यह केवल पैकेज को बेतरतीब ढंग से नहीं फेंकता। यह गणना करता है कि सुपर-जीनियस की एक विशिष्ट शेल्फ से लोकल एक्सपर्ट की एक विशिष्ट शेल्फ तक एक पैकेज ले जाने का सबसे सस्ता और सबसे कुशल तरीका क्या है।
- यह एक मैप (ट्रांसपोर्ट मैट्रिक्स) बनाता है जो कहता है: "सुपर-जीनियस के 'बिल्ली' वाले न्यूरॉन से ज्ञान लें और उसे लोकल एक्सपर्ट के 'बिल्ली' वाले न्यूरॉन में स्थानांतरित करें।"
3. "सर्जरी" (वेट फ्यूजन - Weight Fusion)
एक बार जब उनके पास मैप आ जाता है, तो वे पूरे दिमाग को कॉपी-पेस्ट नहीं करते हैं। ऐसा करने से लोकल एक्सपर्ट टूट जाएगा।
- चयनात्मक सर्जरी (Selective Surgery): वे केवल उन विशिष्ट "न्यूरॉन्स" (दिमाग के हिस्सों) में ज्ञान ले जाते हैं जो सबसे अधिक सक्रिय और प्रासंगिक हैं।
- मास्क (The Mask): इसे एक स्टेंसिल (stencil) की तरह समझें। वे लोकल एक्सपर्ट के दिमाग पर एक मास्क रखते हैं, जो इसके 99% हिस्से को ढंक देता है, और केवल उस 1% न्यूरॉन्स को खुला छोड़ते जिन्हें ज्ञान की वृद्धि की आवश्यकता है।
- वे सुपर-जीनियस के ज्ञान को उन विशिष्ट स्थानों में इंजेक्ट करते हैं।
4. "फाइन-ट्यूनिंग" (रेसिड्यूअल-फ्रोजन एडेप्टेशन - Residual-Frozen Adaptation)
सर्जरी के बाद, लोकल एक्सपर्ट थोड़ा भ्रमित हो सकता है क्योंकि उसके पास नया ज्ञान है लेकिन पुरानी आदतें भी हैं।
- शोधकर्ता लोकल एक्सपर्ट को थोड़े से नए डेटा पर थोड़ा अभ्यास (बहुत कम प्रशिक्षण) करने देते हैं।
- महत्वपूर्ण कदम: वे उस नए ज्ञान को "फ्रीज" (freeze) कर देते हैं जिसे उन्होंने अभी-साथ-साथ इंजेक्ट किया है ताकि उसे ओवरराइट न किया जा सके। वे केवल बाकी दिमाग को उस नए ज्ञान के अनुकूल होने के लिए छोड़ते हैं।
- अंत में, वे नए ज्ञान को मस्तिष्क की संरचना में स्थायी रूप रूप से समाहित कर देते हैं।
यह एक बड़ी बात क्यों है?
- "समान आर्किटेक्चर" का नियम नहीं: अब आप एक विशाल मॉडल (जैसे LLaMA-3 8B) ले सकते हैं और एक छोटे, विशिष्ट मॉडल (जैसे थाई या फाइनेंस के लिए 1B मॉडल) को सिखा सकते हैं, बिना यह देखे कि उन्हें एक ही तरह से बनाया गया है या नहीं।
- सस्ता और तेज़: आपको छोटे मॉडल को फिर से प्रशिक्षित करने के लिए विशाल सुपरकंप्यूटरों की आवश्यकता नहीं है। आपको बस "मूविंग मैप" बनाने के लिए एक छोटा सा डेटासेट (कुछ सौ उदाहरण) चाहिए।
- बेहतर परिणाम: परीक्षणों में, इन मर्ज किए गए मॉडलों ने पुराने तरीकों या शून्य से प्रशिक्षण लेने की तुलना में कम-संसाधन वाली भाषाओं (जैसे मलय, कैंटोनीज़, थाई) और विशिष्ट क्षेत्रों (चिकित्सा, वित्त) में बहुत अधिक बुद्धिमत्ता दिखाई।
वास्तविक दुनिया का प्रभाव
इसे एक विश्वविद्यालय के प्रोफेसर से एक स्थानीय सामुदायिक शिक्षक को ज्ञान हस्तांतरित करने के रूप में देखें।
- पहले: आपको प्रोफेसर को गाँव में रहने के लिए बुलाना पड़ता था, या शिक्षक को वह सब कुछ सिखाने में वर्षों बिताने पड़ते थे जो प्रोफेसर जानता है।
- अब: आप प्रोफेसर के सर्वश्रेष्ठ पाठों को शिक्षक की विशिष्ट शिक्षण शैली में तुरंत स्थानांतरित करने के लिए एक "नॉलेज मैप" का उपयोग करते हैं, बिना शिक्षक के व्यक्तित्व या क्लासरूम के लेआउट को बदले।
यह हमें सभी के लिए शक्तिशाली, विशिष्ट AI बनाने की अनुमति देता है, यहाँ तक कि उन भाषाओं और उद्योगों के लिए भी जिनके पास विशाल मॉडल शून्य से बनाने के लिए धन नहीं है।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।