Knowledge Fusion of Large Language Models Via Modular SkillPacks
यह शोधपत्र GraftLLM को प्रस्तुत करता है, जो एक नवीन विधि है जो बड़े, विषम भाषा मॉडलों के लिए कुशल, विस्मृति-मुक्त (forget-free) क्रॉस-कैपेबिलिटी ट्रांसफर और मॉडल फ्यूजन को सक्षम बनाता है, जो सामान्य क्षमताओं को संरक्षित करते हुए और पैरामीटर संघर्षों को न्यूनतम करते हुए स्रोत क्षमताओं को संक्षिप्त, हस्तांतरणीय "स्किलपैक" (SkillPacks) में संकुचित करता है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आपके पास एक शानदार शेफ है, शेफ A, जो फ्रांसीसी पेस्ट्री बनाने में माहिर है, और एक अन्य शेफ है, शेफ B, जो दुनिया के बेहतरीन सुशी विशेषज्ञों में से एक है।
अभी, यदि आप एक ऐसा रेस्टोरेंट चाहते हैं जो बेहतरीन पेस्ट्री और बेहतरीन सुशी दोनों परोसता हो, तो आपको आमतौर पर दो अलग-अलग किचन (दो अलग-अलग AI मॉडल) किराए पर लेने होंगे। यह महंगा है, बहुत अधिक जगह घेरता है, और इसे मैनेज करना कठिन है।
वैकल्पिक रूप से, आप शेफ A को सुशी बनाना सिखाने की कोशिश कर सकते हैं, जिसमें उन्हें दुनिया की हर सुशी किताब पढ़नी होगी और महीनों अभ्यास करना होगा। लेकिन इसमें एक पेंच है: सुशी सीखने की प्रक्रिया में, शेफ A अपने प्रसिद्ध क्रोइसैन्ट (croissants) बनाना भूल सकते हैं। इसे "कैटैस्ट्रोफिक फॉरगेटिंग" (catastrophic forgetting) या 'विस्मृति' कहा जाता है।
यह पेपर एक नया समाधान पेश करता है जिसे GraftLLM कहा जाता है। पूरे शेफ को फिर से प्रशिक्षित करने या दो अलग-अलग किचन किराए पर लेने के बजाय, वे एक चतुर तरकीब निकालते हैं: "स्किलपैक" (SkillPack)।
मुख्य विचार: "स्किलपैक" बैकपैक
एक AI मॉडल (जैसे कि एक लार्ज लैंग्वेज मॉडल) को एक बेस शेफ के रूप में सोचें जो सामान्य बातचीत और बुनियादी खाना पकाने में बहुत अच्छा है।
जब आप इस बेस शेफ को कोई नई सुपरपावर (जैसे कोडिंग, गणित, या कानूनी सलाह) देना चाहते हैं, तो GraftLLM शेफ के पूरे मस्तिष्क को फिर से नहीं लिखता है। इसके बजाय, यह एक छोटा, हल्का बैकपैक बनाता है जिसे स्किलपैक कहा जाता है।
- ग्राफ्टिंग की प्रक्रिया (The Grafting Process): सिस्टम एक "मास्टर शेफ" (एक विशाल, शक्तिशाली AI) को देखता है जो पहले से ही किसी विशिष्ट कार्य में बहुत अच्छा है। यह पता लगाता है कि उस एक चीज़ में वह मास्टर शेफ इतना अच्छा क्यों है।
- संपीड़न (The Compression): यह उन विशिष्ट "अच्छी आदतों" को लेता है और उन्हें एक छोटे, कुशल बैकपैक (स्किलपैक) में संकुचित (compress) कर देता है। यह बिल्कुल वैसा ही है जैसे सुशी की पूरी लाइब्रेरी को एक एकल, पूरी तरह से व्यवस्थित 'चीट शीट' में समेट देना।
- लगाना (The Attachment): आप फिर इस बैकपैक को अपने बेस शेफ पर "ग्राफ्ट" (लगा) देते हैं। अब, आपका बेस शेफ बिना पेस्ट्री बनाना भूले, तुरंत सुशी बनाना सीख सकता है।
यह पुराने तरीकों से बेहतर क्यों है?
यह पेपर GraftLLM की तुलना दो अन्य सामान्य तरीकों से करता है:
- "फुल रिट्रेनिंग" तरीका (नॉलेज डिस्टिलेशन - Knowledge Distillation): यह बेस शेफ को सुशी सीखने के लिए एक साल तक कुलीन पाक विद्यालय (culinary school) भेजने जैसा है। यह काम करता है, लेकिन यह धीमा, महंगा है, और शेफ अपनी पुरानी रेसिपी भूल सकता है।
- "सिंपल एड-ऑन" तरीका (PEFT/LoRA): यह शेफ को कुछ नोट्स के साथ एक साधारण एप्रन देने जैसा है। यह सस्ता है, लेकिन नोट्स इतने विस्तृत नहीं हैं कि सुशी उतनी अच्छी बने जितनी मास्टर शेफ की होती है।
GraftLLM एक 'स्वीट स्पॉट' है: यह एप्रन जितना हल्का (सस्ता और तेज़) है, लेकिन पूर्ण पाक विद्यालय (उच्च गुणवत्ता) जितना प्रभावी भी है।
"मैजिक बैकपैक" की विशेषताएं
पेपर इस स्किलपैक दृष्टिकोण की तीन सुपरपावर्स पर प्रकाश डालता है:
- भूलने का डर नहीं (Forget-Free Learning): क्योंकि बैकपैक शेफ के मस्तिष्क से अलग है, आप इसे उतार सकते हैं और दूसरा पहन सकते हैं (जैसे, एक "लॉयर बैकपैक") बिना यह भुलाए कि शेफ "मैथ विजार्ड" कैसे था। यह बैकपैक बदलने जैसा है; आपका दिमाग वही रहता है, बस आपके औज़ार बदल जाते हैं।
- मिक्स एंड मैच (मॉडल फ्यूजन - Model Fusion): कल्पना करें कि आपके पास "फाइनेंस" के लिए एक बैकपैक है, "मेडिसिन" के लिए एक, और "लॉ" के लिए एक। GraftLLM के साथ, आप एक राउटर (एक स्मार्ट स्विच) रख सकते हैं जो आपके सवाल को देखता है। यदि आप स्टॉक के बारे में पूछते हैं, तो यह स्वचालित रूप से फाइनेंस बैकपैक पहना देता है। यदि आप हृदय रोग के बारे में पूछते हैं, तो यह मेडिसिन बैकपैक पर स्विच हो जाता है। आपको एक ही मॉडल में दुनिया के सर्वश्रेष्ठ गुणों का संगम मिलता है।
- छोटा आकार (Tiny Size): पेपर दिखाता है कि ये बैकपैक अविश्वसनीय रूप से छोटे हैं। आप 72-बिलियन पैरामीटर वाले विशाल AI का ज्ञान एक ऐसे बैकपैक में संकुचित कर सकते हैं जो उसके आकार का एक बहुत छोटा हिस्सा है, फिर भी वह विशाल मॉडल के लगभग समान काम करता है।
"मॉड्यूल-अवेयर" सीक्रेट सॉस
वे बैकपैक को गुणवत्ता खोए बिना इतना छोटा कैसे बनाते हैं? वे एक स्मार्ट कंप्रेशन स्ट्रैटेजी का उपयोग करते हैं।
AI मॉडल को अलग-अलग कमरों वाले घर के रूप में सोचें:
- किचन (अटेंशन मॉड्यूल्स - Attention Modules): यहाँ असली भारी काम होता है। पेपर कहता है, "इस कमरे को बहुत ज़ोर से न दबाएं, वरना खाना खराब स्वाद देगा।" वे इसे सावधानी से संकुचित करते हैं।
- हॉलवे (एम्बेडिंग/हेड - Embedding/Head): यह केवल चीजों को पास करने के लिए है। वे इस कमरे को बहुत अधिक दबा सकते हैं क्योंकि इसमें बहुत अधिक "स्वाद" नहीं होता।
प्रत्येक कमरे के साथ अलग तरह से व्यवहार करके, वे किसी भी चीज़ को तोड़े बिना बैकपैक को काफी छोटा कर देते हैं।
निचोड़ (The Bottom Line)
GraftLLM एक AI के लिए यूनिवर्सल अडैप्टर की तरह है। यह हमें विशाल, महंगे AI मॉडल से बेहतरीन कौशल लेने और उन्हें छोटे, पोर्टेबल "स्किलपैक" में पैक करने की अनुमति देता है, जिन्हें छोटे, सस्ते मॉडलों से जोड़ा जा सकता है।
इसका अर्थ है:
- सस्ता AI: आपको सब कुछ जानने वाले मॉडल को चलाने के लिए सुपरकंप्यूटर की आवश्यकता नहीं है।
- सुरक्षित AI: यदि कोई AI कुछ बुरा सीखता है (जैसे नफरत भरी बातें लिखना), तो आप पूरे मॉडल को हटाए बिना उस विशिष्ट बैकपैक को बस "अनप्लग" कर सकते हैं।
- स्मार्ट AI: आप बिना भ्रमित हुए तुरंत कौशल (कोडिंग + राइटिंग + मैथ) को मिक्स और मैच कर सकते हैं।
संक्षेप में, GraftLLM AI को नए करतब सिखाने की अव्यवस्थित, महंगी प्रक्रिया को "प्लग-एंड-प्ले" बैकपैक के एक सरल खेल में बदल देता है।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।