← नवीनतम पेपर
💬 NLP

Training-Free Dynamic Upcycling of Expert Language Models

यह शोध पत्र डायनेमिक अपसाइकिलिंग MoE (DUME) को प्रस्तुत करता है, जो एक प्रशिक्षण-मुक्त विधि है जो एक क्लोज्ड-फॉर्म रिज रिग्रेशन समाधान के माध्यम से पूर्व-प्रशिक्षित डेंस एक्सपर्ट्स का पुन: उपयोग करके कुशलतापूर्वक एक एकीकृत, स्केलेबल मिक्स्चर ऑफ एक्सपर्ट्स मॉडल का निर्माण करती है, जिससे बिना किसी अतिरिक्त फाइनट्यूनिंग के और बिना कैटास्ट्रोफिक फॉरगेटिंग (catastrophic forgetting) के झेले, मूल डोमेन-विशिष्ट क्षमताओं को संरक्षित किया जाता है और अक्सर उनसे बेहतर बनाया जाता है।

मूल लेखक: Eros Fanì, Oğuzhan Ersoy

प्रकाशित 2026-04-01
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Eros Fanì, Oğuzhan Ersoy

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आपके पास पाँच प्रतिभाशाली, विशेषज्ञ शेफ की एक टीम है।

  • शेफ A इतालवी व्यंजनों के उस्ताद हैं।
  • शेफ B जापानी सुशी के जीनियस हैं।
  • शेफ C मैक्सिकन स्ट्रीट फूड के बारे में सब कुछ जानते हैं।
  • शेफ D एक पेस्ट्री जादूगर हैं।
  • शेफ E भारतीय करी के उस्ताद हैं।

यदि आप एक ऐसा भोजन चाहते हैं जो इन सभी स्वादों को मिलाता हो, तो आपके पास कुछ विकल्प हैं।

  1. "एक नया शेफ रखने" का दृष्टिकोण: एक नया शेफ नियुक्त करें और उन्हें पाँचों व्यंजन सीखने के लिए वर्षों तक प्रशिक्षित करें। यह अविश्वसनीय रूप से महंगा है और इसमें बहुत समय लगता है।
  2. "मिश्रण (Mash-up)" का दृष्टिकोण: पाँचों शेफ को लें, उन्हें एक ब्लेंडर में डाल दें और उम्मीद करें कि वे मिलकर काम करेंगे। आमतौर पर, इसका परिणाम एक आपदा होता है जहाँ सुशी का स्वाद करी जैसा हो जाता है, और पास्ता का स्वाद चावल जैसा हो जाता है। स्वाद आपस में टकरा जाते हैं।
  3. "पाँच शेफ की टीम" का दृष्टिकोण: पाँचों शेफ को अलग-अलग रखें। जब आप सुशी ऑर्डर करते हैं, तो आप शेफ B को बुलाते हैं। जब आप पास्ता ऑर्डर करते हैं, तो आप शेफ A को बुलाते हैं। यह अच्छा काम करता है, लेकिन यह धीमा और महंगा है क्योंकि आपको एक साथ पाँच पूर्ण किचन चलाने के लिए भुगतान करना पड़ता है।

DUME (Dynamic Upcycling MoE) से मिलिए।

यह पेपर इन पाँचों विशेषज्ञों (घने विशेषज्ञों/dense experts) को एक ही कमरे में रखने का एक चतुर, "प्रशिक्षण-मुक्त" (training-free) तरीका पेश करता है ताकि वे बिना किसी नए शेफ को नियुक्त किए या उन्हें मिश्रण में बदले, किसी भी व्यंजन को पूरी तरह से बना सकें।

DUME कैसे काम करता है: "स्मार्ट स्विचबोर्ड"

मुख्य विचार मौजूदा पाँच विशेषज्ञ शेफ को एक ही कमरे में रखने का है। लेकिन उन्हें मिलाने के बजाय, हम उनके व्यक्तिगत कौशल को बरकरार रखते हैं। जादू इस बात में है कि हम यह तय करने में कि कौन क्या पकाएगा

अधिकांश प्रणालियों में, आपको एक "मैनेजर" (राउटर) को नियुक्त करने की आवश्यकता होती है और उन्हें यह सीखने के लिए महीनों तक प्रशिक्षित करना पड़ता है कि सुशी शेफ को कब बुलाना है और पास्ता शेफ को कब बुलाना है। यही वह महंगा हिस्सा है।

DUME इस प्रशिक्षण को पूरी तरह से छोड़ देता है।

यह करने के लिए कि यह कैसे करता है, यहाँ एक रचनात्मक उपमा दी गई है:

कल्पना कीजिए कि प्रत्येक शेफ के पास उन सामग्रियों पर एक अनूठा "हस्ताक्षर" (signature) है जिनका वे उपयोग करते हैं।

  • जब सुशी शेफ काम कर रहे होते हैं, तो रसोई से समुद्री शैवाल (seaweed) और राइस विनेगर की खुशबू आती है।
  • जब पास्ता शेफ काम कर रहे होते हैं, तो रसोई से बेसिल और लहसुन की खुशबू आती है।

DUME रिज रिग्रेशन (Ridge Regression) नामक एक गणितीय ट्रिक (जिसे एक सुपर-फास्ट, इंस्टेंट कैलकुलेटर समझें) का उपयोग करता है ताकि वर्तमान ऑर्डर (इनपुट टेक्स्ट) की "खुशबू" को देख सके और तुरंत पता लगा सके कि कौन सा शेफ सबसे उपयुक्त है।

  1. सेटअप: हम पाँचों शेफ को लेते हैं। हम उनके चाकू और एप्रन (मॉडल के साझा हिस्से) को समान रखते हैं।
  2. विशेष उपकरण: हम उनके विशिष्ट मसाला रैक (MLP लेयर्स) को अलग रखते हैं।
  3. इंस्टेंट मैनेजर: मैनेजर को प्रशिक्षित करने के बजाय, DUME एक क्लोज्ड-फॉर्म मैथ फॉर्मूला का उपयोग करता है। यह अतीत के "सामग्रियों" (डेटा) को देखता है और तुरंत एक आदर्श नियम पुस्तिका की गणना करता है: "यदि इनपुट से कोड की खुशबू आती है, तो इसे कोडिंग शेफ के पास भेजें। यदि इसमें इतिहास की खुशबू आती है, तो इसे हिस्ट्री शेफ के पास भेजें।"

यह गणना इतनी तेजी से होती है कि यह जादू जैसा लगता है। आपको मैनेजर को फिर से प्रशिक्षित करने की आवश्यकता नहीं है; आप बस डेटा के आधार पर इसे कंप्यूट करते हैं।

यह एक बड़ी बात क्यों है?

1. यह "प्रशिक्षण-मुक्त" है (कोई रिहर्सल नहीं)
आमतौर पर, यदि आप विशेषज्ञों को जोड़ना चाहते हैं, तो आपको पूरे सिस्टम को फिर से प्रशिक्षित करना पड़ता है ताकि वे एक-दूसरे से लड़ना बंद कर दें। DUME कहता है, "नहीं, हम पहले से ही जानते हैं कि कौन किसमें अच्छा है। आइए बस नियम लिख लें और आगे बढ़ें।" यह भारी मात्रा में पैसा और समय बचाता है।

2. यह "डायनामिक" है (कभी भी शेफ जोड़ें)
कल्पना कीजिए कि आप कल एक नया थाई शेफ नियुक्त करते हैं। पुराने तरीकों के साथ, आपको पूरे किचन को फिर से प्रशिक्षित करना होगा। DUME के साथ, आप बस नए शेफ को रोस्टर में जोड़ते हैं, नियम पुस्तिका को अपडेट करने के लिए गणितीय सूत्र को एक बार फिर से चलाते हैं, और आपका काम हो गया। बिना किसी परेशानी के किचन बड़ा हो जाता है।

3. यह "ओरेकल" (Oracle) को भी मात देता है
प्रयोगों में, शोधकर्ताओं ने DUME की तुलना एक "ओरेकल" (एक आदर्श प्रणाली जो चीट शीट के कारण जानती है कि किस शेफ को चुनना है) से की। आश्चर्यजनक रूप से, DUME ने न केवल ओरेकल का मुकाबला किया, बल्कि कुछ मामलों में (जैसे जटिल तर्क कार्यों में), इसने ओरेकल को हरा दिया! इसने विशेषज्ञों को इतनी अच्छी तरह से संयोजित किया कि संपूर्ण अपने हिस्सों के योग से भी महान बन गया।

परिणाम

  • लागत: आप एक नया विशाल मॉडल प्रशिक्षित करने की लागत बचाते हैं।
  • गति: आप तुरंत एक बहु-कौशल वाला AI बना सकते हैं।
  • गुणवत्ता: परिणामी मॉडल व्यक्तिगत विशेषज्ञों के बराबर या कभी-कभी उनसे बेहतर होता है।

संक्षेप में: DUME विशेषज्ञों की एक टीम को लेने, उन्हें एक साझा कार्यक्षेत्र देने और उन्हें सहयोग करने के बारे में एक पूर्व-गणना की गई, सटीक निर्देश पुस्तिका देने जैसा है। कोई प्रशिक्षण नहीं, कोई लड़ाई नहीं, बस त्वरित, उच्च-गुणवत्ता वाले परिणाम।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →