← नवीनतम पेपर
🤖 AI

Signature-Guided Capacity Occupancy for Dense Expert Merging

SigMerge डेंस एक्सपर्ट मर्जिंग के लिए एक संरचित ढांचा है जो कॉन्फ्लिक्ट सिग्नेचर और सीक्वेंशियल ऑक्यूपेंसी नियमों का उपयोग करके क्रॉस-एक्सपर्ट संघर्षों को हल करता है और डोमेन मांग के आधार पर लेयर क्षमता आवंटित करता है, जो विविध मॉडल पूल्स और सेटिंग्स में मौजूदा तरीकों से काफी बेहतर प्रदर्शन करता है।

मूल लेखक: Lingching Tung, Chi-Jui Kim, Beicheng Xu, Yuchen Wang, Bin Cui

प्रकाशित 2026-08-11
📖 7 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Lingching Tung, Chi-Jui Kim, Beicheng Xu, Yuchen Wang, Bin Cui

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक मास्टर शेफ हैं जिन्होंने पांच अलग-अलग सु-शेफ (sous-chefs) को प्रशिक्षित किया है। एक ब्रेड बनाने में जीनियस है, दूसरा तीखे करी का जादूगर है, तीसरा एकदम सही पास्ता बनाता है, चौथा नाजुक डेसर्ट्स में विशेषज्ञ है, और पांचवां एक सुरक्षा विशेषज्ञ है जो यह सुनिश्चित करता है कि कोई जले नहीं। अब, कल्पना कीजिए कि आप एक एकल "सुपर शेफ" बनाना चाहते हैं जो एक साथ ये पांचों काम पूरी तरह से कर सके। आप पांच लोगों को सिर्फ काम पर नहीं रख सकते; आपको एक ही व्यक्ति की आवश्यकता है। इसलिए, आप उनके दिमागों को आपस में मिलाने की कोशिश करते हैं।

आर्टिफिशियल इंटेलिजेंस की दुनिया में, इसे मॉडल मर्जिंग (model merging) कहा जाता है। वैज्ञानिक एक ही बड़े एआई मस्तिष्क (जिसे "मॉडल" कहा जाता है) के विभिन्न संस्करणों को लेते हैं, जिन्हें गणित, कोडिंग या सुरक्षा जैसे विशिष्ट क्षेत्रों में विशेषज्ञ बनाया गया है, और फिर उन्हें एक एकल मॉडल में मिलाने का प्रयास करते हैं। लक्ष्य यह है कि एक ही मॉडल सब कुछ कर सके ताकि पांच अलग-अलग मॉडल चलाने के बजाय एक ही मॉडल चलाने से पैसा और समय बच सके। हालांकि, इसमें एक पेंच है: जब आप इन दिमागों को मिलाते हैं, तो वे अक्सर आपस में बहस करने लगते हैं। गणित का विशेषज्ञ उस हिस्से को बदलने की कोशिश कर सकता है जिसकी कोडिंग विशेषज्ञ को आवश्यकता होती है, और अचानक, सुपर शेफ ब्रेड बनाना भूल जाता है या बहुत खराब कोड लिखता है। यह नीले और पीले रंग को मिलाकर हरा बनाने की कोशिश करने जैसा है, लेकिन इसके बजाय, आपको एक मटमैला भूरा रंग मिल जाता है जहाँ कोई भी रंग अपनी चमक नहीं खोता।

लंबे समय तक, शोधकर्ताओं ने दिमागों को आपस में औसत (average) करने या यह तय करने के लिए सरल नियमों का उपयोग करने की कोशिश की कि किसे बोलने का मौका मिलेगा। लेकिन इन तरीकों ने अक्सर सुपर शेफ को "मटमैला" महसूस कराया—यानी, किसी भी चीज़ में अच्छा नहीं, या कम से कम, मूल विशेषज्ञों जितना अच्छा नहीं। बड़ा सवाल यह था: हम बिना मॉडल को फिर से शुरू से सिखाए इस मटमैले मिश्रण को कैसे ठीक कर सकते हैं?


सिग्नेचर-गाइडेड समाधान: SigMerge

यह पेपर SigMerge (सिग्नेचर-गाइडेड कैपेसिटी ऑक्यूपेंसी) नामक एक नया तरीका पेश करता है जो इन मिश्रित एआई दिमागों के लिए एक स्मार्ट ट्रैफिक कंट्रोलर की तरह काम करता है। विशेषज्ञों को मिलाने के तरीके का केवल अनुमान लगाने के बजाय, SigMerge एक तीन-चरणीय जासूसी प्रक्रिया का उपयोग करता है ताकि यह पता लगाया जा सके कि वास्तव में कहाँ बदलाव करने हैं और किसे वे बदलाव करने हैं।

चरण 1: ट्रैफिक जाम का पता लगाना (कॉन्फ्लिक्ट सिग्नेचर)
सबसे पहले, SigMerge एआई के मस्तिष्क के प्रत्येक स्तर (layer) को देखता है ताकि यह देख सके कि विशेषज्ञ कहाँ लड़ रहे हैं। कल्पना कीजिए कि मस्तिष्क एक शहर है जिसमें कई मोहल्ले (layers) हैं। कुछ मोहल्लों में, गणित का विशेषज्ञ और कोडिंग विशेषज्ञ एक ही सड़क पर विपरीत दिशाओं में कार चलाने की कोशिश कर रहे हैं। SigMerge इस "संघर्ष हस्ताक्षर" (conflict signature) को मापता है। यदि विशेषज्ञ इस बात पर सहमत हैं कि कैसे गाड़ी चलानी है, तो सड़क सभी के लिए खुली रहती है। लेकिन यदि वे लड़ रहे हैं, तो SigMerge दुर्घटना को रोकने के लिए कुछ लेन (निर्देशांक/coordinates) बंद करने का निर्णय लेता है। यह पूरा रास्ता बंद नहीं करता, बल्कि केवल उतना ही बंद करता है जिससे वे बिना टकराए निकल सकें।

चरण 2: किसे मदद की सबसे अधिक आवश्यकता है (डेफिसिट एलोकेशन)
इसके बाद, SigMerge पूछता है: "वास्तव में किसका कौशल कम हो रहा है?" यह मिश्रित सुपर शेफ की तुलना मूल विशेषज्ञों से करता है। यदि सुपर शेफ कोडिंग में महान है लेकिन गणित में बहुत खराब है, तो SigMerge जानता है कि गणित विशेषज्ञ को ही कुछ स्थान वापस लेने की आवश्यकता है। यह प्रत्येक विशेषज्ञ के लिए एक "बजट" बनाता है जो उनके नुकसान के आधार पर होता है। जिस विशेषज्ञ ने सबसे अधिक नुकसान किया है, उसे सबसे बड़ा हिस्सा मिलता है। यह सुनिश्चित करता है कि मॉडल केवल सभी को समान रूप से स्थान न दे; बल्कि यह उन लोगों को स्थान देता है जिन्हें इसकी सबसे अधिक आवश्यकता है।

चरण 3: क्रमिक दावा (सीक्वेंशियल ऑक्यूपेंसी)
अंत में, SigMerge विशेषज्ञों को अपनी बारी लेने देता है। जिस विशेषज्ञ का घाटा (deficit) सबसे अधिक है (जिसने सबसे अधिक खोया है), वह पहले अपनी पसंदीदा लेन चुनता है। वे मस्तिष्क के उन विशिष्ट हिस्सों को पकड़ लेते हैं जिनकी उन्हें आवश्यकता होती है। फिर, अगला विशेषज्ञ आता है और बचे हुए लेन में से चुनता है। यह रोकता है कि दो विशेषज्ञ एक ही जगह के लिए लड़ें। यह संगीत के साथ कुर्सियों के खेल (musical chairs) जैसा है जहाँ जिसे सबसे अधिक सीट की आवश्यकता है, वह पहले बैठ जाता है, यह सुनिश्चित करते हुए कि कोई खड़ा न रह जाए।

उन्होंने क्या पाया

शोधकर्ताओं ने इस पद्धति का परीक्षण 21 अलग-अलग परिदृश्यों पर किया, जिसमें तीन अलग-अलग प्रकार के एआई मॉडल (Llama-3.2-3B, Llama-3.1-8B-Instruct, और Gemma-2-2B-it) को मिलाने के सात अलग-अलग तरीकों का उपयोग किया गया। उन्होंने पांच विशिष्ट कौशलों को देखा: गणित, निर्देश (Instructions), कोडिंग, बहुभाषी क्षमता और सुरक्षा।

परिणाम स्पष्ट और सुसंगत थे:

  • हर एक परीक्षण बेहतर हुआ। SigMerge ने सभी 21 सेटिंग्स में प्रदर्शन में सुधार किया।
  • औसत सुधार 15.0% था। बिना किसी नए प्रशिक्षण के एक विधि के लिए यह एक बड़ी छलांग है।
  • "मटमैला" अंतर कम हो गया। SigMerge से पहले, मिश्रित मॉडल किसी विशिष्ट कार्य के लिए सर्वश्रेष्ठ विशेषज्ञ की तुलना में औसतन 12.13 अंक खराब था। SigMerge के बाद, यह अंतर घटकर केवल 5.77 अंक रह गया।
  • इसने प्रतिस्पर्धा को पछाड़ दिया। छह अन्य लोकप्रिय मर्जिंग विधियों की तुलना में, SigMerge पहले स्थान पर रहा जिसका औसत रैंक 1.67 था (जहाँ 1 सबसे अच्छा है)।

यह क्या नहीं है

यह ध्यान देना महत्वपूर्ण है कि यह पेपर क्या नहीं करता है। SigMerge कोई जादुई छड़ी नहीं है जो शून्य से एक आदर्श विशेषज्ञ बना दे। यदि मूल विशेषज्ञ ही खराब थे, तो यह उन्हें ठीक नहीं कर सकता। यह भी काम नहीं करता है क्योंकि यह लाखों यादृच्छिक संयोजनों (random combinations) में से भाग्यशाली विजेता खोजने के लिए खोज नहीं करता है; वह बहुत लंबा समय लेगा। इसके बजाय, यह वर्तमान में दिखने वाले डेटा के आधार पर एक स्मार्ट, गणनात्मक दृष्टिकोण का उपयोग करता है।

शोधकर्ताओं ने यह भी पाया कि प्रत्येक विशेषज्ञ को समान मात्रा में स्थान देना काम नहीं करता है। यदि आप गणित विशेषज्ञ और कोडिंग विशेषज्ञ को मस्तिष्क स्थान का समान हिस्सा साझा करने के लिए मजबूर करते हैं, भले ही एक बहुत अच्छा कर रहा हो और दूसरा असफल हो रहा हो, तो मॉडल में सुधार नहीं होता है। "घाटे-आधारित" (deficit-driven) दृष्टिकोण—यानी, जो संघर्ष कर रहा है उसे अधिक स्थान देना—ही सफलता की कुंजी है।

निष्कर्ष

SigMerge एक चतुर, प्रशिक्षण-मुक्त उपकरण है जो एआई में "मटमैले मिश्रण" की समस्या को ठीक करता है। यह सुनकर कि विशेषज्ञ कहाँ असहमत हैं और उन्हें अधिक स्थान देकर जो अपने कौशल खो रहे हैं, यह एक ऐसा एकल मॉडल बनाता है जो वास्तव में हर चीज़ में विशेषज्ञ होने के बहुत करीब है। यह विशेषज्ञों के एक समूह को लेकर उन्हें यह सिखाने जैसा है कि रसोई को कैसे साझा किया जाए ताकि हर कोई अपना सर्वश्रेष्ठ व्यंजन बना सके और घर भी न जले। यह पेपर दिखाता है कि यह विधि विभिन्न मॉडलों और कार्यों में विश्वसनीय रूप से काम करती है, जो एआई दिमागों को मिलाने के पिछले तरीकों की तुलना में एक महत्वपूर्ण अपग्रेड प्रदान करती है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →