← नवीनतम पेपर
⚡ electrical engineering

Access Sets Matter: Budgeting Expert Reads for Scalable Weight-Space Model Merging

यह शोध पत्र MergePipe प्रस्तुत करता है, जो एक बजट-जागरूक निष्पादन परत (execution layer) है जो LLM मॉडल मर्जिंग को एक्सपर्ट एक्सेस-सेट समस्या के रूप में मानकर उसे अनुकूलित करता है ताकि उच्च सटीकता को बाउंडेड एरर गारंटी के माध्यम से बनाए रखते हुए I/O को महत्वपूर्ण रूप से कम किया जा सके और प्रक्रिया को तेज किया जा सके।

मूल लेखक: Yuanyi Wang, Yanggan Gu, Su Lu, Yifan Yang, Zhaoyi Yan, Congkai Xie, Jianmin Wu, Hongxia Yang

प्रकाशित 2026-05-29
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Yuanyi Wang, Yanggan Gu, Su Lu, Yifan Yang, Zhaoyi Yan, Congkai Xie, Jianmin Wu, Hongxia Yang

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक मास्टर शेफ हैं जो एक अल्टीमेट फ्यूजन डिश बनाने की कोशिश कर रहे हैं। आपके पास एक बेस रेसिपी (जिसे "बेस मॉडल" कहा जाता है) है और 20 अलग-अलग "एक्सपर्ट" मसालों के मिश्रण (जिन्हें "एक्सपर्ट मॉडल्स" कहा जाता है) की एक विशाल लाइब्रेरी है। प्रत्येक एक्सपर्ट ने बेस रेसिपी में अपने तरीके से बदलाव किया है: किसी ने इसमें अधिक नमक डाला है, किसी ने दालचीनी का थोड़ा सा स्वाद मिलाया है, और तीसरे ने अतिरिक्त तीखापन जोड़ा है।

अतीत में, इस फ्यूजन डिश को बनाने के लिए, आपको शारीरिक रूप से पेंट्री (pantry) तक जाना पड़ता, उन 20 अलग-अलग मसालों के जार को खोलना पड़ता, प्रत्येक से एक चुटकी मसाला निकालना पड़ता, और फिर उन्हें आपस में मिलाना पड़ता इससे पहले कि आप खाना बनाना शुरू कर सकें। यदि आपके पास 100 एक्सपर्ट होते, तो आपको काम करने के लिए 100 बार पेंट्री तक जाना पड़ता। यह धीमा, थका देने वाला और बहुत समय बर्बाद करने वाला काम था (यह वह "I/O" या इनपुट/आउटपुट समस्या है जिसके बारे में पेपर बात करता है)।

MergePipe एक नए, सुपर-स्मार्ट किचन असिस्टेंट की तरह है जो इस कार्य के प्रति आपके दृष्टिकोण को बदल देता है। यह कैसे काम करता है, इसके लिए सरल उपमाओं (analogies) का उपयोग यहाँ दिया गया है:

1. समस्या: "पेंट्री वॉक" का बॉटलनेक (Bottleneck)

पेपर बताता है कि जब AI मॉडल विशाल हो जाते हैं, तो सबसे धीमी प्रक्रिया वास्तव में सामग्रियों को मिलाना (गणित) नहीं है; बल्कि यह सामग्रियों को हार्ड ड्राइव (पेंट्री) से पढ़ना है।

  • पुराना तरीका: यदि आप 20 एक्सपर्ट्स को मिलाना चाहते हैं, तो कंप्यूटर सभी 20 फाइलों को पढ़ता है, भले ही प्रत्येक फाइल का केवल एक छोटा सा हिस्सा ही वास्तव में महत्वपूर्ण हो। यह 20 अलग-अलग किताबों के हर एक पन्ने को केवल इसलिए पढ़ने जैसा है ताकि उनमें से प्रत्येक में मौजूद एक वाक्य को खोजा जा सके।
  • परिणाम: जैसे-जैसे आप अधिक एक्सपर्ट्स जोड़ते हैं, पेंट्री तक "चलने" में लगने वाला समय रैखिक (linearly) रूप से बढ़ता जाता है। यह एक ट्रैफिक जाम बन जाता है।

2. समाधान: "बजटेड शॉपिंग लिस्ट"

MergePipe एक अवधारणा पेश करता है जिसे बजटेड एक्सेस सेट्स (Budgeted Access Sets) कहा जाता है। इसे अपने किचन असिस्टेंट को एक सख्त बजट देने के रूप में सोचें (उदाहरण के लिए, "आप आज केवल 5 जार खोल सकते हैं") और लेबल को जल्दी से देखकर बनाई गई एक शॉपिंग लिस्ट के रूप में।

  • कैटलॉग (The Catalog): खाना शुरू करने से पहले, MergePipe बिना जार खोले उनके "लेबल" (मेटाडेटा जैसे स्केच या नॉर्म्स) को देखता है। उसे पता चल जाता है कि किन जारों में सबसे महत्वपूर्ण बदलाव शामिल हैं।
  • योजना (The Plan): यह एक योजना बनाता है: "हमें केवल नमक, दालचीनी और तीखेपन वाले जार खोलने की आवश्यकता है। हम अन्य 17 जारों को अनदेखा कर सकते हैं क्योंकि इस विशिष्ट मिश्रण के लिए उनके बदलाव बहुत कम मायने रखते हैं।"
  • निष्पादन (The Execution): असिस्टेंट उन विशिष्ट 3 जारों को लेने के लिए केवल एक बार पेंट्री तक जाता है। वह बाकी को अनदेखा कर देता है।

3. यह व्यवहार में कैसे काम करता है

पेपर एक तीन-चरणीय प्रक्रिया का वर्णन करता है:

  1. कैटलॉग (Catalog): सिस्टम सभी एक्सपर्ट मॉडल्स का एक नक्शा बनाता है, यह नोट करते हुए कि मॉडल के कौन से हिस्से (कौन से "ब्लॉक्स" के वेट्स) महत्वपूर्ण हैं।
  2. प्लानर (Planner): यह एक स्मार्ट खरीदार की तरह कार्य करता है। यदि आप इसे एक बजट देते हैं (उदाहरण के लिए, "केवल 10% डेटा पढ़ें"), तो यह सबसे मूल्यवान "डेल्टा" (बेस और एक्सपर्ट के बीच का अंतर) को चुनता है जिसे पढ़ा जाना चाहिए। यह एक ग्रीडी (greedy) रणनीति का उपयोग करता है: "जब तक बजट पूरा न हो जाए, तब तक सबसे बड़े, सबसे महत्वपूर्ण बदलावों को पहले पकड़ें।"
  3. एक्सेक्यूटर (Executor): यह डेटा को स्ट्रीम करता है। यह बेस मॉडल को पढ़ता है, और फिर केवल उन विशिष्ट एक्सपर्ट बदलावों को पढ़ता है जिन्हें पढ़ने की उसने योजना बनाई थी। यह बिना कभी मेमोरी में लोड किए, अनपढ़े हिस्सों को शून्य (zero) मानकर गणितीय रूप से "स्किप" कर देता है।

4. परिणाम: गति और सटीकता

पेपर ने इस तकनीक का परीक्षण लोकप्रिय AI मॉडल्स (Qwen और Llama) पर किया जिनमें 20-25 एक्सपर्ट्स तक थे।

  • गति: क्योंकि यह अनावश्यक फाइलों को पढ़ना बंद कर देता है, MergePipe पुराने तरीके की तुलना में 11 गुना तक तेज़ था।
  • I/O में कमी: इसने हार्ड ड्राइव से पढ़े जाने वाले डेटा की मात्रा को 10 गुना तक (एक ऑर्डर ऑफ मैग्निट्यूड) कम कर दिया।
  • सटीकता: भले ही इसने सब कुछ नहीं पढ़ा, लेकिन अंतिम डिश का स्वाद लगभग एक जैसा ही था। पेपर ने पाया कि "स्वाद का अंतर" (पैरामीटर डेविएशन) बहुत कम (लगभग 0.001) था, और मॉडल अभी भी कोडिंग या लॉजिक पहेलियों जैसे मानक परीक्षणों पर बेहतरीन प्रदर्शन करता है।

5. यह क्यों महत्वपूर्ण है

पेपर का तर्क है कि जैसे-जैसे AI मॉडल सैकड़ों विविधताओं वाले "परिवारों" के रूप में बढ़ते जा रहे हैं, हम बस आँख मूंदकर सब कुछ पढ़ते नहीं रह सकते। हमें एक ऐसे सिस्टम की आवश्यकता है जो मॉडल वेट्स को विशाल, अपारदर्शी फाइलों के बजाय स्ट्रक्चर्ड, बजटेड डेटा के रूप में मानता हो।

संक्षेप में: MergePipe एक ऐसा सिस्टम है जो AI मर्जिंग को "सब कुछ पढ़ने" के उबाऊ काम से मुक्त करता है। इसके बजाय, यह एक स्मार्ट लाइब्रेरियन की तरह कार्य करता है जिसे पता है कि उत्तर प्राप्त करने के लिए आपको किन किताबों के किन पन्नों को पढ़ने की आवश्यकता है, जिससे आपको लाइब्रेरी की अलमारियों तक जाने में लगने वाले घंटों की बचत होती है और सही उत्तर भी मिलता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →