← नवीनतम पेपर
💬 NLP

Can Model Merging Improve Aggregation in DiLoCo?

यह शोध पत्र यह प्रदर्शित करके मॉडल मर्जिंग और डिस्ट्रिब्यूटेड लर्निंग के बीच के अंतर को पाटता है कि नेस्टरोव मोमेंटम के साथ आइसो-सी (Iso-C) मर्जिंग तकनीक को अनुकूलित करना (IsoLoCo), कम-कम्युनिकेशन वाले डिस्ट्रिब्यूटेड ट्रेनिंग में मौजूदा डिलोको (DiLoCo) विधियों से काफी बेहतर प्रदर्शन करता है, विशेष रूप से जैसे-जैसे स्थानीय वर्कर्स की संख्या बढ़ती है।

मूल लेखक: Stefan Horoi, Benjamin Thérien, Guy Wolf, Eugene Belilovsky

प्रकाशित 2026-07-07
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Stefan Horoi, Benjamin Thérien, Guy Wolf, Eugene Belilovsky

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक विशाल, सुपर-स्मार्ट AI मस्तिष्क को प्रशिक्षित करने की कोशिश कर रहे हैं। इसे करने के लिए, आपको बहुत अधिक कंप्यूटर शक्ति की आवश्यकता है। आमतौर पर, कंपनियाँ "डेटा-पैरेलल" (data-parallel) दृष्टिकोण का उपयोग करती हैं: वे सैकड़ों कंप्यूटरों को एक ही काम पर एक साथ, एक ही समय में, लगातार एक-दूसरे को अपडेट बताते हुए, एक पंक्ति में खड़ा कर देती हैं। यह तेज़ है, लेकिन इसके लिए हर एक कंप्यूटर को जोड़ने वाले महंगे, उच्च-गति वाले केबलों की आवश्यकता होती है। यदि एक भी कंप्यूटर धीमा हो जाए या केबल कमजोर हो, तो पूरी पंक्ति को प्रतीक्षा करनी पड़ती है।

समस्या: "द्वीप" (Island) दृष्टिकोण
पैसे बचाने और कमजोर कनेक्शनों का उपयोग करने के लिए, शोधकर्ताओं ने एक विधि विकसित की जिसे DiLoCo कहा जाता है। कल्पना कीजिए कि एक सीधी रेखा के बजाय, आपके पास कंप्यूटरों के कई अलग-अलग "द्वीप" हैं।

  1. प्रत्येक द्वीप कुछ समय के लिए (मान लीजिए 30 स्टेप्स) अपने स्वयं के AI मस्तिष्क का स्वतंत्र रूप से प्रशिक्षण लेता है।
  2. वे उन 30 स्टेप्स के दौरान आपस में बात नहीं करते हैं।
  3. 30 स्टेप्स के बाद, वे एक केंद्रीय हब को अपने द्वारा सीखी गई बातों का एक सारांश (एक "स्यूडो-ग्रेडिएंट") भेजते हैं।
  4. हब इन सारांशों का औसत निकालता है और मुख्य मस्तिष्क को अपडेट करता है।

खामी (The Glitch):
शोधकर्ताओं ने पाया कि इस "द्वीप" दृष्टिकोण में एक दोष है। जैसे-जैसे आप द्वीपों (श्रमिकों) की संख्या बढ़ाते हैं या बात करने से पहले उन्हें लंबे समय तक प्रशिक्षण लेने देते हैं, AI भ्रमित होने लगता है। यह एक समूह के लोगों की तरह है जो बिना बात किए मिलकर एक चित्र बनाने की कोशिश कर रहे हैं: यदि वे बहुत लंबे समय तक अपने आप में काम करते हैं, तो वे अलग-अलग चीजें बनाना शुरू कर देते हैं, और जब वे अपने काम को मिलाने की कोशिश करते हैं, तो परिणाम अस्त-व्यस्त होता है। तकनीकी शब्दों में, अलग-अलग द्वीपों से मिलने वाले "अपडेट" एक-दूसरे से टकराने लगते हैं, जिससे AI का प्रदर्शन गिर जाता है।

प्रेरणा: विशेषज्ञ मॉडलों का विलय (Merging Expert Models)
अलग से, शोधकर्ताओं के एक अन्य समूह ने मॉडल मर्जिंग (Model Merging) पर काम किया था। कल्पना कीजिए कि आपके पास एक विशेषज्ञ शेफ है जिसने इतालवी भोजन सीखा है और दूसरा जिसने जापानी भोजन सीखा है। आप चाहते हैं कि एक ही शेफ दोनों कर सके।

  • पुराना तरीका: बस उनकी रेसिपी का औसत निकाल लें। यह अक्सर विफल हो जाता है क्योंकि सामग्री आपस में टकरा जाती है (जैसे, सोया सॉस और भारी क्रीम को मिलाना)।
  • नया तरीका (टास्क अरिथमेटिक): केवल पूरी रेसिपी का औसत निकालने के बजाय, आप विशेषज्ञ की अंतिम रेसिपी और मूल आधार रेसिपी के बीच के अंतर को देखते हैं। फिर आप केवल उन अंतरों को सावधानीपूर्वक मिलाते हैं।

पेपर का बड़ा "अहा!" क्षण यह था कि उन्होंने महसूस किया कि DiLoCo वास्तव में मॉडल मर्जिंग के समान ही काम कर रहा है, बस एक लूप में।

  • "बेस मॉडल" (Base Model) पिछली बार जब सबने बात की थी, तब का AI मस्तिष्क है।
  • "द्वीप" वे विशेषज्ञ हैं जिन्होंने अपने आप में प्रशिक्षण लिया है।
  • वे जो "अपडेट" वापस भेजते हैं वे "अंतर" (या टास्क वेक्टर्स) हैं।

पेपर तर्क देता है कि कई द्वीपों के साथ DiLoCo के अस्त-व्यस्त होने का कारण वही है जिसके कारण रेसिपी का विलय करना अस्त-व्यस्त हो जाता है: हस्तक्षेप (Interference)। अलग-अलग द्वीपों से आने वाले अपडेट एक-दूसरे से लड़ रहे हैं।

समाधान: IsoLoCo
लेखकों ने DiLoCo को ठीक करने के लिए मॉडल मर्जिंग की दुनिया से "सबसे अच्छी रेसिपी" उधार लेने का निर्णय लिया। उन्होंने विभिन्न विलय तकनीकों का परीक्षण किया और पाया कि Iso-C (Isotropic merging) सबसे अच्छा काम करती है।

Iso-C को अपडेट के लिए एक "सामंजस्य बिठाने वाले" (harmonizer) की तरह समझें। जब द्वीप अपने अपडेट वापस भेजते हैं:

  1. सामंजस्य बिठाने वाला अपडेट के "आकार" को देखता है।
  2. यदि कोई एक द्वीप किसी विशिष्ट दिशा में (एक विशिष्ट गणितीय दिशा में) बहुत ज़ोर से चिल्ला रहा है, तो सामंजस्य बिठाने वाला उसे औसत के बराबर लाने के लिए उसकी आवाज़ कम कर देता है।
  3. यह सुनिश्चित करता है कि कोई भी एक द्वीप हावी न हो या दूसरों से न टकराए, जिससे एक सुचारू और संतुलित संयुक्त अपडेट बनता है।

उन्होंने इस "सामंजस्य बिठाने वाले" में एक "मोमेंटम" (momentum) विशेषता जोड़ी (एक धावक की तरह जो सड़क ऊबड़-खाबड़ होने पर भी अपनी गति बनाए रखता है) ताकि IsoLoCo नामक एक नई विधि बनाई जा सके।

परिणाम
उन्होंने विभिन्न आकारों के AI मॉडलों और द्वीपों की विभिन्न संख्या (1 से 128 तक) पर इस परीक्षण को किया।

  • विजेता: IsoLoCo ने लगातार मूल DiLoCo पद्धति को पछाड़ दिया।
  • अंतर: जैसे-जैसे आप द्वीपों की संख्या बढ़ाते हैं, IsoLoCo का लाभ बढ़ता जाता है। 128 द्वीपों के साथ, मूल विधि काफी अस्त-व्यस्त हो जाती है, लेकिन IsoLoCo साफ और कुशल बनी रहती है।
  • गति: उन्होंने एक गणितीय शॉर्टकट (Newton-Schulz iterations) का उपयोग करके IsoLoCo के लिए एक "फास्ट मोड" भी बनाया, जिसने गुणवत्ता खोए बिना इस प्रक्रिया को बहुत तेज़ बना दिया।

सारांश में
यह पेपर दिखाता है कि वितरित AI प्रशिक्षण को "विशेषज्ञों के विलय" की समस्या की तरह मानकर, हम उन्नत गणितीय ट्रिक्स का उपयोग करके कंप्यूटरों को आपस में लड़ने से रोक सकते हैं। यह हमें प्रदर्शन खोए बिना कई कमजोर रूप से जुड़े कंप्यूटरों पर विशाल AI मॉडल को प्रशिक्षित करने की अनुमति देता है, जिससे बड़े पैमाने पर AI प्रशिक्षण सस्ता और अधिक स्केलेबल हो जाता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →