← नवीनतम पेपर
💻 computer science

MatrixFSDP: communication-free matrix optimizers under ZeRO-3 parameter sharding

MatrixFSDP, Muon जैसे मैट्रिक्स ऑप्टिमाइज़र्स के साथ ZeRO-3 शार्डिंग के तहत पैरामीटर प्लेसमेंट को पुनर्गठित करके प्रत्येक 2D वेट मैट्रिक्स को पूरी तरह से एक ही रैंक पर रखता है, जिससे मेमोरी दक्षता बनाए रखते हुए और महत्वपूर्ण विलंबता (latency) में कमी प्राप्त करते हुए, ऑप्टिमाइज़र स्टेप्स के दौरान महंगी मैट्रिक्स पुनर्निर्माण (reconstruction) की आवश्यकता को समाप्त कर संचार-मुक्त बड़े पैमाने के प्रशिक्षण को सक्षम बनाता है।

मूल लेखक: Ming Gao, Yanwu Xu, Hao Zhang

प्रकाशित 2026-07-08✓ Author reviewed
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Ming Gao, Yanwu Xu, Hao Zhang

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने नहीं लिखा है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप रोबोटों की एक विशाल टीम (एक कंप्यूटर क्लस्टर) को उपन्यास लिखना सिखाने की कोशिश कर रहे हैं। रोबोट एक बहुत बड़ी टेक्स्ट बुक से सीखकर मिलकर काम कर रहे हैं। इसे कुशलतापूर्वक करने के लिए, वे एक विशेष "लर्निंग रूल" का उपयोग करते हैं जिसे Muon कहा जाता है।

समस्या: "पूरी तस्वीर" बनाम "पहेली के टुकड़े"

सामान्यतः, जब रोबोट सीखते हैं, तो वे विशाल किताब को छोटे-छोटे पहेली के टुकड़ों में तोड़ देते हैं। प्रत्येक रोबोट के पास केवल कुछ पन्ने (एक "shard") होते हैं। यह मेमोरी बचाने के लिए बहुत अच्छा है क्योंकि किसी भी अकेले रोबोट को पूरी किताब उठाने की ज़रूरत नहीं होती। इस विधि को ZeRO-3 कहा जाता है।

हालाँकि, Muon लर्निंग रूल थोड़ा नखरेबाज है। यह केवल एक समय में कुछ पन्नों से सीखना नहीं चाहता। अपना काम पूरी तरह से करने के लिए, इसे शब्दों के बीच के संबंधों को समझने हेतु एक बार में पूरा 2D पेज (पूरी मैट्रिक्स) देखने की आवश्यकता होती है।

टकराव:

  • ZeRO-3 कहता है: "हमारे पास केवल पहेली के टुकड़े हैं।"
  • Muon कहता: "मुझे सीखने के लिए पूरा पेज चाहिए।"

पुराने समाधान (बुरे विकल्प):

  1. "पुनर्निर्माण" (Reconstruction) विधि: हर बार जब रोबोटों को सीखना होता है, तो वे रुक जाते हैं, हर रोबोट से पहेली के टुकड़ों को इकट्ठा करते हैं, उन्हें वापस जोड़कर पूरा पेज बनाते हैं, Muon सीखता है, और फिर वे तुरंत उस पेज को फिर से टुकड़ों में तोड़ देते हैं।
    • नुकसान: यह वैसा ही है जैसे लोगों का एक समूह लगातार एक विशाल जिग्सॉ पहेली को जोड़ने के लिए अपना काम रोकता है, सिर्फ उसे सीखने के लिए, और फिर उसे फिर से अलग कर देता है। यह हर स्टेप में बहुत सारा समय और ऊर्जा (कम्युनिकेशन) बर्बाद करता है।
  2. "फुल कॉपी" (Full Copy) विधि: टुकड़ों को साझा करने के बजाय, हर रोबोट पूरी किताब की एक प्रति अपने पास रखता है। Muon तुरंत सीख सकता है क्योंकि सबके पास पूरी तस्वीर है।
    • नुकसान: इसके लिए इतनी मेमोरी की आवश्यकता होती है कि यदि किताब बहुत बड़ी हो जाए, तो रोबोटों के दिमाग (GPUs) फट जाएंगे। उनके पास जगह खत्म हो जाएगी।

नया समाधान: MatrixFSDP

इस पेपर के लेखकों ने, MatrixFSDP, एक चतुर तीसरा रास्ता खोज निकाला। उन्होंने लर्निंग रूल (Muon) को नहीं बदला, और न ही सबको पूरी किताब रखने के लिए मजबूर किया। इसके बजाय, उन्होंने यह बदल दिया कि किताब कौन रखता है।

उपमा: "विशेष लाइब्रेरियन"

एक लाइब्रेरी की कल्पना करें जहाँ किताबें आमतौर पर टुकड़ों में काटकर सभी लाइब्रेरियनों के बीच वितरित की जाती हैं।

  • MatrixFSDP का विचार: किताब के हर एक "पेज" (मैट्रिक्स) के लिए, वे एक विशिष्ट लाइब्रेरियन को "मालिक" (Owner) नियुक्त करते हैं।
    • यह मालिक के पास पूरा, संपूर्ण पेज होता है।
    • अन्य सभी लाइब्रेरियन उस विशिष्ट पेज के लिए कुछ भी नहीं (खाली जगह) रखते हैं।
    • उन हिस्सों के लिए जहाँ विशेष Muon नियम की आवश्यकता नहीं है, वे पुराने "पहेली के टुकड़े" वाले तरीके का पालन करते हैं।

यह वास्तव में कैसे काम करता है:

  1. सीखने के दौरान (Optimizer Step): चूंकि "मालिक" के पास पहले से ही पूरा पेज है, इसलिए Muon तुरंत सीख सकता है। किसी को भी टुकड़ों को इकट्ठा करने या उन्हें जोड़ने की आवश्यकता नहीं है। यह ऐसा है जैसे लाइब्रेरियन अपनी मेज पर रखी किताब को सीधे पढ़ रहा हो। शून्य कम्युनिकेशन की आवश्यकता है।
  2. पढ़ने/लिखने के दौरान (Forward/Backward Passes): जब रोबोटों को किताब पढ़ने या लिखने की आवश्यकता होती है, तो वे अस्थायी रूप से टुकड़ों को वापस लाते हैं, अपना काम करते हैं, और फिर उन्हें तुरंत अपने "मालिक" स्लॉट में वापस रख देते हैं।

यह एक बड़ी बात क्यों है

पेपर का दावा है कि यह दृष्टिकोण बड़े AI मॉडल को प्रशिक्षित करने की सबसे बड़ी बाधा को हल करता है:

  • गति: क्योंकि उन्होंने पन्नों को लगातार "जोड़ने और फाड़ने" की प्रक्रिया को रोक दिया, इसलिए लर्निंग स्टेप अविश्वसनीय रूप से तेज़ हो गया। एक सिंगल कंप्यूटर नोड पर, यह 4.2 गुना तेज़ था। 8 नोड्स के एक बड़े क्लस्टर पर, यह 54.6 गुना तेज़ था क्योंकि पुराना तरीका नेटवर्क के माध्यम से डेटा भेजने में समय बर्बाद कर रहा था, जबकि MatrixFSDP डेटा को स्थानीय (local) रखता है।
  • मेमोरी: "फुल कॉपी" विधि के विपरीत, MatrixFSDP अभी भी "पहेली के टुकड़े" वाली विधि की मेमोरी का उपयोग करता है। यह उन्हें ऐसे मॉडल को प्रशिक्षित करने की अनुमति देता है जो "फुल कॉपी" विधि के लिए बहुत बड़े हैं।
  • सटीकता: उन्होंने साबित किया कि क्योंकि "मालिक" को ठीक वही डेटा मिलता है जो पूरा पेज इकट्ठा करने से मिलता, इसलिए सीखने के परिणाम सटीक, धीमी विधि के समान ही हैं।

सारांश

MatrixFSDP एक टीम को पुनर्गठित करने जैसा है ताकि जिस व्यक्ति को अपना काम करने के लिए पूरे दस्तावेज़ की आवश्यकता है, वही वास्तव में उस पूरे दस्तावेज़ को रखे। बाकी सभी उस विशिष्ट कार्य के लिए कुछ भी नहीं रखते। यह दस्तावेज़ों को इधर-उधर भेजने की निरंतर आवश्यकता को समाप्त करता है, जिससे उनकी टीम बिना अधिक डेस्क (अधिक मेमोरी) की आवश्यकता के बहुत तेज़ी से काम करती है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →