← नवीनतम पेपर
🤖 machine learning

One-Step Gradient Delay is Not a Barrier for Large-Scale Asynchronous Pipeline Parallel LLM Pretraining

यह शोध पत्र इस धारणा को चुनौती देता है कि एक-चरण ग्रेडिएंट विलंब (one-step gradient delay) स्वाभाविक रूप से एसिंक्रोनस पाइपलाइन पैरेललिज्म को अस्थिर करता है, और यह प्रदर्शित करता है कि Muon जैसे सुदृढ़ ऑप्टिमाइज़र को एरर फीडबैक-प्रेरित सुधार के साथ संयोजित करने से बड़े पैमाने पर LLM प्रीट्रेनिंग को सिंक्रोनस विधियों के तुलनीय प्रदर्शन प्राप्त करने में सक्षम बनाया जा सकता है, जबकि पाइपलाइन बबल्स को भी समाप्त किया जा सकता है।

मूल लेखक: Philip Zmushko, Egor Petrov, Nursultan Abdullaev, Mikhail Khrushchev, Samuel Horváth

प्रकाशित 2026-06-30
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Philip Zmushko, Egor Petrov, Nursultan Abdullaev, Mikhail Khrushchev, Samuel Horváth

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

यहाँ इस शोध पत्र (paper) का सरल भाषा और रोज़मर्रा के उदाहरणों के साथ विवरण दिया गया है।

बड़ी समस्या: "असेंबली लाइन" की बाधा (Bottleneck)

कल्पना कीजिए कि आप एक फैक्ट्री में एक विशाल रोबोट बना रहे हैं। इसे तेज़ बनाने के लिए, आप श्रमिकों (GPUs) की एक टीम को काम पर रखते हैं और काम को एक असेंबली लाइन में बाँट देते हैं। वर्कर A पैर बनाता है, वर्कर B धड़ (torso) बनाता है, और वर्कर C सिर बनाता है।

इसे करने के पुराने तरीके (Synchronous Pipeline) में, हर किसी को अपना हिस्सा शुरू करने से पहले पिछले व्यक्ति के काम पूरा होने का इंतज़ार करना पड़ता है।

  • वर्कर A पैर बनाता है और उन्हें वर्कर B को सौंप देता है।
  • वर्कर B धड़ पर काम शुरू करता है।
  • समस्या: जब वर्कर B काम कर रहा होता है, तब वर्कर A खाली खड़ा रहता है क्योंकि वह धड़ के बनने का इंतज़ार कर रहा है ताकि उसे पैरों को सुधारने के लिए फीडबैक मिल सके। इस "इंतज़ार के समय" को बबल (bubble) कहा जाता है। कंप्यूटर में, ये 'बबल्स' भारी मात्रा में ऊर्जा और समय बर्बाद करते हैं।

प्रस्तावित समाधान: "फास्ट-ट्रैक" असेंबली लाइन

यह पेपर इस फैक्ट्री को चलाने के एक अलग तरीके को देखता है जिसे Asynchronous Pipeline Parallelism कहा जाता है।

  • इंतज़ार करने के बजाय, वर्कर A पिछले बैच को सौंपने के तुरंत बाद नए पैर बनाना जारी रखता है। वह फीडबैक का इंतज़ार नहीं करता।
  • इससे "बबल्स" खत्म हो जाते हैं। हर कोई 100% समय काम कर रहा है।
  • नुकसान: क्योंकि वर्कर A पुराने डेटा (धड़ बनने से पहले की जानकारी) के आधार पर नए पैर बना रहा है, इसलिए उसके निर्देश थोड़े "पुराने" या आउटडेटेड (stale) होते हैं। गणितीय भाषा में, इसे ग्रेडिएंट स्टेलेनेस (gradient staleness) कहा जाता है।

लंबे समय तक वैज्ञानिकों का मानना था कि इन "पुराने" निर्देशों का उपयोग करने से रोबोट बहुत खराब बनेगा। उन्हें लगा कि फैक्ट्री क्रैश हो जाएगी या एक टूटा हुआ रोबोट बनेगा।

खोज: समस्या देरी नहीं, "फोरमैन" है

इस पेपर के लेखकों ने इस विश्वास को चुनौती दी। उन्होंने पूछा: क्या समस्या देरी (delay) है, या वह विशिष्ट उपकरण (optimizer) है जिसका उपयोग हम श्रमिकों को प्रबंधित करने के लिए कर रहे हैं?

उन्होंने कई अलग-अलग "फोरमैन" (गणितीय एल्गोरिदम जिन्हें optimizers कहा जाता है) का परीक्षण किया यह देखने के लिए कि कौन से फोरमैन बिना रोबोट को बिगाड़े पुराने निर्देशों को संभाल सकते हैं।

  1. पुराना फोरमैन (AdamW): लंबे समय से यह सबसे लोकप्रिय फोरमैन रहा है। पेपर में पाया गया कि जब इसे पुराने (stale) निर्देश दिए गए, तो AdamW भ्रमित हो गया और रोबोट की गुणवत्ता काफी गिर गई। यह एक ऐसे फोरमैन की तरह था जो शेड्यूल बदलने पर घबरा जाता है।
  2. नया फोरमैन (Muon): यह एक नया और अधिक स्मार्ट फोरमैन है। पेपर में पता चला कि Muon अविश्वसनीय रूप से मजबूत है। भले ही निर्देश एक कदम पुराने हों, Muon रोबोट को पूरी तरह से बनाना जारी रखता है। उसे देरी का लगभग पता भी नहीं चलता।

उदाहरण: कल्पना कीजिए कि आप कार चला रहे हैं।

  • AdamW उस ड्राइवर की तरह है जो 10 सेकंड पीछे रहने वाले GPS पर निर्भर है। यदि आप मोड़ लेते हैं, तो GPS कहता है कि सीधा चलें, और ड्राइवर दुर्घटना कर बैठता है।
  • Muon उस ड्राइवर की तरह है जो सड़क का अनुमान लगा सकता है। भले ही GPS 10 सेकंड पीछे हो, ड्राइवर जानता है कि उसे सीधा चलते रहना है क्योंकि वह ट्रैफिक के प्रवाह को समझता है।

गुप्त हथियार: "एरर फीडबैक" (Error Feedback)

सबसे अच्छे फोरमैन (Muon) के होने के बावजूद, अभी भी "फास्ट-ट्रैक" (Asynchronous) फैक्ट्री और "पुराने तरीके" (Synchronous) के बीच एक छोटा सा अंतर बाकी था।

इसे ठीक करने के लिए, लेखकों ने Error Feedback नामक तकनीक पेश की।

  • उदाहरण: फोरमैन को एहसास होता है, "अरे, मैंने उस पैर को बनाने के लिए एक पुराने निर्देश का उपयोग किया। मुझे इसे सुधारने की आवश्यकता है।"
  • केवल नए निर्देश का उपयोग करने के बजाय, फोरमैन गणना करता है कि उन्हें क्या करना चाहिए था और उन्होंने वास्तव में क्या किया, और उस सुधार को अगले चरण में जोड़ देता है।
  • इस सरल गणितीय ट्रिक ने उस अंतर को पूरी तरह से भर दिया। "फास्ट-ट्रैक" फैक्ट्री ने एक ऐसा रोबोट बनाया जो "पुराने तरीके" वाली फैक्ट्री के बिल्कुल समान था, लेकिन बहुत तेज़ था।

बड़ा परीक्षण: 10-बिलियन पैरामीटर वाला रोबोट

यह साबित करने के लिए कि यह केवल एक छोटा प्रयोग नहीं था, लेखकों ने 10 बिलियन हिस्सों (parameters) वाला एक विशाल रोबोट बनाया।

  • उन्होंने इसे भारी मात्रा में डेटा (200 बिलियन शब्द) पर प्रशिक्षित किया।
  • उन्होंने Muon फोरमैन और Error Feedback सुधार के साथ "फास्ट-ट्रैक" विधि का उपयोग किया।
  • परिणाम: अंतिम रोबोट उस रोबोट के समान ही था जिसे पुराने, धीमे तरीके से प्रशिक्षित किया गया था। उन्होंने वही गुणवत्ता प्राप्त की, लेकिन बिना "बबल्स" के बर्बाद हुए समय के।

दावों का सारांश

  1. बाधा टूट गई है: यह डर कि "पुराना" (stale) डेटा प्रशिक्षण को खराब कर देता है, ज्यादातर एक मिथक है जो गलत उपकरणों (जैसे AdamW) के उपयोग के कारण पैदा हुआ था।
  2. सही उपकरण: Muon जैसे आधुनिक optimizers स्वाभाविक रूप से इन देरी के प्रति प्रतिरोधी हैं।
  3. समाधान: Error Feedback नामक तकनीक बचे हुए मामूली मुद्दों को ठीक कर सकती है, जिससे तेज़ तरीका धीमे तरीके जितना ही अच्छा बन जाता है।
  4. पैमाना (Scale): यह बड़े मॉडल्स (10 बिलियन पैरामीटर्स) पर भी काम करता है, जो साबित करता है कि एसिंक्रोनस ट्रेनिंग भविष्य के AI को बनाने का एक व्यवहार्य और उच्च-गति वाला तरीका है।

संक्षेप में: आपको फीडबैक पाने के लिए असेंबली लाइन को रोकने की आवश्यकता नहीं है। यदि आप सही फोरमैन (Muon) और एक सरल सुधार तकनीक (Error Feedback) का उपयोग करते हैं, तो आप अंतिम उत्पाद की गुणवत्ता से समझौता किए बिना असेंबली लाइन को पूरी गति से चला सकते हैं।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →