← नवीनतम पेपर
🤖 AI

TrainMover: An Interruption-Resilient Runtime for ML Training

TrainMover बड़े पैमाने पर ML ट्रेनिंग के लिए एक लचीला रनटाइम है जो न्यूनतम डाउनटाइम (लगभग 20 सेकंड) और व्यवधानों के दौरान शून्य मेमोरी ओवरहेड प्राप्त करने के लिए इलास्टिक और स्टैंडबाय मशीनों का लाभ उठाता है, जो मौजूदा समाधानों की तुलना में बर्बाद हुए GPU घंटों को 55% तक कम कर सकता है।

मूल लेखक: ChonLam Lao, Jiaqi Gao, Jiamin Cao, Zhipeng Zhang, Pengcheng Zhang, Jiangfei Duan, Zhilong Zheng, Yu Guan, Yichi Xu, Yong Li, Zhengping Qian, Aditya Akella, Minlan Yu, Ennan Zhai, Dennis Cai, Jingren
प्रकाशित 2026-05-18
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: ChonLam Lao, Jiaqi Gao, Jiamin Cao, Zhipeng Zhang, Pengcheng Zhang, Jiangfei Duan, Zhilong Zheng, Yu Guan, Yichi Xu, Yong Li, Zhengping Qian, Aditya Akella, Minlan Yu, Ennan Zhai, Dennis Cai, Jingren Zhou

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप हजारों धावकों (GPUs) के साथ एक विशाल, उच्च-दांव वाली रिले रेस चला रहे हैं जो मिलकर एक विशाल लेगो किला (एक लार्ज लैंग्वेज मॉडल) बना रहे हैं। लक्ष्य इसे जितनी जल्दी हो सके बनाना है।

हालाँकि, इस दौड़ में, धावक अक्सर लड़खड़ा जाते हैं, बीमार पड़ जाते हैं या रखरखाव के लिए उन्हें बदलने की आवश्यकता होती है। पुराने तरीके में, यदि एक धावक बैटन गिरा देता है, तो पूरी दौड़ रुक जाती थी। सभी को रुकना पड़ता था, आयोजकों को एक प्रतिस्थापन ढूंढना होता था, नए धावक को अपने जूते पहनने, अपने फीते बांधने और मार्ग सीखने की आवश्यकता होती थी, और फिर पूरे समूह को पिछले चेकपॉइंट से फिर से शुरू करना पड़ता था। यह "रुकने और चलने" (stop-and-go) की प्रक्रिया घंटों बर्बाद कर सकती थी, जिससे भारी मात्रा में समय और पैसा नष्ट होता था।

TrainMover एक नया सिस्टम है जिसे इसे ठीक करने के लिए डिज़ाइन किया गया है। यह एक सुपर-स्मार्ट रेस डायरेक्टर की तरह है जो यह सुनिश्चित करता है कि जब एक धावक को बदलने की आवश्यकता हो, तो प्रतिस्थापन पहले से ही वार्म-अप, तैयार और दौड़ने के लिए पूरी तरह से तैयार हो। दौड़ मुश्किल से ही रुकती है।

यहाँ बताया गया है कि TrainMover कैसे काम करता है, जिसे तीन सरल ट्रिक्स में विभाजित किया गया है:

1. "शैडो प्रैक्टिस" (सैंडबॉक्स्ड वार्मअप)

आमतौर पर, एक नया धावक तब तक शुरू नहीं कर सकता जब तक कि पूरी टीम रुक न जाए ताकि वे नियमों को सीख सकें और अपना गियर तैयार कर सकें। TrainMover इसे बदल देता है।

  • उपमा: कल्पना करें कि एक "घोस्ट रनर" (एक नई मशीन) एक अलग, अदृश्य कमरे (एक सैंडबॉक्स) में दौड़ का अभ्यास कर रहा है जबकि वास्तविक दौड़ जारी है।
  • यह कैसे काम करता है: यह घोस्ट रनर पूरी शुरुआती प्रक्रिया को दोहराता है—जूते पहनना, मानचित्र की जांच करना और एक अभ्यास चक्कर लगाना—नकली डेटा का उपयोग करके जो असली जैसा दिखता है। क्योंकि यह एक "सैंडबॉक्स" में है, इसे अभी तक अन्य वास्तविक धावकों से बात करने की आवश्यकता नहीं है। जब वास्तविक दौड़ को बदलाव की आवश्यकता होगी, तब तक यह घोस्ट रनर पहले ही सारा उबाऊ सेटअप कार्य पूरा कर चुका होगा। जब यह अंततः वास्तविक दौड़ में शामिल होता है, तो यह पहले से ही पूरी तरह से वार्म-अप और तुरंत जाने के लिए तैयार होता है।

2. "डेल्टा स्विच" (दो-चरणीय संचार)

एक सामान्य दौड़ में, यदि आप एक धावक को बदलते हैं, तो आपको अक्सर पूरा संचार नेटवर्क (वॉकी-टॉकी जिसका हर कोई उपयोग करता है) नष्ट करना पड़ता है और उसे फिर से बनाना पड़ता है। इसमें बहुत समय लगता है।

  • उपमा: कल्पना करें कि टीम धागों के एक विशाल जाल से जुड़ी हुई है। जब कोई धावक बदलता है, तो सभी धागे काटने और नए धागे बांधने के बजाय, TrainMover बैकग्राउंड में नए कनेक्शन तैयार करता है।
  • यह कैसे काम करता है:
    • चरण 1: दौड़ चलते समय, सिस्टम बैकग्राउंड में आने वाले धावक के लिए नए कनेक्शनों को चुपचाप तैयार करता है। यह दौड़ को रोके बिना सारा भारी काम करता है।
    • चरण 2: जब बदलाव होता है, तो सिस्टम वेब में केवल एक छोटा, त्वरित "डेल्टा" (एक छोटा सा बदलाव) करता है। यह बस नए धावक को मौजूदा वेब में स्नैप करता है और पुराने धावक को बाहर निकाल देता है। इसमें मिनटों के बजाय केवल कुछ सेकंड लगते हैं।

3. "यूनिवर्सल सब्स्टिट्यूट" (सामान्य स्टैंडबाय)

कभी-कभी, कोई धावक बिना किसी चेतावनी के अचानक लड़खड़ा जाता है। आप नहीं जानते कि कौन सा धावक विफल होगा, इसलिए आप उस विशिष्ट स्थान के लिए विशिष्ट प्रतिस्थापन तैयार नहीं कर सकते।

  • उपमा: टीम के प्रत्येक स्थान के लिए अलग-अलग प्रतिस्थापन रखने के बजाय, TrainMover एक "यूनिवर्सल सब्स्टिट्यूट" का उपयोग करता है। चूंकि प्रशिक्षण मॉडल सममित (symmetrical) है (अधिकांश धावक बिल्कुल एक जैसा काम करते हैं), एक अच्छी तरह से तैयार प्रतिस्थापन किसी भी धावक की जगह ले सकता है।
  • यह कैसे काम करता है: सिस्टम बैकग्राउंड में कुछ "यूनिवर्सल सब्स्टिट्यूट" तैयार रखता है। वे एक "पहले धावक" के रूप में, फिर एक "मध्य धावक" के रूप में, और फिर एक "अंतिम धावक" के रूप में दौड़ने का अभ्यास करते हैं। यदि कोई भी धावक विफल होता है, तो यूनिवर्सल सब्स्टिट्यूट तुरंत उसकी जगह ले लेता है, क्योंकि वह पहले से ही हर भूमिका को जानता है।

परिणाम: यह क्यों मायने रखता है

पेपर ने बड़े पैमाने पर (1,024 GPUs तक, और 64,000 तक अनुमानित) इसका परीक्षण किया।

  • पुराना तरीका: यदि कोई मशीन विफल हो जाती है, तो सब कुछ फिर से शुरू करने के लिए पूरी जॉब लगभग 4.5 मिनट (या बहुत बड़े कामों के लिए एक घंटा) के लिए रुक जाती है।
  • TrainMover: दौड़ केवल लगभग 20 सेकंड के लिए रुकती है।
  • प्रभाव: 64,000 GPUs के पैमाने पर, यह सिस्टम लगभग 55% बर्बाद समय बचाता है। लेखक गणना करते हैं कि इससे प्रति सप्ताह लगभग 1.4 मिलियन GPU-घंटे बचते हैं।

संक्षेप में, TrainMover एक अराजक, रुक-रुक कर चलने वाली प्रक्रिया को एक सुचारू, निरंतर प्रवाह में बदल देता है, यह सुनिश्चित करता है कि हमारे AI मॉडल को प्रशिक्षित करने वाले विशाल कंप्यूटर वास्तव में सीखने में अपना समय बिताएं, न कि मरम्मत का इंतजार करने में।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →