← नवीनतम पेपर
🤖 AI

DataStates-LLM: Scalable Checkpointing for Transformer Models Using Composable State Providers

DataStates-LLM एक नवीन चेकपॉइंटिंग आर्किटेक्चर है जो स्टेट एब्स्ट्रैक्शन को डेटा मूवमेंट से अलग करने के लिए कंपोजेबल स्टेट प्रोवाइडर्स और लेज़ी एसिंक्रोनस स्नैपशॉट्स का उपयोग करता है, जिससे बड़े पैमाने पर LLMs के लिए 4×\times तक उच्च थ्रूपुट प्राप्त करने और प्रशिक्षण समय को महत्वपूर्ण रूप से कम करने के लिए सीरियलाइजेशन और हेटेरोजेनिटीता की बाधाओं को दूर किया जा सकता है।

मूल लेखक: Avinash Maurya, M. Mustafa Rafique, Franck Cappello, Bogdan Nicolae

प्रकाशित 2026-06-29
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Avinash Maurya, M. Mustafa Rafique, Franck Cappello, Bogdan Nicolae

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक विशाल, सुपर-स्मार्ट रोबोट मस्तिष्क (एक लार्ज लैंग्वेज मॉडल) को कहानियाँ लिखने, गणित की समस्याओं को हल करने या कोडिंग करने के लिए प्रशिक्षित कर रहे हैं। यह मस्तिष्क इतना विशाल है कि यह एक अकेले कंप्यूटर में नहीं समा सकता; यह हजारों ग्राफिक्स कार्ड्स (GPUs) में फैला हुआ है जो एक साथ मिलकर काम कर रहे हैं।

इस मस्तिष्क को प्रशिक्षित करने में हफ्तों या महीनों का समय लगता है। यदि बिजली चली जाए, कोई कंप्यूटर क्रैश हो जाए, या कोई बग आ जाए, तो आप हफ्तों की मेहनत खोना नहीं चाहेंगे। इसलिए, आपको रोबोट के वर्तमान स्वरूप के "स्नैपशॉट्स" (चेकपॉइंट्स) बार-बार लेने होंगे, ठीक वैसे ही जैसे किसी वीडियो गेम को सेव किया जाता है।

समस्या: "भारी सामान" की बाधा (The "Heavy Luggage" Bottleneck)
यह शोध पत्र तर्क देता है कि वर्तमान तरीके इन स्नैपशॉट्स को लेने के मामले में ऐसे हैं जैसे कि ट्रेन पूरी रफ्तार से चल रही हो और आप एक विशाल, अस्त-व्यस्त सूटकेस पैक करने की कोशिश कर रहे हों।

  • अस्त-व्यस्तता (The Mess): रोबोट का "मस्तिष्क" केवल डेटा का एक बड़ा ब्लॉक नहीं है। यह अलग-अलग चीजों का एक अराजक मिश्रण है: तेज़ ग्राफिक्स कार्ड्स पर रहने वाले संख्याओं के विशाल खंड (टेंसर्स), और मुख्य कंप्यूटर मेमोरी में रहने वाले छोटे, बिखरे हुए नोट्स (पायथन ऑब्जेक्ट्स, डिक्शनरीज़)।
  • ट्रैफिक जाम (The Traffic Jam): मौजूदा तरीके इस मिश्रण को एक एकल, अपारदर्शी ढेर (opaque blob) की तरह मानते हैं। वे रोबोट की सोचने की प्रक्रिया को रोक देते हैं ताकि सब कुछ मुख्य मेमोरी में कॉपी किया जा सके, फिर उसे सीरियलाइज़ (डिब्बों में पैक) किया जा सके, और अंत में हार्ड ड्राइव पर लिखा जा सके। यह प्रशिक्षण को रोक देता है, जिससे भारी धीमापन आता है।
  • अक्षमता (The Inefficiency): यह एक लाइब्रेरियन की तरह है जो किताब पढ़ने के बजाय हर एक पन्ने को एक-एक करके वापस शेल्फ में रखने के लिए रुक जाता है, भले ही कुछ पन्ने पहले से ही सही क्रम में हों और उन्हें बस स्थानांतरित करने की आवश्यकता हो।

समाधान: DataStates-LLM
लेखकों ने DataStates-LLM नामक एक नया सिस्टम बनाया है जो एक अत्यंत कुशल, स्मार्ट लॉजिस्टिक्स टीम की तरह काम करता है। यह कैसे काम करता है, इसके सरल उदाहरण यहाँ दिए गए हैं:

1. "आलसी" तरीका (Non-Blocking)

कल्पना कीजिए कि रोबोट मस्तिष्क के दो चरण हैं: सोचना (पढ़ना और प्रोसेस करना) और अपडेट करना (गलतियों से सीखना)।

  • पुराना तरीका: आप रोबोट के नोट्स मूव करने के लिए तब तक प्रतीक्षा करते हैं जब तक वह सोचना बंद न कर दे।
  • नया तरीका: लेखकों ने महसूस किया कि जब रोबोट सोच रहा होता है, तो उसके नोट्स नहीं बदलते। इसलिए, DataStates-LLM रोबोट के सोचने के दौरान ही नोट्स को "स्टोरेज ट्रक" (हार्ड ड्राइव) में भेजना शुरू कर देता है। यह केवल अंत में एक पल के लिए रोबोट को रोकता है ताकि यह सुनिश्चित किया जा सके कि नोट्स बदले नहीं हैं। इसे "लेजी" (lazy) कॉपी करना कहा जाता है क्योंकि यह अनुमति मिलने का इंतज़ार नहीं करता; यह बस सुरक्षित होते ही चीजों को मूव करना शुरू कर देता है।

2. विशेष मूवर्स (State Providers)

डेटा "हेटरोजीनियस" (heterogeneous) है, जिसका अर्थ है कि यह विभिन्न आकारों और प्रकारों में आता है।

  • पुराना तरीका: एक सामान्य मूवर सब कुछ एक ही तरह से पैक करने की कोशिश करता है, भले ही वह एक पहले से पैक किया हुआ बॉक्स (टेंसर) हो जिसे दोबारा पैक करने की आवश्यकता नहीं है।
  • नया तरीका: DataStates-LLM स्टेट प्रोवाइडर्स (State Providers) का उपयोग करता है। इन्हें विशेष मूवर्स के रूप में समझें।
    • एक मूवर बड़े, पहले से पैक किए गए बक्सों (टेंसर्स) को संभालता है और उन्हें बिना खोले सीधे ट्रक पर स्लाइड कर देता है (जीरो-कॉपी)।
    • दूसरा मूवर बिखरे हुए कागजों (पायथन ऑब्जेक्ट्स) को संभालता है और उन्हें सावधानी से लिफाफों में फोल्ड करता है।
    • क्योंकि वे जानते हैं कि वे क्या मूव कर रहे हैं, वे उन चीजों को दोबारा पैक करने में समय बर्बाद नहीं करते जिन्हें पहले से ही तैयार रखा गया है।

3. असेंबली लाइन (Streaming & Overlap)

पूरे सूटकेस को पैक करने के बाद ही उसे ट्रक पर लोड करने का इंतज़ार करने के बजाय, DataStates-LLM एक असेंबली लाइन का उपयोग करता है।

  • जैसे ही डेटा का एक हिस्सा तैयार होता है, उसे लाइन में भेज दिया जाता है।
  • जब "सोचने वाला" रोबोट अपना काम कर रहा होता है, तब "मूविंग" टीम पहले से ही डेटा को हार्ड ड्राइव पर भेज रही होती है।
  • जब "मूविंग" टीम डेटा को हार्ड ड्राइव पर भेज रही होती है, तब "पैकिंग" टीम अगले बैच को तैयार कर रही होती है।
  • यह एक निरंतर प्रवाह बनाता है जहाँ कंप्यूटर कभी भी सेव पूरा होने के इंतज़ार में खाली नहीं बैठता।

परिणाम

टीम ने 256 शक्तिशाली ग्राफिक्स कार्ड्स वाले एक सुपरकंप्यूटर पर इसका परीक्षण किया, जिसमें 70 बिलियन पैरामीटर्स (जैसे प्रसिद्ध Llama मॉडल्स) जितने बड़े मॉडल को प्रशिक्षित किया गया।

  • गति: उन्होंने मौजूदा सर्वोत्तम तरीकों की तुलना में 4 गुना तेज़ी से डेटा बचाया।
  • प्रशिक्षण का समय: क्योंकि रोबोट डेटा बचाने के लिए कम समय इंतज़ार करता है और सीखने के लिए अधिक समय पाता है, इसलिए मॉडल को प्रशिक्षित करने के कुल समय में आधे से अधिक (2.2x तेज़) की कमी आई।

सारांश में
DataStates-LLM विशाल AI मॉडल्स के काम को सहेजने का एक स्मार्ट तरीका है। सामान पैक करने के लिए ट्रेन को रोकने के बजाय, यह एक विशेष, कुशल टीम को बैकग्राउंड में सामान पैक करने और लोड करने के लिए रखता है, जिससे यह सुनिश्चित होता है कि कोई समय बर्बाद न हो और यात्रा बहुत तेज़ी से पूरी हो।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →