← नवीनतम पेपर
🤖 machine learning

Online Dynamic Batching with Formal Guarantees for LLM Training

यह शोध पत्र ऑनलाइन डायनेमिक बैचिंग (ODB) का परिचय देता है, जो एक ड्रॉप-इन डेटालोडर सिस्टम है जो बैच निर्माण को सटीक लागत अवलोकन (cost observability) के बिंदु पर स्थानांतरित करके LLM प्रशिक्षण में ब्लाइंड बैच निर्माण की समस्या को हल करता है, जिससे बिना किसी मॉडल या कर्नेल संशोधन के औपचारिक डेडलॉक-मुक्त गारंटी के साथ महत्वपूर्ण थ्रूपुट लाभ (4.43x तक) प्राप्त होता है।

मूल लेखक: Dian Li, Zekun Wang, Yaoru Wang, Jiahong Yan

प्रकाशित 2026-06-19
📖 4 मिनट में पढ़ें☕ कॉफ़ी ब्रेक में पढ़ें

मूल लेखक: Dian Li, Zekun Wang, Yaoru Wang, Jiahong Yan

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक व्यस्त रसोई (आपका कंप्यूटर GPU) के प्रबंधक हैं जो लोगों के एक बड़े समूह के लिए एक विशाल भोजन (एक Large Language Model को प्रशिक्षित करना) पकाने की कोशिश कर रहे हैं।

समस्या: "अंधा" शेफ

पुराने तरीके में (स्टैंडर्ड बैचिंग), किचन मैनेजर को सामग्री तैयार होने से पहले ही यह अनुमान लगाना पड़ता था कि प्रत्येक ऑर्डर कितना बड़ा होगा।

  • अनुमान: "मैं एक ट्रे पर 8 ऑर्डर रखूँगा।"
  • वास्तविकता: कुछ ऑर्डर बहुत छोटे होते हैं (एक अकेला कुकी), जबकि अन्य बहुत विशाल होते हैं (एक पूरा टर्की)।
  • बर्बादी: यदि आप एक ही ट्रे पर एक छोटी कुकी और एक बड़ा टर्की रखते हैं, तो आपको उन्हें फिट करने के लिए ट्रे में खाली जगह भरनी पड़ती है। यदि टर्की बहुत बड़ा है, तो ट्रे टूट जाती है (आउट ऑफ मेमोरी)।
  • परिणाम: रसोई या तो खाली जगह (बर्बाद ऊर्जा) से भरी होती है या लगातार ट्रे टूट रही होती है (क्रैश होना)। शेफ अगली ट्रे तैयार होने का इंतज़ार करने में अपना बहुत अधिक समय बिता देता है बजाय इसके कि वह खाना पकाए।

समाधान: ऑनलाइन डायनेमिक बैचिंग (ODB)

इस शोध पत्र के लेखकों ने एक नई प्रणाली पेश की है जिसे ऑनलाइन डायनेमिक बैचिंग (ODB) कहा जाता है। इसे एक स्मार्ट, रियल-टाइम असेंबली लाइन के रूप में समझें जो ऑर्डर को कैसे समूहित करना है, इसका निर्णय लेने के लिए बिल्कुल आखिरी सेकंड तक प्रतीक्षा करती है।

  1. सच्चाई का इंतज़ार करें: अनुमान लगाने के बजाय, सिस्टम तब तक प्रतीक्षा करता है जब तक कि भोजन पूरी तरह से तैयार, कटा हुआ और प्लेट में सजाया न जा चुका हो (टोकेनाइजेशन और इमेज प्रोसेसिंग के बाद)। अब, इसे हर एक ऑर्डर का सटीक आकार पता होता है।
  2. स्मार्ट ग्रुपिंग: यह तुरंत ऑर्डर्स को उनके आकार के अनुसार समूहित करता है। यह सभी छोटी कुकीज़ को एक ट्रे पर और बड़े टर्की को दूसरी ट्रे पर रखता है।
    • कोई बर्बादी नहीं: ट्रे पूरी तरह से भरी हुई होती हैं। कोई खाली जगह नहीं।
    • कोई टूट-फूट नहीं: ट्रे का आकार बिल्कुल सही होता है ताकि वे कभी न टूटें।
  3. "सिंक्रोनाइज़ेशन" (तालमेल) का तरीका: यहाँ कठिन काम है। एक मल्टी-किचन सेटअप (एक साथ काम करने वाले कई कंप्यूटरों) में, सभी को अपने ट्रे पूरे करने चाहिए और ठीक एक ही समय पर घंटी बजानी चाहिए। यदि एक किचन जल्दी समाप्त हो जाता है और प्रतीक्षा करता है, तो पूरी लाइन रुक जाती है।
    • शोध पत्र एक "ग्रुप अलाइनमेंट" प्रोटोकॉल पेश करता है। यह एक कंडक्टर की तरह है जो यह सुनिश्चित करता है कि भले ही किचन A के पास 5 ट्रे हों और किचन B के पास 7, वे भोजन को इतनी तेज़ी से इधर-उधर व्यवस्थित कर सकें कि कोई भी अपना भोजन गिराए बिना या अनंत काल तक प्रतीक्षा किए बिना, सब मिलकर घंटी बजा सकें।

परिणाम: तेज़ खाना, वही स्वाद

शोधकर्ताओं ने विभिन्न "मेन्यू" (डेटासेट) पर इस नई प्रणाली का परीक्षण किया, जिसमें सरल टेक्स्ट से लेकर जटिल इमेज और टेक्स्ट का संयोजन शामिल है।

  • गति: उन्होंने पाया कि ODB ने पुराने अनुमान लगाने वाले तरीके की तुलना में 1.5 से 4 गुना तेज़ खाना पकाया। कुछ प्रोडक्शन परिदृश्यों में, यह लगभग 4.5 गुना तेज़ था।
  • गुणवत्ता: तेज़ खाना पकाने के बावजूद, भोजन का स्वाद उतना ही अच्छा था। "टेस्ट टेस्ट" (बेंचमार्क स्कोर) ने दिखाया कि ODB के साथ प्रशिक्षित मॉडल उतने ही स्मार्ट थे जितने कि पुराने, धीमे तरीके से प्रशिक्षित मॉडल।
  • कोई नया उपकरण नहीं: सबसे अच्छी बात? उन्हें रसोई को फिर से बनाने या रेसिपी बदलने की आवश्यकता नहीं पड़ी। उन्होंने बस एक स्मार्ट "ट्रे मैनेजर" (डेटा लोडर) के लिए पुराने को बदल दिया।

यह क्यों महत्वपूर्ण है

यह सिस्टम एक मैनुअल असेंबली लाइन से एक स्मार्ट, अडैप्टिव रोबोटिक आर्म में अपग्रेड करने जैसा है जो वास्तविक समय में खुद को पुनर्गठित करता है। यह मुख्य खाना पकाने की प्रक्रिया को बदले बिना या पहले से सब कुछ गणना किए बिना "खाली स्थान की बर्बादी" और "प्रतीक्षा समय" की समस्या को हल करता है।

संक्षेप में: ODB डेटा के लिए एक स्मार्ट ट्रैफिक पुलिसकर्मी है जो वास्तविक कारों (डेटा सैंपल) को देखने के लिए प्रतीक्षा करता है ताकि यह तय किया जा सके कि उन्हें कैसे समूहबद्ध करना है, यह सुनिश्चित करता है कि हाईवे (GPU) हमेशा ट्रैफिक से भरा रहे लेकिन कभी जाम न हो, जिससे यात्रियों को खोए बिना पूरी यात्रा बहुत तेज़ हो जाती है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →