PlexRL: Cluster-Level Orchestration of Serviceized LLM Execution for RLVR
PlexRL एक क्लस्टर-स्तरीय रनटाइम है जो संरचनात्मक खाली अंतराल (structural idle gaps) को भरने के लिए नौकरियों (jobs) के बीच एकीकृत LLM सेवाओं को मल्टीप्लेक्स करके रिइन्फोर्समेंट लर्निंग विद वेरिफिएबल रिवार्ड्स (RLVR) प्रशिक्षण की दक्षता में सुधार करता है, जिससे महंगे मॉडल माइग्रेशन के बिना उपयोगकर्ता की GPU लागत को 37.58% तक कम किया जा सकता है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आप एक विशाल, हाई-टेक बेकरी चला रहे हैं। इस बेकरी में आपके पास दो मुख्य प्रकार के काम हैं: बेकिंग (जिसके लिए एक बहुत बड़े, महंगे ओवन की आवश्यकता होती है) और डेकोरेटिंग (जिसके लिए एक छोटे, तेज़ स्टेशन की आवश्यकता होती है)।
आर्टिफिशियल इंटेलिजेंस की दुनिया में, विशेष रूप से "रीजनिंग" मॉडल (जैसे कि वे जो गणित की समस्याओं को हल करते हैं) को प्रशिक्षित करने के लिए, "बेकिंग" ट्रेनिंग चरण है, और "डेकोरेटिंग" रोलआउट चरण है (जहाँ AI उत्तर उत्पन्न करता है)।
समस्या: "खाली ओवन" सिंड्रोम
वर्तमान में, अधिकांश AI प्रशिक्षण सेटअप एक ऐसी बेकरी की तरह काम करते हैं जहाँ हर एक ऑर्डर के लिए एक समर्पित ओवन और डेकोरेटिंग स्टेशन होता है, भले ही वे उनका उपयोग हर समय न कर रहे हों।
- "स्प्लिट" (विभाजित) बेकरी: आपके पास एक टीम बेकिंग करने वाली है और दूसरी डेकोरेटिंग करने वाली, लेकिन वे शिफ्ट में काम करती हैं। जब बेकर्स काम कर रहे होते हैं, तो डेकोरेटर्स खाली बैठे रहते हैं। जब डेकोरेटर्स काम कर रहे होते हैं, तो बेकर्स खाली बैठे रहते हैं। आप दो पूरी टीमों के लिए भुगतान कर रहे हैं, लेकिन एक समय में केवल एक ही काम कर रही है।
- "कोलोकेटेड" (एक ही स्थान पर स्थित) बेकरी: आप जगह बचाने के लिए बेकर्स और डेकोरेटर्स को एक ही कमरे में रख देते हैं। लेकिन ओवन इतना बड़ा है (क्योंकि AI मॉडल बहुत विशाल होते हैं) कि डेकोरेटिंग टीम को बेकर्स के काम खत्म करने का इंतज़ार करना पड़ता है ताकि वे काउंटर को छू सकें। ओवन अक्सर छोटे डेकोरेटिंग कार्यों के लिए बहुत बड़ा होता है, जिससे ऊर्जा बर्बाद होती है।
- "एसिंक्रोनस" (अतुल्यकालिक) बेकरी: आप डेकोरेटर्स को कल के केक पर काम करने के लिए कहते हैं जबकि बेकर्स आज के केक पर काम कर रहे होते हैं। यह थोड़ा मदद करता है, लेकिन अंततः, टाइमिंग गड़बड़ा जाती है, और आप या तो बासी केक के साथ या फिर इंतज़ार करते हुए ही रह जाते हैं।
यह पेपर इसे "जॉब-लोकल इनएफिशिएंसी" (कार्य-स्थानीय अक्षमता) कहता है। प्रत्येक एकल AI प्रशिक्षण कार्य में ये "खाली अंतराल" (idle gaps) होते हैं जहाँ महंगे कंप्यूटर चिप्स (GPUs) बस कुछ भी किए बिना बैठे रहते हैं।
समाधान: PlexRL (एक "साझा रसोई" प्रणाली)
लेखकों ने PlexRL नामक एक सिस्टम बनाया है। हर AI जॉब को अपनी निजी रसोई देने के बजाय, PlexRL पूरे डेटा सेंटर को एक विशाल, साझा रसोई में बदल देता है।
यह कैसे काम करता है, हमारे बेकरी उदाहरण का उपयोग करते हुए, यहाँ दिया गया है:
- सेंट्रल मैनेजर (शेड्यूलर): कल्पना कीजिए कि एक हेड शेफ है जिसे इस बात से कोई फर्क नहीं पड़ता कि बेकरी का कौन सा ऑर्डर बनाया जा रहा है। उन्हें केवल कार्यों (tasks) की परवाह है। वे देखते हैं कि जॉब A वर्तमान में "डेकोरेटिंग" कर रही है (ओवन के एक छोटे हिस्से का उपयोग कर रही है) और जॉब B "बेकिंग" कर रही है (ओवन के बड़े हिस्से का उपयोग कर रही है)।
- टाइम-स्लाइसिंग (समय-विभाजन): मैनेजर को एहसास होता है कि जबकि जॉब A एक टूल के आने का इंतज़ार कर रही है, जॉब B उसी ओवन का कुछ सेकंड के लिए उपयोग कर सकती है। PlexRL बहुत तेज़ी से ओवन में "स्टेट" (रेसिपी और वर्तमान केक) को अंदर-बाहर बदलता (swap) है।
- ओवन को न हिलाना: आमतौर पर, एक विशाल ओवन को नए किचन में ले जाने में बहुत समय लगता है। PlexRL स्मार्ट है: यह ओवन को एक ही जगह रखता है और बस सामग्री (AI मॉडल की मेमोरी) को बहुत तेज़ी से अंदर-बाहर करता है। यह ट्रैक रखने के लिए एक "स्टेट मैनेजर" का उपयोग करता है कि हर सामग्री कहाँ है, चाहे वह काउंटर पर हो (फास्ट मेमोरी) या फ्रीजर में (स्लो स्टोरेज)।
जादुई ट्रिक: "एंटी-कोरिलेटेड" गैप्स
इसका सीक्रेट सॉस यह है कि विभिन्न AI जॉब्स के "खाली समय" (idle times) शायद ही कभी एक ही समय पर होते हैं।
- जॉब A किसी टूल कॉल के लिए इंतज़ार कर सकती है (एक लंबा ठहराव)।
- जॉब B गहन गणितीय गणनाओं के बीच में हो सकती है (कोई ठहराव नहीं)।
PlexRL, जॉब A के ठहराव को जॉब B के काम से भर देता है। यह एक टैक्सी ड्राइवर की तरह है जो उत्तर की ओर जाने वाले यात्री को उठाता है, और फिर तुरंत दक्षिण की ओर जाने वाले दूसरे यात्री को उठा लेता है, बजाय इसके कि वह खाली हाथ वापस गैरेज जाए।
परिणाम
पेपर ने इसे 2,048 कंप्यूटर चिप्स (GPUs) के एक विशाल क्लस्टर पर टेस्ट किया है जो अलग-अलग आकार के (छोटे से लेकर बहुत बड़े) AI मॉडल को ट्रेन कर रहे हैं।
- लागत बचत: उन खाली अंतरालों को भरकर, उन्होंने ट्रेनिंग की लागत को 37.58% तक कम कर दिया। यह ऐसा है जैसे बिजली का बिल बचाने के लिए स्मार्ट तरीके से लाइट चालू/बंद करने से आपको 37% की छूट मिल रही हो।
- गति: उन्होंने AI की सीखने की गति को धीमा नहीं किया। मॉडल पहले की तरह ही अच्छी तरह से सीखे; वे बस कम संसाधनों का उपयोग करके वहां पहुंचे।
- लचीलापन: शोधकर्ता अभी भी AI को प्रशिक्षित करने के नए, अजीब या जटिल तरीके आज़मा सकते हैं बिना पूरे सिस्टम को दोबारा लिखे। PlexRL डेटा को इधर-उधर ले जाने की सारी "प्लंबिंग" को संभाल लेता है ताकि शोधकर्ता गणित पर ध्यान केंद्रित कर सकें।
संक्षेप में
PlexRL एक ऐसा सिस्टम है जो AI ट्रेनिंग जॉब्स को अलग-थलग द्वीपों की तरह नहीं देखता। इसके बजाय, यह उन्हें एक व्यस्त, साझा सिटी बस सिस्टम की तरह मानता है। यह सुनिश्चित करता है कि महंगे "बस" (कंप्यूटर चिप्स) कभी खाली न चलें। अलग-अलग जॉब्स को एक ही हार्डवेयर में स्मार्ट तरीके से अंदर-बाहर बदलकर, यह AI को कम बुद्धिमान बनाए बिना बहुत सारा पैसा और कंप्यूटिंग पावर बचाता है।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।