← नवीनतम पेपर
🤖 machine learning

PlexRL: Cluster-Level Orchestration of Serviceized LLM Execution for RLVR

PlexRL एक क्लस्टर-स्तरीय रनटाइम है जो संरचनात्मक खाली अंतराल (structural idle gaps) को भरने के लिए नौकरियों (jobs) के बीच एकीकृत LLM सेवाओं को मल्टीप्लेक्स करके रिइन्फोर्समेंट लर्निंग विद वेरिफिएबल रिवार्ड्स (RLVR) प्रशिक्षण की दक्षता में सुधार करता है, जिससे महंगे मॉडल माइग्रेशन के बिना उपयोगकर्ता की GPU लागत को 37.58% तक कम किया जा सकता है।

मूल लेखक: Yiqi Zhang, Fangzheng Jiao, Tian Tang, Boyu Tian, Hangyu Wang, Qiaoling Chen, Guoteng Wang, Zhen Jiang, Peng Sun, Ping Zhang, Xiaohe Hu, Ziming Liu, Menghao Zhang, Yanmin Jia, Yang You, Siyuan Feng

प्रकाशित 2026-05-21
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Yiqi Zhang, Fangzheng Jiao, Tian Tang, Boyu Tian, Hangyu Wang, Qiaoling Chen, Guoteng Wang, Zhen Jiang, Peng Sun, Ping Zhang, Xiaohe Hu, Ziming Liu, Menghao Zhang, Yanmin Jia, Yang You, Siyuan Feng

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक विशाल, हाई-टेक बेकरी चला रहे हैं। इस बेकरी में आपके पास दो मुख्य प्रकार के काम हैं: बेकिंग (जिसके लिए एक बहुत बड़े, महंगे ओवन की आवश्यकता होती है) और डेकोरेटिंग (जिसके लिए एक छोटे, तेज़ स्टेशन की आवश्यकता होती है)।

आर्टिफिशियल इंटेलिजेंस की दुनिया में, विशेष रूप से "रीजनिंग" मॉडल (जैसे कि वे जो गणित की समस्याओं को हल करते हैं) को प्रशिक्षित करने के लिए, "बेकिंग" ट्रेनिंग चरण है, और "डेकोरेटिंग" रोलआउट चरण है (जहाँ AI उत्तर उत्पन्न करता है)।

समस्या: "खाली ओवन" सिंड्रोम

वर्तमान में, अधिकांश AI प्रशिक्षण सेटअप एक ऐसी बेकरी की तरह काम करते हैं जहाँ हर एक ऑर्डर के लिए एक समर्पित ओवन और डेकोरेटिंग स्टेशन होता है, भले ही वे उनका उपयोग हर समय न कर रहे हों।

  1. "स्प्लिट" (विभाजित) बेकरी: आपके पास एक टीम बेकिंग करने वाली है और दूसरी डेकोरेटिंग करने वाली, लेकिन वे शिफ्ट में काम करती हैं। जब बेकर्स काम कर रहे होते हैं, तो डेकोरेटर्स खाली बैठे रहते हैं। जब डेकोरेटर्स काम कर रहे होते हैं, तो बेकर्स खाली बैठे रहते हैं। आप दो पूरी टीमों के लिए भुगतान कर रहे हैं, लेकिन एक समय में केवल एक ही काम कर रही है।
  2. "कोलोकेटेड" (एक ही स्थान पर स्थित) बेकरी: आप जगह बचाने के लिए बेकर्स और डेकोरेटर्स को एक ही कमरे में रख देते हैं। लेकिन ओवन इतना बड़ा है (क्योंकि AI मॉडल बहुत विशाल होते हैं) कि डेकोरेटिंग टीम को बेकर्स के काम खत्म करने का इंतज़ार करना पड़ता है ताकि वे काउंटर को छू सकें। ओवन अक्सर छोटे डेकोरेटिंग कार्यों के लिए बहुत बड़ा होता है, जिससे ऊर्जा बर्बाद होती है।
  3. "एसिंक्रोनस" (अतुल्यकालिक) बेकरी: आप डेकोरेटर्स को कल के केक पर काम करने के लिए कहते हैं जबकि बेकर्स आज के केक पर काम कर रहे होते हैं। यह थोड़ा मदद करता है, लेकिन अंततः, टाइमिंग गड़बड़ा जाती है, और आप या तो बासी केक के साथ या फिर इंतज़ार करते हुए ही रह जाते हैं।

यह पेपर इसे "जॉब-लोकल इनएफिशिएंसी" (कार्य-स्थानीय अक्षमता) कहता है। प्रत्येक एकल AI प्रशिक्षण कार्य में ये "खाली अंतराल" (idle gaps) होते हैं जहाँ महंगे कंप्यूटर चिप्स (GPUs) बस कुछ भी किए बिना बैठे रहते हैं।

समाधान: PlexRL (एक "साझा रसोई" प्रणाली)

लेखकों ने PlexRL नामक एक सिस्टम बनाया है। हर AI जॉब को अपनी निजी रसोई देने के बजाय, PlexRL पूरे डेटा सेंटर को एक विशाल, साझा रसोई में बदल देता है।

यह कैसे काम करता है, हमारे बेकरी उदाहरण का उपयोग करते हुए, यहाँ दिया गया है:

  • सेंट्रल मैनेजर (शेड्यूलर): कल्पना कीजिए कि एक हेड शेफ है जिसे इस बात से कोई फर्क नहीं पड़ता कि बेकरी का कौन सा ऑर्डर बनाया जा रहा है। उन्हें केवल कार्यों (tasks) की परवाह है। वे देखते हैं कि जॉब A वर्तमान में "डेकोरेटिंग" कर रही है (ओवन के एक छोटे हिस्से का उपयोग कर रही है) और जॉब B "बेकिंग" कर रही है (ओवन के बड़े हिस्से का उपयोग कर रही है)।
  • टाइम-स्लाइसिंग (समय-विभाजन): मैनेजर को एहसास होता है कि जबकि जॉब A एक टूल के आने का इंतज़ार कर रही है, जॉब B उसी ओवन का कुछ सेकंड के लिए उपयोग कर सकती है। PlexRL बहुत तेज़ी से ओवन में "स्टेट" (रेसिपी और वर्तमान केक) को अंदर-बाहर बदलता (swap) है।
  • ओवन को न हिलाना: आमतौर पर, एक विशाल ओवन को नए किचन में ले जाने में बहुत समय लगता है। PlexRL स्मार्ट है: यह ओवन को एक ही जगह रखता है और बस सामग्री (AI मॉडल की मेमोरी) को बहुत तेज़ी से अंदर-बाहर करता है। यह ट्रैक रखने के लिए एक "स्टेट मैनेजर" का उपयोग करता है कि हर सामग्री कहाँ है, चाहे वह काउंटर पर हो (फास्ट मेमोरी) या फ्रीजर में (स्लो स्टोरेज)।

जादुई ट्रिक: "एंटी-कोरिलेटेड" गैप्स

इसका सीक्रेट सॉस यह है कि विभिन्न AI जॉब्स के "खाली समय" (idle times) शायद ही कभी एक ही समय पर होते हैं।

  • जॉब A किसी टूल कॉल के लिए इंतज़ार कर सकती है (एक लंबा ठहराव)।
  • जॉब B गहन गणितीय गणनाओं के बीच में हो सकती है (कोई ठहराव नहीं)।

PlexRL, जॉब A के ठहराव को जॉब B के काम से भर देता है। यह एक टैक्सी ड्राइवर की तरह है जो उत्तर की ओर जाने वाले यात्री को उठाता है, और फिर तुरंत दक्षिण की ओर जाने वाले दूसरे यात्री को उठा लेता है, बजाय इसके कि वह खाली हाथ वापस गैरेज जाए।

परिणाम

पेपर ने इसे 2,048 कंप्यूटर चिप्स (GPUs) के एक विशाल क्लस्टर पर टेस्ट किया है जो अलग-अलग आकार के (छोटे से लेकर बहुत बड़े) AI मॉडल को ट्रेन कर रहे हैं।

  • लागत बचत: उन खाली अंतरालों को भरकर, उन्होंने ट्रेनिंग की लागत को 37.58% तक कम कर दिया। यह ऐसा है जैसे बिजली का बिल बचाने के लिए स्मार्ट तरीके से लाइट चालू/बंद करने से आपको 37% की छूट मिल रही हो।
  • गति: उन्होंने AI की सीखने की गति को धीमा नहीं किया। मॉडल पहले की तरह ही अच्छी तरह से सीखे; वे बस कम संसाधनों का उपयोग करके वहां पहुंचे।
  • लचीलापन: शोधकर्ता अभी भी AI को प्रशिक्षित करने के नए, अजीब या जटिल तरीके आज़मा सकते हैं बिना पूरे सिस्टम को दोबारा लिखे। PlexRL डेटा को इधर-उधर ले जाने की सारी "प्लंबिंग" को संभाल लेता है ताकि शोधकर्ता गणित पर ध्यान केंद्रित कर सकें।

संक्षेप में

PlexRL एक ऐसा सिस्टम है जो AI ट्रेनिंग जॉब्स को अलग-थलग द्वीपों की तरह नहीं देखता। इसके बजाय, यह उन्हें एक व्यस्त, साझा सिटी बस सिस्टम की तरह मानता है। यह सुनिश्चित करता है कि महंगे "बस" (कंप्यूटर चिप्स) कभी खाली न चलें। अलग-अलग जॉब्स को एक ही हार्डवेयर में स्मार्ट तरीके से अंदर-बाहर बदलकर, यह AI को कम बुद्धिमान बनाए बिना बहुत सारा पैसा और कंप्यूटिंग पावर बचाता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →