← नवीनतम पेपर
🤖 AI

RollArt: Disaggregated Multi-Task Agentic RL Training at Scale

RollArt एक विसंयोजित (disaggregated) मल्टी-टास्क एजेंटिक RL सिस्टम है जो पाइपलाइन चरणों को विशिष्ट हार्डवेयर से मैप करके, सिंक्रोनाइज़ेशन बाधाओं को समाप्त करने के लिए ट्राजेक्टरी-स्तरीय इंटरैक्शन को डिकपल करके, और एसिंक्रोनस वेट अपडेट्स के माध्यम से रोलआउट को ट्रेनिंग के साथ ओवरलैप करके ट्रेनिंग थ्रूपुट और स्केलेबिलिटी को अनुकूलित करता है, जिससे बड़े पैमाने के क्लस्टर्स पर 2.05× तक तेज़ ट्रेनिंग समय प्राप्त होता है।

मूल लेखक: Wei Gao, Yuheng Zhao, Tianyuan Wu, Shaopan Xiong, Weixun Wang, Dakai An, Lunxi Cao, Dilxat Muhtar, Zichen Liu, Haizhou Zhao, Ju Huang, Siran Yang, Yongbin Li, Wenbo Su, Jiamang Wang, Lin Qu, Bo Zheng
प्रकाशित 2026-06-16
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Wei Gao, Yuheng Zhao, Tianyuan Wu, Shaopan Xiong, Weixun Wang, Dakai An, Lunxi Cao, Dilxat Muhtar, Zichen Liu, Haizhou Zhao, Ju Huang, Siran Yang, Yongbin Li, Wenbo Su, Jiamang Wang, Lin Qu, Bo Zheng, Wei Wang

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक बहुत ही विशिष्ट रोबोट (एक AI) को जटिल समस्याओं को हल करना सिखाने की कोशिश कर रहे हैं, जैसे कि सॉफ्टवेयर कोड लिखना या किसी वेबसाइट को नेविगेट करना। इसे करने के लिए, आप उसे केवल एक पाठ्यपुस्तक नहीं देते; बल्कि आप उसे एक वास्तविक दुनिया के सिमुलेशन में अभ्यास करने देते हैं। इस प्रक्रिया को एजेंटिक रीइन्फोर्समेंट लर्निंग (Agentic Reinforcement Learning) कहा जाता है।

यह शोध पत्र एक नए सिस्टम के बारे में बताता है जिसे ROLLART कहा जाता है, जो इस प्रशिक्षण प्रक्रिया के लिए एक अत्यंत कुशल ट्रैफिक कंट्रोलर की तरह काम करता है। यह कैसे काम करता है, इसके लिए यहाँ सरल उपमाओं का उपयोग किया गया है।

समस्या: "एक ही आकार सबके लिए" वाला ट्रैफिक जाम (The "One-Size-Fits-All" Traffic Jam)

कल्पना कीजिए कि एक फैक्ट्री है जहाँ श्रमिकों की एक ही टीम को तीन बहुत अलग काम करने हैं:

  1. सोचना: कठिन गणितीय समस्याओं को हल करना (इसके लिए एक तेज़ दिमाग की आवश्यकता होती है)।
  2. पढ़ना: लंबी किताबें तेज़ी से पढ़ना (इसके लिए तेज़ आँखों की आवश्यकता होती है)।
  3. बनाना: भौतिक पुर्जों को जोड़ना (इसके लिए मज़बूत हाथों की आवश्यकता होती है)।

पुराने सिस्टम में, हर काम के लिए एक ही प्रकार के कार्यकर्ता का उपयोग किया जाता था। यदि आपने "पढ़ने" के लिए "तेज़ दिमाग" वाले कार्यकर्ता को नियुक्त किया, तो वे धीमे थे। यदि आपने "गणित" के लिए "मज़बूत हाथ" वाले कार्यकर्ता को नियुक्त किया, तो वे भी धीमे थे। इसके अलावा, यदि एक कार्यकर्ता टूटे हुए खिलौने को ठीक करने में फंस जाता था (एक "स्ट्रैगलर" या पिछड़ने वाला), तो पूरी फैक्ट्री को अगले चरण पर जाने से पहले उनके लिए रुकना पड़ता था। इससे भारी देरी होती थी।

समाधान: ROLLART की विशिष्ट असेंबली लाइन (ROLLART's Specialized Assembly Line)

ROLLART इसे विशेष ज़ोन में तोड़कर और विभिन्न टीमों को उनकी अपनी गति से काम करने देकर ठीक करता है।

1. सही उपकरणों के साथ श्रमिकों का मिलान (Hardware Affinity)

सिस्टम यह समझ जाता है कि कुछ कार्यों के लिए कंप्यूटिंग पावर (जैसे गणित हल करना) की आवश्यकता होती है और अन्य के लिए मेमोरी स्पीड (जैसे लंबे टेक्स्ट पढ़ना) की।

  • पुराना तरीका: सभी एक ही महंगे, भारी-भरकम कंप्यूटर का उपयोग करते थे।
  • ROLLART का तरीका: यह "गणित" के कार्यों को सुपर-फास्ट कंप्यूटरों पर भेजता है और "पढ़ने" के कार्यों को विशाल, तेज़ मेमोरी वाले कंप्यूटरों पर भेजता है। यह एक शेफ को हाई-पावर्ड स्टोव वाली रसोई में भेजने और एक लाइब्रेरियन को विशाल, तेज़ कार्ड कैटलॉग वाली लाइब्रेरी में भेजने जैसा है। वे काम को बहुत तेज़ी से पूरा करते हैं क्योंकि वे काम के लिए सही उपकरण का उपयोग कर रहे हैं।

2. श्रमिकों को उनकी अपनी गति से आगे बढ़ने देना (Trajectory-Level Asynchrony)

पुराने कारखाने में, यदि एक कार्यकर्ता को एक कार्य पूरा करने में 10 मिनट लगते थे जबकि अन्य को 1 मिनट लगता था, तो पूरी लाइन 10 मिनट के लिए रुक जाती थी।

  • ROLLART का तरीका: यह प्रत्येक एकल अभ्यास रन (जिसे "ट्रैजेक्टरी" कहा जाता है) को एक स्वतंत्र प्रोजेक्ट के रूप में मानता है। यदि एक रोबोट एक कठिन पहेली में फंस जाता है, तो अन्य रोबोट अपने स्वयं के पहेलियों पर काम करना जारी रखते हैं। सिस्टम धीमे वाले का इंतज़ार नहीं करता; यह बस तेज़ वालों को आगे बढ़ता रहता है। एक बार जब धीमा वाला अंततः काम पूरा कर लेता है, तो उसे स्कोर दिया जाता है, और तेज़ वाले नए कार्यों की ओर बढ़ जाते हैं।

3. सरल कार्यों के लिए "गिग वर्कर्स" को काम पर रखना (Serverless Offloading)

एक रोबोट द्वारा कार्य पूरा करने के बाद, किसी को उसे ग्रेड (अंक देना) करना होता है। कभी-कभी यह एक साधारण जाँच होती है (जैसे "क्या दरवाज़ा खुला?") और कभी-कभी यह दूसरे AI द्वारा की गई एक जटिल समीक्षा होती है।

  • पुराना तरीका: आप इन सरल कार्यों को ग्रेड करने के लिए महंगे, उच्च-शक्ति वाले कंप्यूटरों की एक टीम को खाली बैठा रखते थे। उन्हें काम न करने के दौरान भी "स्टैंडबाय" पर रखने के लिए यह महंगा पड़ता था।
  • ROLLART का तरीका: यह "गिग वर्कर्स" (सर्वरलेस क्लाउड कंप्यूटिंग) का उपयोग करता है। आप केवल तभी भुगतान करते हैं जब वास्तव में ग्रेडिंग होती है। यदि कोई ग्रेडिंग नहीं हो रही है, तो आप कुछ भी भुगतान नहीं करते हैं। यह महंगे कंप्यूटरों को कठिन काम सीखने पर ध्यान केंद्रित करने के लिए मुक्त करता है।

4. सीखते समय सिखाना (Bounded-Staleness Training)

आमतौर पर, शिक्षक (प्रशिक्षण कंप्यूटर) और छात्र (अभ्यास करने वाला रोबोट) बारी-बारी से काम करते हैं। छात्र अभ्यास करता है, रुकता है, अपने ज्ञान को अपडेट करने के लिए शिक्षक का इंतज़ार करता है, और फिर फिर से शुरू करता है।

  • ROLLART का तरीका: शिक्षक और छात्र एक साथ काम करते हैं। छात्र "कल के संस्करण" के ज्ञान के साथ अभ्यास करना जारी रखता है जबकि शिक्षक "आज के संस्करण" को अपडेट करने में व्यस्त होता है। सिस्टम यह सुनिश्चित करता है कि छात्र बहुत अधिक पीछे न रह जाए (एक "स्टेलेनेस बाउंड" का उपयोग करके), लेकिन उन्हें कभी भी रुकने या इंतज़ार करने की आवश्यकता नहीं होती है। यह एक कोच द्वारा धावक को दौड़ते समय नई निर्देश चिल्लाने जैसा है, बजाय इसके कि कोच के पास नया सुझाव होने पर धावक को शुरुआती रेखा पर ही रोक दिया जाए।

परिणाम

इस शोध पत्र ने एक बड़े पैमाने पर (अलीबाबा द्वारा 3,000 से अधिक कंप्यूटरों का उपयोग करके) इस प्रणाली का परीक्षण किया।

  • गति: इसने पिछले तरीकों की तुलना में प्रशिक्षण प्रक्रिया को 1.3 से 2 गुना तेज़ बना दिया।
  • दक्षता: इसने खाली बैठे कार्यों पर महंगी कंप्यूटिंग शक्ति को बर्बाद करने से रोका।
  • स्थिरता: इसने साबित किया कि भले ही चीजें गलत हो जाएं (जैसे कंप्यूटर क्रैश होना या कार्य में बहुत अधिक समय लगना), सिस्टम बिना टूटे चलता रहता है।

संक्षेप में, ROLLART एक स्मार्ट मैनेजर है जो AI प्रशिक्षण में "इंतज़ार करने के खेल" को रोकता है। यह सही कार्यों को सही कंप्यूटरों पर डालता है, तेज़ श्रमिकों को आगे बढ़ने देता है भले ही धीमे लोग पीछे छूट रहे हों, और सरल कामों के लिए सस्ते, ऑन-डिमांड हेल्प का उपयोग करता है, जिसके परिणामस्वरूप उन्नत AI को प्रशिक्षित करने का एक बहुत तेज़ और सस्ता तरीका मिलता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →