JoyNexus: Service-Oriented Multi-Tenant Post-Training for VLA Models
JoyNexus पोस्ट-ट्रेनिंग विजन-लैंग्वेज-एक्शन (VLA) मॉडल्स के लिए एक एकीकृत, मल्टी-टेनेंट सेवा है जो प्रशिक्षण, इन्फरेंस और एनवायरनमेंट घटकों को अलग करती है ताकि कुशल संसाधन साझाकरण, क्रॉस-टेनेंट शेड्यूलिंग और ग्रुप बैचिंग को सक्षम बनाया जा सके, जिससे पारंपरिक आइसोलेटेड सिंगल-टेनेंट निष्पादन की तुलना में कुल GPU समय कम होता है और उपयोगिता में सुधार होता है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि एक ऐसी दुनिया है जहाँ रोबोट इंसानों की तरह चीजें करना सीख सकते हैं: एक बिखरा हुआ कमरा देखना, "साफ करने" का निर्देश समझना, और फिर खिलौनों को उठाने का तरीका जानना। यह विज़न-लैंग्वेज-एक्शन (VLA) मॉडल का रोमांचक क्षेत्र है। इन मॉडलों को एक रोबोट के मस्तिष्क के रूप में सोचें जो उसकी आँखों (दृष्टि), उसकी आवाज़ (भाषा) और उसकी मांसपेशियों (क्रिया) को जोड़ता है। एक रोबोट को वास्तव में कुछ उपयोगी करने के योग्य बनाने के लिए, वैज्ञानिकों को उसे "पोस्ट-ट्रेन" (post-train) करना पड़ता है। यह एक बुद्धिमान छात्र को सामान्य तथ्य जानने के बाद, उसे जूते के फीते बांधने या जार खोलने जैसे विशिष्ट कौशल सिखाने जैसा है।
हालाँकि, इन रोबोटिक मस्तिष्कों को सिखाना अविश्वसनीय रूप से महंगा और जटिल है। अभी, यदि कोई शोधकर्ता एक रोबोट को प्रशिक्षित करना चाहता है, तो उसे आमतौर पर एक विशाल, महंगे कंप्यूटर (जीपीयू/GPU) को अकेले किराए पर लेना पड़ता है। यह एक निजी जिम किराए पर लेने जैसा है जहाँ आप केवल कुछ पुश-अप्स करने के लिए पूरा कमरा लेते हैं; जब आप अपने वजन लोड कर रहे होते हैं या ब्रेक का इंतजार कर रहे होते हैं, तब भी मशीन खाली बैठी रहती है, और फिर भी आपको पूरे घंटे का भुगतान करना पड़ता है। यह "एक रोबोट, एक जिम" वाला दृष्टिकोण बर्बादी है और यह कई लोगों को एक ही समय में रोबोट लर्निंग के प्रयोग करने में कठिनाई पैदा करता है।
यहाँ आता है JoyNexus, जो JD AI Infra और कई विश्वविद्यालयों के शोधकर्ताओं का एक नया विचार है। वे रोबोट के मस्तिष्क के लिए एक "साझा जिम" (shared gym) का प्रस्ताव देते हैं। एक पूरा कंप्यूटर किराए पर लेने के बजाय, कई शोधकर्ता सुरक्षित और कुशलतापूर्वक एक ही शक्तिशाली मशीन को साझा कर सकते हैं। यह पेपर एक प्रणाली पेश करता है जो एक सुपर-स्मार्ट कोच की तरह काम करती है, जिससे कई अलग-अलग टीमें एक-दूसरे से टकराए बिना एक साथ अपने रोबोटों को प्रशिक्षित कर सकती हैं। अपने काम को चतुराई से व्यवस्थित करके, JoyNexus सुझाव देता है कि हम इन रोबोटों को प्रशिक्षित करने के लिए आवश्यक कुल समय और ऊर्जा को कम कर सकते हैं, जिससे उन्नत रोबोट लर्निंग सभी के लिए तेज़ और सस्ती हो सके।
रोबोट के मस्तिष्क के लिए "साझा जिम"
तो, JoyNexus वास्तव में कैसे काम करता है? एक व्यस्त, हाई-टेक जिम की कल्पना करें। पुराने तरीके में, यदि आप प्रशिक्षण लेना चाहते, तो आप ट्रेडमिल, वेट और शीशे के साथ एक पूरा कमरा किराए पर लेते और उस कमरे में केवल आप ही जाने की अनुमति होती। यदि आप पानी पीने या अपना फोन देखने के लिए रुक जाते, तो कमरा खाली रहता, लेकिन फिर भी आप पूरे समय का भुगतान करते।
JoyNexus नियमों को बदल देता है। यह जिम को तीन मुख्य क्षेत्रों वाले एक हलचल भरे, साझा स्थान में बदल देता है:
- ब्रेन ज़ोन (ट्रेनिंग मॉडल सर्विस): यहाँ भारी काम होता है। रोबोट का "मस्तिष्क" (वह बड़ा, जटिल हिस्सा जो छवियों और शब्दों को समझता है) एक केंद्रीय, साझा स्थान में रखा जाता है। यह एक विशाल, महंगे ट्रेडमिल की तरह है जिसका उपयोग हर कोई कर सकता है।
- मसल ज़ोन (एक्शन मॉड्यूल): प्रत्येक रोबोट की अपनी अनूठी "मांसपेशियाँ" या विशिष्ट कौशल होते हैं (जैसे क्लॉ के लिए ग्रिपर या कार के लिए पहिया)। JoyNexus में, इन विशिष्ट हिस्सों को प्रत्येक टीम के लिए अलग रखा जाता है। आप साझा ट्रेडमिल का उपयोग करने के लिए अपने स्वयं के अनूठे वजन लेकर आते हैं।
- ऑब्स्टेकल कोर्स (एनवायरनमेंट सर्विस): यह वह सिम्युलेटर है जहाँ रोबोट अभ्यास करता है। यह एक आभासी रसोई, एक फैक्ट्री फ्लोर, या एक लिविंग रूम हो सकता है।
JoyNexus का जादू इस बात में है कि यह ट्रैफ़िक को कैसे प्रबंधित करता है। यह एक "मास्टर सर्विस" (एक बहुत ही संगठित जिम मैनेजर की तरह) का उपयोग करता है जो यह तय करता है कि कब कौन ट्रेडमिल पर जाएगा। यदि टीम A अपने रोबलेट के सिमुलेशन पूरा होने का इंतजार कर रही है, और टीम B एक गणितीय अपडेट करने के लिए तैयार है, तो मैनेजर उन्हें तुरंत बदल देता है ताकि ट्रेडमिल कभी भी रुक न जाए।
"ग्रुप बैचिंग" का कमाल
इसकी एक सबसे शानदार विशेषता है जिसे लेखक ग्रुप बैचिंग (group batching) कहते हैं। कल्पना कीजिए कि आप एक कॉफी शॉप में हैं। यदि एक व्यक्ति लाटे (latte) ऑर्डर करता है, तो बारिस्ता को केवल एक कप के लिए मशीन शुरू करनी होगी, बीन्स पीसने होंगे और दूध गर्म करना होगा। यदि दस लोग एक ही समय में लाटे ऑर्डर करते हैं, तो बारिस्ता सभी दस के लिए पर्याप्त बीन्स पीस सकता है और एक बड़ा जग दूध गर्म कर सकता है, जिससे प्रति कप प्रक्रिया बहुत तेज़ हो जाती है।
JoyNexus रोबोट प्रशिक्षण के लिए यही करता है। अक्सर, विभिन्न टीमें साझा "मस्तिष्क" (VLA मॉडल) को छोटे अनुरोध भेजती हैं। यदि सिस्टम उन्हें एक-एक करके प्रोसेस करता, तो कंप्यूटर शुरू होने और रुकने में समय बर्बाद करता। इसके बजाय, JoyNexus एक सेकंड के बहुत छोटे हिस्से तक इंतजार करता है यह देखने के लिए कि क्या अन्य टीमों के पास भी अनुरोध हैं। यदि उनके पास हैं, तो यह उन्हें एक साथ समूहबद्ध (group) कर देता है। यह सभी के लिए एक ही बार में "साझा मस्तिष्क" वाले हिस्से को चलाता है, और फिर परिणामों को प्रत्येक टीम के विशिष्ट "मांसपेशियों" के प्रशिक्षण को पूरा करने के लिए वापस विभाजित कर देता है।
पेपर दिखाता है कि जब कई टीमें डेटा के छोटे बैच भेज रही होती हैं, तो यह बहुत अच्छा काम करता है। उनके सिमुलेशन में, जब उन्होंने 8 अलग-अलग टीमों के अनुरोधों को समूहबद्ध किया, तो "शेयर्ड फॉरवर्ड पास" (वह हिस्सा जहाँ मस्तिष्क डेटा को देखता है) की गति में काफी सुधार हुआ। कुछ मॉडलों के लिए, इसने साझा हिस्से को एक-एक करके करने की तुलना में 2.21 गुना तेज़ बना दिया।
उन्होंने क्या पाया (और क्या नहीं)
शोधकर्ताओं ने चार अलग-अलग टीमों के परिदृश्य का अनुकरण करके JoyNexus का परीक्षण किया: तीन टीमें आभासी वातावरण (जैसे LIBERO या ManiSkill नामक सिमुलेशन में ब्लॉक हिलाना) में कार्यों को करने के लिए रोबोट को प्रशिक्षित कर रही थीं, और एक टीम केवल एक स्टेटिक डेटासेट (सुपरवाइज्ड फाइन-ट्यूनिंग) के साथ अभ्यास कर रही थी।
उन्होंने इस "साझा जिम" दृष्टिकोण की तुलना पुराने "निजी जिम" पद्धति से की, जहाँ प्रत्येक टीम अपने कार्यों को एक के बाद एक चलाती थी। परिणाम उत्साहजनक थे:
- कम बर्बादी: काम को ओवरलैप करके, JoyNexus ने कुल "जीपीयू समय" (महंगे कंप्यूटर के चलने का समय) को 28.3% कम कर दिया।
- बेहतर उपयोग: मल्टी-टेनेंट सेटअप में साझा कंप्यूटर 41.3% समय व्यस्त थे, जबकि आइसोलेटेड सेटअप में यह केवल 20.8% था। यह दक्षता में लगभग दोगुना है!
- कोई भ्रम नहीं: महत्वपूर्ण रूप से, सिस्टम ने सब कुछ सुरक्षित रखा। भले ही टीमों ने बड़े मस्तिष्क को साझा किया, लेकिन उनके विशिष्ट "मांसपेशियों", उनके डेटा और उनकी प्रगति को पूरी तरह से अलग रखा गया था। पेपर दिखाता है कि प्रत्येक टीम के लिए लर्निंग कर्व (कि वे कितनी तेज़ी से बेहतर हुए) बिल्कुल वैसा ही था जैसा कि वे अकेले प्रशिक्षण ले रहे होते।
यह ध्यान देना महत्वपूर्ण है कि ये परिणाम सिमुलेशन और वर्कलोड टेस्ट से आए हैं, न कि हजारों रोबोटों के वास्तविक दुनिया के परिनियोजन (deployment) से। लेखक सुझाव देते हैं कि यह दृष्टिकोण समय और पैसा बचा सकता है, लेकिन उन्होंने अभी यह साबित नहीं किया है कि यह हर संभावित वास्तविक दुनिया के परिदृश्य में पूरी तरह से काम करेगा। वे यह भी बताते हैं कि जबकि सिस्टम संसाधनों को साझा करने में बहुत अच्छा है, यह वर्तमान में उपयोगकर्ताओं द्वारा डेटा फॉर्मेटिंग के बारे में विशिष्ट नियमों का पालन करने पर निर्भर करता है। यदि कोई टीम एक पूरी तरह से अजीब, कस्टम रोबोट डिज़ाइन का उपयोग करना चाहती है जो मानक "जिम" नियमों में फिट नहीं बैठता, तो उसे शामिल करना कठिन हो सकता है।
रोबोट प्रशिक्षण का भविष्य
पेपर निष्कर्ष निकालता है कि JoyNexus रोबोट लर्निंग को सुलभ बनाने की दिशा में एक बड़ा कदम है। एक निजी सुपरकंप्यूटर किराए पर लेने के लिए लाखों डॉलर की आवश्यकता होने के बजाय, शोधकर्ता संभावित रूप से केवल उस समय के लिए भुगतान कर सकते हैं जिसका वे वास्तव में उपयोग करते हैं, और दूसरों के साथ लागत साझा कर सकते हैं।
हालाँकि, लेखक यथार्थवादी हैं। वे स्वीकार करते हैं कि वास्तविक दुनिया में इसके काम करने के लिए, हमें सुरक्षा (ताकि एक टीम गलती से दूसरी टीम के रोबोट को नुकसान न पहुँचा दे), मूल्य निर्धारण (साझा समय के लिए कितना शुल्क लिया जाए), और लचीलेपन (उपयोगकर्ताओं को अपने अजीब सिम्युलेटर लाने देना) के बेहतर तरीकों की आवश्यकता है। वे सुझाव देते हैं कि भविष्य के संस्करण अधिक स्मार्ट हो सकते हैं, जो जिम के व्यस्त होने के आधार पर संसाधनों को स्वचालित रूप से समायोजित कर सकें।
संक्षेप में, JoyNexus सुझाव देता है कि रोबोट प्रशिक्षण का भविष्य प्रत्येक शोधकर्ता के लिए बड़े, अलग किलों के निर्माण के बारे में नहीं है। यह एक व्यस्त, कुशल सामुदायिक केंद्र बनाने के बारे में है जहाँ हर कोई एक साथ सीख सकता है, महंगे उपकरणों को साझा कर सकता है, और अपने रोबोटों को पहले से कहीं अधिक तेज़ी से चलाने के लिए तैयार कर सकता है।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।