← नवीनतम पेपर
🤖 AI

Thousand-GPU Large-Scale Training and Optimization Recipe for AI-Native Cloud Embodied Intelligence Infrastructure

यह शोध पत्र एम्बॉडीड इंटेलिजेंस के लिए उद्योग का पहला क्लाउड-आधारित, हज़ार-जीपीयू वितरित प्रशिक्षण मंच प्रस्तुत करता है, जो एक पुनर्गठित डेटा पाइपलाइन, उन्नत मॉडल अनुकूलन (फ्लैशअटेंशन और FP8 क्वांटाइजेशन सहित), और एक उच्च-प्रदर्शन बुनियादी ढांचे का लाभ उठाकर GR00T-N1.5 मॉडल के लिए 40 गुना प्रशिक्षण गति वृद्धि प्राप्त करता है और अगली पीढ़ी के स्वायत्त रोबोटों के लिए एक क्लोज्ड-लूप मूल्यांकन प्रणाली स्थापित करता है।

मूल लेखक: Chen Zhou, Haoran Sun, Hedan Yang, Jing Long, Junwu Xiong, Luqiao Wang, Mingxi Luo, Qiming Yang, Shuai Di, Song Wang, Tianyun Zhao, Wanting Xu, Wen Huang, Xiaodong Bai, Xiaomeng Tian, Xiaolong Xiang
प्रकाशित 2026-03-13
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Chen Zhou, Haoran Sun, Hedan Yang, Jing Long, Junwu Xiong, Luqiao Wang, Mingxi Luo, Qiming Yang, Shuai Di, Song Wang, Tianyun Zhao, Wanting Xu, Wen Huang, Xiaodong Bai, Xiaomeng Tian, Xiaolong Xiang, Yicheng Gong, Yongjian Guo, Yucheng Guo, Yunxuan Ma, Yu Wei, Zhong Guan, Zhen Sun

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। ✨ नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक रोबोट को जटिल काम करना सिखाने की कोशिश कर रहे हैं, जैसे कि खाना बनाना या कपड़े तह करना, बिल्कुल वैसे ही जैसे एक इंसान करता है। इसे एम्बोडीड इंटेलिजेंस (Embodied Intelligence) कहा जाता है। यह केवल रोबोट के दिमाग (AI) के बारे में नहीं है; यह इस बारे में है कि कैसे वह दिमाग एक भौतिक शरीर से जुड़ता है ताकि वह वास्तविक दुनिया में हिल सके और बातचीत कर सके।

आपके द्वारा साझा किया गया पेपर एक विशाल, सुपर-फास्ट "रोबोट स्कूल" बनाने के ब्लूप्रिंट की तरह है जहाँ हजारों कंप्यूटर (GPUs) मिलकर इन रोबोट्स को प्रशिक्षित करते हैं। JD टेक्नोलॉजी की टीम और कई शीर्ष विश्वविद्यालयों ने इस सिस्टम को इसलिए बनाया क्योंकि रोबोट को प्रशिक्षित करना आमतौर पर बहुत धीमा, महंगा और अव्यवस्थित होता है।

यहाँ उनके समाधान का सरल उपमाओं (analogies) का उपयोग करके विवरण दिया गया है:

1. समस्या: "ट्रैफिक जाम" वाला स्कूल

इस नए सिस्टम से पहले, एक रोबोट को प्रशिक्षित करना एक छोटे से कमरे में केवल एक शिक्षक के साथ 1,000 छात्रों को पढ़ाने जैसा था।

  • डेटा बॉटलनैक्स (Data Bottlenecks): "पाठ्यपुस्तकें" (डेटा) अव्यवस्थित थीं और उन्हें ढूँढना कठिन था।
  • इंतज़ार का खेल: कंप्यूटर अपना अधिकांश समय डेटा आने या अन्य कंप्यूटरों के काम पूरा करने का इंतज़ार करने में बिताते थे।
  • बर्बाद प्रयास: रोबोट को "नकली" या खाली चरणों (padding) पर अभ्यास करने के लिए मजबूर किया जाता था, जिससे ऊर्जा उन चीजों पर बर्बाद होती थी जो महत्वपूर्ण नहीं थीं।

2. समाधान: "सुपर-एक्सप्रेस" फैक्ट्री

टीम ने एक क्लाउड-नेटिव इंफ्रास्ट्रक्चर (एक विशाल, लचीली डिजिटल फैक्ट्री) बनाया है जो एक साथ 1,000 GPUs पर चलता है। इसे साइकिल डिलीवरी सेवा से हाई-स्पीड ड्रोन के बेड़े में अपग्रेड करने के रूप में सोचें।

इन्होंने इसे सफल बनाने के लिए चार मुख्य "सीक्रेट सॉस" का उपयोग किया है:

अ. डेटा पाइपलाइन: "स्मार्ट कन्वेयर बेल्ट"

  • पुराना तरीका: कल्पना करें कि एक फैक्ट्री है जहाँ बॉक्स अलग-अलग गति से आते हैं, और श्रमिकों को अगला बॉक्स पैक करने से पहले सबसे धीमे बॉक्स का इंतज़ार करना पड़ता है।
  • नया तरीका: उन्होंने एक Ray-driven Elastic AI Data Lake बनाया। यह एक स्मार्ट कन्वेयर बेल्ट की तरह है जो तुरंत बॉक्सों को छाँटता और पैक करता है। यदि कोई बॉक्स छोटा है, तो उसे जगह को पूरी तरह भरने के लिए अन्य छोटे बॉक्सों के साथ पैक किया जाता है।
  • परिणाम: अब कोई इंतज़ार नहीं। कंप्यूटरों को डेटा इतनी तेज़ी से दिया जाता है कि वे कभी रुकते नहीं हैं।

ब. प्रशिक्षण की गति: "40x स्पीड बूस्ट"

  • पुराना तरीका: एक विशिष्ट रोबोट मॉडल (GR00T-N1.5) को प्रशिक्षित करने में सीखने के एक दौर के लिए 15 घंटे लगते थे।
  • नया तरीका: डेटा लोड करने और कंप्यूटरों के आपस में बात करने के तरीके को अनुकूलित करके, उन्होंने उस समय को घटाकर केवल 22 मिनट कर दिया।
  • उपमा: यह रश ऑवर ट्रैफिक में कार चलाने से हेलीकॉप्टर उड़ाने जैसा है। उन्होंने 40 गुना तेज़ गति हासिल की।

स. स्मार्ट गणित: "फालतू चीज़ों को हटाना"

रोबोट अक्सर "पैडिंग" (padding) से भ्रमित हो जाते हैं—यह अतिरिक्त, बेकार डेटा है जिसे सब कुछ एक समान आकार का दिखाने के लिए जोड़ा जाता है (जैसे सूटकेस को भरा हुआ दिखाने के लिए उसमें खाली जगह डालना)।

  • Variable-Length FlashAttention: रोबोट को खाली जगह पढ़ने के लिए मजबूर करने के बजाय, उन्होंने इसे पैडिंग को छोड़ने और केवल वास्तविक जानकारी पर ध्यान केंद्रित करने के लिए सिखाया।
  • डेटा पैकिंग: उन्होंने कई छोटी कहानियों को एक लंबी कहानी में जोड़ने का तरीका सीखा ताकि कोई भी जगह बर्बाद न हो।
  • परिणाम: इसने प्रशिक्षण को 188% तेज़ बना दिया और कंप्यूटर मेमोरी की भारी बचत की।

द. "एसिंक्रोनस" क्रांति: "रिले रेस"

यह शायद सबसे चतुर हिस्सा है।

  • पुराना तरीका (Synchronous): कल्पना करें कि एक रिले रेस है जहाँ बैटन (baton) लेकर दौड़ने वाले को अगले धावक के पूरी तरह तैयार होने का इंतज़ार करना पड़ता है। यदि एक धावक धीमा है, तो सभी इंतज़ार करते हैं।
  • नया तरीका (RL-VLA3): उन्होंने एक Triple-Level Asynchronous सिस्टम पेश किया।
    • जबकि कंप्यूटरों का एक समूह रोबोट की गति का सिमुलेशन (Rollout) कर रहा है, दूसरा समूह मस्तिष्क को अपडेट (Training) कर रहा है, और तीसरा समूह अगला कदम जनरेट कर रहा है।
    • वे एक-दूसरे का इंतज़ार नहीं करते हैं। वे बैटन मिलते ही उसे आगे बढ़ा देते हैं।
  • परिणाम: सिस्टम 126% अधिक दक्षता के साथ चलता है क्योंकि कोई भी कंप्यूटर खाली नहीं बैठता।

3. "स्लिमिंग" डाइट: क्वांटाइजेशन (Quantization)

कभी-कभी, रोबोट का दिमाग एक छोटे डिवाइस (जैसे रोबोटिक हाथ) पर चलने के लिए बहुत भारी होता है।

  • समाधान: उन्होंने FP8 Quantization का उपयोग किया। इसे एक हाई-डेफिनिशन मूवी को बिना पिक्चर क्वालिटी खोए छोटी फ़ाइल साइज़ में कंप्रेस करने के रूप में समझें।
  • परिणाम: मॉडल 140% तेज़ हो गया और इसने कम जगह ली, जिससे इन स्मार्ट दिमागों को केवल बड़े सर्वरों तक सीमित न रखकर वास्तविक रोबोटों पर लगाना संभव हो गया।

4. बड़ी तस्वीर: यह क्यों मायने रखता है?

यह पेपर केवल रोबोट को तेज़ बनाने के बारे में नहीं है; यह रोबोट को व्यावहारिक बनाने के बारे में है।

  • पहले: केवल लाखों डॉलर वाले बड़े लैब्स ही उन्नत रोबोट को प्रशिक्षित कर सकते थे।
  • अब: यह सिस्टम साबित करता है कि सही "इंफ्रास्ट्रक्चर" के साथ, हम बड़े पैमाने पर, सस्ते और तेज़ी से रोबोट को प्रशिक्षित कर सकते हैं।

अंतिम उपमा:
यदि एम्बोडीड इंटेलिजेंस एक रोबोट बटलर (नौकर) के सपने को पूरा करना है, तो यह पेपर उन बटलर के दिमागों का बड़े पैमाने पर उत्पादन करने वाली अल्टीमेट फैक्ट्री का निर्माण है। उन्होंने एक ऐसी प्रक्रिया को लिया जो धीमी, बोझिल और महंगी थी, और उसे एक सुव्यवस्थित, हाई-स्पीड असेंबली लाइन में बदल दिया।

संक्षेप में: उन्होंने एक सुपर-फास्ट, सुपर-स्मार्ट ट्रेनिंग ग्राउंड बनाया जो रोबोट को दिनों के बजाय मिनटों में लाखों अनुभवों से सीखने की अनुमति देता है, जो हमें उस युग के करीब लाता है जहाँ रोबोट वास्तव में हमारे दैनिक जीवन में हमारी मदद कर सकें।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →