← नवीनतम पेपर
💻 computer science

A Heterogeneous Architecture for Robot RL Beyond GPU-Dominant Paradigms

यह शोध पत्र UniLab को प्रस्तुत करता है, जो एक हेट्रोजेनियस (heterogeneous) CPU-सिमुलेशन और GPU-लर्निंग आर्किटेक्चर है जो भौतिकी (physics) को पॉलिसी अपडेट से अलग करता है ताकि 3–10× तेज़ एंड-टू-एंड ट्रेनिंग दक्षता प्राप्त की जा सके और NVIDIA CUDA पर निर्भरता कम की जा सके तथा क्रॉस-प्लेटफ़ॉर्म रोबोट RL ट्रेनिंग को सक्षम बनाया जा सके।

मूल लेखक: Yufei Jia, Zhanxiang Cao, Mingrui Yu, Heng Zhang, Shenyu Chen, Dixuan Jiang, Meng Li, Xiaofan Li, Yiyang Liu, Junzhe Wu, Zheng Li, XiLin Fang, Tingyu Cui, Shengcheng Fu, Haoyang Li, Anqi Wang, Zifan W
प्रकाशित 2026-05-29
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Yufei Jia, Zhanxiang Cao, Mingrui Yu, Heng Zhang, Shenyu Chen, Dixuan Jiang, Meng Li, Xiaofan Li, Yiyang Liu, Junzhe Wu, Zheng Li, XiLin Fang, Tingyu Cui, Shengcheng Fu, Haoyang Li, Anqi Wang, Zifan Wang, Dongjie Zhu, Chenyu Cao, Zhenbiao Huang, Ziang Zheng, Jie Lu, Xin Ma, Zhengyang Wei, Xiang Zhao, Tianyue Zhan, Ye He, Yuxiang Chen, Yizhou Jiang, Yue Li, Haizhou Ge, Yuhang Dong, Fan Jia, Ziheng Zhang, Meng Zhang, Xiwa Deng, Zhixing Chen, Hanyang Shao, Chenxin Dong, Yixuan Li, Yizhi Chen, Bokui Chen, Kaifeng Zhang, Hanqing Cui, Yusen Qin, Ruqi Huang, Lei Han, Tiancai Wang, Xiang Li, Yue Gao, Guyue Zhou

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। ✨ नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

यहाँ UniLab पेपर का विवरण दिया गया है, जिसे सरल अवधारणाओं और रोज़मर्रा के उदाहरणों के माध्यम से समझाया गया है।

मुख्य विचार: "केवल GPU" की आदत को तोड़ना

कल्पना कीजिए कि आप एक रोबोट को चलना, नाचना या कप उठाना सिखाने की कोशिश कर रहे हैं। इसे कुशलता से करने के लिए, आपको एक कंप्यूटर की आवश्यकता है जो एक ही समय में दो मुख्य काम चला सके:

  1. सिमुलेटर (दुनिया): यह रोबोट की हज़ारों आभासी कॉपियाँ बनाता है, उन्हें गिरते हुए, उठते हुए और फिर से प्रयास करते हुए दिखाता है। यह भारी, भौतिकी (physics) पर आधारित काम है।
  2. शिक्षक (मस्तिष्क): यह रोबोट को देखता है, उनकी गलतियों से सीखता है, और "मस्तिष्क" (पॉलिसी) को अपडेट करता है ताकि अगले बैच के रोबोट बेहतर प्रदर्शन कर सकें।

पुराना तरीका (GPU-प्रधान प्रतिमान):
पिछले कुछ वर्षों से, उद्योग का मानक यह रहा है कि इन दोनों कामों को एक ही, सुपर-फास्ट ग्राफिक्स कार्ड (GPU) पर चलाने के लिए मजबूर किया जाए। यह एक अकेले, अविश्वसनीय रूप से तेज़ शेफ (रसोइया) को सब कुछ करने के लिए नियुक्त करने जैसा है: सब्जियां काटना, स्टेक पकाना, खाना प्लेट में सजाना और बर्तन धोना।

  • फायदे: जब शेफ अपनी लय में होता है, तो यह बहुत तेज़ होता है।
  • नुकसान: यदि काटना (फिजिक्स सिमुलेशन) बहुत जटिल या अव्यवज़ित हो जाता है, तो शेफ अभिभूत (overwhelmed) हो जाता है। साथ ही, आप एक बहुत ही विशिष्ट, महंगे प्रकार के शेफ (NVIDIA GPU) को खरीदने के लिए मजबूर होते हैं और किसी और का उपयोग नहीं कर सकते।

UniLab समाधान (एक विषम दृष्टिकोण - Heterogeneous Approach):
इस पेपर के लेखकों का कहना है, "ठहरिए। शेफ को सब्जियां काटने और खाना पकाने, दोनों का काम क्यों करना चाहिए?"
उन्होंने UniLab बनाया, एक ऐसा सिस्टम जो काम को इस आधार पर विभाजित करता है कि कौन किस काम में सबसे अच्छा है:

  • CPU (काटने वाली टीम): वे भौतिकी सिमुलेशन चलाने के लिए मानक कंप्यूटर प्रोसेसर (CPUs) का उपयोग करते हैं। CPU एक साथ कई सरल कार्य करने में माहिर होते हैं (जैसे एक साथ 1,000 सब्जियां काटना)।
  • GPU (पकाने वाली टीम): वे ग्राफिक्स कार्ड का उपयोग केवल "पकाने" के हिस्से के लिए करते हैं—डेटा से सीखना और रोबोट के मस्तिष्क को अपडेट करना।
  • रनटाइम (वेटर): उन्होंने एक विशेष "वेटर" सिस्टम बनाया जो बिना किसी देरी के CPU टीम से कटे हुए सब्जियों को GPU शेफ तक तुरंत पहुँचा देता है।

मुख्य दावे और परिणाम

1. यह तेज़ है (3x से 10x की गति वृद्धि)
पेपर का दावा है कि काम को इस तरह विभाजित करके, वे पुराने "सभी-ऑन-GPU" तरीकों की तुलना में रोबोट को 3 से 10 गुना तेज़ी से प्रशिक्षित कर सकते हैं, और वह भी बिल्कुल उसी कंप्यूटर हार्डवेयर का उपयोग करके।

  • उदाहरण: यह यह समझने जैसा है कि जबकि एक सुपर-फास्ट शेफ महान है, लेकिन 10 साधारण लाइन कुक्स (CPUs) की एक टीम जो सब्जियां काट रही है और एक मास्टर शेफ (GPU) जो डिश को सजा रहा है, रात का खाना बहुत तेज़ी से परोस सकता है।

2. यह विभिन्न हार्डवेयर पर काम करता है (केवल NVIDIA ही नहीं)
चूंकि उन्होंने सिमुलेशन को सीखने से अलग कर दिया है, इसलिए UniLab को इससे फर्क नहीं पड़ता कि आप NVIDIA कार्ड का उपयोग कर रहे हैं, AMD कार्ड का, Intel चिप का, या यहाँ तक कि Apple Mac कंप्यूटर का।

  • उदाहरण: पुराना सिस्टम एक ऐसे रेस्तरां की तरह था जो केवल एक विशिष्ट बैंक से ही नकद स्वीकार करता था। UniLab एक ऐसे रेस्तरां की तरह है जो कैश, क्रेडिट कार्ड, Apple Pay और क्रिप्टो सभी स्वीकार करता है। आप उच्च-स्तरीय गेमिंग रिग के बजाय एक Mac लैपटॉप या एक मानक ऑफिस पीसी पर भी ट्रेनिंग चला सकते हैं।

3. यह "अव्यवस्थित" भौतिकी (Messy Physics) को बेहतर ढंग से संभालता है
कुछ रोबोटिक कार्यों में जटिल अंतःक्रियाएं शामिल होती हैं, जैसे कि एक हाथ द्वारा फिसलन भरी वस्तु को उठाना या एक रोबोट का ऊबड़-खाबड़ इलाके पर चलना। ये "अव्यवस्थित" भौतिकी की समस्याएं हैं जिन्हें GPU कुशलता से सिम्युलेट करने में कठिनाई होती है।

  • उदाहरण: GPU एक हाई-स्पीड असेंबली लाइन की तरह हैं जो चिकने, अनुमानित कार्यों के लिए एकदम सही काम करती है। लेकिन यदि कार्य अव्यवस्थित है (जैसे गीले साबुन के साथ करतब दिखाना), तो असेंबली लाइन जाम हो जाती है। UniLab में CPU टीम उस अव्यवस्था को संभालने में बेहतर है, जबकि GPU टीम रणनीति सीखने पर ध्यान केंद्रित करती है।

उन्होंने वास्तव में क्या टेस्ट किया

लेखकों ने इस सिस्टम का परीक्षण कई रोबोट परिदृश्यों पर किया:

  • चलने वाले रोबोट: समतल जमीन और ऊबड़-खाबड़ इलाके पर चलने वाले क्वाड्रुपेड्स (कुत्तों जैसे) और ह्यूमनॉइड्स (इंसानों जैसे)।
  • कुशल हाथ (Dexterous Hands): रोबोट जो अपनी हथेली के अंदर वस्तुओं (जैसे गेंद या सिलेंडर) को घुमाने के लिए जटिल हाथों का उपयोग करते हैं।
  • विभिन्न एल्गोरिदम: उन्होंने साबित किया कि यह विभिन्न लर्निंग मेथड्स (PPO, SAC, TD3, आदि) के साथ काम करता है।

उन्होंने क्या दावा नहीं किया

  • उन्होंने यह दावा नहीं किया कि रोबोट को प्रशिक्षित करने का यही एकमात्र तरीका है। यदि आपके पास सैकड़ों GPU वाला एक विशाल सुपरकंप्यूटर है, तो पुराना "ऑल-ऑन-जीपीयू" तरीका अभी भी ठीक हो सकता है।
  • उन्होंने यह दावा नहीं किया कि यह हर प्रकार के सिमुलेशन के लिए काम करता है। उन्होंने अपना ध्यान "रिजिड बॉडी" रोबोट (ठोस धातु के पुर्जों वाले) पर केंद्रित किया। उन्होंने सॉफ्ट, स्पंजी रोबोट या तरल पदार्थों (fluids) का परीक्षण नहीं किया।
  • उन्होंने यह दावा नहीं किया कि यह एक नया "लर्निंग एल्गोरिदम" है। उन्होंने रोबोट के सीखने का नया तरीका नहीं बनाया; उन्होंने उन कंप्यूटरों को व्यवस्थित करने का एक नया तरीका बनाया जो यह सीखना करते हैं।

निष्कर्ष (The Bottom Line)

यह पेपर तर्क देता है कि यह विश्वास कि "हमें तेज़ होने के लिए भौतिकी सिमुलेशन को GPU पर रखना ही होगा" एक मिथक है। सिमुलेशन के लिए CPU और सीखने के लिए GPU के मिश्रण का उपयोग करके, और उन्हें एक स्मार्ट डेटा सिस्टम के साथ जोड़कर, आप रोबोट को बहुत तेज़ी से और कंप्यूटरों की एक विस्तृत श्रृंखला पर प्रशिक्षित कर सकते हैं। यह "एक सुपर-वर्कर द्वारा सब कुछ करने" से बदलकर "एक विशेषज्ञ टीम के मिलकर काम करने" की ओर एक बदलाव है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →