← नवीनतम पेपर
🤖 machine learning

RLDX-1 Technical Report

यह शोधपत्र RLDX-1 प्रस्तुत करता है, जो मल्टी-स्ट्रीम एक्शन ट्रांसफॉर्मर (MSAT) आर्किटेक्चर पर आधारित एक सामान्य रोबोटिक पॉलिसी है, जो विषम मोडैलिटीज़ और विशिष्ट सिस्टम डिज़ाइन्स को एकीकृत करता है ताकि जटिल, संपर्क-समृद्ध और गतिशील वास्तविक दुनिया के डेक्सट्रस मैनिपुलेशन कार्यों में मौजूदा विज़न-लैंग्वेज-एक्शन मॉडल्स से काफी बेहतर प्रदर्शन किया जा सके।

मूल लेखक: Dongyoung Kim, Huiwon Jang, Myungkyu Koo, Suhyeok Jang, Taeyoung Kim, Beomjun Kim, Byungjun Yoon, Changsung Jang, Daewon Choi, Dongsu Han, Donguk Lee, Heeseung Kwon, Hojin Jeon, Jaehyun Kang, Jaekyoun
प्रकाशित 2026-05-06
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Dongyoung Kim, Huiwon Jang, Myungkyu Koo, Suhyeok Jang, Taeyoung Kim, Beomjun Kim, Byungjun Yoon, Changsung Jang, Daewon Choi, Dongsu Han, Donguk Lee, Heeseung Kwon, Hojin Jeon, Jaehyun Kang, Jaekyoung Bae, Jihyuk Lee, Jimin Lee, John Won, Joonwoo Ahn, Junhyeong Park, Junyoung Sung, Kyungmin Lee, Minseong Han, Minsung Yoon, Sejune Joo, Seonil Son, Seungcheol Park, Seunggeun Cho, Seungjun Moon, Seungku Kim, Yonghoon Dong, Yongjin Cho, Youngchan Kim, Chang Hwan Kim, Dohyeon Kim, Hazel Lee, Heecheol Kim, Hensen Ahn, Hyungkyu Ryu, Hyunsoo Choi, Hyunsoo Shin, Jaeheon Jung, Jaewoo Kim, Jinwook Kim, Joochul Chang, Joonsoo Kim, Junghun Park, Jungwoo Park, Junho Cho, Junhyeok Park, Junwon Lee, Kangwook Lee, Kwanghoon Kim, Kyoungwhan Choe, Manoj Bhadu, Nayoung Oh, Sangjun Kim, Sangwoo Kim, Seunghoon Shim, Seunghyun Kim, Seungjun Lee, Seungyup Ka, Sungryol Yang, Wook Jung, Yashu Shukla, Yeonjae Lee, Yeonwoo Bae, Jinwoo Shin

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आपने एक ऐसा रोबोट बनाया है जो निर्देशों को पढ़ने और छवियों को देखने में अविश्वसनीय रूप से स्मार्ट है। वह जानता है कि "कप" क्या है, "डालना" (pouring) क्या होता है, और उनके बारे में धाराप्रवाह बोल सकता है। यह एक ऐसे रोबोट की तरह है जिसके पास सिद्धांत में पीएचडी है, लेकिन वास्तविक दुनिया का कोई अनुभव नहीं है। यदि आप उससे कन्वेयर बेल्ट पर चलती हुई गेंद को पकड़ने या बिना तोड़े बल्ब को घुमाने के लिए कहते हैं, तो वह जम सकता है क्योंकि वह गति (movement), स्मृति (memory), या स्पर्श (touch) को नहीं समझता।

यह कार्य RLDX-1 को प्रस्तुत करता है, जो एक नया रोबोटिक "मस्तिष्क" है जिसे इस समस्या को ठीक करने के लिए डिज़ाइन किया गया है। RLDX-1 को केवल एक बुद्धिमान पाठक के रूप में नहीं, बल्कि एक कुशल शिल्पकार (master craftsman) के रूप में देखें जो अपनी मौजूदा बुद्धिमत्ता के साथ तीन नई महाशक्तियों को जोड़ता है:

1. महाशक्तियाँ: गति, स्मृति और स्पर्श

  • गति धारणा (The "Juggler" - जादूगर):
    अधिकांश रोबोट एक स्थिर फोटो देखते हैं और अनुमान लगाते हैं कि आगे क्या करना है। लेकिन वास्तविक दुनिया चलती है। यदि कन्वेयर बेल्ट पर एक बॉक्स फिसलता है, तो एक स्थिर फोटो बेकार है। RLDX-1 एक जादूगर की तरह है जो न केवल गेंद को देखता है; वह हवा में उड़ती गेंद के पूरे वीडियो को देखता है। यह गति और दिशा को समझता है, जिससे यह उन चलती वस्तुओं को पकड़ने में सक्षम होता है जिन्हें अन्य रोबोट चूक जाते हैं।
  • दीर्घकालिक स्मृति (The "Sherlock Holmes" - शरलॉक होम्स):
    कुछ कार्यों में समय लगता है। कल्पना कीजिए कि एक 'शेल गेम' (shell game) है जहाँ एक व्यक्ति तीन कपों में से एक के नीचे पासा छिपाता है, दूर चला जाता है, और फिर रोबट को उसे खोजने के लिए कहता है। केवल "अल्पकालिक स्मृति" वाला रोबोट कपों को तो देखता है लेकिन भूल जाता है कि व्यक्ति ने किसे छुआ था। RLDX-1 क्या हुआ था, इसके बारे में एक "नोटबुक" रखता है। यह घटनाओं के क्रम को याद रखता है, जिससे यह उन पहेलियों को हल करने में सक्षम होता है जिनमें अतीत की ओर देखने की आवश्यकता होती है।
  • भौतिक संवेदन (The "Gentle Hand" - कोमल हाथ):
    देखना अच्छा है, लेकिन आप सॉकेट के अंदर नहीं देख सकते या यह महसूस नहीं कर सकते कि आप एक नाजुक अंडे पर कितना दबाव डाल रहे हैं। RLD-1 अपने सेंसरों के माध्यम से "महसूस" कर सकता है। यह अपने जोड़ों में टॉर्क (torque - घूर्णन बल) और अपनी त्वचा से टैक्टाइल (tactile - स्पर्श) संकेतों को पढ़ता है। यह एक दृष्टिहीन व्यक्ति की तरह है जो बिल्कुल बता सकता है कि प्लग सॉकेट में कब बैठा है या अंडा कब टूटने वाला है, और तुरंत अपनी पकड़ को समायोजित कर सकता है।

2. प्रशिक्षण: इसने कैसे सीखा

आप केवल रोबोट को कुछ वीडियो दिखाकर ये कौशल नहीं सिखा सकते। RLDX-1 ने एक तीन-चरणीय प्रशिक्षण शिविर से गुजरना तय किया:

  • चरण 1: सामान्यज्ञ (Pre-training - पूर्व-प्रशिक्षण): इसने विभिन्न रोबोटों (हाथों, मानव रूपी रोबोटों) को सरल चीजें करते हुए लाखों वीडियो देखे। इसने इसे दुनिया कैसे काम करती है, इसकी एक व्यापक समझ दी।
  • चरण 2: विशेषज्ञ (Mid-training - मध्य-प्रशिक्षण): यहाँ, इसने अपनी नई महाशक्तियों को सीखा। इसने विशेष रूप से "गति", "स्मृति" और "स्पर्श" के मॉड्यूल के साथ अभ्यास किया। इसे करने के लिए, शोधकर्ताओं ने एक चतुर तकनीक का उपयोग किया: उन्होंने AI वीडियो जनरेटर का उपयोग करके हजारों नए, दुर्लभ परिदृश्य बनाए (जैसे कि एक रसोई में सूप डालते हुए रोबोट जो अस्तित्व में ही नहीं है), और फिर गणित का उपयोग करके यह पता लगाया कि रोबोट को क्या करना चाहिए था। इसने उन अंतरालों को भर दिया जहाँ वास्तविक डेटा की कमी थी।
  • चरण 3: परिशोधन (Post-training - उत्तर-प्रशिक्षण): अंत में, इसने विशिष्ट वास्तविक दुनिया के कार्यों पर अभ्यास किया और अपनी गलतियों से सीखा। यदि यह कप उठाने में विफल रहा, तो इसने फिर से प्रयास किया, एक सुदृढीकरण शिक्षण (reinforcement learning) पद्धति का उपयोग करते हुए जो प्रदर्शन में सुधार के लिए तत्काल फीडबैक देने वाले कोच की तरह काम करती है।

3. गति: तेज़ मार्ग पर

भले ही सबसे स्मार्ट मस्तिष्क भी बेकार है यदि वह बहुत धीमा है। यदि एक रोबोट सोचने में 0.1 सेकंड लेता है, तो जब तक वह कार्य करता है, दुनिया बदल सकती है। यह कार्य बताता है कि RLDX-1 को मानक प्रणालियों की तुलना में 1.6 गुना तेज़ चलने के लिए अनुकूलित किया गया था।

  • उपमा: कल्पना कीजिए कि एक डिलीवरी ड्राइवर हर ट्रैफिक लाइट पर रुककर मैप चेक करता है (मानक प्रोसेसिंग)। RLDX-1 एक ऐसे ड्राइवर की तरह है जिसने पहले से ही पूरा रास्ता मैप कर लिया है, जानता है कि कौन सी लाइटें हरी होने वाली हैं, और बिना रुके चलता रहता है। यह इसे तेज़ चलती कन्वेयर बेल्ट पर भी वास्तविक समय में प्रतिक्रिया करने की अनुमति देता है।

4. परिणाम: प्रमाण परिणाम में है

शोधकर्ताओं ने अन्य शीर्ष रोबोट दिमागों (जैसे π0.5\pi0.5 और GR00T N1.6) के मुकाबले दो तरीकों से RLDX-1 का परीक्षण किया:

  • सिमुलेशन में (वीडियो गेम): RLDX-1 जटिल रसोई कार्यों और चलती वस्तुओं से जुड़ी चुनौतियों में लगातार दूसरों को हरा देता है।
  • वास्तविक दुनिया में (परीक्षण):
    • कन्वेयर बेल्ट: जब वस्तुएं तेजी से चलती थीं, तो RLDX-1 87.5% मामलों में सफल रहा, जबकि दूसरा सबसे अच्छा रोबोट लगभग 70% मामलों में विफल रहा।
    • शेल गेम: स्मृति के आधार पर छिपी हुई वस्तु को खोजने के लिए पूछे जाने पर, RLDX-1 91.7% मामलों में सही था। अन्य रोबोटों ने रैंडम अनुमान लगाया और वे केवल 30% के आसपास ही सही थे।
    • लाइटबल्ब: जब इसे बल्ब को तब तक घुमाने के लिए कहा गया जब तक कि वह जल न जाए, तो RLDX-1 ने इसे एक मानव ट्रेनर द्वारा दिखाए गए प्रयासों से कम प्रयासों में करना सीख लिया।

सारांश

RLDX-1 एक ऐसी रोबोट रणनीति है जो केवल "देखने और समझने" से आगे बढ़कर कुशल, शिल्प-समान क्रिया की ओर जाती है। गति, स्मृति, और स्पर्श के लिए विशेष मॉड्यूल के साथ एक शक्तिशाली दृश्य मस्तिष्क को जोड़कर, और वास्तविक एवं AI-जनित डेटा के विशाल मिश्रण पर प्रशिक्षित होकर, यह उन जटिल, गतिशील और नाजुक कार्यों में मानव-तुल्य क्षमता प्राप्त करता है जहाँ पहले के रोबोट संघर्ष करते थे। यह उन रोबोटों की ओर एक महत्वपूर्ण कदम है जो वास्तव में अराजक, गतिशील और स्पर्श-आधारित वास्तविक दुनिया में हमारे साथ काम कर सकते हैं।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →