← नवीनतम पेपर
💻 computer science

RL Bootstrapping of OpenVLA-OFT for a Novel Robot Embodiment

यह शोध पत्र प्रदर्शित करता है कि सुदृढीकरण शिक्षण (reinforcement learning) बिना किसी एम्बॉडिमेंट-विशिष्ट प्रदर्शन डेटा के, एक नवीन केबल-ड्रिवन पैरेलल रोबोट के लिए प्रीट्रेंड OpenVLA-OFT पॉलिसी को सफलतापूर्वक बूटस्ट्रैप कर सकता है, जो दो-चरणीय PPO और GRPO प्रशिक्षण प्रक्रिया के माध्यम से बेहतर दिशात्मक गति और ऑब्जेक्ट-टारगेटिंग क्षमताओं को प्राप्त करता है।

मूल लेखक: Damir Nurtdinov, Alexei Kornaev, Alexander Maloletov

प्रकाशित 2026-08-04
📖 7 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Damir Nurtdinov, Alexei Kornaev, Alexander Maloletov

मूल पेपर CC0 1.0 (http://creativecommons.org/publicdomain/zero/1.0/) के तहत सार्वजनिक डोमेन को समर्पित है। ✨ नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक बहुत ही बुद्धिमान रोबोट को अपने हाथ हिलाना सिखाने की कोशिश कर रहे हैं। आमतौर पर, रोबोट को यह सिखाने का सबसे अच्छा तरीका यह है कि पहले उसे किसी इंसान को वह काम करते हुए दिखाने वाला एक वीडियो दिखाया जाए, जैसे एक डांस टीचर अपने छात्र को स्टेप्स दिखाता है। इसे "डेमोंस्ट्रेशन" (प्रदर्शन) कहा जाता है, और यह तब बहुत अच्छा काम करता है जब रोबोट इंसान जैसा दिखता हो या उसके पास मानक हाथ हों। लेकिन क्या होता है अगर आपके पास एक बिल्कुल नया, अजीब सा रोबोट हो जो किसी भी ट्रेनिंग वीडियो से मेल नहीं खाता? जैसे कि, मान लीजिए कि वह धागों से लटका हुआ एक विशाल तैरता हुआ प्लेटफॉर्म है, या उसके पास हाथ के बजाय एक छोटा, साधारण ग्रिपर है। यदि आप इसे पुराने तरीके से सिखाने की कोशिश करते हैं, तो आप फंस जाएंगे क्योंकि आपके पास इस विशिष्ट रोबट को कुछ भी करते हुए दिखाने वाले कोई वीडियो नहीं हैं। यह वह पहेली है जिसका सामना शोधकर्ता कर रहे हैं: आप एक रोबोट को भाषा समझने और सही ढंग से हिलने-डुलने के लिए कैसे तैयार कर सकते हैं जब वह एक पूरी तरह से नया प्रकार का मशीन हो जिसके पास कोई पिछला अनुभव न हो?

यह शोध पत्र ठीक इसी समस्या को संबोधित करता है। शोधकर्ताओं ने एक शक्तिशाली, प्री-ट्रेंड रोबोट मस्तिष्क (एक मॉडल जिसे OpenVLA-OFT कहा जाता है, जो पहले से ही बात करना और देखना जानता है) को लिया और इसे एक बहुत ही अजीब केबल-ड्रिवन रोबोट को नियंत्रित करने के लिए सिखाने की कोशिश की। ट्विस्ट यह था? उन्होंने इसे चलते हुए एक भी वीडियो नहीं दिखाया। इसके बजाय, उन्होंने रोबोट को एक वीडियो गेम सिमुलेशन के अंदर रखा और एक अलग प्रकार की शिक्षण पद्धति का उपयोग किया जिसे "रीइन्फोर्समेंट लर्निंग" (Reinforcement Learning) कहा जाता है। इसे एक ऐसे वीडियो गेम की तरह समझें जिसमें आपके पास कोई वॉकथ्रू या मैप नहीं है; आपको बस लक्ष्य के करीब पहुँचने के लिए अंक प्राप्त करके यह समझना होगा कि कैसे हिलना है। शोधकर्ताओं ने पाया कि इस "प्रयास और त्रुटि" (trial and error) विधि के साथ एक विशेष स्कोरिंग सिस्टम का उपयोग करके, वे रोबोट को बिना किसी इंसान को पहले देखे, "बाएं जाओ" या "सेब के पास जाओ" जैसे आदेशों को सुनने और सही ढंग से हिलने के काबिल बना सकते हैं।

स्ट्रिंग-ड्रिवन रोबोट की कहानी

इस कहानी के रोबोट से मिलिए: यह एक केबल-ड्रिवन पैरेलल रोबोट (CDPR) है। कल्पना कीजिए कि एक कैमरा या उपकरण हवा में लटका हुआ है, जिसे कई धागों (केबल्स) द्वारा ऊपर से पकड़ा गया है जो उसे अलग-अलग दिशाओं में खींचते हैं। यह जोड़ों वाला कोई मानक रोबोटिक हाथ नहीं है; यह तनाव (tension) द्वारा नियंत्रित एक तैरता हुआ प्लेटफॉर्म है। शोधकर्ता इस तैरते हुए प्लेटफॉर्म को आवाज के आदेशों को सुनने और इधर-उधर घूमने के लिए सिखाना चाहते थे, लेकिन उनके सामने एक बड़ी बाधा थी: रोबोट का "शरीर" पूरी तरह से नया था, और उनके पास इसके हिलने-डुलने का कोई भी वीडियो मौजूद नहीं था।

आमतौर पर, रोबोट को सिखाने के लिए, आपको एक "डेमोंस्ट्रेशन डेटासेट" की आवश्यकता होती है। आप एक इंसान (या एक आदर्श रोबोट) को वह कार्य 100 बार करते हुए रिकॉर्ड करते हैं, और नया रोबोट उन चालों की नकल करता है। लेकिन इस अजीब स्ट्रिंग-रोबोट के लिए, ऐसे कोई वीडियो मौजूद नहीं थे। इसलिए, शोधकर्ताओं ने पूछा: क्या हम वीडियो को पूरी तरह से छोड़ सकते हैं और केवल एक वीडियो गेम का उपयोग करके रोबोट को सिखा सकते हैं?

दो-चरणीय प्रशिक्षण खेल

इसका उत्तर देने के लिए, उन्होंने एक कंप्यूटर सिमुलेशन (एक आभासी दुनिया जो भौतिकी की नकल करती है) में एक प्रशिक्षण शिविर आयोजित किया। उन्होंने दो-चरणीय प्रक्रिया का उपयोग किया, जैसे कि वीडियो गेम में लेवल अप करना।

लेवल 1: दिशात्मक अभ्यास (PPO)
सबसे पहले, उन्होंने सरल कमांड का उपयोग करके रोबोट को बुनियादी हलचल सिखाई: "बाएं चलें," "दाएं चलें," "आगे चलें," और "पीछे चलें।" उन्होंने PPO (प्रॉक्सिमल पॉलिसी ऑप्टिमाइजेशन) नामक एक एल्गोरिदम का उपयोग किया। गेम में, जब भी रोबोट लक्ष्य दिशा के करीब पहुँचता, उसे अंक (रिवॉर्ड्स) मिलते। यह केवल पास या फेल होने वाला खेल नहीं था; यह एक "प्रगति" का खेल था। यदि रोबोट थोड़ा सा भी बाईं ओर बढ़ता, तो उसे एक छोटा रिवॉर्ड मिलता। इससे रोबोट ने यह समझना शुरू किया कि उसके अनूठे स्ट्रिंग-पुलिंग मैकेनिज्म वास्तव में कैसे काम करते हैं।

Level 2: वस्तु की खोज (GRPO)
एक बार जब रोबोट को दिशाओं में हिलने का अंदाज़ा हो गया, तो उन्होंने खेल का स्तर बढ़ा दिया। उन्होंने GRPO नामक एक नया एल्गोरिदम पेश किया और कमांड का एक नया सेट जोड़ा: " [वस्तु] की ओर बढ़ें।" उन्होंने आभासी दुनिया में आठ अलग-अलग चीजें बिखेर दीं—सेब, बेसबॉल, कटोरा, कप, मग, आड़ू, नाशपाती और प्लेट। अब, रोबोट को न केवल यह समझना था कि कैसे हिलना है, बल्कि यह भी कि किस चीज़ की ओर बढ़ना है।

परिणाम: सफलता और लड़खड़ाहट का मिश्रण

परिणाम उत्साहजनक थे, लेकिन पूर्ण नहीं। यहाँ आंकड़े क्या कहते हैं:

  • दिशात्मक चालें: पहले प्रशिक्षण चरण (PPO) के बाद, रोबोट सही दिशा में लगभग 34.25% बार सफल रहा। दूसरे चरण (GRPO जोड़ने) के बाद, वह संख्या बढ़कर 53.50% हो गई।
    • सबसे बड़ा सुधार "बाएं चलें" (17.00% से 52.00% तक जाना) और "पीछे चलें" (15.00% से 48.00% तक जाना) पर हुआ।
    • "आगे चलें" पहले से ही 62.00% पर अच्छा प्रदर्शन कर रहा था और वहीं बना रहा।
  • वस्तु की खोज: जब किसी विशिष्ट वस्तु (जैसे "सेब की ओर बढ़ें") को खोजने के लिए कहा गया, तो रोबोट 9.75% प्रयासों (400 में से 39 कोशिशों) में सफल रहा।

हालांकि 9.75% सुनने में कम लग सकता है, लेकिन शोधकर्ताओं ने एक महत्वपूर्ण बात गौर की। कई असफल प्रयासों में, रोबोट ने वास्तव में शुरुआत में सही काम किया था: उसने सेब की पहचान की और उसकी ओर बढ़ना शुरू किया। बस अंत में वह थोड़ा डगमगा गया और टकरा गया। इससे पता चलता है कि रोबोट ने कमांड और वस्तु को समझ लिया था, लेकिन उसे काम को सुचारू रूप से पूरा करने के लिए अभी और अभ्यास की आवश्यकता है।

यह क्यों महत्वपूर्ण है (और यह क्या नहीं है)

यह शोध पत्र एक बड़ी बात है क्योंकि यह साबित करता है कि आप बिना किसी मानव प्रदर्शन (human demonstration) के, केवल सिमुलेशन और रिवॉर्ड्स का उपयोग करके शून्य से एक रोबोट कंट्रोलर तैयार कर सकते हैं। यह एक कुत्ते को गेंद लाने के लिए दूसरे कुत्ते का वीडियो दिखाने के बजाय, उसे गेंद के करीब जाने पर ट्रीट (इनाम) देकर सिखाने जैसा है।

हालाँकि, लेखक बहुत सावधान हैं कि वे इसे एक "हल की गई" (solved) समस्या न कहें। वे स्पष्ट रूप से कहते हैं कि यह अभी भी केवल एक सिमुलेशन है। रोबोट अभी भी मजबूत (robust) नहीं है; यह अक्सर विफल होता है, खासकर विशिष्ट वस्तुओं को पकड़ने की कोशिश करते समय। वे यह दावा नहीं कर रहे हैं कि यह सभी रोबोटों के लिए अंतिम समाधान है। इसके बजाय, वे सुझाव देते हैं कि यह एक उपयोगी पहला कदम है।

विचार यह है कि यह "RL-only" विधि एक रोबोट को उस बिंदु तक पहुँचा सकती है जहाँ वह अपने नए शरीर की बुनियादी बातों को समझ सके। एक बार जब उसके पास वह आधार बन जाता है, तो शोधकर्ता वास्तविक दुनिया के कुछ वीडियो एकत्र करके उसे फाइन-ट्यून कर सकते हैं, जिससे यह पूरी प्रक्रिया शून्य से शुरू करने की तुलना में बहुत सस्ती और तेज़ हो जाती है।

संक्षेप में, यह पेपर दिखाता है कि एक बिल्कुल नए, अजीब रोबोट के लिए, आपको शुरुआत करने के लिए वीडियो की लाइब्रेरी की आवश्यकता नहीं है। आप एक वीडियो गेम में एक चतुर स्कोरिंग सिस्टम का उपयोग करके उसे बारीकियां सिखा सकते हैं, जिससे "जीरो-डेमो" की स्थिति को "पहली कोशिश" की सफलता में बदला जा सकता है। यह अभी एक परफेक्ट रोबोट नहीं है, लेकिन यह एक ऐसा रोबोट है जो आखिरकार सुनना शुरू कर सकता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →