← नवीनतम पेपर
💻 computer science

Object-Centric Residual RL for Zero-Shot Sim-to-Real VLA Enhancement

यह शोध पत्र एक ऑब्जेक्ट-सेंट्रिक रेसिडुअल रिइन्फोर्समेंट लर्निंग फ्रेमवर्क प्रस्तावित करता है जो ज़ीरो-शॉट सिम-टू-रियल ट्रांसफर प्राप्त करने के लिए ऑब्जेक्ट पोज़ और एक सिम्युलेटेड VLA काउंटरपार्ट का उपयोग करके विशुद्ध रूप से सिमुलेशन में एक सुधारात्मक नीति (corrective policy) को प्रशिक्षित करता है, जिससे बिना किसी अतिरिक्त टेलीऑपरेशन डेटा की आवश्यकता के वास्तविक दुनिया के मैनिपुलेशन कार्यों पर विजन-लैंग्वेज-एक्शन मॉडल्स की सफलता दर में महत्वपूर्ण वृद्धि होती है।

मूल लेखक: Kinam Kim, Namiko Saito, Heecheol Kim, Katsushi Ikeuchi, Jaegul Choo, Yasuyuki Matsushita

प्रकाशित 2026-06-19
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Kinam Kim, Namiko Saito, Heecheol Kim, Katsushi Ikeuchi, Jaegul Choo, Yasuyuki Matsushita

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। ✨ नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आपके पास एक बहुत ही बुद्धिमान, जानकार रोबोट सहायक (जिसे VLA कहा जाता है) है। इस सहायक ने लाखों किताबें पढ़ी हैं और लोगों को काम करते हुए हजारों वीडियो देखे हैं, इसलिए वह लगभग किसी भी स्थिति में क्या करना है, यह जानता है। हालांकि, जब आप इसे वास्तविक दुनिया में अपने भौतिक हाथों से कुछ करने के लिए कहते हैं, तो यह अक्सर अनाड़ी हो जाता है। यह एक कप को कुछ मिलीमीटर की दूरी से चूक सकता है, या दराज को बहुत जोर से धकेल सकता है। क्योंकि यह नकल करके सीखता है (इमिटेशन लर्निंग), छोटी गलतियाँ जमा होती जाती हैं और कार्य विफल हो जाता है।

शोधकर्ताओं ने पूछा: "क्या हम इस रोबोट को अधिक सटीक बनाना सीख सकते हैं बिना इसे किसी खतरनाक वास्तविक दुनिया के प्रशिक्षण शिविर में भेजे?"

उनका उत्तर एक विधि है जिसे Object-Centric Residual RL कहा जाता है। यह कैसे काम करता है, यहाँ सरल अवधारणाओं में दिया गया है:

1. समस्या: प्रशिक्षण का "अनकैनी वैली" (Uncanny Valley)

आमतौर पर, रोबोट को बेहतर बनाने के लिए, आपको या तो:

  • इसे एक वीडियो गेम में प्रशिक्षित करना होता है (सिमुलेशन): लेकिन रोबोट भ्रमित हो जाता है जब वह वास्तविक दुनिया को देखता है क्योंकि लाइटिंग और बनावट (textures) अलग दिखती हैं (जैसे कि वीआर चश्मा पहनना जो दुनिया को नकली दिखाता है)।
  • इसे वास्तविक दुनिया में प्रशिक्षित करना होता है: यह धीमा, महंगा और जोखिम भरा है। यदि रोबोट गलत सीखता है, तो यह कुछ तोड़ सकता है या खुद को चोट पहुँचा सकता है।

2. समाधान: "को-पायलट" सिस्टम

लेखकों ने एक ऐसा सिस्टम बनाया है जिसमें दो भाग मिलकर काम करते हैं:

  • कप्तान (द बेस VLA): यह बुद्धिमान, पूर्व-प्रशिक्षित रोबोट मस्तिष्क है। यह सामान्य योजना जानता है (जैसे, "कप उठाओ")। यह स्थिर रहता है और इस प्रक्रिया के दौरान बदलता नहीं है।
  • को-पायलट (द रेसिडुअल पॉलिसी): यह एक छोटा, सुपर-फास्ट "सुधार" मस्तिष्क है। इसका एकमात्र काम कप्तान की योजना को देखना और कहना है, "रुको, तुम थोड़ा बाईं ओर निशाना साध रहे हो; इसे थोड़ा दाईं ओर धकेलो।"

3. गुप्त नुस्खा: "ऑब्जेक्ट-सेंट्रिक" आँखें

बड़ी सफलता यह है कि को-पायलट क्या देखता है।

  • पुराने तरीकों ने पूरे कैमरा इमेज (पिक्सेल) को देखने की कोशिश की। यह कठिन है क्योंकि एक वास्तविक रसोई एक सिम्युलेटेड रसोई से अलग दिखती है।
  • यह विधि पृष्ठभूमि (background) को अनदेखा करती है। इसके बजाय, को-पायलट केवल वस्तुओं के गणितीय निर्देशांक (mathematical coordinates) को देखता है (जैसे, "कप X, Y, Z पर है")।

उपमा: कल्पना कीजिए कि आप एक लक्ष्य को हिट करने की कोशिश कर रहे हैं।

  • इमेज-आधारित प्रशिक्षण धूप का चश्मा पहनने जैसा है जो हर बार बाहर निकलने पर अपना रंग बदल देता है। आप भ्रमित हो जाते हैं।
  • ऑब्जेक्ट-सेंट्रिक प्रशिक्षण एक लेजर पॉइंटर जैसा है जो आपको बताता है कि लक्ष्य कहाँ है, चाहे मौसम या रोशनी कैसी भी हो। "लेजर" (वस्तु की स्थिति) वीडियो गेम और वास्तविक जीवन दोनों में एक समान होती है।

4. उन्होंने इसे कैसे प्रशिक्षित किया (द "घोस्ट" प्रैक्टिस)

यह सुनिश्चित करने के लिए कि को-पायलट वास्तविक दुनिया में काम करे, बिना कभी वास्तविक दुनिया को देखे, उन्होंने कुछ चतुर किया:

  1. उन्होंने वास्तविक रोबोट को प्रशिक्षित करने के लिए उपयोग किए गए ठीक वही मानव प्रदर्शन (demonstrations) लिए।
  2. उन्होंने उन सटीक मूव्स को एक वीडियो गेम (सिमुलेशन) के अंदर चलाया ताकि एक "सिम-रोबोट" को प्रशिक्षित किया जा सके।
  3. उन्होंने को-पायलट को वीडियो गेम के भीतर सिम-रोबोट की गलतियों को सुधारने के लिए प्रशिक्षित किया।
  4. क्योंकि को-पायलट केवल "लेजर निर्देशांकों" (ऑब्जेक्ट पोसेस) को देखता है और पृष्ठभूमि की तस्वीरों को नहीं, इसलिए उसे इस बात से फर्क नहीं पड़ता कि वह गेम में है या वास्तविक जीवन में। वह बस जानता है: "कप यहाँ है, हाथ वहाँ ले जाओ।"

उन्होंने प्रशिक्षण के दौरान "नॉइज़" (noise) भी जोड़ा (जैसे निर्देशांकों को थोड़ा हिलाना) ताकि को-पायलट को सख्त बनाया जा सके, भले ही सेंसर परफेक्ट न हों।

5. परिणाम: ज़ीरो-शॉट सफलता

"ज़ीरो-शॉट" का अर्थ है कि उन्होंने प्रशिक्षित को-पायलट को वास्तविक रोबोट पर बिना किसी अतिरिक्त प्रशिक्षण या वास्तविक रोबोट पर परीक्षण के लगाया।

  • पहले: रोबोट (जैसे क्यूब्स को स्टैक करना या दराज बंद करना) कार्यों में केवल 42% बार सफल होता था।
  • बाद में: को-पायलट की मदद से, सफलता बढ़कर 76% हो गई।

को-पायलट एक सुरक्षा जाल की तरह काम करता है, जो कप्तान को तब पकड़ लेता है जब वह अपने रास्ते से भटकने लगता है।

6. बोनस: रोबोट अपने आप स्मार्ट होता जाता है

पेपर यह भी दिखाता है कि एक बार जब रोबोट को को-पायलट के साथ सफलतापूर्वक कार्य करने लगता है, तो आप उन सफल प्रयासों को रिकॉर्ड कर सकते हैं और उन्हें "कप्तान" (मुख्य मस्तिष्क) को फिर से प्रशिक्षित करने के लिए उपयोग कर सकते हैं। यह एक चक्र बनाता है जहाँ रोबोट बिना किसी इंसान के हाथ पकड़े खुद को बेहतर बनाने के लिए खुद को सिखाता है।

सारांश

शोधकर्ताओं ने रोबोट के दिमाग के लिए एक यूनिवर्सल करेक्शन टूल बनाया है। रोबोट को दुनिया को पूरी तरह से देखना सिखाने के बजाय, उन्होंने उसे केवल वस्तुओं की गणितीय स्थिति पर ध्यान केंद्रित करना सिखाया। यह संभव बनाता है कि वीडियो गेम में प्रशिक्षित एक रोबोट वास्तविक दुनिया में रखे जाने पर तुरंत बहुत अधिक सटीक हो जाए, और वास्तविक समय में अपनी गलतियों को सुधार सके।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →