← नवीनतम पेपर
🤖 machine learning

Intrinsic Robot Rewarding: Reusing VLA Representations for Autonomous Evaluation and Policy Improvement

यह शोध पत्र इंट्रिन्सिक रोबोट रिवॉर्डिंग (IRR) का प्रस्ताव देता है, जो मौजूदा विजन-लैंग्वेज-एक्शन (VLA) रिप्रजेंटेशन्स और सफल प्रदर्शन एंडपॉइंट्स का लाभ उठाकर स्वायत्त रूप से रोबोटिक परिणामों का मूल्यांकन करता है और बिना किसी अलग इवैल्यूएटर या अतिरिक्त परसेप्शन बैकबोन की आवश्यकता के पॉलिसी सुधार में मार्गदर्शन करता है।

मूल लेखक: Tobias Schaffer, Mohab Elkhayat, Daniela Nicklas, Mustafa Almohamad, Elham Al-Fuqara

प्रकाशित 2026-09-16
📖 1 मिनट में पढ़ें☕ कॉफ़ी ब्रेक में पढ़ें

मूल लेखक: Tobias Schaffer, Mohab Elkhayat, Daniela Nicklas, Mustafa Almohamad, Elham Al-Fuqara

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

तकनीकी सारांश: इंट्रिन्सिक रोबोट रिवार्डिंग (IRR)

समस्या विवरण

विज़न-लैंग्वेज-एक्शन (VLA) मॉडल, जैसे कि OpenVLA, विज़ुअल ऑब्जर्वेशन और लैंग्वेज इंस्ट्रक्शन्स को एक्शन से जोड़कर रोबोटिक मैनिपुलेशन के लिए एक आधार स्थापित कर चुके हैं। हालांकि, इन पॉलिसियों को नए औद्योगिक कार्यों के लिए अनुकूलित करने हेतु आमतौर पर अनुभव से सीखने (जैसे कि रिइन्फोर्समेंट लर्निंग के माध्यम से) के लिए बाहरी रिवॉर्ड सिग्नल्स की आवश्यकता होती है। वर्तमान दृष्टिकोण अक्सर निम्नलिखित पर निर्भर करते हैं:

  • समर्पित रिवॉर्ड फाउंडेशन मॉडल्स या अलग विज़न-लैंग्वेज इवैल्यूएटर्स।
  • अतिरिक्त परसेप्शन बैकबोन्स।
  • रिवॉर्ड सिग्नल उत्पन्न करने के लिए परिणामों का व्यापक मानव लेबलिंग।

यह अलगाव एकीकरण के प्रयास, कम्प्यूटेशनल ओवरहेड और बार-बार होने वाले मानव पर्यवेक्षण लागत को बढ़ाता है। यह शोध पत्र यह तर्क देता है कि एक VLA पाइपलाइन में पहले से उपलब्ध संसाधन—विशेष रूप से फ्रोजन विज़ुअल एनकोडर और इमिटेशन लर्निंग के लिए उपयोग किए गए सफल प्रदर्शन एंडपॉइंट्स—रोबोट के प्रदर्शन के मूल्यांकन के लिए कम उपयोग किए जा रहे हैं। मुख्य समस्या यह है कि कैसे नए मॉडल्स या महत्वपूर्ण बाहरी पर्यवेक्षण को पेश किए बिना, पॉलिसी सुधार के लिए इंट्रिन्सिक रिवार्ड्स उत्पन्न करने के लिए इन मौजूदा आंतरिक निरूपणों (internal representations) का लाभ उठाया जाए।

कार्यप्रणाली: इंट्रिन्सिक रोबोट रिवार्डिंग (IRR)

IRR एक ऐसा ढांचा प्रस्तावित करता है जहाँ रोबोट अपने उन्हीं पर्सेप्चुअल रिसोर्सेज का उपयोग करके अपने परिणामों का मूल्यांकन करता है जिनका उपयोग वह एक्शन जनरेशन के लिए करता है। यह कार्यप्रणाली चार मुख्य घटकों से बनी है:

1. टास्क-कंडीशन्ड रेफरेंस बैंक

एक अलग रिवॉर्ड मॉडल प्रशिक्षित करने के बजाय, IRR इमिटेशन लर्निंग के लिए पहले से एकत्र किए गए सफल प्रदर्शनों के एंडपॉइंट्स से एक रेफरेंस बैंक (Zg+Z^+_g) बनाता है।

  • फीचर एक्सट्रैक्शन: VLA का एक फ्रोजन चेकपॉइंट विज़ुअल एनकोडर (ϕ\phi), कैमरा ऑब्जर्वेशन्स (oto_t) से फीचर वेक्टर्स (ztz_t) निकालता है।
  • रेफरेंस कंस्ट्रक्शन: सफल प्रदर्शन ट्रेजेक्टरीज (τi\tau_i) संदर्भ एम्बेडिंग्स का एक सेट प्रदान करती हैं जो वैध टास्क आउटकम्स का प्रतिनिधित्व करती हैं। यह बैंक एक एकल विज़ुअल प्रोटोटाइप को थोपने के बजाय कई वैध आउटकम्स (जैसे, विभिन्न ऑब्जेक्ट पोसेस) को समाहित करता है।

2. सिमिलैरिटी-बेस्ड स्कोरिंग

नए रोबोट प्रयासों को उनके रेफरेंस बैंक के साथ उनकी समानता के आधार पर स्कोर किया जाता है।

  • डिस्टेंस मेट्रिक: सिस्टम वर्तमान ऑब्जर्वेशन के एम्बेडिंग और रेफरेंस बैंक में उसके kk-निकटतम पड़ोसियों के बीच औसत स्क्वेर्ड यूक्लिडियन डिस्टेंस (dgd_g) की गणना करता है।
  • स्कोरिंग फंक्शन: एक स्कोर (sgs_g) एक एक्सपोनेंशियल डिके फंक्शन का उपयोग करके प्राप्त किया जाता है, जिसे टास्क-विशिष्ट टेम्परेचर पैरामीटर (τg\tau_g) द्वारा नियंत्रित किया जाता है।
  • परसिस्टेंस: क्षणिक विज़ुअल मैच से बचने के लिए, प्रयास के बाद एक संक्षिप्त ऑब्जर्वेशन विंडो में न्यूनतम स्कोर को देखते हुए एक परसिस्टेंस स्कोर (sgperss^{pers}_g) लिया जाता है।
  • रिवॉर्ड सिग्नल: अंतिम इंट्रिन्सिक रिवॉर्ड (rTIRRr^{IRR}_T) एक बाइनरी या स्केल्ड वैल्यू है जो एपिसोड के टर्मिनल टाइम स्टेप पर लागू की जाती है।

3. रेसिडुअल RL के माध्यम से पॉलिसी सुधार

यह ढांचा एक रेसिडुअल रिइन्फोर्समेंट लर्निंग (RL) कंट्रोलर के साथ IRR को एकीकृत करता है।

  • आर्किटेक्चर: बेस पॉलिसी (π0\pi_0) इमिटेशन-ट्रेन्ड VLA है। एक रेसिडुअल पॉलिसी (πθ\pi_\theta) IRR फीडबैक के आधार पर कार्टेशियन करेक्शन (δat\delta a_t) आउटपुट करना सीखती है।
  • एग्जीक्यूशन: अंतिम एक्शन, बेस पॉलिसी के एक्शन और रेसिडुअल करेक्शन का एक बाउंडेड सम होता है। यह सिस्टम को पूरे VLA बैकबोन को तुरंत फिर से प्रशिक्षित किए बिना सुधार सीखने की अनुमति देता है।
  • लर्निंग एल्गोरिदम: स्टोकैस्टिक लर्निंग मैकेनिज्म को संभालने के लिए ऑफ-पॉलिसी एक्टर-क्रिटिक मेथड्स (जैसे, सॉफ्ट एक्टर-क्रिटिक) प्रस्तावित किए गए हैं।

4. कैलिब्रेशन और वैलिडेशन

  • पॉजिटिव-ओनली बनाम कैलिब्रेटेड: सिस्टम "पॉजिटिव-ओनली" मोड (बैंक बनाने के लिए केवल सफल प्रदर्शनों का उपयोग करना) में या निर्णय थ्रेसहोल्ड को ट्यून करने या एक छोटा रिवॉर्ड हेड प्रशिक्षित करने के लिए लेबल किए गए फेलियर्स के एक छोटे सेट का उपयोग करने वाले "कैलिब्रेटेड" मोड में काम कर सकता है।
  • स्वतंत्र ऑडिटिंग: विश्वसनीयता सुनिश्चित करने के लिए, मूल्यांकन के लिए सफलता/विफलता लेबल सिंक्रोनाइज्ड वीडियो की समीक्षा करने वाले मानव इवैल्यूएटर्स द्वारा जेनरेट किए जाते हैं, जो रिवॉर्ड जनरेशन प्रक्रिया से अलग होते हैं।

मुख्य योगदान

यह शोध पत्र निम्नलिखित विशिष्ट योगदानों को रेखांकित करता है:

  1. रिसोर्स रियूज़: एक डिज़ाइन जो क्रिया निष्पादन और परिणाम मूल्यांकन दोनों के लिए VLA के मौजूदा फ्रोजन विज़ुअल एनकोडर और प्रदर्शन डेटा का पुन: उपयोग करता है, जिससे अलग रिवॉर्ड मॉडल्स या अतिरिक्त परसेप्शन बैकबोन्स की आवश्यकता समाप्त हो जाती है।
  2. रिवॉर्ड फॉर्मुलेशन: एक टास्क-कंडीशन्ड रिवॉर्ड उत्पन्न करने के लिए एक ठोस गणितीय फॉर्मुलेशन जो सफल एंडपॉइंट्स के रेफरेंस बैंक के साथ समानता पर आधारित है।
  3. TRL 4 डेमोंस्ट्रेटर: एक COMAU Racer 3 इंडस्ट्रियल आर्म, Robotiq Hand-E ग्रिपर और OpenVLA-7B का उपयोग करके एक ऑपरेशनल प्रयोगशाला फाउंडेशन की प्रस्तुति, जो वर्तमान में क्यूब-टू-कंटेनर टास्क पर 56% टास्क सक्सेस रेट प्राप्त कर रही है।
  4. रिसर्च फ्रेमवर्क: रिप्रेजेंटेशन रियूज़, फिजिकल पॉलिसी इम्प्रूवमेंट और एफिशिएंसी गेन्स का आकलन करने के लिए रिसर्च क्वेश्चंस (RQs) और इवैल्यूएशन मेट्रिक्स का एक संरचित सेट।

वर्तमान परिणाम और प्रयोगात्मक आधार

शोध पत्र IRR लर्निंग लूप के अंतिम परिणाम रिपोर्ट नहीं करता है, क्योंकि प्रस्तावित शोध भौतिक नीति सुधार (physical policy improvement) को रिवॉर्ड फॉर्मुलेशन से जोड़ने के बारे में है। हालांकि, यह एक वैलिडेटेड बेसलाइन प्रदान करता है:

  • सिस्टम: एक थर्ड-पर्सन कैमरा और ROS कंट्रोल स्टैक के साथ COMAU Racer 3 आर्म।
  • बेसलाइन परफॉरमेंस: 50 फिजिकल ट्रायल्स (ग्रीन क्यूब को कंटेनर में रखना) के अध्ययन में, इमिटेशन-ट्रेन्ड OpenVLA-7B पॉलिसी ने 56% सक्सेस रेट (50 में से 28 ट्रायल्स) प्राप्त किया।
  • फेलियर एनालिसिस: प्राथमिक विफलता मोड (22 विफलताओं में से 8) एंड-इफेक्टर को ऑब्जेक्ट पर केंद्रित करने में विफलता थी, जिसने रेसिडुअल RL करेक्शन के लिए एक विशिष्ट लक्ष्य की पहचान की।
  • डेटा उपलब्धता: रेफरेंस बैंक के निर्माण के लिए 245 प्रदर्शन एपिसोड उपलब्ध हैं।

महत्व और दावे

यह शोध पत्र IRR को खुद का मूल्यांकन करने और खुद को सुधारने वाले औद्योगिक रोबोटों की ओर एक व्यावहारिक मार्ग के रूप में प्रस्तुत करता है। इसका महत्व तीन आयामों के इर्द-गिर्द फ्रेम किया गया है:

  1. कम एकीकरण प्रयास: मौजूदा VLA एनकोडर और प्रदर्शन डेटा का पुन: उपयोग करके, यह दृष्टिकोण अलग रिवॉर्ड फाउंडेशन मॉडल्स या अतिरिक्त परसेप्शन बैकबोन्स को प्रशिक्षित करने और बनाए रखने की जटिलता से बचता है।
  2. पर्यवेक्षण में दक्षता: इसका लक्ष्य लर्निंग फेज के दौरान आउटकम स्कोरिंग के लिए आवश्यक बार-बार होने वाले मानव प्रयास को कम करना है, क्योंकि सिस्टम आंतरिक निरूपणों के आधार पर सफलता का स्वायत्त रूप से मूल्यांकन कर सकता है।
  3. स्केलेबिलिटी: यह दृष्टिकोण नए कार्यों (नए पार्ट्स, फिक्स्चर्स या कंडीशंस) के लिए केवल नए सफल प्रदर्शनों के साथ रेफरेंस बैंक को अपडेट करके अनुकूलित होने का एक तंत्र प्रदान करता है, बिना कोर परसेप्शन मॉडल को फिर से प्रशिक्षित किए।

लेखक एक मध्यम रुख बनाए रखते हैं, यह स्वीकार करते हुए कि हालांकि सैद्धांतिक आधार और TRL 4 डेमोंस्ट्रेटर स्थापित हैं, महत्वपूर्ण अगला कदम यह अनुभवजन्य रूप से मान्य करना है कि यह इंट्रिन्सिक रिवॉर्ड सिग्नल प्रभावी रूप से फिजिकल पॉलिसी सुधार को संचालित करता है और आंतरिक मूल्यांकन की विश्वसनीयता स्वतंत्र मानव ऑडिट के अनुरूप है। यह कार्य एक पूर्णतः हल की गई समस्या की रिपोर्ट के बजाय एक पोजीशन पेपर और एक शोध दिशा के प्रस्ताव के रूप में कार्य करता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →