Closing the Lab-to-Store Gap: A Data-Efficient Post-Training and Experience-Driven Learning VLA Framework for Retail Humanoids
यह शोध पत्र DEED को प्रस्तुत करता है, जो एक सिस्टम-स्तरीय ढांचा है जो डेटा-कुशल पोस्ट-ट्रेनिंग, अनुभव-संचालित परिशोधन और लेटेंट-स्पेस विश्लेषण को जोड़कर ह्यूमनॉइड रोबोटों के लिए लैब बेंचमार्क और वास्तविक दुनिया के रिटेल ऑपरेशन्स के बीच के अंतर को पाटता है, ताकि न्यूनतम कंप्यूटेशनल संसाधनों का उपयोग करके चिप-रीस्टॉकिंग कार्य पर सुदृढ़ प्रदर्शन प्राप्त किया जा सके।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आप एक रोबोट को कोई काम सिखाने की कोशिश कर रहे हैं, जैसे कपड़े तह करना या शेल्फ पर सामान रखना। आप सोच सकते हैं कि सबसे कठिन हिस्सा रोबोट का मस्तिष्क बनाना है ताकि वह दुनिया को "देख" और "समझ" सके। लेकिन रोबletिक्स की दुनिया में, एक आदर्श, नियंत्रित प्रयोगशाला और एक वास्तविक, अस्त-व्यस्त दुकान के बीच एक पेचीदा अंतर होता है। लैब में, रोबोट अक्सर जीनियस की तरह दिखते हैं, लेकिन उन्हें दरवाजे से बाहर कदम रखते ही, वे किसी कालीन से टकरा सकते हैं या कोई वस्तु गिरा सकते हैं क्योंकि रोशनी बदल गई या कोई डिब्बा थोड़ा टेढ़ा हो गया।
इस अंतर को पाटने के लिए, वैज्ञानिक विजन-लैंग्वेज-एक्शन (VLA) मॉडल नामक चीज़ का उपयोग करते हैं। एक VLA को एक सुपर-स्मार्ट रोबोट मस्तिष्क के रूप में समझें जिसने पूरा इंटरनेट पढ़ लिया है। वह जानता है कि "चिप्स का पैकेट" कैसा दिखता है, वह वाक्य "इसे शेल्फ पर रखें" को समझता है, और वह इसे करने के लिए अपने हाथों को कैसे हिलाना है, यह भी जानता है। ये मॉडल शक्तिशाली हैं, लेकिन वे उन छात्रों की तरह हैं जिन्होंने केवल पाठ्यपुस्तकों से पढ़ाई की है। उन्होंने वास्तव में वास्तविक दुनिया में होमवर्क नहीं किया है। जब चीजें योजना के अनुसार नहीं होती हैं, तो वे संघर्ष करते हैं, और चालू होने के बाद वे अपनी गलतियों से सीख नहीं सकते। बड़ा सवाल जो शोधकर्ता पूछ रहे हैं वह यह है: हम इन प्रतिभाशाली लेकिन अनुभवहीन रोबोट मस्तिष्क को बिना करोड़ों डॉलर के सुपरकंप्यूटर की आवश्यकता के, भरोसेमंद कार्यकर्ता में कैसे बदल सकते हैं?
यह पेपर ठीक इसी समस्या को हल करने के लिए DEED (डेटा-एफिशिएंट पोस्ट-ट्रेनिंग एंड एक्सपीरियंस-ड्रिवन लर्निंग) नामक एक नई विधि पेश करता है। शोधकर्ताओं ने अपने विचार का परीक्षण एक Unitree G1-Edu रोबोट पर किया, जो एक मानव जैसा दिखने वाला ह्यूमनॉइड है, जो एक बहुत ही विशिष्ट कार्य करने की कोशिश कर रहा था: सुपरमार्केट में चिप्स के बैग को फिर से भरना। उन्होंने पाया कि रोबोट को काम करने के लायक बनाने का रहस्य एक नया, अधिक जटिल मस्तिष्क आर्किटेक्चर बनाना नहीं था। इसके बजाय, यह एक बहुत ही सावधान शिक्षक होने के बारे में था।
सबसे पहले, उन्होंने महसूस किया कि केवल एक पूर्व-प्रशिक्षित रोबोट मस्तिष्क डाउनलोड करना और उसे "जाओ" कहना काम नहीं आया; रोबोट पूरी तरह से विफल रहा। समस्या यह थी कि रोबोट अव्यवस्थित, असंगत डेटा से सीखने की कोशिश कर रहा था और अपने कैमरों तथा गतिविधियों के समय (timing) को लेकर भ्रमित था। टीम ने इसे एक "डेटा-एफिशिएंट" रेसिपी बनाकर ठीक किया। उन्होंने हिचकिचाहट और गलतियों को हटाने के लिए प्रशिक्षण वीडियो को साफ किया, रोबोट की कैमरा गति को उसकी आंदोलन गति के साथ सिंक्रोनाइज़ किया (ताकी वह अपनी देखने की क्षमता से तेज़ न चले), और यहाँ तक कि एक सहायक उपकरण का उपयोग किया जो ठीक से उजागर करता था कि रोबोट को कहाँ देखना चाहिए, जैसे कि शेल्फ पर खाली जगह के चारों ओर एक हरा बॉक्स बनाना। उन्होंने रोबोट के काम को सरल बनाया और उसके हाथ को हर छोटी मांसपेशी को नियंत्रित करने के बजाय एक साधारण ऑन/ऑफ स्विच की तरह माना। केवल इन सावधानीपूर्वक किए गए बदलावों और एक सिंगल ग्राफिक्स कार्ड के साथ, उन्होंने एक रोबोट को जो 0% सफल था, उसे 32% बार चिप्स भरने में सक्षम बना दिया।
इसके बाद, उन्होंने रोबोट को अपने अनुभव से सीखने देने की कोशिश की, जिसे "एक्सपीरियंस-ड्रिवन लर्निंग" कहा जाता है। उन्होंने रोबोट को अपने आप कार्य करने दिया, और जब वह गलती करता, तो एक इंसान हस्तक्षेप करके उसे ठीक करता। रोबोट ने इन सुधारों का उपयोग अपने मस्तिष्क को अपडेट करने के लिए किया। यह काम कर गया! इस अभ्यास के एक दौर के बाद, रोबोट की सफलता दर बढ़कर 42% हो गई, और वह अपनी गतिविधियों में अधिक तेज़ और सीधा हो गया।
हालाँकि, यह पेपर बहुत अधिक ऐसा करने के बारे में एक चेतावनी भी देता है। जब उन्होंने अभ्यास के दूसरे दौर की कोशिश की, तो रोबोट वास्तव में और खराब हो गया, और उसकी सफलता दर गिरकर 22% रह गई। शोधकर्ताओं को संदेह है कि ऐसा इसलिए हुआ क्योंकि रोबोट अपने स्वयं के "भ्रम" (hallucinations) पर बहुत अधिक निर्भर करने लगा कि क्या काम करता है, बजाय इसके कि जो ठोस उदाहरण मानव शिक्षक द्वारा दिए गए थे। यह वैसा ही है जैसे यदि कोई छात्र केवल अपने द्वारा बनाए गए नकली टेस्ट के उत्तरों का अनुमान लगाकर अभ्यास करता है; अंततः, वे वास्तविक नियम भूलने लगते हैं। टीम ने रोबोट के मस्तिष्क को वास्तविक समय में देखने के लिए एक विशेष उपकरण भी बनाया, जो यह मापता था कि उसकी वर्तमान स्थिति, जिसे उसे प्रशिक्षित किया गया था, उसके मुकाबले कितनी "अजीब" थी। इस उपकरण ने उन्हें यह देखने में मदद की कि रोबोट ठीक कब खतरनाक, अपरिचित क्षेत्र में जा रहा था।
अंततः, यह पेपर सुझाव देता है कि स्टोर में ह्यूमनॉइड रोबोट रखने के लिए सबसे बड़ी बाधा एक स्मार्ट मस्तिष्क बनाना नहीं है, बल्कि एक बेहतर प्रशिक्षण प्रणाली बनाना है। डेटा को सावधानीपूर्वक व्यवस्थित करके और यह जानकर कि रोबोट को अपने आप "अभ्यास" करने से कब रोकना है, हम एक अनाड़ी, पूर्व-प्रशिक्षित मॉडल को बहुत कम कंप्यूटिंग पावर का उपयोग करके एक सक्षम कार्यकर्ता में बदल सकते हैं। शोधकर्ताओं ने पाया कि जबकि आत्म-सुधार का एक दौर मदद करता है, बहुत अधिक करना नुकसानदेह हो सकता है, और सफलता की कुंजी रोबोट के अपने अनुभवों और मानव प्रदर्शनों के विश्वसनीय मार्गदर्शन के बीच संतुलन बनाने में निहित है।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।