WARP-RM: A Warp-Augmented Relative Progress Reward Model for Data Curation
यह शोध पत्र WARP-RM को प्रस्तुत करता है, जो एक पूर्णतः स्व-पर्यवेक्षित (self-supervised) रिवॉर्ड मॉडल है जो टाइम-वॉर्प्ड सफल प्रदर्शनों (time-warped successful demonstrations) से सघन सापेक्ष प्रगति संकेत (dense relative progress signals) उत्पन्न करता है ताकि WARP-BC को सक्षम बनाया जा सके, जो एक व्यवहार क्लोनिंग (behavior cloning) विधि है जो मिश्रित-गुणवत्ता वाले डेटा से एक्शन चंक्स (action chunks) को फ़िल्टर और पुन: भारित (reweight) करके लंबी अवधि के कार्यों (long-horizon tasks) पर रोबोट के प्रदर्शन में महत्वपूर्ण सुधार करती है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
रोबोट लंबे समय से मनुष्यों को देखकर सीखने में संघर्ष करते रहे हैं। जहाँ एक व्यक्ति किसी कार्य को देखते ही उसके संचलन के प्रवाह को समझ सकता है, वहीं वीडियो डेटा पर प्रशिक्षित एक रोबोट अक्सर सफलताओं के साथ-साथ गलतियों को भी सीख लेता है। यदि कोई मानव ऑपरेटर सोचने के लिए रुकता है, किसी वस्तु के साथ जूझता है, या सफल होने से पहले एक अनाड़ी पकड़ आज़माता है, तो रोबोट इन हिचकिचचाहटों को सही पथ के हिस्से के रूप में देखता है। यह लंबी, जटिल कार्यों जैसे कि कपड़े तह करने या वस्तुओं को जोड़ने के लिए एक विशेष समस्या है, जहाँ भ्रम का एक क्षण भी पूरे क्रम को पटरी से उतार सकता है। वर्षों से, शोधकर्ता रोबोट को इन बुरे क्षणों को अनदेखा करना सिखाने की कोशिश कर रहे हैं, लेकिन अधिकांश विधियों के लिए यह बताने के लिए महंगे मानवीय लेबल (human labels) की आवश्यकता होती थी कि गलती ठीक कहाँ हुई थी, या उन्होंने उन पूरे वीडियो क्लिप्स को हटा दिया जिनमें कोई त्रुटि थी, जिससे वे त्रुटिपूर्ण प्रदर्शनों के भीतर छिपे मूल्यवान सुधार वाले मूव्स (recovery moves) भी बेकार हो जाते थे।
कैलिफोर्निया विश्वविद्यालय, बर्कले और स्टैनफोर्ड यूनिवर्सिटी के शोधकर्ताओं की एक टीम ने रोबोट को उत्पादक संचलन और बर्बाद किए गए समय के बीच अंतर करना सिखाने का एक नया तरीका विकसित किया है, जिसके लिए किसी मानवीय लेबल की आवश्यकता नहीं है। उन्होंने एक प्रणाली बनाई जिसे WARP कहा जाता है, जिसका अर्थ है 'वार्प-ऑगमेंटेड रिलेटिव प्रोग्रेस' (Warp-Augmented Relative Progress)। वीडियो के घंटों को देखने और अच्छे और बुरे क्षणों के चारों ओर बॉक्स बनाने के लिए किसी इंसान से कहने के बजाय, शोधकर्ताओं ने कंप्यूटर को अलग-अलग गति से वीडियो चलाकर और यहाँ तक कि उन्हें उल्टा (reverse) चलाकर प्रगति की गति और दिशा को समझने के लिए प्रशिक्षित किया। रोबोट को यह पहचानने के लिए प्रशिक्षित करके कि "आगे" की प्रगति कैसी दिखती है, "पीछे" की या रुकी हुई गति की तुलना में, सिस्टम ने वीडियो के हर एक फ्रेम को एक स्कोर देने के बारेв सीखा। यह स्कोर रोबोट को बताता है कि कार्य कितनी तेजी से आगे बढ़ रहा है, क्या वह अटक गया है, या क्या वह वास्तव में पीछे की ओर जा रहा है।
शोधकर्ताओं ने इस विचार का परीक्षण दो हाथों वाले एक भौतिक रोबोट पर किया, जिसमें उसे बिन में रखे हुए मुड़े हुए टी-शर्ट को तह करने के लिए कहा गया। उन्होंने अलग-अलग गुणवत्ता के प्रशिक्षण डेटासेट बनाए। सबसे अच्छे डेटासेट में, मानव प्रदर्शन तेज़ और कुशल थे। सबसे खराब डेटासेट में, मानव प्रदर्शनों में ठहराव, बार-बार प्रयास और फंबल करने के लंबे दौर शामिल थे। जब उन्होंने एक मानक रोबोट लर्निंग सिस्टम को इन अव्यवस्थित, निम्न-गुणवत्ता वाले वीडियो पर प्रशिक्षित किया, तो रोबोट लगभग पूरी तरह से विफल हो गया। वह छोटे, बेकार समायोजनों के लूप में फंस जाता था, और कार्य पूरा करने में असमर्थ रहता था। हालाँकि, जब उन्होंने नए WARP सिस्टम का उपयोग करके डेटा को फ़िल्टर किया, तो परिणाम नाटकीय रूप से बदल गए। सिस्टम ने स्वचालित रूप से वीडियो के धीमे, हिचकिचाते हिस्सों की पहचान की और उनका महत्व कम कर दिया, जबकि तेज़, निर्णायक क्षणों को बनाए रखा। उन अव्यवस्थित डेटासेट्स पर जहाँ मानक रोबोट बीस में से बीस बार विफल हुआ था, WARP-प्रशिक्षित रोबोट बीस में से उन्नीस बार सफल हुआ। इसने मानक रोबोट की तुलना में उसी खराब-गुणवत्ता वाले डेटा के साथ टी-शर्ट को लगभग अठारह गुना तेजी से भी तह किया।
टीम यहीं नहीं रुकी। उन्होंने इस पद्धति का परीक्षण एक ऐसे कार्य पर भी किया जहाँ रोबोट को प्लास्टिक की बोतलों को एक बिन में रखना था। वास्तविक दुनिया में, नए सिस्टम ने अस्सी में से चौहत्तर बोतलें रखीं, जबकि मानक सिस्टम केवल उन्यासी बोतलें रख सका। नया रोबमान बोतलों को अधिक तेज़ी से और अधिक निरंतरता के साथ रख रहा था। यह सुनिश्चित करने के लिए कि ये परिणाम केवल विशिष्ट रोबोट हार्डवेयर का संयोग नहीं हैं, शोधकर्ताओं ने पाँच सौ बारह विभिन्न परिदृश्यों के साथ एक विशाल सिमुलेशन चलाया। इस आभासी परीक्षण में, नया सिस्टम प्रति घंटे 290 बोतलें रखता था, जो मानक सिस्टम (जो 237 बोतलें प्रति घंटा रख पा रहा था) से काफी बेहतर था। अन्य उन्नत विधियों की तुलना में भी, जो डेटा को साफ करने की कोशिश करती हैं, यह नया दृष्टिकोण लगातार सबसे तेज़ और सबसे विश्वसनीय परिणाम देता है।
यह काम क्यों काम करता है, इसका एक प्रमुख हिस्सा यह है कि सिस्टम प्रगति को कैसे पहचानता है। शोधकर्ताओं ने कंप्यूटर को यह नहीं बताया कि "तह की हुई शर्ट" कैसी दिखती है। इसके बजाय, उन्होंने शर्ट तह करने वाले मनुष्यों के सफल वीडियो लिए और उन्हें यादृच्छिक (random) गति से चलाया, कभी उन्हें बहुत धीमा कर दिया तो कभी तेज़ कर दिया। उन्होंने कुछ वीडियो को उल्टा भी चलाया। फिर कंप्यूटर से अनुमान लगाने के लिए कहा गया कि एक क्लिप की शुरुआत और वर्तमान क्षण के बीच कितना समय बीता है। इन विकृत (warped), बिखरे हुए वीडियो में बीते समय का अनुमान लगाना सीखकर, कंप्यूटर ने कार्य की स्वाभाविक लय को समझना सीख लिया। उसने सीखा कि एक तेज़, सुचारू गति आमतौर पर यह दर्शाती है कि कार्य आगे बढ़ रहा है, जबकि एक धीमी, झटकेदार गति या पीछे की ओर की गति का अर्थ है कि कार्य रुका हुआ है या विफल हो रहा है। इसने सिस्टम को वीडियो के हर फ्रेम के लिए एक निरंतर स्कोर उत्पन्न करने की अनुमति दी, जिससे रोबोट को ठीक से पता चल गया कि उसे प्रदर्शन के किन हिस्सों पर ध्यान देना है और किन्हें अनदेखा करना है।
शोधकर्ताओं ने पाया कि केवल खराब वीडियो को फेंक देना पर्याप्त नहीं था। सबसे प्रभावी रणनीति यह थी कि अव्यवस्थित वीडियो को रखें लेकिन रोबोट को उनसे कैसे सीखना है, यह बदल दें। सिस्टम वीडियो के क्रिया (action) के एक हिस्से को लेगा और उस हिस्से के बिल्कुल अंत में प्रगति स्कोर को देखेगा। यदि स्कोर उच्च था, जिसका अर्थ है कि कार्य तेज़ी से आगे बढ़ रहा है, तो रोबोट उस हिस्से से पूरी तीव्रता के साथ सीखेगा। यदि स्कोर कम या नकारात्मक था, जिसका अर्थ है कि रोबोट हिचकिचा रहा था या पीछे की ओर जा रहा था, तो सिस्टम या तो उस हिस्से को पूरी तरह से अनदेखा कर देगा या उससे बहुत हल्के में सीखेगा। इस दृष्टिकोण ने रोबोट को उन रिकवरी मूव्स से सीखने की अनुमति दी जो मनुष्यों ने शर्ट गिराने और उसे फिर से उठाने के दौरान किए थे, बिना उस घबराहट और हिचकिचाहट को सीखे जिसके कारण शर्ट गिरी थी।
यह कार्य बताता है कि जटिल कौशल सीखने के लिए रोबोटों को पूर्ण मानव प्रदर्शनों की आवश्यकता नहीं है। वे जटिल कार्यों को सीख सकते हैं यदि उनके पास उस डेटा के भीतर समय और प्रगति के प्रवाह को समझने का तरीका हो। शोधकर्ताओं ने उल्लेख किया कि उनकी विधि एक विशिष्ट प्रकार के डेटा ऑग्मेंटेशन (data augmentation) पर निर्भर करती है जहाँ वीडियो को उल्टा चलाया जाता है, जो एक वास्तविक रोबोट के लिए भौतिक रूप से असंभव है। हालाँकि, सिस्टम ने इस कृत्रिम प्रशिक्षण से उपयोगी पैटर्न सीखे। हालाँकि यह विधि हर संभव कार्य के लिए काम करने वाला कोई जादुई समाधान नहीं है, लेकिन यह रोबोट को मानवीय त्रुटि के शोर को अनदेखा करने और सफल क्रिया के संकेत पर ध्यान केंद्रित करने के लिए एक शक्तिशाली नया उपकरण प्रदान करती है। टीम ने अपने कोड और डेटा को उपलब्ध करा दिया है ताकि अन्य शोधकर्ता इन विचारों को अपने स्वयं के रोबोटों और कार्यों पर परख सकें, जिससे संभावित रूप से रोबोटों की एक नई पीढ़ी तैयार हो सके जो अपूर्ण, रोजमर्रा की दुनिया से जल्दी सीख सकें।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।