From Action Labels to Sets: Rethinking Action Supervision for Imitation Learning from Corrective Feedback
यह शोध पत्र CLIC को प्रस्तुत करता है, जो एक ह्यूमन-इन-द-लूप इमिटेशन लर्निंग फ्रेमवर्क है जो भंगुर पॉइंटवाइज एक्शन सुपरविजन को सुधारात्मक फीडबैक से प्राप्त सेट-वैल्यूड टारगेट्स से बदल देता है, जिससे एक मजबूत पॉलिसी लर्निंग सक्षम होती है जो शोरपूर्ण, सापेक्ष और मल्टी-मोडल मानवीय मार्गदर्शन को समाहित करती है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आप एक रोबोट को कोई कार्य करना सिखा रहे हैं, जैसे कप में पानी डालना या गेंद पकड़ना। पारंपरिक तरीका जिसे बिहेवियर क्लोनिंग (Behavior Cloning) कहा जाता है, वह इस तरह काम करता है। यह एक सख्त शिक्षक की तरह है जो मानचित्र पर एक सटीक बिंदु की ओर इशारा करते हुए कहता है, "तुम्हें बिल्कुल यहीं आना है।"
समस्या यह है कि इंसान भी पूर्ण नहीं होते। कभी-कभी हम थक जाते हैं, हमारे हाथ कांपते हैं, या हम बस थोड़ा गलत निर्देश दे देते हैं। यदि रोबोट हर एक मानवीय निर्देश को एक पूर्ण और अपरिवर्तनीय नियम मान लेता है, तो वह हमारी गलतियों को भी याद करने लगता है। इससे वह "भंगुर" (brittle) हो जाता है—यदि इंसान एक छोटी सी गलती करता है, तो रोबोट भ्रमित हो जाता है और विफल हो जाता है। यह उस छात्र की तरह है जो परीक्षा में एक गलत उत्तर के सटीक निर्देशांक (coordinates) को रट लेता है और फिर किसी भिन्नता को संभालने में असमर्थ होने के कारण असफल हो जाता है।
दूसरी ओर, कुछ विधियाँ रोबोट को इस तरह सिखाने की कोशिश करती हैं कि "यह क्रिया उस क्रिया से बेहतर है।" यह एक ऐसे शिक्षक की तरह है जो कहता है, "बाएँ जाना, दाएँ जाने से बेहतर है," बिना यह बताए कि कितना बाएँ जाना है। हालांकि यह अधिक लचीला है, लेकिन अक्सर यह बहुत अस्पष्ट होता है। रोबोट बिना किसी लक्ष्य के भटक सकता है क्योंकि उसे "अच्छे" व्यवहार की सीमाओं का ज्ञान नहीं होता।
नया विचार: "सेफ ज़ोन" (सुरक्षित क्षेत्र)
इस शोध पत्र के लेखक CLIC (कंट्रास्टिव पॉलिसी लर्निंग फ्रॉम इंटरएक्टिव करेक्शन) नामक एक मध्य मार्ग प्रस्तावित करते हैं। रोबोट को केवल एक बिंदु या एक अस्पष्ट तुलना देने के बजाय, वे उसे एक "सेफ ज़ोन" या एक "टारगेट सेट" खोजना सिखाते हैं।
यहाँ उपमा दी गई है:
- पुराना तरीका (पॉइंटवाइज): शिक्षक कहता है, "ठीक इसी विशिष्ट टाइल पर खड़े हो जाओ।" यदि शिक्षक थोड़ा गलत टाइल की ओर इशारा करता है, तो रोबट वहीं खड़ा हो जाता है और विफल हो जाता है।
- पुराना तरीका (पेयरवाइज): शिक्षक कहता है, "दाहिनी ओर के बजाय बाईं ओर खड़ा होना बेहतर है।" रोबोट जानता है कि उसे दाईं ओर नहीं होना चाहिए, लेकिन उसे यह नहीं पता कि उसे बहुत बाईं ओर, बीच में, या बस थोड़ा बाईं ओर खड़ा होना है। यह बहुत ढीला है।
- CLIC (सेट-वैल्यूड): शिक्षक कहता है, "लाल टाइल पर मत खड़े हो (जहाँ रोबोट ने गलती की थी), लेकिन तुम हरे टाइल के आसपास के नीले घेरे में कहीं भी खड़े हो सकते हो।"
इस नए तरीके में, जब कोई इंसान रोबोट को सुधारता है, तो वे केवल एक नया निर्देशांक (coordinate) नहीं दे रहे होते। वे स्वीकार्य क्रियाओं के एक क्षेत्र को परिभाषित कर रहे होते हैं।
- यदि इंसान रोबोट के हाथ को सुधारने के लिए उसे थोड़ा बाईं ओर धकेलता है, तो रोबोट सीखता है: "ठीक है, सही क्रिया इस सामान्य दिशा में कहीं भी हो सकती है, न कि अनिवार्य रूप से ठीक वहीं जहाँ आपने मुझे धकेला।"
- यदि इंसान एक शोर भरा या कांपता हुआ सुधार देता है, तो रोबोट समझ जाता है कि "सेफ ज़ोन" थोड़ा धुंधला है, लेकिन वह अभी भी यह जानता है कि क्या नहीं करना है (गलत पक्ष) और क्या सामान्य रूप से स्वीकार्य है (ज़ोन)।
व्यावहारिक रूप में यह कैसे काम करता है
शोधकर्ताओं ने इस विचार का परीक्षण दो मुख्य तरीकों से किया:
सिमुलेशन (Simulations): उन्होंने टी-आकार (T-shaped) के ब्लॉक को धकेलने, कैन उठाने, या दो रोबोटिक भुजाओं के साथ किसी वस्तु को उठाने जैसे कार्यों के लिए हजारों कंप्यूटर सिमुलेशन चलाए।
- परिणाम: जब मानव डेटा सटीक था, तो CLIC पुराने तरीकों की तरह ही अच्छा काम करता था। लेकिन जब मानव डेटा शोर युक्त, कांपता हुआ या अधूरा (उदाहरण के लिए, इंसान ने दो हाथों वाले रोबोट के केवल एक हाथ को सुधारा) था, तब भी CLIC काम करता रहा जबकि पुराने तरीके पूरी तरह विफल हो गए या क्रैश हो गए।
- क्यों? क्योंकि CLIC ने कांपती हुई हाथ की गतिविधियों को याद करने की कोशिश नहीं की। इसने सही व्यवहार के आकार को सीखा।
वास्तविक रोबोट (Real Robots): उन्होंने वास्तविक रोबोटों पर निम्नलिखित कार्यों के लिए इसका परीक्षण किया:
- टी-आकार को यू-आकार में डालना: एक जटिल पहेली जिसमें सटीक गति की आवश्यकता होती है।
- गेंद पकड़ना: एक तेज़, गतिशील कार्य जहाँ इंसान आसानी से सटीक प्रदर्शन नहीं दे सकते, इसलिए वे केवल त्वरित दिशात्मक संकेत देते हैं।
- पानी डालना: एक कार्य जिसके लिए बोतल के सूक्ष्म नियंत्रण की आवश्यकता होती है।
- परिणाम: रोबोट ने अधिक तेज़ी से और अधिक विश्वसनीयता के साथ सीखा। गेंद पकड़ने के कार्य में, रोबोट शायद ही कभी गेंद पकड़ पाता था, लेकिन केवल दो प्रयासों के भीतर वह लगातार गेंद पकड़ने लगा, भले ही इंसान केवल मोटे दिशात्मक संकेत दे रहा था।
मुख्य निष्कर्ष
यह शोध पत्र दावा करता है कि मानवीय सुधारों को सटीक लक्ष्यों के बजाय संभावनाओं के क्षेत्रों के रूप में मानने से, रोबोट बहुत अधिक मजबूत (robust) बन जाते हैं। वे मानवीय गलतियों, कांपते हाथों और अधूरे निर्देशों को बिना भ्रमित हुए संभाल सकते हैं।
यह एक ऐसे छात्र के बीच का अंतर है जो एक गलत उत्तर को रट लेता है और उस छात्र के बीच का अंतर है जो सही उत्तर की अवधारणा (concept) को समझता है। CLIC रोबोट को केवल निर्देशांकों के बजाय अवधारणा (यानी "सेफ ज़ोन") सिखाता है, जो इसे मनुष्यों के शामिल होने पर एक बहुत बेहतर शिक्षार्थी बनाता है।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।