← नवीनतम पेपर
💻 computer science

From Action Labels to Sets: Rethinking Action Supervision for Imitation Learning from Corrective Feedback

यह शोध पत्र CLIC को प्रस्तुत करता है, जो एक ह्यूमन-इन-द-लूप इमिटेशन लर्निंग फ्रेमवर्क है जो भंगुर पॉइंटवाइज एक्शन सुपरविजन को सुधारात्मक फीडबैक से प्राप्त सेट-वैल्यूड टारगेट्स से बदल देता है, जिससे एक मजबूत पॉलिसी लर्निंग सक्षम होती है जो शोरपूर्ण, सापेक्ष और मल्टी-मोडल मानवीय मार्गदर्शन को समाहित करती है।

मूल लेखक: Zhaoting Li, Rodrigo Pérez-Dattari, Robert Babuska, Cosimo Della Santina, Jens Kober

प्रकाशित 2026-05-01
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Zhaoting Li, Rodrigo Pérez-Dattari, Robert Babuska, Cosimo Della Santina, Jens Kober

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। ✨ नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक रोबोट को कोई कार्य करना सिखा रहे हैं, जैसे कप में पानी डालना या गेंद पकड़ना। पारंपरिक तरीका जिसे बिहेवियर क्लोनिंग (Behavior Cloning) कहा जाता है, वह इस तरह काम करता है। यह एक सख्त शिक्षक की तरह है जो मानचित्र पर एक सटीक बिंदु की ओर इशारा करते हुए कहता है, "तुम्हें बिल्कुल यहीं आना है।"

समस्या यह है कि इंसान भी पूर्ण नहीं होते। कभी-कभी हम थक जाते हैं, हमारे हाथ कांपते हैं, या हम बस थोड़ा गलत निर्देश दे देते हैं। यदि रोबोट हर एक मानवीय निर्देश को एक पूर्ण और अपरिवर्तनीय नियम मान लेता है, तो वह हमारी गलतियों को भी याद करने लगता है। इससे वह "भंगुर" (brittle) हो जाता है—यदि इंसान एक छोटी सी गलती करता है, तो रोबोट भ्रमित हो जाता है और विफल हो जाता है। यह उस छात्र की तरह है जो परीक्षा में एक गलत उत्तर के सटीक निर्देशांक (coordinates) को रट लेता है और फिर किसी भिन्नता को संभालने में असमर्थ होने के कारण असफल हो जाता है।

दूसरी ओर, कुछ विधियाँ रोबोट को इस तरह सिखाने की कोशिश करती हैं कि "यह क्रिया उस क्रिया से बेहतर है।" यह एक ऐसे शिक्षक की तरह है जो कहता है, "बाएँ जाना, दाएँ जाने से बेहतर है," बिना यह बताए कि कितना बाएँ जाना है। हालांकि यह अधिक लचीला है, लेकिन अक्सर यह बहुत अस्पष्ट होता है। रोबोट बिना किसी लक्ष्य के भटक सकता है क्योंकि उसे "अच्छे" व्यवहार की सीमाओं का ज्ञान नहीं होता।

नया विचार: "सेफ ज़ोन" (सुरक्षित क्षेत्र)

इस शोध पत्र के लेखक CLIC (कंट्रास्टिव पॉलिसी लर्निंग फ्रॉम इंटरएक्टिव करेक्शन) नामक एक मध्य मार्ग प्रस्तावित करते हैं। रोबोट को केवल एक बिंदु या एक अस्पष्ट तुलना देने के बजाय, वे उसे एक "सेफ ज़ोन" या एक "टारगेट सेट" खोजना सिखाते हैं।

यहाँ उपमा दी गई है:

  • पुराना तरीका (पॉइंटवाइज): शिक्षक कहता है, "ठीक इसी विशिष्ट टाइल पर खड़े हो जाओ।" यदि शिक्षक थोड़ा गलत टाइल की ओर इशारा करता है, तो रोबट वहीं खड़ा हो जाता है और विफल हो जाता है।
  • पुराना तरीका (पेयरवाइज): शिक्षक कहता है, "दाहिनी ओर के बजाय बाईं ओर खड़ा होना बेहतर है।" रोबोट जानता है कि उसे दाईं ओर नहीं होना चाहिए, लेकिन उसे यह नहीं पता कि उसे बहुत बाईं ओर, बीच में, या बस थोड़ा बाईं ओर खड़ा होना है। यह बहुत ढीला है।
  • CLIC (सेट-वैल्यूड): शिक्षक कहता है, "लाल टाइल पर मत खड़े हो (जहाँ रोबोट ने गलती की थी), लेकिन तुम हरे टाइल के आसपास के नीले घेरे में कहीं भी खड़े हो सकते हो।"

इस नए तरीके में, जब कोई इंसान रोबोट को सुधारता है, तो वे केवल एक नया निर्देशांक (coordinate) नहीं दे रहे होते। वे स्वीकार्य क्रियाओं के एक क्षेत्र को परिभाषित कर रहे होते हैं।

  • यदि इंसान रोबोट के हाथ को सुधारने के लिए उसे थोड़ा बाईं ओर धकेलता है, तो रोबोट सीखता है: "ठीक है, सही क्रिया इस सामान्य दिशा में कहीं भी हो सकती है, न कि अनिवार्य रूप से ठीक वहीं जहाँ आपने मुझे धकेला।"
  • यदि इंसान एक शोर भरा या कांपता हुआ सुधार देता है, तो रोबोट समझ जाता है कि "सेफ ज़ोन" थोड़ा धुंधला है, लेकिन वह अभी भी यह जानता है कि क्या नहीं करना है (गलत पक्ष) और क्या सामान्य रूप से स्वीकार्य है (ज़ोन)।

व्यावहारिक रूप में यह कैसे काम करता है

शोधकर्ताओं ने इस विचार का परीक्षण दो मुख्य तरीकों से किया:

  1. सिमुलेशन (Simulations): उन्होंने टी-आकार (T-shaped) के ब्लॉक को धकेलने, कैन उठाने, या दो रोबोटिक भुजाओं के साथ किसी वस्तु को उठाने जैसे कार्यों के लिए हजारों कंप्यूटर सिमुलेशन चलाए।

    • परिणाम: जब मानव डेटा सटीक था, तो CLIC पुराने तरीकों की तरह ही अच्छा काम करता था। लेकिन जब मानव डेटा शोर युक्त, कांपता हुआ या अधूरा (उदाहरण के लिए, इंसान ने दो हाथों वाले रोबोट के केवल एक हाथ को सुधारा) था, तब भी CLIC काम करता रहा जबकि पुराने तरीके पूरी तरह विफल हो गए या क्रैश हो गए।
    • क्यों? क्योंकि CLIC ने कांपती हुई हाथ की गतिविधियों को याद करने की कोशिश नहीं की। इसने सही व्यवहार के आकार को सीखा।
  2. वास्तविक रोबोट (Real Robots): उन्होंने वास्तविक रोबोटों पर निम्नलिखित कार्यों के लिए इसका परीक्षण किया:

    • टी-आकार को यू-आकार में डालना: एक जटिल पहेली जिसमें सटीक गति की आवश्यकता होती है।
    • गेंद पकड़ना: एक तेज़, गतिशील कार्य जहाँ इंसान आसानी से सटीक प्रदर्शन नहीं दे सकते, इसलिए वे केवल त्वरित दिशात्मक संकेत देते हैं।
    • पानी डालना: एक कार्य जिसके लिए बोतल के सूक्ष्म नियंत्रण की आवश्यकता होती है।
    • परिणाम: रोबोट ने अधिक तेज़ी से और अधिक विश्वसनीयता के साथ सीखा। गेंद पकड़ने के कार्य में, रोबोट शायद ही कभी गेंद पकड़ पाता था, लेकिन केवल दो प्रयासों के भीतर वह लगातार गेंद पकड़ने लगा, भले ही इंसान केवल मोटे दिशात्मक संकेत दे रहा था।

मुख्य निष्कर्ष

यह शोध पत्र दावा करता है कि मानवीय सुधारों को सटीक लक्ष्यों के बजाय संभावनाओं के क्षेत्रों के रूप में मानने से, रोबोट बहुत अधिक मजबूत (robust) बन जाते हैं। वे मानवीय गलतियों, कांपते हाथों और अधूरे निर्देशों को बिना भ्रमित हुए संभाल सकते हैं।

यह एक ऐसे छात्र के बीच का अंतर है जो एक गलत उत्तर को रट लेता है और उस छात्र के बीच का अंतर है जो सही उत्तर की अवधारणा (concept) को समझता है। CLIC रोबोट को केवल निर्देशांकों के बजाय अवधारणा (यानी "सेफ ज़ोन") सिखाता है, जो इसे मनुष्यों के शामिल होने पर एक बहुत बेहतर शिक्षार्थी बनाता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →