Leveraging Human Feedback for Semantically-Relevant Skill Discovery
यह शोध पत्र सिमेंटिकली रिलेवेंट स्किल डिस्कवरी (SRSD) को प्रस्तुत करता है, जो एक ह्यूमन-इन-द-लूप दृष्टिकोण है जो अधिक अर्थपूर्ण और प्रासंगिक व्यवहारों को सीखने के लिए मानव सिमेंटिक लेबल का उपयोग करके सुदृढीकरण शिक्षण (रिनफोर्समेंट लर्निंग) में अनसुपरवाइज्ड स्किल डिस्कवरी की दक्षता और विविधता में सुधार करता है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आप एक रोबोट को फुटबॉल खेलना सिखा रहे हैं।
यदि आप केवल रोबोट को यह कहते हैं, "खोजबीन करो और दिलचस्प चीजें करो," तो वह तीन घंटे तक गोल-गोल घूमने या अपनी उंगलियां हिलाने सीखने में बिता सकता है। ये "विविध" व्यवहार तो हैं, लेकिन फुटबॉल के लिए बेकार हैं।
यदि आप इसे "पसंद" (preferences) का उपयोग करके सिखाने की कोशिश करते हैं—जैसे इंसान से पूछना, "क्या आपको यह गति उस दूसरी गति से अधिक पसंद है?"—तो इंसान थक जाएगा। यह दस घंटों तक लगातार "हॉट और कोल्ड" (पास या दूर) वाला खेल खेलने जैसा है। यह समझने में बहुत समय लगता है कि "किक मारना" "गोल घूमने" से बेहतर है।
यह शोध पत्र रोबोट को सिखाने का एक स्मार्ट तरीका पेश करता है जिसे SRSD (Semantically Relevant Skill Discovery) कहा जाता है।
मुख्य विचार: "लेबलिंग" का शॉर्टकट
"हॉट और कोल्ड" खेलने के बजाय, शोधकर्ता सेमेंटिक लेबलिंग (Semantic Labeling) नामक एक विधि का सुझाव देते हैं।
इसे इस तरह सोचें: कल्पना करें कि आप एक खिलाड़ी को देख रहे कोच हैं। लगातार "बेहतर" या "खराब" कहने के बजाय, आप बस इशारा करते हैं और चीजों को एक नाम देते हैं। आप एक खिलाड़ी को दौड़ते हुए देखते हैं और कहते हैं, "वह दौड़ना है।" आप उन्हें किक मारते हुए देखते हैं और कहते हैं, "वह गोल किक है।" यदि वे नाक खुजलाने लगते हैं, तो आप बस कहते हैं, "यह अप्रासंगिक है।"
इन व्यवहारों को नाम (semantics) देकर, इंसान बहुत कम प्रयास के साथ बहुत सारी जानकारी प्रदान करता है। रोबोट केवल यह नहीं सीखता कि एक चाल दूसरी से "बेहतर" है; वह "दौड़ना" बनाम "किक मारना" की अवधारणा (concept) को समझता है।
SRSD का "दिमाग" कैसे काम करता है
शोधकर्ताओं ने एक ऐसी प्रणाली बनाई है जो तीन मुख्य चरणों में काम करती है:
- एक्सप्लोरर (टॉडलर चरण): सबसे पहले, रोबट को एक छोटे बच्चे (toddler) की तरह कार्य करने की अनुमति दी जाती है। वह यह देखने के लिए इधर-उधर घूमता है कि उसका शरीर क्या कर सकता है (यह "अनसुपरवाइज्ड" हिस्सा है)। वह खोज निकालता है कि वह कूद सकता है, कलाबाजी कर सकता है और रेंग सकता है।
- टीचर (लेबलिंग चरण): इंसान बीच में आता है। दो चालों की तुलना करने के बजाय, इंसान एक क्लिप देखता है और एक लेबल असाइन करता है: "दौड़ना," "कूदना," या "अप्रासंगिक।"
- स्टूडेंट (लर्निंग चरण): रोबोट एक "सेमेंटिक प्रेडिक्टर" बनाता है—जो वास्तव में एक मानसिक शब्दकोश की तरह है। वह समझने लगता है, "आह, जब मैं अपने पैरों को इस तरह हिलाता हूँ, तो इंसान इसे 'दौड़ना' कहता है। मुझे ऐसा और अधिक करना चाहिए!"
यह इतनी बड़ी बात क्यों है? ("स्विस आर्मी नाइफ" प्रभाव)
यह शोध पत्र दो प्रमुख बातें सिद्ध करता है:
- यह बहुत तेज़ है: पारंपरिक तरीके "भ्रमित" हो जाते हैं जैसे-जैसे आप कौशल के प्रकार बढ़ाते हैं। यदि आपके पास सीखने के लिए 16 अलग-अलग खेल हैं, तो एक प्राथमिकता-आधारित (preference-based) रोबोट गणित में खो जाता है। लेकिन SRSD रोबोट कुशल रहता है क्योंकि वह केवल नामों की एक सूची सीख रहा है।
- यह अधिक विविध है: क्योंकि रोबोट को नए नाम (नई सेमेंटिक श्रेणियां) खोजने के लिए पुरस्कृत किया जाता है, इसलिए वह केवल आगे बढ़ने के 10 अलग-अलग तरीके नहीं सीखता। वह दौड़ना, कूदना, कलाबाजी करना और संतुलन बनाना सीखता है। वह एक बहुत ही तेज, एकल-उद्देश्य वाले चाकू के बजाय कौशलों का एक "स्विस आर्मी नाइफ" बनाता है।
निष्कर्ष
शोधकर्ताओं ने दिखाया है कि मानव फीडबैक को चीज़ों को रैंक देने के बजाय चीजों को नाम देने की तरह मानकर, हम रोबोट को बहुत अधिक कुशलता से एक विस्तृत, उपयोगी और व्यवस्थित कौशल भंडार सिखा सकते हैं। यह हमें ऐसे रोबोटों से दूर ले जाता है जो केवल "यादृच्छिक रूप से सक्रिय" (randomly active) हैं, और ऐसे रोबोटों की ओर ले जाता है जो "अर्थपूर्ण रूप से सक्षम" (meaningfully capable) हैं।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।