← नवीनतम पेपर
🤖 machine learning

Leveraging Human Feedback for Semantically-Relevant Skill Discovery

यह शोध पत्र सिमेंटिकली रिलेवेंट स्किल डिस्कवरी (SRSD) को प्रस्तुत करता है, जो एक ह्यूमन-इन-द-लूप दृष्टिकोण है जो अधिक अर्थपूर्ण और प्रासंगिक व्यवहारों को सीखने के लिए मानव सिमेंटिक लेबल का उपयोग करके सुदृढीकरण शिक्षण (रिनफोर्समेंट लर्निंग) में अनसुपरवाइज्ड स्किल डिस्कवरी की दक्षता और विविधता में सुधार करता है।

मूल लेखक: Maxence Hussonnois, Thommen George Karimpanal, Santu Rana

प्रकाशित 2026-04-28
📖 4 मिनट में पढ़ें☕ कॉफ़ी ब्रेक में पढ़ें

मूल लेखक: Maxence Hussonnois, Thommen George Karimpanal, Santu Rana

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक रोबोट को फुटबॉल खेलना सिखा रहे हैं।

यदि आप केवल रोबोट को यह कहते हैं, "खोजबीन करो और दिलचस्प चीजें करो," तो वह तीन घंटे तक गोल-गोल घूमने या अपनी उंगलियां हिलाने सीखने में बिता सकता है। ये "विविध" व्यवहार तो हैं, लेकिन फुटबॉल के लिए बेकार हैं।

यदि आप इसे "पसंद" (preferences) का उपयोग करके सिखाने की कोशिश करते हैं—जैसे इंसान से पूछना, "क्या आपको यह गति उस दूसरी गति से अधिक पसंद है?"—तो इंसान थक जाएगा। यह दस घंटों तक लगातार "हॉट और कोल्ड" (पास या दूर) वाला खेल खेलने जैसा है। यह समझने में बहुत समय लगता है कि "किक मारना" "गोल घूमने" से बेहतर है।

यह शोध पत्र रोबोट को सिखाने का एक स्मार्ट तरीका पेश करता है जिसे SRSD (Semantically Relevant Skill Discovery) कहा जाता है।

मुख्य विचार: "लेबलिंग" का शॉर्टकट

"हॉट और कोल्ड" खेलने के बजाय, शोधकर्ता सेमेंटिक लेबलिंग (Semantic Labeling) नामक एक विधि का सुझाव देते हैं।

इसे इस तरह सोचें: कल्पना करें कि आप एक खिलाड़ी को देख रहे कोच हैं। लगातार "बेहतर" या "खराब" कहने के बजाय, आप बस इशारा करते हैं और चीजों को एक नाम देते हैं। आप एक खिलाड़ी को दौड़ते हुए देखते हैं और कहते हैं, "वह दौड़ना है।" आप उन्हें किक मारते हुए देखते हैं और कहते हैं, "वह गोल किक है।" यदि वे नाक खुजलाने लगते हैं, तो आप बस कहते हैं, "यह अप्रासंगिक है।"

इन व्यवहारों को नाम (semantics) देकर, इंसान बहुत कम प्रयास के साथ बहुत सारी जानकारी प्रदान करता है। रोबोट केवल यह नहीं सीखता कि एक चाल दूसरी से "बेहतर" है; वह "दौड़ना" बनाम "किक मारना" की अवधारणा (concept) को समझता है।

SRSD का "दिमाग" कैसे काम करता है

शोधकर्ताओं ने एक ऐसी प्रणाली बनाई है जो तीन मुख्य चरणों में काम करती है:

  1. एक्सप्लोरर (टॉडलर चरण): सबसे पहले, रोबट को एक छोटे बच्चे (toddler) की तरह कार्य करने की अनुमति दी जाती है। वह यह देखने के लिए इधर-उधर घूमता है कि उसका शरीर क्या कर सकता है (यह "अनसुपरवाइज्ड" हिस्सा है)। वह खोज निकालता है कि वह कूद सकता है, कलाबाजी कर सकता है और रेंग सकता है।
  2. टीचर (लेबलिंग चरण): इंसान बीच में आता है। दो चालों की तुलना करने के बजाय, इंसान एक क्लिप देखता है और एक लेबल असाइन करता है: "दौड़ना," "कूदना," या "अप्रासंगिक।"
  3. स्टूडेंट (लर्निंग चरण): रोबोट एक "सेमेंटिक प्रेडिक्टर" बनाता है—जो वास्तव में एक मानसिक शब्दकोश की तरह है। वह समझने लगता है, "आह, जब मैं अपने पैरों को इस तरह हिलाता हूँ, तो इंसान इसे 'दौड़ना' कहता है। मुझे ऐसा और अधिक करना चाहिए!"

यह इतनी बड़ी बात क्यों है? ("स्विस आर्मी नाइफ" प्रभाव)

यह शोध पत्र दो प्रमुख बातें सिद्ध करता है:

  • यह बहुत तेज़ है: पारंपरिक तरीके "भ्रमित" हो जाते हैं जैसे-जैसे आप कौशल के प्रकार बढ़ाते हैं। यदि आपके पास सीखने के लिए 16 अलग-अलग खेल हैं, तो एक प्राथमिकता-आधारित (preference-based) रोबोट गणित में खो जाता है। लेकिन SRSD रोबोट कुशल रहता है क्योंकि वह केवल नामों की एक सूची सीख रहा है।
  • यह अधिक विविध है: क्योंकि रोबोट को नए नाम (नई सेमेंटिक श्रेणियां) खोजने के लिए पुरस्कृत किया जाता है, इसलिए वह केवल आगे बढ़ने के 10 अलग-अलग तरीके नहीं सीखता। वह दौड़ना, कूदना, कलाबाजी करना और संतुलन बनाना सीखता है। वह एक बहुत ही तेज, एकल-उद्देश्य वाले चाकू के बजाय कौशलों का एक "स्विस आर्मी नाइफ" बनाता है।

निष्कर्ष

शोधकर्ताओं ने दिखाया है कि मानव फीडबैक को चीज़ों को रैंक देने के बजाय चीजों को नाम देने की तरह मानकर, हम रोबोट को बहुत अधिक कुशलता से एक विस्तृत, उपयोगी और व्यवस्थित कौशल भंडार सिखा सकते हैं। यह हमें ऐसे रोबोटों से दूर ले जाता है जो केवल "यादृच्छिक रूप से सक्रिय" (randomly active) हैं, और ऐसे रोबोटों की ओर ले जाता है जो "अर्थपूर्ण रूप से सक्षम" (meaningfully capable) हैं।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →