← नवीनतम पेपर
🤖 AI

Masked IRL: LLM-Guided Reward Disambiguation from Demonstrations and Language

यह शोध पत्र मास्क्ड IRL (Masked IRL) का प्रस्ताव देता है, जो एक ऐसा फ्रेमवर्क है जो प्राकृतिक भाषा निर्देशों से स्टेट-रेलेवेंस मास्क (state-relevance masks) को निकालने के लिए लार्ज लैंग्वेज मॉडल्स का लाभ उठाता है, जिससे प्रदर्शनों (demonstrations) में अस्पष्टता दूर होती है और रोबोट के लिए रिवॉर्ड लर्निंग की सैंपल दक्षता, सामान्यीकरण और मजबूती में महत्वपूर्ण सुधार होता है।

मूल लेखक: Minyoung Hwang, Alexandra Forsey-Smerek, Nathaniel Dennler, Andreea Bobu

प्रकाशित 2026-04-01
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Minyoung Hwang, Alexandra Forsey-Smerek, Nathaniel Dennler, Andreea Bobu

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। ✨ नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक रोबोट को आपको कॉफी का एक कप बनाना सिखा रहे हैं। आप रोबोट को यह दिखाने के लिए कि इसे कैसे करना है, खुद उसके हाथ को हिलाकर उसे दिखाते हैं (डेमोंस्ट्रेशन/प्रदर्शन) और साथ ही आप उसे कहते हैं, "लैपटॉप को गिराने से सावधान रहना।"

समस्या यह है कि रोबोट अविश्वसनीय रूप से शाब्दिक (literal) होते हैं और कभी-कभी थोड़े डरे हुए भी होते हैं। यदि आप उन्हें केवल गति दिखाते हैं, तो वे सोच सकते हैं, "ओह, मैं समझ गया! इंसान ने हाथ को एक वक्र (curve) में घुमाया। शायद सबसे महत्वपूर्ण बात यह सुनिश्चित करना है कि हाथ एक सटीक वृत्त (circle) बनाए!" वे लैपटॉप को पूरी तरह से अनदेखा कर सकते हैं और गलत विवरणों पर ध्यान केंद्रित कर सकते हैं, जैसे मेज का रंग या गति। इसे ओवरफिटिंग (overfitting) कहा जाता: रोबोट उस विशिष्ट "नृत्य" को सीख जाता है जो आपने किया था, लेकिन वास्तविक लक्ष्य को नहीं।

दूसरी ओर, यदि आप केवल कहते हैं, "दूर रहो," बिना उन्हें कुछ दिखाए, तो रोबोट भ्रमित हो जाता है। किससे दूर रहूँ? मेज से? इंसान से? कॉफी कप से?

समाधान: "मास्क्ड IRL" (Masked IRL)

MIT CSAIL के शोधकर्ताओं ने एक चतुर समाधान निकाला जिसे मास्क्स्ड IRL (इन्वर्स रिइन्फोर्समेंट लर्निंग) कहा जाता है। इसे एक रोबोट को स्मार्ट चश्मे और एक बुद्धिमान सहायक देने के रूप में समझें।

यह कैसे काम करता है, यहाँ सरल चरणों में दिया गया है:

1. बुद्धिमान सहायक (LLM)

रोबोट के पास एक "दिमाग" है जो एक लार्ज लैंग्वेज मॉडल (LLM) से जुड़ा है—मूल रूप से, एक सुपर-स्मार्ट AI जो मानव भाषा और सामान्य ज्ञान को समझता है।

  • कार्य: जब आप "दूर रहो" जैसा निर्देश देते हैं, तो रोबोट का AI सहायक आपके प्रदर्शन (आपके द्वारा की गई गति) को देखता है और कहता है, "आह, मैंने देखा कि आपने हाथ को लैपटॉप से दूर ले जाया। आपने मेज से दूर नहीं हटाया। इसलिए, 'दूर रहो' का अर्थ है 'लैपटॉप से दूर रहो'।"
  • उपमा: यह एक शिक्षक की तरह है जो छात्र के उत्तरों को देख रहा है। यदि छात्र गलत उत्तर चुनता है लेकिन शिक्षक जानता है कि छात्र वास्तव में किसी विशिष्ट जाल से बचने की कोशिश कर रहा था, तो शिक्षक समझ सकता है कि छात्र का मतलब क्या था।

2. स्मार्ट चश्मे (स्टेट मास्क - State Masks)

एक बार जब AI सहायक यह समझ लेता है कि क्या महत्वपूर्ण है, तो वह रोबोट के लिए "स्मार्ट चश्मे" पहन लेता है।

  • कार्य: ये चश्मे एक मास्क (mask) बनाते हैं। वे रोबोट को बताते हैं: "लैपटॉप और अपने हाथ को देखो। मेज, फर्श और दीवारों के रंग को अनदेखा (ignore) करो। इस विशिष्ट कार्य के लिए वे चीजें मायने नहीं रखतीं।"
  • उपमा: कल्पना कीजिए कि आप एक भीड़ भरे कमरे में किसी विशिष्ट व्यक्ति को खोजने की कोशिश कर रहे हैं। एक सामान्य व्यक्ति हर किसी का चेहरा, उनके कपड़े और पृष्ठभूमि को देख सकता है। "स्मार्ट चश्मे" बाकी सभी को धुंधला कर देंगे सिवाय उस व्यक्ति के जिसे आप देख रहे हैं। यह रोबकार को अप्रासंगिक विवरणों (जैसे मेज के रंग) से विचलित होने से रोकता है।

3. प्रशिक्षण (The "Don't Care" Rule - "परवाह नहीं" नियम)

फिर रोबोट को एक विशेष नियम के साथ प्रशिक्षित किया जाता है: "यदि आप उन चीजों को बदलते हैं जिन्हें चश्मा अनदेखा करने के लिए कहता है (जैसे मेज), तो आपका स्कोर नहीं बदलना चाहिए।"

  • उपमा: कल्पना कीजिए कि आप केक बना रहे हैं। रेसिपी कहती है, "चीनी डालें।" यदि आप गलती से चीनी के बजाय एक चुटकी नमक डाल देते हैं, तो केक का स्वाद खराब हो जाता है। लेकिन यदि रेसिपी कहती है, "चीनी डालें, और कटोरे के रंग को अनदेखा करें," तो कटोरे का रंग बदलने से केक खराब नहीं होता है। रोबोट सीख जाता है कि कटोरे का रंग (अप्रासंगिक स्थिति) मायने नहीं रखता, इसलिए वह उस पर ध्यान देना बंद कर देता है।

यह एक बड़ी बात क्यों है?

  1. इसे कम डेटा की आवश्यकता होती है: क्योंकि रोबोट अप्रासंगिक चीजों (जैसे मेज के रंग) के बारे में सीखने में समय बर्बाद नहीं कर रहा है, इसलिए वह बहुत तेजी से सीखता है। पेपर कहता है कि इसे पुराने तरीकों की तुलना में 4.7 गुना कम प्रदर्शनों (demonstrations) की आवश्यकता होती है। यह सड़क पर ध्यान केंद्रित करके ड्राइविंग सीखने जैसा है, न कि अन्य कारों के रंग पर।
  2. यह अस्पष्ट निर्देशों को संभालता है: यदि आप कहते हैं "दूर रहो" (जो कि अस्पष्ट है), तो रोबोट यह अनुमान लगाने के लिए प्रदर्शन का उपयोग करता है कि आपका मतलब "लैपटॉप से दूर रहो" था। वह अटकता या भ्रमित नहीं होता।
  3. यह वास्तविक दुनिया में काम करता है: उन्होंने इसे एक वास्तविक रोबोटिक हाथ पर टेस्ट किया, और यह पिछले तरीकों की तुलना में बेहतर काम करता है, तब भी जब निर्देश थोड़े अस्पष्ट हों या रोबोट की हरकतें एकदम सटीक न हों।

निष्कर्ष

मास्क्ड IRL एक रोबोट को कॉमन-सेंस फ़िल्टर देने जैसा है। यह क्या महत्वपूर्ण है यह समझने के लिए भाषा का उपयोग करता है, इसे कैसे करना है यह समझने के लिए प्रदर्शन का उपयोग करता है, और शोर (noise) को अनदेखा करने के लिए AI का उपयोग करता है। यह रोबोट को स्मार्ट, तेज़ सीखने वाला बनाता है जो वास्तव में समझ सकता है कि इंसान वास्तव में क्या चाहता है, भले ही हम इसे पूरी तरह से स्पष्ट न करें।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →