← नवीनतम पेपर
🤖 AI

Ego-Foresight: Self-supervised Learning of Agent-Aware Representations for Improved RL

यह शोध पत्र Ego-Foresight को प्रस्तुत करता है, जो एक स्व-पर्यवेक्षित शिक्षण (self-supervised learning) विधि है जो एजेंट और पर्यावरण के निरूपणों (representations) को अलग करने के लिए मोटर भविष्यवाणी का लाभ उठाती है, जिससे बिना किसी पर्यवेक्षी संकेतों (supervisory signals) के सुदृढीकरण लर्निंग (reinforcement learning) एल्गोरिदम की नमूना दक्षता (sample efficiency) और प्रदर्शन में सुधार होता है।

मूल लेखक: Manuel Serra Nunes, Atabak Dehban, Yiannis Demiris, José Santos-Victor

प्रकाशित 2026-04-02
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Manuel Serra Nunes, Atabak Dehban, Yiannis Demiris, José Santos-Victor

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। ✨ नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप जुग्लिंग (juggling) करना सीख रहे हैं। यदि आप केवल किसी दूसरे को जुग्लिंग करते हुए वीडियो में देखते हैं, तो आपको एक सामान्य अंदाजा मिल सकता है, लेकिन आप वास्तव में यह तब तक नहीं समझ पाएंगे कि आपके अपने हाथों को कैसे हिलना चाहिए जब तक कि आप इसे स्वयं करने का प्रयास नहीं करते।

यह शोध पत्र, "Ego-Foresight," रोबोट्स को बिना किसी शिक्षक के हाथ पकड़कर सिखाए जाने की आवश्यकता के बिना, उसी तरह की "आत्म-जागरूकता" सीखने के बारे में है।

यहाँ इस विचार का विवरण दिया गया है, सरल उपमाओं (analogies) का उपयोग करते हुए:

1. समस्या: रोबोट "डेटा के भूखे" होते हैं

आर्टिफिशियल इंटेलिजेंस की दुनिया में, रोबोट उन छात्रों की तरह हैं जिन्हें किसी विषय में परीक्षा पास करने से पहले पूरी लाइब्रेरी पढ़नी पड़ती है। कोई नया कौशल सीखने के लिए (जैसे कप उठाना या दरवाजा खोलना), एक रोबोट को आमतौर पर हजारों बार प्रयास करना पड़ता है, बार-बार असफल होना पड़ता है, ताकि वह बुनियादी बातें समझ सके। यह वास्तविक दुनिया में अक्षम और खतरनाक है।

2. मानवीय रहस्य: "मोटर प्रेडिक्शन" (Motor Prediction)

इंसान अलग होते हैं। हम एक नया कौशल बहुत जल्दी सीख सकते हैं। क्यों? क्योंकि हमारा मस्तिष्क लगातार एक सिमुलेशन चला रहा होता है।

  • उपमा: अपने मस्तिष्क को एक फिल्म निर्देशक के रूप में सोचें। जब आप अपना हाथ हिलाने का निर्णय लेते हैं, तो आपका मस्तिष्क तुरंत भविष्यवाणी करता है, "यदि मैं अपना हाथ इस तरह हिलाता हूँ, तो बैकग्राउंड शिफ्ट हो जाएगा, और मेरा हाथ यहाँ होगा।"
  • "गुदगुदी" वाला नुस्खा: यही कारण है कि आप खुद को गुदगुदी नहीं कर सकते। आपका मस्तिष्क अपनी पसलियों को छूने के अहसास की भविष्यवाणी करता है, इसलिए वह उस अहसास को रद्द कर देता है। वह केवल आश्चर्यजनक चीजों पर ध्यान देता है (जैसे जब कोई दूसरा आपको गुदगुदी करता है)।

लेखकों ने महसूस किया: यदि हम रोबोट्स को यह भविष्यवाणी करना सिखाते हैं कि उनका अपना शरीर कैसे हिलता है, तो वे तेजी से सीखेंगे।

3. समाधान: Ego-Foresight (EF)

टीम ने Ego-Foresight नामक एक विधि बनाई। रोबोट को सिर्फ यह बताने के बजाय कि, "इनाम पाने के लिए अपना हाथ हिलाओ," वे उसे एक साइड-क्वेस्ट (side-quest) देते हैं: "भविष्यवाणी करो कि अगले कुछ सेकंड में तुम्हारा हाथ कैसा दिखेगा।"

यह कैसे काम करता है, चरण-दर-चरण:

  • स्प्लिट स्क्रीन (Split Screen): रोबोट एक वीडियो फीड देखता है। सिस्टम इस दृश्य को दो मानसिक चैनलों में विभाजित करता है:
    1. बैकग्राउंड (Background): मेज, दीवार, हिलता हुआ कॉफी कप (वे चीजें जिन्हें रोबोट ने नहीं बनाया)।
    2. स्वयं (The Self): रोबोट का अपना हाथ, ग्रिपर, या कोई भी उपकरण जो वह पकड़े हुए है (वे चीजें जिन्हें रोबोट ने किया है)।
  • "बॉटलनेक" (Bottleneck) का तरीका: रोबोट को "स्वयं" की अपनी समझ को एक बहुत ही संकीर्ण चैनल (जैसे एक स्ट्रॉ/नली) में संकुचित करने के लिए मजबूर किया जाता है। क्योंकि यह बहुत छोटा है, रोबोट को केवल सबसे महत्वपूर्ण, अनुमान लगाने योग्य हिस्सों पर ध्यान केंद्रित करना ही होगा: उसकी अपनी गति। वह गिरती हुई पत्ती की रैंडम गति की भविष्यवाणी करने में जगह बर्बाद नहीं कर सकता।
  • प्रेडिक्शन गेम (The Prediction Game): रोबोट अपनी वर्तमान स्थिति को देखता है, उस कमांड को देखता है जो उसने अभी दी है ("हाथ ऊपर उठाओ"), और कोशिश करता है कि एक सेकंड के अंश में उसका हाथ कैसा दिखेगा, उसका चित्र बनाना।
    • यदि वह सही भविष्यवाणी करता है, तो उसे "अच्छा काम किया" का संकेत मिलता है।
    • यदि वह गलत भविष्यवाणी करता है, तो वह अपने शरीर के आंतरिक मानचित्र (internal map) को समायोजित करना सीखता है।

4. यह गेम-चेंजर क्यों है

पेपर में परीक्षण किया गया कि रोबोट दरवाजे खोलने या हथौड़ा चलाने जैसे कार्य कैसे करते हैं।

  • "टूल" का जादू: एक प्रयोग में, एक रोबोट ने हथौड़ा उठाया। एक सुपरवाइज्ड रोबोट (जिसे इंसान ने सिखाया हो) भ्रमित हो सकता है क्योंकि हथौड़ा उसके मूल शरीर के हिस्से का हिस्सा नहीं था। लेकिन Ego-Foresight रोबोट ने महसूस किया: "अरे, जब मैं हिलता हूँ, तो हथौड़ा भी मेरे साथ हिलता है। इसलिए, हथौड़ा अब 'मैं' का हिस्सा है।" इसने तुरंत अपनी आत्म-छवि को टूल (उपकरण) को शामिल करने के लिए अपडेट कर लिया।
  • परिणाम: अपनी गति की भविष्यवाणी करना सीखकर, रोबोट वास्तविक कार्य को सीखने में बहुत बेहतर हो गया। उसे सफल होने के लिए कम प्रयासों की आवश्यकता पड़ी और उसने उन रोबोट्स की तुलना में बेहतर प्रदर्शन किया जिनमें यह आत्म-जागरूकता नहीं थी।

5. बड़ा परिदृश्य (The Big Picture)

एक वीडियो गेम सीखने के बारे में सोचें।

  • पुराना तरीका: आप बस बटन दबाते रहते हैं जब तक कि आप जीत न जाएं। इसमें बहुत समय लगता है।
  • Ego-Foresight तरीका: आप रुकते हैं और सोचते हैं, "यदि मैं यह बटन दबाता हूँ, तो मेरा कैरेक्टर यहाँ कूदेगा। यदि मैं वह दबाता हूँ, तो मैं वहाँ फिसलेगा।" आप अपने कैरेक्टर के भौतिक विज्ञान (physics) का एक मानसिक मानचित्र बनाते हैं। क्योंकि आप अपने स्वयं के "शरीर" को समझते हैं, आप अपना मस्तिष्क पहेली (वातावरण) को हल करने पर केंद्रित कर सकते हैं, बजाय इसके कि आप केवल यह समझने में उलझे रहें कि कैसे हिलना है।

संक्षेप में: Ego-Foresic रोबोट्स को अपनी गतिविधियों के साथ "आगे क्या होगा?" का खेल खेलकर "खुद को जानने" की शिक्षा देता है। यह आत्म-ज्ञान एक शॉर्टकट के रूप में कार्य करता है, जिससे वे जटिल कार्यों को बहुत तेज़ी से सीख सकते हैं और बिना किसी इंसान द्वारा उनके चारों ओर मास्क बनाए, नए उपकरणों के अनुकूल हो सकते हैं।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →