← नवीनतम पेपर
🤖 machine learning

Apple: Toward General Active Perception via Reinforcement Learning

यह शोध पत्र APPLE को प्रस्तुत करता है, जो एक नवीन सुदृढीकरण शिक्षण (reinforcement learning) ढांचा है जो स्पर्श अन्वेषण (tactile exploration) सहित विविध रोबोटिक कार्यों के लिए सक्रिय धारणा (active perception) हेतु एक बहुमुखी, सामान्य-उद्देश्यीय समाधान बनाने के लिए एक ट्रांसफार्मर-आधारित धारणा मॉड्यूल और निर्णय लेने वाली नीति को संयुक्त रूप से प्रशिक्षित करता है।

मूल लेखक: Tim Schneider, Cristiana de Farias, Roberto Calandra, Liming Chen, Jan Peters

प्रकाशित 2026-03-02
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Tim Schneider, Cristiana de Farias, Roberto Calandra, Liming Chen, Jan Peters

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। ✨ नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक बिखरे हुए, अंधेरे टूलबॉक्स के अंदर एक विशिष्ट उपकरण (tool) की तलाश कर रहे हैं। आप अंदर देख नहीं सकते, इसलिए आपको अपना हाथ अंदर डालना होगा। यदि आप बस अपनी उंगलियों को बेतरतीब ढंग से हिलाते हैं, तो शायद आप अंततः रिंच (wrench) ढूंढ लेंगे, लेकिन इसमें बहुत समय लग सकता है। यदि आप समझदार हैं, तो आप चीज़ों को महसूस करेंगे, हैंडल के आकार पर ध्यान देंगे, और यह समझने के लिए कि वह वास्तव में कहाँ है और किस दिशा में है, अपने हाथ को उसके साथ स्लाइड करेंगे।

यह शोध पत्र APPLE (एक्टिव परसेप्शन पॉलिसी लर्निंग) पेश करता है, जो रोबोट को ठीक यही सिखाने का एक नया तरीका है: जानकारी के लिए केवल प्रतीक्षा करने के बजाय, जानकारी कैसे "देखनी" (या महसूस करनी) है, यह सीखना।

यहाँ बताया गया है कि यह कैसे काम करता है, सरल उपमाओं का उपयोग करते हुए:

1. समस्या: रोबोट "अंधा" और अनभिज्ञ है

अधिकांश रोबोट उन चीजों को देखने में बहुत अच्छे होते हैं जो उनके ठीक सामने होती हैं। लेकिन वास्तविक दुनिया में, चीजें अक्सर छिपी होती हैं, या रोबोट को उनका केवल एक छोटा सा, धुंधला हिस्सा ही दिखाई देता है (जैसे कि उंगली के पोर से किसी वस्तु के एक छोटे से हिस्से को छूना)।

  • पुराना तरीका: पिछले रोबोट "चीट शीट्स" या कठोर नियमों का उपयोग करते थे। उदाहरण के लिए, "यदि आप एक वक्र (curve) को छूते हैं, तो बाईं ओर बढ़ें।" यह एक विशिष्ट कार्य के लिए तो काम करता है, लेकिन यदि आप वस्तु या वातावरण को बदल देते हैं, तो यह विफल हो जाता है। यह एक कुत्ते को केवल एक विशिष्ट स्वर में "बैठो" कहने पर बैठने के लिए सिखाने जैसा है; यदि आप कहते हैं "कृपया बैठिए," तो कुत्ता भ्रमित हो जाता है।
  • लक्ष्य: शोधकर्ता एक ऐसा रोबोट चाहते थे जो सीखना सीख सके। वे एक ऐसा रोबोट चाहते थे जो कह सके, "मुझे नहीं पता कि यह क्या है, इसलिए मुझे अधिक जानने के लिए अपना हाथ हिलाने की आवश्यकता है," बिना यह बताए कि उसे बिल्कुल कैसे हिलना है।

2. समाधान: "स्मार्ट डिटेक्टिव" (APPLE)

लेखकों ने APPLE नामक एक फ्रेमवर्क बनाया है। APPLE को एक डिटेक्टिव के रूप में सोचें जो एक छात्र भी है।

  • छात्र वाला भाग (परसेप्शन): रोबोट के पास एक "मस्तिष्क" (एक न्यूरल नेटवर्क) है जो अनुमान लगाने की कोशिश करता है कि वस्तु क्या है (जैसे, "क्या यह एक रिंच है या पेचकश?")।
  • डिटेक्टिव वाला भाग (एक्शन): रोबोट के पास एक "हाथ" है जो यह तय करता है कि बेहतर सुराग पाने के लिए आगे कहाँ जाना है।
  • जादुई ट्रिक: आमतौर पर, आप छात्र और डिटेक्टिव को अलग-अलग प्रशिक्षित करते हैं। APPLE इन दोनों को एक साथ प्रशिक्षित करता है।
    • यदि छात्र गलत अनुमान लगाता है, तो डिटेक्टिव सीखता है, "ओह, मुझे बेहतर सुराग पाने के लिए अपना हाथ एक अलग जगह पर ले जाने की आवश्यकता है!"
    • यदि डिटेक्टिव ऐसी जगह जाता है जो छात्र को सही अनुमान लगाने में मदद करती है, तो दोनों को एक "हाई फाइव" (पुरस्कार) मिलता है।

वे रीइन्फोर्समेंट लर्निंग (प्रयास और त्रुटि) को ट्रांसफॉर्मर्स (AI मस्तिष्क का एक प्रकार जो अनुक्रमों को समझने में अच्छा है, जैसे कहानी पढ़ना) के साथ जोड़कर उपयोग करते हैं।

3. यह कैसे सीखता है: "वीडियो गेम" की उपमा

कल्पना कीजिए कि रोबोट एक वीडियो गेम खेल रहा है जहाँ लक्ष्य एक छिपी हुई आकृति की पहचान करना है।

  • स्क्रीन: रोबोट एक बार में वस्तु का केवल एक छोटा 5x5 पिक्सेल का विंडो (एक "झलक") देखता है।
  • कंट्रोल्स: रोबोट उस विंडो को कहीं भी घुमा सकता है।
  • स्कोर: रोबोट को आकृति को सही ढंग से पहचानने के लिए अंक मिलते हैं।
  • रणनीति:
    • एक रैंडम प्लेयर (बेसलाइन) विंडो को बेतरतीब ढंग से इधर-उधर घुमाता है। वे भाग्यशाली हो सकते हैं, लेकिन आमतौर पर वे विफल हो जाते हैं।
    • APPLE रोबोट जल्दी से समझ जाता है: "यदि मैं अपनी विंडो को वस्तु के किनारे पर ले जाता हूँ, तो मैं वक्र (curve) देख सकता हूँ। यदि मैं वक्र का अनुसरण करता हूँ, तो मैं पूरी आकृति को समझ सकता हूँ।"
    • यह एक रणनीति सीख जाता है (जैसे "एक घेरे में खोज करना," फिर "हैंडल के साथ स्लाइड करना") जो किसी इंसान ने इसे नहीं सिखाई थी। इसने अपनी गलतियों को कम करने की कोशिश करके खुद ही यह रणनीति खोजी।

4. प्रयोग: डिटेक्टिव का परीक्षण

शोधकर्ताओं ने कई "मिस्ट्री बॉक्स" चुनौतियों पर APPLE का परीक्षण किया:

  • आकृति का खेल: स्पर्श करके यह पहचानना कि छिपी हुई वस्तु एक वृत्त (circle) है या वर्ग (square)।
  • संख्या का खेल: मिट्टी से बनी एक 3D संख्या (जैसे "3" या "7") को छूकर यह अनुमान लगाना कि वह कौन सी संख्या है।
  • वॉल्यूम का खेल: केवल उसकी सतह को महसूस करके यह अनुमान लगाना कि 3D वस्तु कितनी बड़ी है।
  • टूलबॉक्स का खेल: एक बड़े बॉक्स में रिंच (wrench) को खोजना और यह पता लगाना कि वह वास्तव में कहाँ है और किस दिशा में है।

परिणाम:

  • APPLE पिछले तरीकों की तुलना में कहीं अधिक बेहतर था।
  • इसने प्रत्येक कार्य के लिए विशिष्ट नियम लिखने की आवश्यकता के बिना इन पहेलियों को हल करना सीख लिया।
  • इसने सरल कार्यों (वृत्त बनाम वर्ग) और जटिल कार्यों (बिखरे हुए बॉक्स में रिंच की पहचान करना) दोनों पर काम किया।
  • यहाँ तक कि जब उन्होंने नए कार्य के लिए सेटिंग्स को नहीं बदला, तब भी APPLE ने अच्छा प्रदर्शन किया, जिससे यह साबित होता है कि यह एक सामान्य-उद्देश्य वाला टूल है, न कि केवल एक ही काम करने वाला यंत्र।

5. यह क्यों महत्वपूर्ण है

APPLE से पहले, यदि आप चाहते थे कि कोई रोबोट एक नए वातावरण का पता लगाए, तो आपको एक प्रोग्रामर होना पड़ता था और यह लिखने के लिए जटिल नियम बनाने पड़ते थे कि उसे कैसे अन्वेषण करना चाहिए।

APPLE के साथ, आप बस रोबोट को एक लक्ष्य देते हैं ("यह वस्तु क्या है इसका पता लगाओ") और सफलता को मापने का एक तरीका (लॉस फंक्शन) देते हैं। रोबोट बाकी सब खुद समझ लेता है। यह एक बच्चे को उत्तर वाले नक्शे के बजाय एक रहस्य सुलझाने के लिए आवर्धक लेंस (magnifying glass) देने जैसा है।

संक्षेप में: APPLE रोबोट को जिज्ञासु बनना सिखाता है। खाली बैठे रहने या बेतरतीब ढंग से घूमने के बजाय, वे सक्रिय रूप से उस जानकारी को खोजने के लिए सीखते हैं जिसकी उन्हें अपने आस-पास की दुनिया को समझने के लिए आवश्यकता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →