← नवीनतम पेपर
💻 computer science

Domain Adaptation with Adaptive Imagination for Visual Reinforcement Learning under Limited Target Data

यह शोध पत्र AIDA का प्रस्ताव करता है, जो विजुअल रीइन्फोर्समेंट लर्निंग के लिए एक डोमेन एडेप्टेशन फ्रेमवर्क है जो वितरण-शिफ्ट-जागरूक डिस्क्रिमिनेटर और एक सेल्फ-कंसिस्टेंसी लॉस के माध्यम से विश्वसनीय, सिमेंटिक इमेजिनेशन रोलआउट्स उत्पन्न करके लक्ष्य डेटा की कमी की चुनौती को दूर करता है, जिससे अतिरिक्त लक्ष्य वातावरण संपर्क के बिना प्रभावी सिम-टू-रियल ट्रांसफर सक्षम होता है।

मूल लेखक: Hyunwoo Park, Sang-Hyun Lee

प्रकाशित 2026-06-30
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Hyunwoo Park, Sang-Hyun Lee

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक रोबोट को चलना सिखा रहे हैं। आपके पास इसे सिखाने के दो तरीके हैं:

  1. सिमुलेशन (वीडियो गेम): आप रोबोट को एक आदर्श, कंप्यूटर-जनित दुनिया में सिखाते हैं। यह तेजी से सीखता है क्योंकि भौतिक विज्ञान (physics) एकदम सटीक है, और आप देख सकते हैं कि रोबोट के शरीर का हर हिस्सा कहाँ है (जैसे कि उसके घुटने का सटीक कोण क्या है)।

  2. वास्तविक दुनिया (बिखरा हुआ किचन): आप चाहते हैं कि रोबोट आपके वास्तविक घर में चले। लेकिन यहाँ समस्या यह है कि वास्तविक दुनिया अलग दिखती है (रोशनी, बनावट, छाया), और रोबोट केवल एक कैमरे के माध्यम से "देख" सकता है। उसे अब अपने शरीर के सटीक कोणों का पता नहीं है; वह केवल पिक्सेल देखता है।

वीडियो गेम और वास्तविक दुनिया के बीच के इस अंतर को "सिम-टू-रियल गैप" (Sim-to-Real Gap) कहा जाता है। आमतौर पर, यदि आप गेम में प्रशिक्षित रोबोट को वास्तविक दुनिया में ले जाते हैं, तो वह तुरंत गिर जाता है।

समस्या: अभ्यास के लिए पर्याप्त समय की कमी

इसे ठीक करने के लिए, वैज्ञानिक आमतौर पर रोबोट को वास्तविक दुनिया में "अनुकूलित" (adapt) होने के लिए अभ्यास करने देते हैं। लेकिन वास्तविक दुनिया में, डेटा एकत्र करना महंगा, धीमा और जोखिम भरा है (रोबोट टूट सकता है)।

अधिकांश पिछले तरीकों ने माना था कि आप रोबोट को सिखाने के लिए घंटों का वास्तविक दुनिया का डेटा एकत्र कर सकते हैं। लेकिन वास्तव में, आपके पास केवल 5 मिनट का फुटेज हो सकता है। यदि आप बहुत कम डेटा के साथ रोबोट को सिखाने की कोशिश करते हैं, तो यह आमतौर पर विफल हो जाता है क्योंकि इसने गेम और वास्तविकता के बीच के अंतर को समझने के लिए पर्याप्त उदाहरण नहीं देखे होते हैं।

समाधान: AIDA (एडेप्टिव इमेजिनेशन - Adaptive Imagination)

लेखक एक नया तरीका प्रस्तावित करते हैं जिसे AIDA कहा जाता है। AIDA को एक स्मार्ट ट्यूटर के रूप में सोचें जो रोबोट को उसकी "कल्पना" का उपयोग करके बहुत कम वास्तविक दुनिया के डेटा से सीखने में मदद करता है।

AIDA कैसे काम करता है, यहाँ तीन सरल चरणों में दिया गया है:

1. "ड्रीम" चरण (कल्पना)

चूंकि रोबोट के पास अध्ययन करने के लिए वास्तविक दुनिया की पर्याप्त तस्वीरें नहीं हैं, इसलिए AIDA एक "ड्रिम मशीन" (डायनेमिक्स मॉडल) का उपयोग करता है ताकि यह कल्पना कर सके कि आगे क्या होगा।

  • उपमा: कल्पना कीजिए कि आप गाड़ी चलाना सीख रहे हैं। आपके पास एक नक्शा है (सिमुलेशन) और एक विशिष्ट सड़क की कुछ तस्वीरें हैं (सीमित वास्तविक डेटा)। AIDA अपनी आँखें बंद करता है और उस सड़क पर गाड़ी चलाने की कल्पना करता है, हर मोड़ और झटके का पूर्वानुमान लगाता है। यह उन कुछ तस्वीरों के आधार पर हजारों "नकली" ड्राइविंग परिदृश्य उत्पन्न करता है।

2. "झूठ पकड़ने वाला यंत्र" (द डिस्क्रिमिनेटर)

कल्पना करने के साथ समस्या यह है कि रोबोट अंततः मतिभ्रम (hallucinate) करने लगता है। यदि रोबोट बहुत लंबे समय तक कल्पना करता है, तो वह ऐसी दुनिया में जा सकता है जो वास्तविक सड़क से बिल्कुल अलग हो (जैसे, कल्पना करना कि वह चाँद पर गाड़ी चला रहा है)।

  • समाधान: AIDA के पास एक झूठ पकड़ने वाला यंत्र (एक तीन-तरफा डिस्क्रिमिनेटर) है। यह हर "कल्पित" कदम की जाँच करता है।
    • क्या यह वास्तविक सड़क जैसा दिखता है? हाँ? आगे बढ़ते रहें।
    • क्या यह अजीब लग रहा है या वास्तविकता से दूर जा रहा है? हाँ? तुरंत रुक जाएँ।
  • उपमा: यह एक सख्त शिक्षक की तरह है जो कहता है, "आप 10 सेकंड तक गाड़ी चलाने की कल्पना कर सकते हैं, लेकिन जिस क्षण आप बादलों पर गाड़ी चलाने की कल्पना करेंगे, मैं आपको रोक दूँगा।" यह सुनिश्चित करता है कि रोबोट केवल "विश्वसनीय" सपनों से सीखे, न कि पागलपन भरे मतिभ्रम से।

3. "मिरर टेस्ट" (स्व-संगति/Self-Consistency)

एक बार जब रोबोट के पास ढेर सारे विश्वसनीय काल्पनिक कदम होते हैं, तो AIDA रोबोट को "मिरर, मिरर" का खेल खिलाता है।

  • यह एक काल्पनिक स्थिति लेता है (जैसे, "घुटना 45 डिग्री पर मुड़ा हुआ है"), उसे एक तस्वीर में बदलता है, और फिर उस तस्वीर को वापस उस स्थिति में बदलने की कोशिश करता है।
  • यदि रोबोट कहता है, "मैंने अपना घुटना 45 डिग्री पर मोड़ा था," लेकिन तस्वीर दिखाती है कि घुटना 90 डिग्री पर है, तो रोबोट समझ जाता है कि उसने गलती की है।
  • उपमा: यह आईने में देखने जैसा है। यदि आपको लगता है कि आपकी शर्ट साफ है, लेकिन आईना दाग दिखाता है, तो आप जानते हैं कि आपको अपनी समझ को ठीक करने की आवश्यकता है। यह "मिरर टेस्ट" रोबोट को केवल अनुमान लगाने के बजाय, जो वह देख रहा है उसके वास्तविक अर्थ को सीखने के लिए मजबूर करता है।

परिणाम

लेखकों ने सात अलग-अलग रोबोट कार्यों (जैसे चलना, तैरना और पहुँचना) पर इसका परीक्षण किया। उन्होंने रोबोट को बहुत कम वास्तविक दुनिया का डेटा दिया (अन्य तरीकों की तुलना में लगभग 1/6 हिस्सा)।

  • विजेता: AIDA ने लगातार अन्य सभी तरीकों को पछाड़ दिया।
  • क्यों? अन्य तरीकों ने थोड़े से वास्तविक डेटा से सीखने की कोशिश की और विफल रहे, या उन्होंने बहुत अधिक कल्पना करने की कोशिश की और भ्रमित हो गए। AIDA ने "स्वीट स्पॉट" (सही संतुलन) खोज लिया: उसने पर्याप्त कल्पना की, लेकिन जैसे ही कल्पना अविश्वसनीय होने लगी, वह रुक गया।
  • आश्चर्य: कुछ मामलों में, AIDA का प्रदर्शन उस रोबोट से भी बेहतर था जिसे असीमित समय के लिए वास्तविक दुनिया में अभ्यास करने की अनुमति दी गई थी। ऐसा इसलिए क्योंकि AIDA ने पहले एक स्थिर "गेम" संस्करण से सीखा, जबकि असीमित समय वाले रोबोट को केवल बिखरी हुई कैमरा छवियों का उपयोग करके सब कुछ शुरू से सीखना पड़ा।

सारांश

AIDA रोबोट को वास्तविक दुनिया में चलने के लिए सिखाने का एक चतुर तरीका है जब आपके पास उन्हें अभ्यास करने के लिए पर्याप्त समय नहीं होता है। यह अतिरिक्त अभ्यास बनाने के लिए कल्पना का उपयोग करता है, कल्पना को बेतुका होने से रोकने के लिए एक झूठ पकड़ने वाले यंत्र का उपयोग करता है, और यह सुनिश्चित करने के लिए कि रोबोट जो देख रहा है उसे समझता है, एक मिरर टेस्ट का उपयोग करता है। यह रोबोट को बहुत कम डेटा से प्रभावी ढंग से सीखने में सक्षम बनाता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →