Emergent Neural Automaton Policies: Learning Symbolic Structure from Visuomotor Trajectories
यह शोध पत्र ENAP को प्रस्तुत करता है, जो एक द्वि-स्तरीय न्यूरो-सिंबोलिक ढांचा (bi-level neuro-symbolic framework) है जो विज़ुओमोटर प्रदर्शनों (visuomotor demonstrations) से एक व्याख्या योग्य मीली स्टेट मशीन (Mealy state machine) को अनुकूल रूप से इन्फर करता है ताकि एक निम्न-स्तरीय नियंत्रक (low-level controller) को निर्देशित किया जा सके, जिससे बिना किसी हस्तनिर्मित सिंबोलिक प्रायोरिटी (hand-crafted symbolic priors) या कार्य-विशिष्ट लेबल की आवश्यकता के, अत्याधुनिक एंड-टू-एंड नीतियों की तुलना में बेहतर सैंपल दक्षता और दीर्घ-अवधि कार्य प्रदर्शन प्राप्त होता है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आप एक रोबोट को एक जटिल लेगो (Lego) किला बनाना सिखा रहे हैं।
यदि आप पारंपरिक "एंड-टू-एंड" (End-to-End) AI का उपयोग करते हैं (जैसे वर्तमान लोकप्रिय मॉडल), तो यह रोबोट को बने हुए किले की एक विशाल, धुंधली फोटो देने और यह कहने जैसा है कि, "बस इसकी नकल करो।" रोबोट एक ही बार में हर एक पिक्सेल और मांसपेशियों की हरकत को याद करने की कोशिश करता है। यह सरल कार्यों के लिए ठीक काम करता है, लेकिन यदि आप इसे अलग रंग योजना या थोड़े अलग आकार वाला किला बनाने के लिए कहते हैं, तो यह भ्रमित हो जाता है। यह एक "ब्लैक बॉक्स" है—हमें नहीं पता कि इसने गलती क्यों की, और इसे सीखने के लिए हजारों उदाहरणों की आवश्यकता होती है।
यदि आप पुराने जमाने के "सिंबोलिक" (Symbolic) AI का उपयोग करते हैं, तो यह रोबोट को एक कठोर, हस्तलिखित निर्देश पुस्तिका देने जैसा है: "चरण 1: लाल ब्लॉक उठाएं। चरण 2: X की ओर बढ़ें। चरण 3: ब्लॉक रखें।" यह बहुत स्पष्ट और तार्किक है, लेकिन यदि रोबोट एक ब्लॉक गिरा देता है या मेज थोड़ी झुकी हुई होती है, तो यह तुरंत टूट जाता है। यह वास्तविक दुनिया के अनुकूल नहीं हो सकता क्योंकि इसके नियम बहुत सख्त हैं।
ENAP (इमर्जेंट न्यूरल ऑटोमेटन पॉलिसी - Emergent Neural Automaton Policy) एक "गोल्डिलॉक्स" (Goldilocks) समाधान है। यह एक ऐसा ढांचा है जो रोबोट को चलते समय अपना स्वयं का तर्क (logic) समझने के लिए प्रशिक्षित करता है।
यह कैसे काम करता है, इसे तीन सरल भागों में विभाजित किया गया है:
1. "डिटेक्टिव" चरण (कहानी खोजना)
रोबोट को निर्देश पुस्तिका देने के बजाय, हम उसे एक मानव विशेषज्ञ द्वारा किला बनाने का वीडियो दिखाते हैं। रोबोट उस वीडियो को देखता है और एक जासूस की तरह व्यवहार करता है।
- उपमा: एक फिल्म देखते हुए यह महसूस करना कि, "ओह, अब नायक 'चेज़' (पीछा करने) के दृश्य में है," और फिर, "अब वे 'हाइड' (छिपने) के दृश्य में हैं।"
- ENAP क्या करता है: यह अव्यवस्थित, निरंतर वीडियो डेटा को देखता है और स्वतः ही क्षणों को विशिष्ट "चरणों" (phases) या "मोड्स" (modes) में समूहित करता है। यह खोज निकालता है कि एक "रीच" (पहुंचना) चरण है, एक "ग्रास्प" (पकड़ना) चरण है, और एक "इन्सर्ट" (डालना) चरण है। इसे यह बताने की आवश्यकता नहीं है कि ये मौजूद हैं; यह उन्हें अपने आप ढूंढ लेता है।
2. "मैप मेकर" चरण (फ्लोचार्ट बनाना)
एक बार जब रोबोट इन चरणों की पहचान कर लेता है, तो वह एक फ्लोचार्ट (स्टेट मशीन) बनाता है।
- उपमा: एक सबवे मैप (मेट्रो मानचित्र) के बारे में सोचें। स्टेशन चरण हैं (रीच, ग्रास्प, इन्सर्ट), और रेखाएं उनके बीच के संबंध हैं।
- जादू: यह मानचित्र कठोर नहीं है। यदि रोबोट एक पेग डालने की कोशिश करता है और वह चूक जाता है (एक "विफलता"), तो मानचित्र जानता है कि दोबारा प्रयास करने के लिए "एलाइन" (संरेखित करना) स्टेशन पर वापस जाने के लिए एक "लूप" है। यह सीखता है कि गलतियां होती हैं और तार्किक अगला कदम "वापस जाकर फिर से कोशिश करना" है, न कि बस क्रैश हो जाना। इसे स्वायत्त विफलता रिकवरी (autonomous failure recovery) कहा जाता है।
3. "ड्राइवर" चरण (बारीक मोटर कौशल)
अब रोबोट के पास एक उच्च-स्तरीय मानचित्र (फ्लोचार्ट) है, लेकिन अभी भी उसे यह जानने की आवश्यकता है कि एक विशिष्ट ब्लॉक को उठाने के लिए अपनी उंगलियों को बिल्कुल कैसे चलाना है।
- उपमा: फ्लोचार्ट वह GPS है जो आपको बताता है, "अगले चौराहे पर बाएं मुड़ें।" "ड्राइवर" वह वास्तविक हाथ है जो कार को स्टीयर करता है।
- यह कैसे काम करता है: फ्लोचार्ट एक "कोर्स" (स्थूल) निर्देश देता है (जैसे, "हाथ को ब्लॉक की ओर ले जाएं")। फिर, एक छोटा, तेज़ न्यूरल नेटवर्क (रेसिडुअल नेटवर्क) उन सूक्ष्म, सटीक समायोजनों को जोड़ता है जिनकी आवश्यकता ब्लॉक को बिना गिराए पकड़ने के लिए होती है।
यह एक बड़ी बात क्यों है?
- यह तेजी से सीखता है: क्योंकि रोबोट कार्य की संरचना (फ्लोचार्ट) को समझता है, इसलिए इसे हर एक गतिविधि को शून्य से याद करने की आवश्यकता नहीं होती है। यह शतरंज के नियमों को सीखने जैसा है, न कि हर संभावित खेल को रटने जैसा। शोध पत्र दिखाता है कि इसे अन्य शीर्ष तरीकों की तुलना में सीखने के लिए 39% कम डेटा पॉइंट्स की आवश्यकता होती है।
- यह व्याख्या योग्य (Explainable) है: यदि रोबोट विफल होता है, तो हम फ्लोचार्ट को देख सकते हैं और कह सकते, "आह, यह 'एलाइन' लूप में फंस गया क्योंकि पेग टेढ़ा था।" हम देख सकते हैं कि वह क्यों विफल हुआ। पारंपरिक AI एक ब्लैक बॉक्स है; ENAP एक व्हाइट बॉक्स है जिसमें एक स्पष्ट मानचित्र है।
- यह "क्या होगा अगर" को संभालता है: यदि आप कार्य को थोड़ा बदल देते हैं (जैसे, "ब्लॉकों को अलग क्रम में स्टैक करें"), तो रोबोट अक्सर अपने मौजूदा मानचित्र पर एक अलग रास्ता बस फॉलो कर सकता है, जबकि अन्य रोबोटों को शुरू से फिर से प्रशिक्षित करने की आवश्यकता होगी।
संक्षेप में
ENAP एक रोबोट लर्निंग सिस्टम है जो रोबोट को अपना स्वयं का निर्देश मैनुअल लिखने के साथ-साथ चलना सिखाता है। यह "बड़ी तस्वीर की सोच" (चरणों की योजना बनाना) को "मांसपेशियों की स्मृति" (हाथ हिलाना) से अलग करता है, जिससे रोबोट स्मार्ट, अनुकूलन योग्य और समझने में आसान बन जाता है, भले ही चीजें गलत हो जाएं।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।