LANTERN: LLM-Augmented Neurosymbolic Transfer with Experience-Gated Reasoning Networks
यह शोध पत्र LANTERN का प्रस्ताव करता है, जो एक एकीकृत न्यूरोसिम्बोलिक ट्रांसफर लर्निंग फ्रेमवर्क है जो मल्टी-सोर्स रीइन्फोर्समेंट लर्निंग परिदृश्यों में सैंपल एफिशिएंसी और रोबस्टनेस को महत्वपूर्ण रूप से सुधारने के लिए LLM-जनरेटेड टास्क ऑटोमेटा, सिमेंटिक पॉलिसी एग्रीगेशन और अडैप्टिव गेटिंग का लाभ उठाता है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आप एक रोबोट को एक जटिल मिशन पूरा करना सिखाने की कोशिश कर रहे हैं, जैसे कि एक ड्रैगन को हराने के लिए कालकोठरी (dungeon) में रास्ता बनाना। अतीत में, एक रोबोट को इस तरह सिखाना एक बच्चे को केवल एक विशिष्ट प्रकार की कार पर एक विशिष्ट सड़क पर अभ्यास करने की अनुमति देकर गाड़ी चलाना सिखाने जैसा था। यदि रोबोट ने एक छोटी, शांत सड़क पर सीखा, तो उसे व्यस्त राजमार्ग पर गाड़ी चलाने के लिए कहा जाने पर वह पूरी तरह से भटक सकता है।
यह शोध पत्र LANTERN पेश करता है, जो रोबोट को सिखाने का एक नया तरीका है जो एक सुपर-स्मार्ट, बहुभाषी मेंटर (गुरु) प्रणाली की तरह कार्य करता है। केवल एक शिक्षक या एक प्रकार के अनुभव पर निर्भर रहने के बजाय, LANTERN कई अलग-अलग "शिक्षकों" (स्रोत कार्यों) से ज्ञान प्राप्त करता है और यह पता लगाता है कि उनके परामर्श को बुद्धिमानी से कैसे मिलाया जाए।
यहाँ बताया गया है कि LANTERN कैसे काम करता है, जिसे चार सरल चरणों में विभाजित किया गया है:
1. "अनुवादक" (LLM-जनित मानचित्र)
आमतौर पर, किसी रोबोट को एक जटिल कार्य सिखाने के लिए, एक मानव विशेषज्ञ को एक विस्तृत मानचित्र (जिसे "डिटरमिनिस्टिक फाइनाइट ऑटोमेटा" या DFA कहा जाता है) खींचना पड़ता है, जो हर उस कदम को दर्शाता है जिसे रोबोट को उठाना चाहिए। यह धीमा है और इसके लिए एक विशेषज्ञ होना आवश्यक है।
LANTERN की तरकीब: यह एक लार्ज लैंग्वेज मॉडल (जैसे कि एक बहुत ही उन्नत AI चैटबॉट) का उपयोग करता है ताकि कार्य के एक साधारण वाक्य विवरण (जैसे, "चाबी खोजो, फिर ढाल खोजो, फिर तलवार खोजो") को पढ़ सके और स्वचालित रूप से रोबोट के लिए मानचित्र बना सके।
- उपमा: एक मानव वास्तुकार द्वारा हफ्तों तक ब्लूप्रिंट बनाने के बजाय, आप बस एक स्मार्ट AI को कहते हैं, "एक घर बनाओ जिसमें एक रसोई और दो बेडरूम हों," और वह तुरंत आपको ब्लूप्रिंट सौंप देता है।
2. "ज्ञान का पुस्तकालय" (बहु-स्रोत एकत्रीकरण)
अतीत में, रोबोट केवल एक अन्य कार्य से ही सीख सकते थे। यदि आप एक रोबोट को "लकड़ी इकट्ठा करना" सिखाना चाहते थे, तो आप केवल एक ऐसे रोबोट का उपयोग कर सकते थे जिसने पहले से ही "लकड़ी इकट्ठा करना" सीखा हो। यदि आप एक ऐसे रोबोट का उपयोग करने का प्रयास करते थे जिसने "पत्थर इकट्ठा करना" सीखा था, तो उसकी सलाह बेकार या भ्रमित करने वाली हो सकती थी।
LANTERN की तरकीब: यह एक साथ कई अलग-अलग शिक्षकों को देखता है। यह पूछता है: "क्या 'लकड़ी इकट्ठा करने' का कार्य 'पत्थर इकट्ठा करने' के कार्य के साथ कोई समानता साझा करता है?"
- जादू: यह एक "सिमेंटिक एम्बेडिंग" (शब्दों को गणितीय बिंदुओं में बदलने का एक तरीका) का उपयोग करता है। यह महसूस करता है कि भले ही "लकड़ी" और "पत्थर" अलग हैं, लेकिन "सामग्री एकत्र करने" की अवधारणा समान है।
- उपमा: कल्पना कीजिए कि आप एक विशिष्ट स्टू (stew) बनाना सीख रहे हैं। केवल एक ऐसे शेफ से पूछने के बजाय जो केवल स्टू बनाता है, आप एक बेकर, एक ग्रिल मास्टर और एक सूप शेफ से पूछते हैं। LANTERN उनके परामर्श को देखता है और कहता है, "बेकर जानता है कि सामग्री को कैसे मिलाया जाता है (स्टू के आधार के लिए अच्छा है), और ग्रिल मास्टर जानता है कि समय का प्रबंधन कैसे किया जाता है (गर्मी के लिए अच्छा है)। मैं उनकी प्रासंगिकता के आधार पर उनकी सलाह को एक साथ मिला दूँगा।"
3. "विश्वास मीटर" (दोहरी-अस्थिरता गेटिंग)
यह सबसे महत्वपूर्ण हिस्सा है। यदि कोई रोबत अंधे होकर गलत शिक्षक का अनुसरण करता है, तो वह विफल हो जाएगा। LANTERN में एक अंतर्निहित "विश्वास मीटर" होता है जो यह तय करता है कि किसी दिए गए क्षण में शिक्षकों की कितनी बात मानी जाए। यह दो चीजें जाँचता है:
- अनुभव अस्थिरता (Experience Volatility): क्या रोबोट अभी भ्रमित है? (क्या वह बड़ी गलतियाँ कर रहा है?) यदि हाँ, तो वह शिक्षकों पर अधिक भरोसा करता है।
- सिमेंटिक अस्थिरता (Semantic Volatility): क्या शिक्षक की सलाह वास्तव में इस विशिष्ट क्षण के लिए प्रासंगिक है? यदि रोबोट "लकड़ी इकट्ठा" रहा है लेकिन शिक्षक "ब्रेड बेक करने" के बारे में बात कर रहा है, तो विश्वास मीटर गिर जाता है।
- उपमा: एक छात्र के बारे में सोचें जो परीक्षा दे रहा है।
- यदि छात्र को उत्तर पता है (कम अस्थिरता), तो वह शिक्षक को अनदेखा करता है और अपना उत्तर लिखता है।
- यदि छात्र फंसा हुआ और भ्रमित है (उच्च अस्थिरता), तो वह शिक्षक की ओर देखता है।
- महत्वपूर्ण रूप से: यदि शिक्षक किसी पूरी तरह से अलग विषय पर बात कर रहा है (कम सिमेंटिक संरेखण), तो छात्र उन्हें अनदेखा कर देता है भले ही वह भ्रमित क्यों न हो। LANTERN केवल सही समय पर सही शिक्षक की बात सुनता है।
4. परिणाम: तेजी से और समझदारी से सीखना
इस शोध पत्र ने दो मुख्य दुनियाओं में LANTERN का परीक्षण किया:
- डंजन क्वेस्ट (Dungeon Quest): एक रोबोट जो वस्तुओं को इकट्ठा करने और ड्रैगन से लड़ने के लिए भूलभुलैया में रास्ता बना रहा है।
- ब्लाइंड क्राफ्ट्समैन (Blind Craftsman): एक रोबोट जो वस्तुएं बनाने के लिए संसाधन (जैसे लकड़ी या अयस्क) एकत्र कर रहा है।
निष्कर्ष:
- गति: LANTERN ने पिछले तरीकों की तुलना में 40% से 60% तेजी से सीखा। इसे कार्य में महारत हासिल करने के लिए बहुत कम प्रयासों की आवश्यकता पड़ी।
- मजबूती (Robustness): भले ही "शिक्षक" बहुत अलग दुनिया के थे (उदाहरण के लिए, खेती करने वाले रोबोट की सलाह का उपयोग करके खनन करने वाले रोबोट को सिखाना), LANTERN भ्रमित नहीं हुआ। इसने सफलतापूर्वक सलाह के उपयोगी हिस्सों को चुना और बाकी को अनदेखा कर दिया।
- कोई मैनुअल कार्य नहीं: इसे मानचित्र बनाने के लिए मनुष्यों की आवश्यकता नहीं थी; AI ने इसे स्वचालित रूप से किया।
सारांश
LANTERN एक ऐसे छात्र की तरह है जिसके पास हजारों अलग-अलग विशेषज्ञों का पुस्तकालय है। जब छात्र के सामने कोई नई चुनौती आती है, तो वह केवल एक विशेषज्ञ की नकल नहीं करता है। इसके बजाय, वे:
- एक AI से लक्ष्य का मानचित्र बनाने के लिए कहते हैं।
- अपने पुस्तकालय को स्कैन करते हैं ताकि उन विशेषज्ञों को खोजा जा सके जिन्होंने समान चीजें की हैं।
- उन विशेषज्ञों को केवल तभी सुनते हैं जब वे भ्रमित होते हैं, और केवल तभी जब विशेषज्ञ सही विषय पर बात कर रहे होते हैं।
यह रोबोट को जटिल, दीर्घकालिक कार्यों को पहले से कहीं अधिक तेजी से और अधिक विश्वसनीयता के साथ सीखने की अनुमति देता है, बिना किसी मानव के हर कदम को नियंत्रित करने की आवश्यकता के।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।