← नवीनतम पेपर
🤖 AI

PEAM: Parametric Embodied Agent Memory through Contrastive Internalization of Experience in Minecraft

PEAM माइनक्राफ्ट में एम्बॉडीड एजेंट्स के लिए एक नवीन ढांचा है जो धीमी विचारशील तर्क और तेज़ रिफ्लेक्सिव निष्पादन की एक दोहरी-प्रणाली वास्तुकला का उपयोग करके स्मृति को इन्फरेंस-टाइम रिट्रीवल से पैरामीटर-रेसिडेंट कौशल में परिवर्तित करता है, जहाँ विफलताएं कंट्रास्टिव लर्निंग के लिए महत्वपूर्ण प्रशिक्षण संकेतों के रूप में कार्य करती हैं और एक स्व-ट्रिगर तंत्र स्वायत्त रूप से यह निर्णय लेता है कि कैटास्ट्रोफिक फॉरगेटिंग के बिना निरंतर शिक्षण सक्षम करने के लिए अनुभवों को कब आंतरिक रूप से आत्मसात किया जाए।

मूल लेखक: Yuchen Guo, Junli Gong, Hongmin Cai, Yiu-ming Cheung, Weifeng Su

प्रकाशित 2026-05-28
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Yuchen Guo, Junli Gong, Hongmin Cai, Yiu-ming Cheung, Weifeng Su

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक रोबोट को Minecraft खेलना सिखा रहे हैं। वर्तमान में, अधिकांश रोबोट एक ऐसे छात्र की तरह सीखते हैं जो कभी कुछ याद नहीं रखता। हर बार जब वे किसी ज़ोंबी का सामना करते हैं या भट्टी (furnace) बनाने की ज़रूरत होती है, तो उन्हें रुकना पड़ता है, पिछले अनुभवों की एक विशाल नोटबुक खोलनी पड़ती है, एक समान कहानी खोजनी पड़ती है, उसे पढ़ना पड़ता है, और फिर यह समझने की कोशिश करनी पड़ती है कि क्या करना है। यह धीमा है, बहुत अधिक "मस्तिष्क स्थान" (कंप्यूटर मेमोरी) का उपयोग करता है, और यदि नोटबुक बहुत बड़ी हो जाती है, तो वे भ्रमित हो जाते हैं।

PEAM (पैरामीट्रिक एम्बोडीड एजेंट मेमोरी) सीखने का एक नया तरीका है जो खेल बदल देता है। केवल एक नोटबुक रखने के बजाय, PEAM रोबोट को अपने अनुभवों को आंतरिक बनाने (internalize) में मदद करता है। यह "मुझे याद है कि मैंने यह कैसे किया था" को "मुझे पता है कि यह कैसे करना है" में बदल देता है।

यह यहाँ कैसे काम करता है, सरल अवधारणाओं में विभाजित है:

1. दो-मस्तिष्क प्रणाली: विचारक और कर्ता

PEAM एक "धीमे" और एक "तेज़" मस्तिष्क को एक साथ काम करते हुए उपयोग करता है:

  • धीमा विचारक (Deliberative LLM): यह एक विशेषज्ञ योजनाकार है। यह गहराई से सोचता है, कोड लिखता है, जटिल चरणों की योजना बनाता है, और कठिन समस्याओं को हल करने की कोशिश करता है। यदि यह विफल होता है, तो यह समझता है कि क्यों और फिर से प्रयास करता है।
  • तेज़ कर्ता (Parametric Skills): यह रिफ्लेक्सिव मसल मेमोरी (muscle memory) है। एक बार जब धीमा विचारक किसी समस्या को हल कर लेता है (जैसे तलवार बनाना), तो वह केवल कहानी को सहेजता नहीं है। वह सीधे तेज़ कर्ता को वह कौशल सिखाता है। अगली बार, तेज़ कर्ता धीमे विचारक से पूछे बिना तुरंत वह काम कर सकता है।

2. "आंतरिक बनाने" की प्रक्रिया: नोटबुक से मसल मेमोरी तक

साइकिल चलाना सीखने के बारे में सोचें। शुरू में, आपको संतुलन बनाने, पैडल मारने और स्टीयरिंग करने के बारे में सोचना पड़ता है (धीमा विचारक)। अंततः, आप बिना सोचे समझे इसे बस कर लेते हैं (तेज़ कर्ता)। PEAM रोबोट के लिए इसे स्वचालित करता है।

  • विफलता से सीखना: अधिकांश रोबोट गलतियों को अनदेखा करते हैं या उन्हें केवल टेक्स्ट नोट्स के रूप में लिख देते हैं। PEAM विफलता को एक प्रशिक्षण संकेत (training signal) के रूप में देखता है। यह एक "विफल प्रयास" और उस "सुधार" को देखता है जिसने उसे ठीक किया। यह रोबोट को सिखाता है: "X मत करो (विफलता); Y करो (सुधार)।" यह एक कोच की तरह है जो कहता है, "तुम इसलिए गिरे क्योंकि तुम बहुत बाईं ओर झुक गए थे; अगली बार, दाईं ओर झुकना।"
  • "योग्यता" स्कोर: रोबोट सब कुछ नहीं सीखता। इसके पास एक फ़िल्टर (जिसे Parameterization-Worthiness कहा जाता है) है जो पूछता है: "क्या यह कौशल इतना उपयोगी है कि इसे याद किया जाए? क्या यह स्थिर है? क्या यह कुछ ऐसा है जो हम अक्सर करते हैं?" यदि उत्तर हाँ है, तो इसे आंतरिक बनाया जाता है। यदि यह एक बार की घटना है, तो यह नोटबुक में ही रहता है।

3. "विशेषज्ञ जिम" (Isolated Adapters)

यह पेपर का सबसे बड़ा नवाचार है जो "भूलने" को रोकने के लिए है।
एक जिम की कल्पना करें जिसमें अलग-अलग कमरे हैं: एक क्राफ्टिंग रूम, एक कॉम्बैट रूम (लड़ाई का कमरा), और एक फार्मिंग रूम

  • पुराने सिस्टम में, लड़ाई सीखना अनजाने में रोबोट के क्राफ्टिंग करने के तरीके को ओवरराइट कर सकता था (जैसे अपने जिम के कपड़ों को आपस में मिला देना)।
  • PEAM में, रोबोट के पास भौतिक रूप से अलग कमरे (जिन्हें adapters कहा जाता है) होते हैं। जब यह लड़ना सीखता है, तो यह केवल "कॉम्बैट रूम" को अपडेट करता है। "क्राफ्टिंग रूम" अछूता रहता है। इसका मतलब है कि रोबोट बिना पुराने को भूले हमेशा नए कौशल सीख सकता है।

4. स्वयं-ट्रिगर होने वाला अलार्म क्लॉक

रोबोट को कैसे पता चलता है कि उसे अभ्यास कब बंद करना चाहिए और याद करना कब शुरू करना चाहिए?

  • पुराना तरीका: "आइए 100 प्रयासों के लिए अभ्यास करें, फिर याद करें।" (यह कठोर है और शायद बहुत जल्दी या बहुत देर से याद कर लेता है)।
  • PEAM का तरीका: रोबोट के पास एक स्वयं-ट्रिगर होने वाला अलार्म है। यह अपनी विफलता दर पर नज़र रखता है। यदि यह किसी विशिष्ट कार्य में सामान्य से अधिक बार विफल होने लगता है, तो अलार्म बज उठता है: "हे, हम इसमें संघर्ष कर रहे हैं। आइए तुरंत समाधान को आंतरिक बनाना बंद करें और इसे याद करें।" यह बिना किसी मानव द्वारा विशिष्ट संख्या सेट किए, किसी भी कार्य के लिए काम करता है।

यह बेहतर क्यों है?

इस पेपर ने Minecraft में इसका परीक्षण किया और तीन मुख्य लाभ पाए:

  1. गति: क्योंकि रोबोट को हर बार नोटबुक खोजने की आवश्यकता नहीं होती है, इसलिए यह बहुत तेज़ी से कार्य करता है (परीक्षणों में लगभग 40% तेज़)।
  2. दक्षता: यह बहुत कम कंप्यूटर शक्ति का उपयोग करता है (लग लगभग 85% कम "टेक्स्ट" को प्रोसेस करना पड़ता है) क्योंकि इसे पुरानी कहानियों को फिर से पढ़ने की आवश्यकता नहीं होती है।
  3. भूलना नहीं: क्योंकि इसके पास "विशेषज्ञ कमरे" हैं, इसलिए एक नया कॉम्बैट मूव सीखने से रोबोट घर बनाना नहीं भूल गया।

सारांश

PEAM एक ऐसे छात्र को लेने जैसा है जो हर एक सवाल के लिए पाठ्यपुस्तक पर निर्भर रहता है और उसे एक ऐसे विशेषज्ञ में बदलना है जिसने वास्तव में कौशल को आत्मसात (memorize) कर लिया है। यह करके सीखता है, गलतियों से सीखता है, विभिन्न कौशलों को अलग रखता है ताकि वे आपस में न मिलें, और इसे पता होता है कि अभ्यास कब रोकना है और याद करना कब शुरू करना है। परिणाम एक ऐसा रोबोट है जो तेज़, स्मार्ट है, और जो उसने सीखा है उसे भूलता नहीं है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →