← नवीनतम पेपर
💬 NLP

UniMem: Complementary Episodic-to-Parametric Memory for Boundary-Agnostic Task Streams

UniMem एक स्व-मार्गदर्शन (self-routing) ढांचा है जो सीमा-अज्ञेय (boundary-agnostic) कार्य प्रवाह में नवीन कार्यों के लिए एक एपिसोडिक बफर और आवर्ती पैटर्न के लिए एक विस्तार योग्य पैरामीट्रिक मेमोरी को गतिशील रूप से समन्वित करके स्थिरता-प्लास्टिसिटीता दुविधा (stability-plasticity dilemma) का समाधान करता है, जिससे स्पष्ट कार्य लेबल या निश्चित पैरामीटर बजट की आवश्यकता के बिना उत्कृष्ट प्रदर्शन प्राप्त होता है।

मूल लेखक: Siyu Xia, Chenheng Zhang, Yanting Wu, Haoxuan Li, Jiajun Chai, Xiaohan Wang, Guojun Yin, Wei Lin, Zhouchen Lin, Haifeng Zhang, Jun Wang

प्रकाशित 2026-07-29
📖 8 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Siyu Xia, Chenheng Zhang, Yanting Wu, Haoxuan Li, Jiajun Chai, Xiaohan Wang, Guojun Yin, Wei Lin, Zhouchen Lin, Haifeng Zhang, Jun Wang

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक सुपर-स्मार्ट रोबोट को घर के काम करना सिखा रहे हैं। आप चाहते हैं कि वह हर उस कार्य से सीखे जिसका वह सामना करता है, चाहे वह कपड़े तह करना हो या टपकते नल को ठीक करना। लेकिन यहाँ एक पेंच है: रोबोट के पास पहले से ही सामान्य ज्ञान से भरा एक दिमाग है, और आप हर बार कुछ नया सीखने के लिए उसके पूरे दिमाग को आसानी से फिर से नहीं लिख सकते। यह लार्ज लैंग्वेज मॉडल्स (LLMs) की दुनिया है, जो आज के चैटबॉट्स और सहायकों के पीछे के AI दिमाग हैं।

इन रोबोटों को स्मार्ट बनाने के लिए, वैज्ञानिक आमतौर पर दो मुख्य तरकीबें आजमाते हैं। पहली तरकीब ऐसी है जैसे रोबोट को एक नोटबुक देना (External Memory)। जब वह किसी नई समस्या का सामना करता है, तो वह अपने नोटबुक में पन्ने पलटता है ताकि पहले देखे गए किसी समान उदाहरण को ढूँढ सके। यह नई चीजें सीखने के लिए बहुत अच्छा है, लेकिन यह धीमा है क्योंकि रोबोट को हर बार रुककर खोजना पड़ता है और वह वास्तव में कौशल को "सीखता" नहीं है—वह बस उत्तर की नकल करता है। दूसरी तरकीब है दिमाग को फिर से वायर करना (Parametric Memory)। यह एक कौशल का अभ्यास करने जैसा है जब तक कि आपकी मांसपेशियों को वह याद न हो जाए। एक बार सीख लेने के बाद, रोबोट तेज़ और कुशल होता है, लेकिन इसे जो पहले से पता है उसे बिगाड़े बिना नई चीजें सिखाना कठिन है, और इसे यह जानने की आवश्यकता होती है कि यह वास्तव में क्या सीख रहा है।

बड़ा सवाल जो वैज्ञानिक पूछ रहे हैं: हम एक ऐसा AI कैसे बना सकते हैं जो नए, मिले-जुले कार्यों की कभी न खत्म होने वाली धारा को बिना भ्रमित हुए या धीमे हुए संभाल सके? इसे एक-बार के अजीब कामों के लिए नोटबुक उठाने के लिए पर्याप्त लचीला होना चाहिए, लेकिन सामान्य कार्यों के लिए अभ्यास करने और "मसल-मेमोरी" बनाने के लिए भी पर्याप्त स्मार्ट होना चाहिए। यह पेपर, UniMem, एक समाधान प्रस्तावित करता है जो इस बात से प्रेरित है कि मानव मस्तिष्क वास्तव में कैसे काम करता है।


मस्तिष्क की सबसे अच्छी तरकीब: एक टू-सिस्टम टीम

अपने स्वयं के मस्तिष्क के बारे में सोचें। जब आपके पास गुलाबी हाथी के उड़ने का कोई जंगली, एक बार का सपना आता है, तो आप इसे एक या दो दिन तक याद रख सकते हैं, लेकिन आप इसके लिए स्थायी मांसपेशी स्मृति (muscle memory) बनाने की कोशिश नहीं करते हैं। यह आपकी एपिसोडिक मेमोरी (episodic memory) है—विशिष्ट, ताज़ा अनुभवों के लिए एक अस्थायी भंडारण। लेकिन जब आप एक सप्ताह तक साइकिल चलाने का अभ्यास करते हैं, तो आपका मस्तिष्क धीरे-धीरे उस कौशल को अपनी प्रोसीजरल मेमोरी (procedural memory) में स्थानांतरित कर देता है। अब, आप बिना सोचे समझे साइकिल चला सकते हैं, और आपको हर बार निर्देश देखने की आवश्यकता नहीं होती है।

इस पेपर के लेखकों ने देखा कि AI एजेंटों को इसी तरह की समस्या का सामना करना पड़ता है। उन्हें "बाउंड्री-अग्नोस्टिक" (सीमा-अज्ञेय) कार्य धाराओं को संभालने के लिए कहा जा रहा है। कल्पना कीजिए कि एक रोबोट सहायक को यह नहीं पता कि एक काम कब समाप्त होता है और दूसरा कब शुरू होता है। उसे बस अनुरोधों का एक निरंतर प्रवाह मिलता है: "एक कविता लिखें," "टिप की गणना करें," "इस कोड को डीबग करें," "फिर से एक कविता लिखें," "पिज्जा ऑर्डर करें," "फिर से एक कविता लिखें।"

यदि रोबक केवल एक नोटबुक (रिट्रीवल) का उपयोग करता है, तो उसे बार-बार "कविता लिखने" के निर्देशों को खोजने के कारण धीमा और अनाड़ी होना पड़ता है। यदि वह हर एक अनुरोध के लिए अपने दिमाग को फिर से वायर करने की कोशिश करता है, तो वह भ्रमित हो जाता है और पिज्जा ऑर्डर करना भूल जाता है क्योंकि वह उसी समय एक नई कविता शैली सीखने की कोशिश कर रहा होता है।

प्रवेश UniMem में: द स्मार्ट ट्रैफिक Cop

शोधकर्ता UniMem का प्रस्ताव करते हैं, जो रोबोट के मेमोरी के लिए एक सुपर-स्मार्ट ट्रैफिक पुलिसकर्मी की तरह काम करता है। रोबोट को केवल नोटबुक या पुनर्गठित मस्तिष्क में से एक को चुनने के लिए मजबूर करने के बजाय, UniMem इसे दोनों का उपयोग करने देता है, और स्वचालित रूप से उनके बीच स्विच करता है।

यह कैसे काम करता है, एक चंचल उपमा का उपयोग करते हुए देखें:

कल्पना कीजिए कि रोबोट के पास एक जादुई टिकट बूथ (Routing Tokens) है। हर बार जब एक नया अनुरोध आता है, तो रोबोट अपने वर्तमान "ज्ञात कार्यों" के विरुद्ध अनुरोध की जाँच करता है।

  • "मैंने इसे पहले देखा है" वाला टिकट: यदि अनुरोध परिचित लगता है (जैसे "एक कविता लिखें"), तो जादुई टिकट बूथ रोबोट को एक विशेष चाबी (एक Parametric Memory Block) देता है। यह चाबी उस विशिष्ट कार्य के लिए एक समर्पित, हाई-स्पीड मसल मेमोरी को अनलॉक करती है। रोबोट कार्य को तुरंत और कुशलता से निष्पादित करता है, ठीक वैसे ही जैसे आप साइकिल चलाते हैं।
  • "यह क्या है?" वाला टिकट: यदि अनुरोध अजीब, दुर्लभ, या यदि रोबोट अनिश्चित है (जैसे "एक टोस्टर के बारे में समुद्री डाकू की शैली में कविता लिखें"), तो जादुic टिकट बूथ अनुरोध को एक वेटिंग रूम (Episodic Buffer) में भेज देता है। यहाँ, रोबोट स्थायी स्मृति बनाने की कोशिश नहीं करता है। इसके बजाय, वह अपने नोटबुक से एक "चीट शीट" (retrieval) निकालता है ताकि प्रश्न का उत्तर देने में मदद मिल सके।

मेमोरी को "बढ़ाने" का जादू

असली जादू तब होता है जब रोबोट बार-बार "अजीब" अनुरोधों को देखना शुरू करता है।

वेटिंग रूम में, रोबोट उन सभी "टोस्टर पाइरेट" अनुरोधों की एक सूची रखता है जो उसने देखे हैं। एक बार जब वह पैटर्न बनाने के लिए पर्याप्त (मान लीजिए 50 या अधिक) देख लेता है, तो सिस्टम कहता है, "हे, यह अब केवल एक बार की घटना नहीं है! यह एक वास्तविक कौशल है।"

उस क्षण, UniMem एक कंसोलिडेशन (consolidation) करता है। वह उस पैटर्न को लेता है, विशेष रूप से "टोस्टर पाइरेट कविताओं" के लिए एक नया "चाबी" (एक नया Parametric Memory Block) बनाता है, और उसे वेटिंग रूम से स्थायी मसल मेमोरी में स्थानांतरित कर देता है। रोबोट अब बिना सब कुछ फिर से सीखे, एक नया, स्थायी कौशल रखता है।

यदि कोई अनुरोध वास्तव में दुर्लभ है और वापस नहीं आता है, तो वह वेटिंग रूम में ही रहता है, और रोबोट बस प्रश्न का उत्तर देने के लिए अपनी नोटबुक का उपयोग करता है। यह रोबोट को उन चीजों पर मस्तिष्क स्थान बर्बाद करने से रोकता है जिन्हें वह दोबारा कभी नहीं करेगा।

प्रयोगों ने क्या दिखाया

शोधकर्ताओं ने इस प्रणाली का परीक्षण कार्यों की एक लंबी धारा पर किया, एक ऐसे रोबोट का अनुकरण करते हुए जिसे सरल गणित से लेकर जटिल तर्क तक सब कुछ संभालना था, जिसमें कुछ कार्य अक्सर आते थे और अन्य केवल कुछ ही बार आते थे।

उन्होंने पाया कि UniMem ने लगातार अन्य तरीकों को पछाड़ दिया।

  • केवल नोटबुक (Retrieval) का उपयोग करने वाले रोबोटों की तुलना में, UniMem तेज़ और अधिक सटीक था क्योंकि उसे सामान्य कार्यों के लिए हर बार खोजने की आवश्यकता नहीं थी।
  • उन रोबोटों की तुलना में जो हर चीज़ के लिए अपने पूरे मस्तिष्क को फिर से वायर करने की कोशिश करते थे (Parametric Memory), UniMem भ्रमित नहीं हुआ या पुराने कौशल नहीं भूला। इसने सामान्य और दुर्लभ दोनों कार्यों को बहुत बेहतर तरीके से संभाला।

LLaMA-3.2-3B नामक मॉडल के साथ एक विशिष्ट परीक्षण में, UniMem ने अन्य तरीकों की तुलना में सटीक उत्तर देने की सटीकता में औसतन लगभग 4.0 अंक का सुधार किया। जब उन्होंने 100 अलग-अलग कार्यों के स्ट्रीम पर इसका परीक्षण किया, तो UniMem ने उच्च प्रदर्शन बनाए रखा, जबकि अन्य तरीके संघर्ष करने लगे या भूलने लगे।

निष्कर्ष

यह पेपर सुझाव देता है कि मानव मस्तिष्क की रणनीति की नकल करके—जिसमें नई चीजों के लिए एक अस्थायी "स्क्रैचपैड" और सामान्य चीजों के लिए एक स्थायी "स्किल लाइब्रेरी" होती है—हम ऐसे AI एजेंट बना सकते हैं जो लचीले और कुशल दोनों हों। UniMem केवल डेटा स्टोर नहीं करता है; यह सीखता है कि इसे स्थायी रूप से कब स्टोर करना है और इसे अस्थायी कब रखना है।

यह ऐसे AI बनाने की दिशा में एक कदम है जो वास्तविक दुनिया में बढ़ और अनुकूल हो सकता है, जहाँ कार्य अस्त-व्यस्त, मिले-जुले और लगातार बदलते रहते हैं, बिना किसी इंसान को यह बताने की आवश्यकता के कि आगे क्या सीखना है। यह सिस्टम सुझाव देता है कि AI मेमोरी का भविष्य एक बड़े मस्तिष्क या एक बड़ी नोटबुक को चुनने के बारे में नहीं है, बल्कि एक स्मार्ट सिस्टम के बारे में है जो जानता है कि दोनों का उपयोग कैसे करना है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →