← नवीनतम पेपर
💬 NLP

AdaMem: Learning What to Remember for Personalized Long-Horizon LLM Agents

यह शोध पत्र AdaMem को प्रस्तुत करता है, जो एक अनुकूलन योग्य मेमोरी सिस्टम है जो अप्रासंगिक जानकारी को फ़िल्टर करने के लिए उपयोगकर्ता फीडबैक से भूमिका-विशिष्ट राइट नीतियों (write policies) को सीखता है, जिससे मेमोरी ब्लोट कम होता है और यूनिफॉर्म मेमोरी बेसलाइन की तुलना में लॉन्ग-होरिजन QA सटीकता में महत्वपूर्ण सुधार होता है।

मूल लेखक: Xingyu Chen, Rui Wang, Zhaopeng Tu, Liefeng Bo

प्रकाशित 2026-06-23
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Xingyu Chen, Rui Wang, Zhaopeng Tu, Liefeng Bo

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आपके पास एक व्यक्तिगत सहायक (personal assistant) है जो महीनों तक हर दिन आपसे बात करता है। शुरुआत में, वे आपकी कही हुई बातों को याद रखने में बहुत अच्छे होते हैं। लेकिन जैसे-जैसे समय बीतता है, वे थोड़े परेशान या बोझिल दिखने लगते हैं। क्यों? क्योंकि वे सब कुछ याद रखने की कोशिश कर रहे हैं।

उन्हें आपका पसंदीदा कॉफी ऑर्डर याद है, लेकिन उन्हें वह मौसम भी याद है जिसके बारे में आपने एक मंगलवार को शिकायत की थी, एक अजनबी का नाम जिसे आपने संक्षिप्त में देखा था, और हर एक "नमस्ते" और "अलविदा"। उनका मस्तिष्क (या डिजिटल मेमोरी) इस "शोर" से इतना भर जाता है कि जब आप कोई सवाल पूछते हैं, तो वे महत्वपूर्ण चीज़ों को ढूँढ नहीं पाते। इसे मेमोरी ब्लोट (memory bloat) कहा जाता है।

यह शोध पत्र AdaMem (Adaptive Memory) नामक एक नई प्रणाली पेश करता है जो इसे ठीक करती है। यह कैसे काम करती है, इसके लिए सरल उपमाओं (analogies) का उपयोग किया गया है:

1. समस्या: "कबाड़ जमा करने वाला" सहायक

अधिकांश वर्तमान AI सहायक एक डिजिटल कबाड़ इकट्ठा करने वाले (hoarder) की तरह व्यवहार करते हैं। उनका एक नियम है: "हर तथ्य को सहेजें।"

  • परिणाम: हफ्तों के साथ, उनका मेमोरी बैंक बेकार की जानकारी से भर जाता है। जब आप पूछते हैं, "हमने मेरे छुट्टियों के कार्यक्रम के बारे में क्या तय किया था?" तो AI को मौसम या सामान्य चुटकुलों के हजारों अप्रासंगिक संदेशों के बीच से खुदाई करनी पड़ती है। महत्वपूर्ण उत्तर दब जाता है, और AI गलत उत्तर देता है।

2. समाधान: "स्मार्ट एडिटर" (AdaMem)

AdaMem इस नियम को बदल देता है। सब कुछ सहेजने के बजाय, यह पूछता है: "इस विशिष्ट उपयोगकर्ता को वास्तव में किस चीज़ की परवाह है?"

AdaMem को एक स्मार्ट एडिटर के रूप में सोचें जो आपकी व्यक्तिगत पसंद को सीखता है।

  • यदि आप एक व्यस्त मैनेजर हैं: एडिटर केवल मीटिंग की समय सीमा और व्यावसायिक निर्णयों को रखने के लिए सीखता है, और छोटी-मोटी बातों को हटा देता है।
  • यदि आप एक फिटनेस उत्साही हैं: एडिटर वर्कआउट शेड्यूल और डाइट लक्ष्यों को रखना सीखता है, और ट्रैफिक के बारे में आपकी शिकायतों को अनदेखा कर देता है।

यह प्रणाली इसे एक बार अनुमान लगाकर भूल नहीं जाती। यह देखकर कि आप इसके उत्तरों पर कैसी प्रतिक्रिया देते हैं, यह सीखती है कि क्या रखना है।

3. यह कैसे सीखता है: साप्ताहिक "पैच" (Weekly Patch)

यह प्रणाली एक साप्ताहिक चक्र पर चलती है, जैसे एक शिक्षक होमवर्क चेक करता है और फिर पाठ योजना को अपडेट करता है:

  1. सप्ताह: AI प्रतिदिन आपसे बात करता है, अपने वर्तमान "नियमों" (जिन्हें मेमोरी पॉलिसी कहा जाता है) के आधार पर यादों को सहेजता है।
  2. परीक्षण: सप्ताह के अंत में, यह इस बारे में सवाल हल करता है कि क्या हुआ था।
  3. गलती: यदि यह किसी सवाल का गलत उत्तर देता है, तो यह केवल "ओह" नहीं कहता। यह देखता है कि यह क्यों विफल हुआ।
    • क्या इसने कुछ महत्वपूर्ण भूल गया? (नियम बहुत सख्त था)।
    • क्या यह किसी बेकार विवरण से भ्रमित हो गया? (नियम बहुत ढीला था)।
  4. पैच: AI अपने नियमों के लिए एक छोटा सा "सॉफ्टवेयर पैच" (एक छोटा अपडेट) लिखता है। यह कहता है, "अगले सप्ताह, मैं केवल शेड्यूल को याद रखूँगा और मौसम को भूल जाऊँगा।"
  5. सेफ्टी नेट: नए नियम को लागू करने से पहले, यह जाँचता है: "क्या यह नया नियम उस चीज़ को बिगाड़ देगा जो मैंने पहले सही की थी?" यदि नया नियम चीज़ों को बदतर बनाता है, तो यह पुराने नियम पर वापस (roll back) चला जाता है। यह AI को गलत विचारों के साथ पागल होने से रोकता है।

4. परिणाम: कम शोर, बेहतर उत्तर

शोधकर्ताओं ने इसका परीक्षण एक सिम्युलेटेड वातावरण में किया जहाँ एक AI ने 10 हफ्तों तक विभिन्न "पात्रों" (characters) से बात की।

  • पुराना तरीका (Uniform Memory): AI सब कुछ याद रखता था। 10वें सप्ताह तक, इसकी सटीकता गिर गई क्योंकि यह शोर में डूब गया था।
  • AdaMem का तरीका: AI ने कम याद रखा (लगभग 9% कम डेटा), लेकिन इसने सही चीज़ें याद रखीं।
  • परिणाम: AI ने पुराने तरीके की तुलना में 9% अधिक सवालों के सही उत्तर दिए। यह एक बिखरी हुई अलमारी को साफ करने जैसा था: पुराने मोजों को फेंककर और केवल उन्हीं शर्टों को रखकर जिन्हें आप वास्तव में पहनते हैं, आप अपनी पसंदीदा शर्ट बहुत तेज़ी से ढूँढ सकते हैं।

5. कमी: इसे स्पष्ट फीडबैक की आवश्यकता है

शोध पत्र ने एक दिलचस्प सीमा भी पाई।

  • स्पष्ट फीडबैक (Explicit Feedback): यदि आप AI को कहते हैं, "आप गलत थे! याद रखें कि मुझे शेड्यूल की परवाह है," तो AI बहुत तेज़ी से सीखता है और नियमों को एकदम सटीक बना लेता है।
  • अप्रत्यक्ष फीडबैक (Implicit Feedback): यदि आप बिना यह बताए कि क्यों गलत हैं कि "यह उत्तर गलत है," तो AI को यह समझने में संघर्ष करना पड़ता है कि वास्तव में आपको किस चीज़ की परवाह है। यह उस छात्र की तरह है जो जानता है कि उसका टेस्ट गलत गया है, लेकिन उसे यह नहीं पता कि उसने कौन सा नियम तोड़ा है।

सारांश

AdaMem एक ऐसी प्रणाली है जो AI एजेंटों को सब कुछ याद रखने की कोशिश करने से रोकती है। इसके बजाय, यह एक व्यक्तिगत फिल्टर के रूप में कार्य करता है जो सप्ताह-दर-सप्ताह सीखता है कि आपके लिए कौन सी जानकारी मूल्यवान है और कौन सा केवल शोर है। मेमोरी को छोटा और केंद्रित रखकर, यह लंबे समय तक AI को सटीक और सहायक रहने में मदद करता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →