← नवीनतम पेपर
💬 NLP

Learning What Not to Forget: Long-Horizon Agent Memory from a Few Kilobytes of Learning

यह शोध पत्र LRE (लर्नड रिलेवेंस इविक्शन) को प्रस्तुत करता है, जो एक हल्का, केवल CPU-आधारित, भाषा-मॉडल-मुक्त स्कोरर है जो लंबे समय तक चलने वाले एजेंटों के लिए महत्वपूर्ण इंटरैक्शन इतिहास की पहचान करने और उसे बनाए रखने के लिए सीखता है, जो न्यूनतम कम्प्यूटेशनल लागत और एनोटेशन-मुक्त प्रशिक्षण के साथ काम करते हुए मौजूदा बेसलाइन की तुलना में बेहतर सटीकता और दक्षता प्राप्त करता है।

मूल लेखक: Nusrat Jahan Lia, Aritra Mazumder

प्रकाशित 2026-06-23
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Nusrat Jahan Lia, Aritra Mazumder

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक सुपर-स्मार्ट सहायक (एक अत्यधिक उन्नत AI की तरह) हैं जो किसी जटिल पहेली को हल करने या किसी मित्र के साथ लंबी बातचीत करने की कोशिश कर रहे हैं। समस्या यह है कि आपके पास एक सीमित आकार का मस्तिष्क है। आप एक समय में कितनी जानकारी अपने "सक्रिय मेमोरी" (active memory) में रख सकते हैं, इसकी एक निश्चित सीमा है।

जैसे-जैसे आप काम करते हैं, आपके पास नोट्स, कार्यों और बातचीत का एक विशाल इतिहास जमा होता जाता है। अंततः, यह इतिहास इतना बड़ा हो जाता है कि आपके मस्तिष्क में फिट नहीं बैठता। आपको नई सोच के लिए जगह बनाने के लिए कुछ चीजों को हटाना पड़ता है। इसे इविक्शन (eviction) कहा जाता है।

यह शोध पत्र इस समस्या को हल करने के लिए एक नई विधि प्रस्तुत करता है जिसे LRE (Learned Relevance Eviction) कहा जाता है। यह कैसे काम करता है, इसके लिए सरल उपमाओं (analogies) का उपयोग किया गया है:

समस्या: "बहुत बड़ा हो जाना" वाला मस्तिष्क

कल्पना कीजिए कि आप एक यात्रा के लिए पैकिंग कर रहे हैं, लेकिन आपके सूटकेस की ज़िप बहुत छोटी है जो केवल आधी ही खुल पाती है। आपके पास सैकड़ों वस्तुएं हैं (आपकी बातचीत का इतिहास या कार्य के चरण)।

  • पुराना तरीका (FIFO/Recency): आप बस नए सामान के लिए जगह बनाने के लिए ढेर के सबसे नीचे रखी पुरानी वस्तुओं को फेंक देते हैं।
    • जोखिम: आप "भार वहन करने वाली" (load-bearing) वस्तु को फेंक सकते हैं, जैसे कि आपका पासपोर्ट या लॉग इन करने के लिए आवश्यक कोई विशिष्ट कोड टोकन। यदि आप इसे खो देते हैं, तो आपकी यात्रा (या कार्य) विफल हो जाएगी, भले ही आपके पास पर्याप्त जगह बची हो।
  • महंगा तरीका (LLM Compression): आप एक पेशेवर संपादक (एक दूसरा AI) को नियुक्त करते हैं जो आपके नोट्स पढ़ता है और उन्हें एक छोटे पैराग्राफ में सारांशित (summarize) करता है।
    • जोखिम: संपादक संक्षिप्त होने के चक्कर में अनजाने में किसी महत्वपूर्ण विवरण को छोड़ सकता है। साथ ही, हर बार नया नोट जोड़ने पर एक संपादक को काम पर रखना धीमा है और इसमें बहुत अधिक कंप्यूटिंग शक्ति (पैसा) खर्च होती है।

समाधान: LRE (एक छोटा, स्मार्ट लाइब्रेरियन)

LRE एक छोटा, सुपर-फास्ट "लाइब्रेरियन" है जो एक मानक कंप्यूटर चिप (CPU) पर रहता है। इसे अपना काम करने के लिए सुपर-कंप्यूटर या दूसरे AI की आवश्यकता नहीं है।

1. यह छोटा और तेज़ है
LRE को एक पॉकेट-साइज़ चेकलिस्ट (केवल कुछ किलोबाइट आकार की) के रूप में सोचें। यह आपके नोट्स को फिर से नहीं लिखता; यह केवल यह तय करता है कि कौन से नोट्स रखने हैं। यह इतना तेज़ चलता है कि यह एक सेकंड में 1,000 से अधिक नोट्स की जांच कर सकता है, जबकि "पेशेवर संपादक" (dense encoders) शायद केवल 36 ही प्रबंधित कर पाते हैं।

2. यह सीखता है कि क्या महत्वपूर्ण है ("भार वहन करने वाली" अवधारणा)
LRE आपके इतिहास को देखता है और पूछता है: "क्या मुझे बाद में इस विशिष्ट जानकारी की आवश्यकता होगी?"

  • उपमा: कल्पना कीजिए कि आप एक घर बना रहे हैं। आपके पास ईंटों, लकड़ी और कचरे का एक ढेर है।
    • एक "रेसेन्सी" (हालिया) दृष्टिकोण उन अंतिम कुछ चीजों को रखता है जिन्हें आपने अभी छुआ है।
    • LRE उस ढेर को देखता है और कहता है, "चरण 3 की वह विशिष्ट ईंट चरण 17 में हम जो छत बना रहे हैं, उसका आधार है। इसे बिल्कुल वैसा ही रखें।"
    • यह सटीक (verbatim) टेक्स्ट रखता है, ताकि यदि बाद में पासवर्ड या कोई विशिष्ट आईडी नंबर की आवश्यकता हो, तो वह बिना बदले वहीं मौजूद रहे।

3. इसे शिक्षक की आवश्यकता नहीं है (स्व-पर्यवेक्षण/Self-Supervision)
आमतौर पर, कंप्यूटर को यह सिखाने के लिए कि क्या रखना है, आपको हजारों उदाहरणों को लेबल करने के लिए एक इंसान की आवश्यकता होती है ("इसे रखें," "उसे फेंक दें")।

  • LRE की तरकीब: यह खुद को देखते हुए सीखता है। यह अपने स्वयं के पिछले व्यवहार को देखता है।
    • बातचीत में: यदि AI कोई तथ्य बताता है (जैसे "मैं ट्रांसजेंडर हूँ") और फिर 400 टर्न बाद, वह एक प्रश्न का उत्तर देने के लिए उस तथ्य का उपयोग करता है, तो LRE सीखता है: "आह, वह तथ्य महत्वपूर्ण था! मुझे उसे रखना चाहिए था।"
    • कार्य में: यदि AI एक लॉगिन टोकन जेनरेट करता है और बाद में तीन बार उसका उपयोग करता है, तो LRE सीखता है: "वह टोकन भार वहन करने वाला (load-bearing) है। इसे रखें।"
    • इसका मतलब है कि यह बिना किसी मानव लेबलिंग के सीख सकता है।

परिणाम: यह क्यों जीतता है

शोध पत्र ने LRE का दो मुख्य परिदृश्यों में परीक्षण किया:

1. एजेंट (रोबोट वर्कर)

  • परिदृश्य: एक AI जो उड़ान बुक करने या ईमेल खाता प्रबंधित करने के चरणों की एक श्रृंखला का उपयोग करके कार्य करने की कोशिश कर रहा है।
  • परिणाम: जब मेमोरी की सीमा कम थी, तो अन्य विधियाँ विफल हो गईं क्योंकि उन्होंने लॉगिन टोकन या कार्य पूरा करने के लिए आवश्यक विशिष्ट आईडी नंबर को हटा दिया था। LRE ने उन सटीक विवरणों को सुरक्षित रखा।
  • उपमा: जबकि अन्य विधियाँ बार-बार लॉग इन करने के चक्कर में गोल-गोल घूम रही थीं (समय बर्बाद कर रही थीं), LRE के पास पूरे समय काम करने की कुंजी उसकी जेब में थी और उसने काम पूरा कर लिया। इसने 37% कम चरणों में काम पूरा किया। यह सब कुछ रखने जितना ही सटीक था, लेकिन इसने 52% कम स्थान का उपयोग किया।

2. संवादात्मक (चैट पार्टनर)

  • परिदृश्य: हफ्तों पहले हुई एक लंबी चैट के विवरण को याद रखना।
  • परिणाम: LRE, जटिल और महंगे AI मॉडल (जो चैट को सारांशित करने की कोशिश करते हैं) की तुलना में प्रश्न का उत्तर देने के लिए सही जानकारी खोजने में बेहतर था।
  • उपमा: यदि आप पूछते हैं, "कैरोलिन ने 400 संदेश पहले अपने परिवार के बारे में क्या कहा था?", तो LRE तुरंत उस सटीक संदेश को खोज लेता है। अन्य विधियाँ या तो उसे भूल गईं या उन्होंने इसे इतनी खराब तरह से सारांशित किया कि उत्तर ही खो गया।

मुख्य निष्कर्ष (The Bottom Line)

LRE मेमोरी प्रबंधित करने का एक सस्ता, तेज़ और सटीक तरीका है।

  • यह सारांशित या पुनर्गठित नहीं करता (जिससे त्रुटियां होती हैं)।
  • इसे यह तय करने के लिए महंगे सुपर-कंप्यूटर की आवश्यकता नहीं है कि क्या रखना है।
  • यह अपनी गलतियों और सफलताओं से सीखता है।

शोध पत्र का तर्क है कि AI एजेंटों और चैटबॉट्स के लिए, हमें जानकारी को फेंकने या उन्हें सारांशित करने के लिए महंगे संपादकों को नियुक्त करने की आवश्यकता नहीं है। हमें बस एक छोटे, स्मार्ट फिल्टर की आवश्यकता है जो यह जानता हो कि हमारे इतिहास की "भार वहन करने वाली" ईंटों को कैसे रखना है ताकि संरचना ढह न जाए।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →