← नवीनतम पेपर
💬 NLP

MemBuilder: Reinforcing LLMs for Long-Term Memory Construction via Attributed Dense Rewards

MemBuilder एक सुदृढीकरण शिक्षण (reinforcement learning) ढांचा है जो सिंथेटिक सत्र-स्तरीय प्रश्न निर्माण और योगदान-जागरूक ग्रेडिएंट वेटिंग के माध्यम से स्पार्स रिवार्ड्स (sparse rewards) और बहु-आयामी मेमोरी एट्रिब्यूशन को संबोधित करके LLMs में दीर्घकालिक संवाद निरंतरता को बढ़ाता है, जिससे एक 4B-पैरामीटर वाला मॉडल अत्याधुनिक क्लोज्ड-सोर्स बेसलाइनों को पीछे छोड़ने में सक्षम होता है।

मूल लेखक: Zhiyu Shen, Ziming Wu, Fuming Lai, Shaobing Lian, Yanghui Rao

प्रकाशित 2026-04-21
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Zhiyu Shen, Ziming Wu, Fuming Lai, Shaobing Lian, Yanghui Rao

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक ऐसे दोस्त से बात कर रहे हैं जिसकी याददाश्त बहुत खराब है। हर बार जब आप उसे अपने बचपन की कोई कहानी सुनाते हैं, तो उसे वह पाँच मिनट तक याद रहती है, और फिर वह उसे पूरी तरह भूल जाता है। अगर आप एक घंटे बाद उससे उसके बारे में पूछते हैं, तो उसे कुछ भी याद नहीं रहता कि आप किस बारे में बात कर रहे थे।

यह कई AI चैटबॉट्स की वर्तमान समस्या है। वे चैट करने में तो बहुत अच्छे हैं, लेकिन लंबी बातचीत (जैसे हफ्तों या महीनों की बातचीत) के दौरान वे चीजों को याद रखने में संघर्ष करते हैं। या तो वे सब कुछ भूल जाते हैं, या फिर वे हर बार अपनी पूरी चैट हिस्ट्री को पढ़ने की कोशिश करते हैं, जो धीमा और भ्रमित करने वाला होता है।

यहाँ एक नया सिस्टम पेश किया गया है जिसे MemBuilder कहा जाता है। इसे ऐसे समझें जैसे आपने AI को एक सुपर-ऑर्गनाइज्ड, व्यक्तिगत लाइब्रेरियन (पुस्तकालयाध्यक्ष) दे दिया है, जो जानता है कि नोट्स कैसे लेने हैं, उन्हें कैसे फाइल करना है और बाद में उन्हें कैसे ढूँढना है।

MemBuilder कैसे काम करता है, यहाँ सरल अवधारणाओं में दिया गया है:

1. समस्या: "एक बड़ा ढेर" बनाम "फाइलिंग कैबिनेट"

अधिकांश AI सिस्टम यह याद रखने की कोशिश करते हैं कि आपने अब तक जो कुछ भी कहा है, वह "एक बड़ा ढेर" है। जब आप कोई सवाल पूछते हैं, तो वे उस अव्यवस्थित ढेर में खोजते हैं।

  • दोष: यह एक पुराने जूतों के डिब्बे में रखे ढेर सारे मुड़े हुए कागज, पुराने च्युइंग गम के रैपर और किराने की सूचियों में से किसी खास रसीद को खोजने जैसा है। यह बहुत अव्यवस्थित है, और AI अक्सर महत्वपूर्ण चीजों को मिस कर देता है या पुरानी जानकारी से भ्रमित हो जाता है जो अब सच नहीं है।

MemBuilder का समाधान: एक ढेर के बजाय, यह चार विशिष्ट दराजों वाला एक हाई-टेक फाइलिंग कैबिनेट बनाता है:

  • कोर ड्रॉअर (आप कौन हैं): आपका नाम, आपकी नौकरी, आपका पसंदीदा रंग और आपका व्यक्तित्व। इसे हमेशा पास रखा जाता है।
  • डायरी ड्रॉअर (क्या हुआ): घटनाओं का एक टाइमलाइन। "सोमवार को, मैं पार्क गया।" "मंगलवार को, मुझे एक नया कुत्ता मिला।"
  • फैक्ट ड्रॉअर (आप क्या जानते हैं): आपके जीवन के बारे में विशिष्ट तथ्य। "मेरी बहन शिकागो में रहती है।" "मुझे धनिया पसंद नहीं है।"
  • हाउ-टू ड्रॉअर (आपकी दिनचर्या): आपकी आदतें। "मैं सुबह 7 बजे कॉफी बनाता हूँ।" "मैं हमेशा रविवार को अपनी माँ को कॉल करता हूँ।"

2. जादुई ट्रिक: "डेंस रिवॉर्ड्स" (वीडियो गेम का उदाहरण)

AI को यह सिखाने की सबसे बड़ी चुनौती यह है कि: हमें कैसे पता चलेगा कि वह अच्छा काम कर रहा है?

अतीत में, शोधकर्ता AI को 50 दिनों तक चैट करने देते थे, अंत में एक सवाल पूछते थे, और कहते थे, "अच्छा काम किया!" या "बुरा काम किया!"

  • समस्या: यह एक ऐसा वीडियो गेम खेलने जैसा है जहाँ आपको गेम के 10 घंटे के अभियान के बिल्कुल अंत में एक स्कोर मिलता है। यदि आप लेवल 1 में एक जीवन खो देते हैं, तो आपको तब तक पता नहीं चलता कि आपने क्यों खोया जब तक कि गेम खत्म नहीं हो जाता। AI भ्रमित हो जाता है और अपनी गलतियों से नहीं सीख पाता।

MemBuilder का समाधान: वे डेंस रिवॉर्ड्स (Dense Rewards) का उपयोग करते हैं।
कल्पना कीजिए कि आप वह वीडियो गेम खेल रहे हैं, लेकिन हर एक लेवल के बाद, आपको एक स्कोर और बेहतर करने के लिए एक संकेत मिलता है।

  • उन्होंने इसे कैसे किया: AI एक स्मृति (मेमोरी) बनाता है। फिर, सिस्टम तुरंत AI से उस स्मृति पर आधारित एक परीक्षण प्रश्न पूछता है (जैसे, "आपने अपने कुत्ते के बारे में क्या कहा था?")। यदि AI सही ढंग से याद रखता है, तो उसे तुरंत एक "पॉइंट" मिलता है। यदि वह भूल जाता है, तो उसे तुरंत "पॉइंट कटौती" मिलती है।
  • परिणाम: AI बहुत तेज़ी से सीखता है क्योंकि उसे अंत में एक बड़े ग्रेड के बजाय निरंतर फीडबैक मिलता है।

3. "क्रेडिट कार्ड" सिस्टम (एट्रीब्यूटेड डेंस रिवॉर्ड्स)

यही सबसे चतुर हिस्सा है। कभी-कभी, AI "आप कौन हैं" वाले ड्रॉअर को अपडेट करता है, और कभी-कभी यह "डायरी" वाले ड्रॉअर को अपडेट करता है। लेकिन वास्तव में किस एक ने सवाल का जवाब देने में मदद की?

  • पुराना तरीका: यदि AI ने सही उत्तर दिया, तो वह सभी ड्रॉअर्स को समान रूप से क्रेडिट देता था। यह एक ग्रुप प्रोजेक्ट की तरह है जहाँ सभी को 'A' ग्रेड मिलता है, भले ही एक व्यक्ति ने सारा काम किया हो और बाकी सब सो रहे हों।
  • MemBuilder का तरीका: उन्होंने एट्रीब्यूटेड रिवॉर्ड्स (Attributed Rewards) पेश किए।
    • यदि सवाल था "मेरे कुत्ते का नाम क्या है?", तो सिस्टम चेक करता है: "क्या 'डायरी' ड्रॉअर ने मदद की?" हाँ। "क्या 'हाउ-टू' ड्रॉअर ने मदद की?" नहीं।
    • इसलिए, AI उस "डायरी" ड्रॉअर को एक बड़ा बोनस देता है जिसने अच्छा काम किया, और अन्य को एक न्यूट्रल स्कोर देता है।
    • यह AI को सिखाता है कि विशिष्ट प्रकार के प्रश्नों के लिए किस प्रकार की मेमोरी में सुधार करना है।

4. परिणाम: एक छोटा दिमाग, बड़ी याददाश्त

आमतौर पर, इस स्तर की याददाश्त पाने के लिए, आपको एक विशाल, महंगे AI (जैसे कि सुपरकंप्यूटर) की आवश्यकता होती है।

  • MemBuilder का आश्चर्य: उन्होंने इस पद्धति का उपयोग करके एक अपेक्षाकृत छोटा, हल्का AI (केवल 4 बिलियन पैरामीटर्स वाला—AI मानकों के अनुसार छोटा) प्रशिक्षित किया।
  • आउटकम: इस छोटे AI ने, अपने नए "लाइब्रेरियन" कौशल के साथ, उन विशाल, महंगे AI मॉडल्स से बेहतर प्रदर्शन किया जो सरल ट्रिक्स पर निर्भर करते हैं। इसने विवरणों को याद रखा, टाइमलाइन को समझा, और भ्रमित नहीं हुआ, भले ही बातचीत बहुत लंबी क्यों न थी।

सारांश उपमा

पुराने AI को एक ऐसे छात्र के रूप में सोचें जो हर बार सवाल पूछे जाने पर हर किताब को शुरू से अंत तक पढ़कर पूरी लाइब्रेरी को याद करने की कोशिश करता है। यह धीमा है, थका देने वाला है, और वे अक्सर विवरण भूल जाते हैं।

MemBuilder एक ऐसे छात्र की तरह है जिसने एक शानदार लाइब्रेरियन को काम पर रखा है।

  1. लाइब्रेरियन हर नए तथ्य को सही दराज (कोर, डायरी, फैक्ट्स, रूटीन) में डालता है।
  2. लाइब्रेरियन को तत्काल फीडबैक मिलता है: "क्या आपने इसे सही ढंग से फाइल किया? हाँ? बहुत बढ़िया! नहीं? फिर से कोशिश करें।"
  3. लाइब्रेरियन ठीक से सीख जाता है कि किस सवाल के लिए कौन सी दराज चेक करनी है।

परिणाम? एक कुशल, प्रभावी छात्र जो किसी भी लंबी अवधि की बातचीत के टेस्ट में अव्वल आता है, यह साबित करता है कि एक महान याददाश्त के लिए आपको विशाल दिमाग की नहीं, बल्कि एक अच्छे सिस्टम की आवश्यकता होती है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →