← नवीनतम पेपर
💬 NLP

MemSearcher: Training LLMs to Reason, Search and Manage Memory via End-to-End Reinforcement Learning

MemSearcher एक LLM-आधारित एजेंट फ्रेमवर्क है जो एक कॉम्पैक्ट मेमोरी मैकेनिज्म और एक नवीन मल्टी-कॉन्टेक्स्ट GRPO ट्रेनिंग एल्गोरिदम का उपयोग करता है ताकि मल्टी-टर्न सर्च कार्यों के लिए कुशल, एंड-टू-एंड सुदृढीकरण शिक्षण (reinforcement learning) प्राप्त किया जा सके, जो स्थिर कॉन्टेक्स्ट लंबाई बनाए रखते हुए पारंपरिक हिस्ट्री-कॉन्कैटेनेशन बेसलाइन्स से बेहतर प्रदर्शन करता है।

मूल लेखक: Qianhao Yuan, Jie Lou, Zichao Li, Jiawei Chen, Yaojie Lu, Hongyu Lin, Le Sun, Debing Zhang, Xianpei Han

प्रकाशित 2026-05-11
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Qianhao Yuan, Jie Lou, Zichao Li, Jiawei Chen, Yaojie Lu, Hongyu Lin, Le Sun, Debing Zhang, Xianpei Han

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

यहाँ MemSearcher पेपर का स्पष्टीकरण दिया गया है, जिसे सरल अवधारणाओं और रोज़मर्रा के उदाहरणों के माध्यम से समझाया गया है।

समस्या: "बहुत अधिक कचरा" वाला एजेंट

कल्पना कीजिए कि आपने एक जटिल प्रश्न का उत्तर देने के लिए एक बहुत ही बुद्धिमान लेकिन थोड़े भुलक्कड़ शोध सहायक (AI) को काम पर रखा है।

वर्तमान मानक पद्धति (जिसे ReAct कहा जाता है) में, हर बार जब सहायक सोचता है, कार्य करता है या जानकारी का एक नया टुकड़ा पढ़ता है, तो वे उस सभी को एक ही, विशाल नोटबुक में लिख देते हैं।

  • टर्न 1: वे प्रश्न और पहला खोज परिणाम लिखते हैं।
  • टर्न 2: वे अपना नया विचार और दूसरा खोज परिणाम पहले वाले के नीचे लिखते हैं।
  • टर्न 10: अब नोटबुक 50 पन्नों की हो चुकी है।

समस्या: जैसे-जैसे नोटबुक लंबी होती जाती है, सहायक घबराने लगता है। उस एक वाक्य को खोजने के लिए जो वास्तव में महत्वपूर्ण है, उसे पिछले 50 पन्नों के नोट्स को फिर से पढ़ना पड़ता है। यह धीमा, महंगा (जैसे एक विशाल पुस्तकालय के लिए भुगतान करना) है, और अक्सर गलतियों का कारण बनता है क्योंकि सहायक बीच के "शोर" (अप्रासंगिक विवरणों) के कारण भ्रमित हो जाता है।

समाधान: "स्मार्ट समराइज़र" (MemSearcher)

लेखकों ने MemSearcher बनाया है, जो AI के काम करने का एक नया तरीका है। एक विशाल, बढ़ती हुई नोटबुक रखने के बजाय, MemSearcher एक एकल, पुन: प्रयोज्य इंडेक्स कार्ड (index card) का उपयोग करता है।

यह इस प्रकार काम करता है:

  1. प्रश्न: आप AI से एक प्रश्न पूछते हैं।
  2. खोज (Search): AI उत्तर की खोज करता है।
  3. अपडेट: एक लंबी सूची में नई जानकारी लिखने के बजाय, AI एक क्यूरेटर (curator) की तरह कार्य करता है। वह नई जानकारी को देखता है, तय करता है कि वास्तव में उपयोगी क्या है, और केवल सबसे महत्वपूर्ण तथ्यों को शामिल करने के लिए इंडेक्स कार्ड को फिर से लिखता है।
  4. अगला टर्न: अगले चरण के लिए, AI केवल वर्तमान इंडेक्स कार्ड और मूल प्रश्न को देखता है। उसे पिछले 10 खोजों के इतिहास को पढ़ने की आवश्यकता नहीं होती।

परिणाम: "नोटबुक" कभी भी इंडेक्स कार्ड के आकार (लगभग 4,000 वर्णों) से बड़ी नहीं होती। यह AI को तेज़, सस्ता और केंद्रित रखता है, भले ही बातचीत के कई टर्न क्यों न हो जाएं।

प्रशिक्षण की चुनौती: क्यूरेशन कौशल सिखाना

आप सोच सकते हैं, "क्या हम बस AI को यह करने के लिए नहीं कह सकते?" पेपर कहता है नहीं। वर्तमान AI मॉडल लंबी कहानियाँ लिखने के लिए प्रशिक्षित हैं, न कि सारांश बनाने और भूलने के लिए। यदि आप उनसे केवल एक छोटा मेमोरी उपयोग करने के लिए कहते हैं, तो वे भ्रमित हो जाते हैं और विफल हो जाते हैं।

इसे ठीक करने के लिए, लेखकों ने रीइन्फोर्समेंट लर्निंग (RL) नामक एक प्रशिक्षण पद्धति का उपयोग किया।

  • उपमा: कल्पना कीजिए कि आप एक कुत्ते को गेंद लाना सिखा रहे हैं। आप कुत्ते के लिए कोई मैनुअल नहीं लिखते। इसके बजाय, आप एक गेंद फेंकते हैं। यदि कुत्ता उसे वापस लाता है, तो आप उसे इनाम (टreat) देते हैं। यदि वह उसे गिरा देता है, तो कोई इनाम नहीं।
  • नवाचार: पेपर एक विशेष प्रशिक्षण तकनीक पेश करता है जिसे Multi-Context GRPO कहा जाता है।
    • आमतौर पर, एक लंबे संवाद पर AI को प्रशिक्षित करना एक पूरे निबंध को एक साथ ग्रेड करने जैसा है।
    • MemSearcher की विधि उस निबंध के प्रत्येक वाक्य को व्यक्तिगत रूप से ग्रेड करने जैसी है, लेकिन यह तय करने के लिए कि प्रत्येक वाक्य कितना अच्छा था, पूरे निबंध के अंतिम ग्रेड का उपयोग करती है।
    • यह AI को यह सिखाता है कि बातचीत के किस हिस्से को इंडेक्स कार्ड पर रखना है और किसे हटा देना है, और यह पूरी प्रक्रिया के दौरान होता है।

यह क्यों महत्वपूर्ण है (परिणाम)

लेखकों ने सात अलग-अलग कठिन ट्रिविया और सर्च डेटासेट पर पुराने "विशाल नोटबुक" तरीके के मुकाबले MemSearcher का परीक्षण किया।

  1. अधिक स्मार्ट: MemSearcher ने पुराने तरीकों की तुलना में बेहतर स्कोर प्राप्त किया, यहाँ तक कि छोटे, सस्ते AI मॉडल का उपयोग करते समय भी।
  2. तेज़ और सस्ता: क्योंकि "नोटबुक" छोटी रहती है, इसलिए कंप्यूटर को कम मेहनत करनी पड़ती है। यह कम मेमोरी का उपयोग करता है और इसे चलाना सस्ता है।
  3. कम भ्रम: पेपर में दिखाए गए एक उदाहरण में, पुराना तरीका भ्रमित हो गया क्योंकि उसने लंबे संवाद के विभिन्न हिस्सों में उल्लेखित दो अलग-अलग लोगों को आपस में मिला दिया। MemSearcher ने, एक साफ सारांश रखकर, सही व्यक्ति की पहचान सही ढंग से की।

सारांश

MemSearcher एक शोधकर्ता को उस व्यक्ति से अपग्रेड करने जैसा है जो कागज के हर उस टुकड़े को इकट्ठा करता है जिसे उसने कभी छुआ था, से एक पेशेवर लाइब्रेरियन बनने तक, जो सबसे महत्वपूर्ण तथ्यों का एक पूरी तरह से व्यवस्थित, अद्यतित (up-to-date) सारांश रखता है। यह AI को अपना स्वयं का मेमोरी मैनेजर बनने के लिए प्रशिक्षित करके हासिल किया जाता है, जिससे यह सुनिश्चित होता है कि बातचीत चाहे कितनी भी लंबी क्यों न हो जाए, वह सटीक और कुशल बनी रहे।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →