← नवीनतम पेपर
🤖 AI

AdMem: Advanced Memory for Task-solving Agents

यह शोध पत्र AdMem को प्रस्तुत करता है, जो एक एकीकृत, स्वचालित मेमोरी फ्रेमवर्क है जो LLM-आधारित एजेंटों के लिए लंबी अवधि के कार्यों (long-horizon tasks) में स्केलेबल, अनुकूलन योग्य शिक्षण और बेहतर प्रदर्शन को सक्षम करने के लिए मल्टी-एजेंट आर्किटेक्चर के भीतर सिमेंटिक, एपिसोडिक और प्रोसीजरल मेमोरी को एकीकृत करता है।

मूल लेखक: Runzhe Wang, Huilin Lu, Shengjie Liu, Li Dong, Jason Zhu

प्रकाशित 2026-06-08
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Runzhe Wang, Huilin Lu, Shengjie Liu, Li Dong, Jason Zhu

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आपके पास एक बेहद प्रतिभाशाली लेकिन भूलक्कड़ सहायक है जो एक-एक करके पहेलियाँ सुलझाने में अविश्वसनीय रूप से कुशल है। हालाँकि, यदि आप उनसे कई दिनों तक लंबी, जटिल पहेलियों की एक श्रृंखला हल करने के लिए कहते हैं, तो वे भटक जाते हैं। वे शायद पहले पहेली के पहले चरण को याद रख पाएंगे, लेकिन वे भूल जाएंगे कि उन्होंने दूसरी पहेली के तीसरे चरण को कैसे हल किया था, या वे वही गलती दोहरा सकते हैं जो उन्होंने कल की थी क्योंकि उन्होंने उससे "सीखा" नहीं।

यह शोध पत्र AdMem पेश करता है, जो एक नया सिस्टम है जिसे इन AI सहायकों को एक सुपरचार्ज्ड, व्यवस्थित मस्तिष्क देने के लिए डिज़ाइन किया गया है ताकि वे भ्रमित हुए बिना लंबे, जटिल कार्यों को संभाल सकें।

यह कैसे काम करता है, इसे सरल अवधारणाओं में विभाजित किया गया है:

1. समस्या: "कम ध्यान अवधि" वाला AI

वर्तमान AI मॉडल बहुत कम समय की स्मृति (short-term memory) वाले लोगों की तरह हैं। यदि आप उन्हें एक लंबी बातचीत या बहु-चरणीय कार्य देते हैं, तो वे केवल कुछ हालिया वाक्यों को ही अपने दिमाग में रख सकते हैं।

  • पुराना तरीका: पिछले प्रयासों में इस समस्या को ठीक करने के लिए AI को एक विशाल नोटबुक देने जैसा था। वे तथ्य (जैसे "आकाश नीला है") या क्या हुआ उसका सारांश लिखते थे। लेकिन वे मुख्य रूप से यह भूल जाते थे कि चीज़ों को कैसे करना है। यदि AI किसी चरण में विफल हो जाता, तो नोटबुक उसे यह नहीं बताती थी कि वह क्यों विफल हुआ या अगली बार इसे कैसे ठीक किया जाए।
  • अंतराल (The Gap): AI को न केवल यह याद रखने की आवश्यकता थी कि क्या हुआ, बल्कि यह भी कि निर्णय कैसे लेने हैं, और उसे यह जानने की भी आवश्यकता थी कि कौन सी यादें वास्तव में उपयोगी थीं और कौन सी केवल कचरा थीं।

2. समाधान: एक तीन-सदस्यीय टीम

एक अकेले AI के सब कुछ करने के बजाय, AdMem तीन विशिष्ट "एजेंटों" (AI वर्कर्स) की एक छोटी टीम स्थापित करता है जो मिलकर काम करते हैं:

  • द एक्टर (करने वाला - The Doer): यह मुख्य AI है जो आपसे बात करता है और वास्तविक कार्य करता है। यह तात्कालिक कार्य के लिए एक "अल्पकालिक स्मृति" (एक स्टिकी नोट की तरह) रखता है।
  • द क्रिटिक (कोच - The Coach): यह सिस्टम का सबसे स्मार्ट हिस्सा है। जब एक्टर काम कर रहा होता है, तो क्रिटिक बारीकी से नज़र रखता है। जब एक्टर कोई कदम उठाता है, तो क्रिटिक पूछता है: "क्या यह काम आया? क्या इसने हमारे लक्ष्य को पूरा किया?" यदि एक्टर ने गलती की, तो क्रिटिक एक नोट लिखता है कि वह क्यों विफल हुआ और अगली बार बेहतर कैसे किया जाए। यदि एक्टर सफल रहा, तो क्रिटिक सफलता की रेसिपी (विधि) लिख देता है।
  • द लाइब्रेरियन (स्मृति संरक्षक - The Librarian): यह एजेंट लंबी अवधि की यादों के एक विशाल, व्यवस्थित पुस्तकालय का प्रबंधन करता है। यह केवल सब कुछ स्टोर नहीं करता है; यह उन्हें तीन विशिष्ट अनुभागों में व्यवस्थित करता है:
    1. सिमेंटिक मेमोरी (विश्वकोश - The Encyclopedia): सामान्य तथ्य और ज्ञान (जैसे "किसी उपकरण का उपयोग कैसे करें")।
    2. एपिसोडिक मेमोरी (डायरी - The Diary): पिछली घटनाओं के सारांश (जैसे "पिछले मंगलवार, हमने फ्लाइट बुक करने की कोशिश की थी और वह विफल रही")।
    3. प्रोसीजरल मेमोरी (रेसिपी बुक - The Recipe Book): यह सबसे महत्वपूर्ण हिस्सा है। यह पिछली सफलताओं और विफलताओं के आधार पर "कैसे करें" मार्गदर्शिकाएँ संग्रहीत करता है। यह एक कुकबुक की तरह है जो कहती है, "यदि आप X करने की कोशिश करते हैं, तो Z के बजाय Y करें, क्योंकि पिछली बार Z विफल रहा था।"

3. वे मिलकर कैसे काम करते हैं: "फीडबैक लूप"

कल्पना कीजिए कि एक्टर केक बनाने (कार्य) की कोशिश कर रहा है।

  1. योजना (Planning): एक्टर "रेसिपी बुक" (प्रोसीजरल मेमोरी) को देखता है कि क्या उसने पहले कभी यह केक बनाया है।
  2. क्रिया (Action): एक्टर सामग्री मिलाता है।
  3. समीक्षा (Review): क्रिटिक देखता है। यदि केक जल जाता है, तो क्रिटिक केवल "बुरा" नहीं कहता। वह एक विशिष्ट नोट लिखता है: "अगली बार, गर्मी को 10 डिग्री कम करें।"
  4. भंडारण (Storage): लाइब्रेरियन उस नोट को लेता है, जाँच करता है कि क्या वह उपयोगी है, और उसे रेसिपी बुक में जोड़ देता है। वह उस नोट को एक "स्कोर" भी देता है। यदि वह नोट बाद में एक्टर को सफल होने में मदद करता है, तो उसका स्कोर बढ़ जाता है। यदि वह कभी उपयोग नहीं किया जाता या गलतियों का कारण बनता है, तो लाइब्रेरियन जगह बचाने के लिए उसे अंततः हटा देता है।

4. "स्मार्ट फ़िल्टर" (क्यों यह अव्यवस्थित नहीं होता)

मेमोरी सिस्टम के साथ एक आम समस्या यह है कि वे बहुत अधिक कचरे से भर जाते हैं। AdMem इसे एक रिवॉर्ड सिस्टम (इनाम प्रणाली) के साथ हल करता है।

  • हर बार जब AI अपने लाइब्रेरी से किसी स्मृति का उपयोग करने की कोशिश करता है, तो सिस्टम जाँचता है: "क्या इस स्मृति ने हमें जीतने में मदद की?"
  • यदि कोई स्मृति AI को सफल होने में मदद करती है, तो उसे उच्च स्कोर मिलता है और वह लाइब्रेरी में बनी रहती है।
  • यदि कोई स्मृति शायद ही कभी उपयोग की जाती है या विफलता की ओर ले जाती है, तो उसका स्कोर गिर जाता है। यदि यह बहुत कम हो जाता है, तो लाइब्रेरियन उसे हटा देता है।
  • यह सुनिश्चित करता है कि AI केवल "सर्वश्रेष्ठ रेसिपी" रखे और खराब वाली को भूल जाए, जिससे वह समय के साथ स्मार्ट बनता जाता है।

5. परिणाम: अभ्यास के साथ बेहतर होना

लेखकों ने विभिन्न डिजिटल वातावरणों (जैसे वीडियो गेम, वेब ब्राउज़िंग और टूल का उपयोग) में इस सिस्टम का परीक्षण किया।

  • निष्कर्ष: अन्य तरीकों की तुलना में, AdMem लंबे, बहु-चरणीय कार्यों को पूरा करने में बहुत बेहतर था।
  • "स्व-सुधार" (Self-Improvement): जब AI को बार-बार एक ही प्रकार के कार्य करने के लिए कहा गया (जैसे दूसरे या तीसरे राउंड के लिए गेम खेलना), तो वह काफी बेहतर हो गया। इसने अपनी पिछली गलतियों और सफलताओं से सीखा, जबकि अन्य तरीके बस वही गलतियाँ दोहराते रहे।

सारांश में

AdMem एक AI को व्यक्तिगत कोच और एक स्मार्ट फाइलिंग कैबिनेट देने जैसा है। केवल तथ्यों को याद रखने के बजाय, यह कैसे सोचना है और कैसे कार्य करना है इसे याद रखता है। यह लगातार अपने स्वयं के प्रदर्शन की समीक्षा करता है, अच्छे सबक रखता है, बुरे सबक हटा देता है, और जटिल समस्याओं को हल करने में बेहतर होने के लिए उस ज्ञान का उपयोग करता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →