← नवीनतम पेपर
🤖 AI

Memory as Action: Autonomous Context Curation for Long-Horizon Agentic Tasks

यह शोध पत्र मेमोरी-एज़-एक्शन (MemAct) का परिचय देता है, जो एक ऐसा ढांचा है जो वर्किंग मेमोरी प्रबंधन को सुदृढीकरण शिक्षण (reinforcement learning) के माध्यम से अनुकूलित सीखने योग्य नीतिगत कार्यों (learnable policy actions) के रूप में मानता है ताकि लंबी अवधि के एजेंटिक कार्यों के लिए कुशल, अनुकूलनीय संदर्भ क्यूरेशन (context curation) को सक्षम किया जा सके, जिससे बहुत बड़े मॉडलों की सटीकता प्राप्त करते हुए संदर्भ लंबाई को काफी कम किया जा सके।

मूल लेखक: Yuxiang Zhang, Jiangming Shu, Ye Ma, Xueyuan Lin, Shangxi Wu, Jitao Sang

प्रकाशित 2026-05-08
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Yuxiang Zhang, Jiangming Shu, Ye Ma, Xueyuan Lin, Shangxi Wu, Jitao Sang

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक विशाल, बहु-चरणीय पहेली को हल करने की कोशिश कर रहे हैं, जैसे कि किसी जटिल यात्रा की योजना बनाना या किसी बड़े सॉफ़्टवेयर प्रोग्राम को डीबग करना। आपके पास एक विशाल व्हाइटबोर्ड (आपका कंप्यूटर मेमोरी) है जहाँ आप अपने हर विचार, खोज परिणाम और सुराग को लिखते हैं।

समस्या:
जैसे-जैसे कार्य लंबा होता जाता है, आपका व्हाइटबोर्ड अव्यवस्थित होता जाता है। आप सब कुछ लिखना शुरू कर देते हैं: "मैंने मौसम के बारे में जानकारी ली," "मैंने ट्रेन का शेड्यूल चेक किया," "मैंने शहर के इतिहास के बारे में पढ़ा," "मैंने फिर से मौसम के बारे में जानकारी ली।" अंततः, बोर्ड इतने सारे स्क्रिबल्स (लिखावट) से भर जाता है कि आप महत्वपूर्ण सुरागों को ढूँढ नहीं पाते। आप अपने ही नोट्स के बीच में "खो" जाते हैं।

वर्तमान AI असिस्टेंट भी ऐसा ही करते हैं। वे बस नीचे की ओर नोट्स जोड़ते रहते जाते हैं, कुछ भी मिटाते नहीं हैं, जब तक कि पेज पढ़ने के लिए बहुत अधिक अस्त-व्यस्त न हो जाए।

समाधान: "मेमोरी एज एक्शन" (MemAct)
यह पेपर AI को सोचने का एक नया तरीका पेश करता है। केवल निष्क्रिय रूप से नोट्स लिखने के बजाय, AI को अपनी मेमोरी पर कार्य (act) करने के लिए सिखाया जाता है। इसे ऐसे समझें जैसे AI को एक कैंची और एक हाइलाइटर दे दिया गया हो।

लेखक इस फ्रेमवर्क को MemAct कहते हैं। यह सरल शब्दों में इस प्रकार काम करता है:

1. "एडिट" बटन

पुराने तरीके में, AI बस बोलना जारी रखता है। MemAct में, AI के पास एक विशेष टूल है जिसे प्रून एंड राइट (Prune & Write) कहा जाता है।

  • प्रून (कैंची): AI अपने इतिहास को देखता है और निर्णय लेता है, "मुझे अब उन 10 पुराने खोज परिणामों की आवश्यकता नहीं है; मुझे उस भाग का उत्तर पहले से पता है।" वह उन्हें काट देता है।
  • राइट (हाइलाइटर): काटने से पहले, AI उन पुराने नोट्स से सीखी गई बातों का एक छोटा, साफ सारांश लिखता है।
  • परिणाम: एक अव्यवस्थित, लंबे इतिहास को एक साफ, छोटे सारांश से बदल दिया जाता है। AI अर्थ को बनाए रखता है लेकिन अव्यवस्था को हटा देता है।

2. "स्मार्ट" निर्णय

यह जानना कठिन हिस्सा है कि कब काटना है। यदि आप बहुत जल्दी काट देते हैं, तो आप महत्वपूर्ण तथ्य खो देते हैं। यदि आप बहुत देर से काटते हैं, तो बोर्ड बहुत अव्यवस्थित हो जाता है।

  • पुराना तरीका: एक मानव प्रोग्रामर एक नियम सेट करता है जैसे, "हर 5 मिनट में, सबसे पुराने नोट्स को हटा दें।" यह कठोर है और अक्सर गलत चीज़ों को हटा देता है।
  • MemAct तरीका: AI खुद निर्णय लेना सीखता है। यह एक छात्र की तरह है जो सीखता है, "जब मैं गणित के पहले भाग को हल कर लेता हूँ, तो मैं अपने रफ वर्क (scratch work) को मिटा सकता हूँ ताकि मेरे पास अगले भाग के लिए जगह बन सके।" AI इस रणनीति को ट्रायल एंड एरर (Reinforcement Learning) के माध्यम से सीखता है।

3. "ट्रेन ट्रैक" चुनौती (DCPO)

एक बड़ा तकनीकी अवरोध था। कल्पना कीजिए कि एक ट्रेन पटरियों पर आगे बढ़ रही है। यदि AI अचानक अपने पीछे के ट्रैक का एक हिस्सा हटा देता है, तो ट्रेन (AI की सोचने की प्रक्रिया) क्रैश हो सकती है क्योंकि इसे इस धारणा पर बनाया गया था कि ट्रैक केवल जोड़े जाते हैं, कभी हटाए नहीं जाते।

लेखकों ने एक चतुर समाधान विकसित किया जिसे DCPO (Dynamic Context Policy Optimization) कहा जाता है।

  • उपमा: कल्पना कीजिए कि आप एक फिल्म बना रहे हैं। यदि अभिनेता एक संवाद भूल जाता है और निर्देशक कहता है, "कट! चलिए वह दृश्य फिर से शूट करते हैं," तो आप केवल गलती के ऊपर फिल्मांकन जारी नहीं रखते। आप वापस जाते हैं, उस दृश्य को फिर से शूट करते हैं, और नए, सही फुटेज को मूवी रील में जोड़ देते हैं।
  • समाधान: DCPO AI के प्रशिक्षण के लिए यही करता है। जब AI अपनी मेमोरी को एडिट करता है, तो सिस्टम तार्किक रूप से "रीवाइंड" करता है और प्रशिक्षण डेटा को साफ, अलग-अलग खंडों में पुनर्गठित करता है। यह AI को अपनी ही परिवर्तनों से भ्रमित हुए बिना अपनी मेमोरी को एडिट करना सीखने की अनुमति देता है।

परिणाम: छोटा, तेज़, स्मार्ट

इस पेपर ने एक 14-बिलियन-पैरामीटर वाले AI मॉडल (जो बड़ा है, लेकिन सबसे बड़ा नहीं) के साथ इसका परीक्षण किया।

  • तुलना: उन्होंने एक "विशाल" AI मॉडल (235 बिलियन पैरामीटर) के साथ तुलना की जिसके पास एक विशाल मेमोरी है लेकिन वह उसे साफ करना नहीं जानता।
  • परिणाम: छोटे MemAct AI ने विशाल मॉडल के समान प्रदर्शन किया, लेकिन इसने 51% कम मेमोरी स्पेस का उपयोग किया।
  • लाभ: क्योंकि इसने अपना "व्हाइटबोर्ड" साफ रखा, यह तेज़ था और अप्रासंगिक जानकारी से भ्रमित नहीं हुआ। इसने एक "सर्जिकल" संपादक बनने के रूप में सीखा, जो केवल आवश्यक चीजों को हटाकर अपना फोकस तीक्ष्ण रखता है।

सारांश

पेपर का दावा है कि AI को उसकी अपनी अल्पकालिक मेमोरी को सक्रिय रूप से प्रबंधित करने के लिए सिखाकर—यह तय करना कि क्या रखना है, क्या सारांशित करना है, और क्या मिटाना है—वह जटिल, दीर्घकालिक समस्याओं को बहुत अधिक कुशलता से हल कर सकता है। यह मेमोरी प्रबंधन को एक निष्क्रिय स्टोरेज समस्या से एक सक्रिय, सीखी गई स्किल में बदल देता है, जिससे छोटे मॉडल भी अपनी क्षमता से कहीं अधिक प्रभावी ढंग से कार्य कर पाते हैं।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →