← नवीनतम पेपर
🤖 machine learning

Mem-T: Densifying Rewards for Long-Horizon Memory Agents

Mem-T एक स्वायत्त मेमोरी एजेंट पेश करता है जिसे MoT-GRPO फ्रेमवर्क के माध्यम से प्रशिक्षित किया गया है, जो मौजूदा मेमोरी प्रबंधन प्रणालियों की तुलना में बेहतर प्रदर्शन और दक्षता प्राप्त करने के लिए ट्री-गाइडेड बैकप्रोपैगेशन के माध्यम से स्पार्स लॉन्ग-होराइजन रिवार्ड्स को डेंसिफाई करता है।

मूल लेखक: Yanwei Yue, Boci Peng, Xuanbo Fan, Jiaxin Guo, Qiankun Li, Yan Zhang

प्रकाशित 2026-03-10
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Yanwei Yue, Boci Peng, Xuanbo Fan, Jiaxin Guo, Qiankun Li, Yan Zhang

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक बहुत ही बुद्धिमान लेकिन भुलक्कड़ रोबोट सहायक को यह सिखाने की कोशिश कर रहे हैं कि एक इंसान के साथ वर्षों तक चलने वाली लंबी बातचीत को कैसे संभाला जाए। समस्या यह है कि रोबोट की एक बहुत छोटी "वर्किंग मेमोरी" (जैसे कि एक स्टिकी नोट) है जो एक बार में केवल कुछ वाक्य ही रख सकती है। यदि बातचीत बहुत लंबी हो जाती है, तो रोबोट शुरुआत की बातें भूल जाता है, भ्रमित हो जाता है और अपनी ओर से बातें बनाने लगता है।

यह पेपर Mem-T पेश करता है, जो रोबोट को प्रभावी ढंग से लॉन्ग-टर्म मेमोरी (दीर्घकालिक स्मृति) बनाने और उपयोग करने का तरीका सिखाने का एक नया तरीका है। यहाँ सरल उपमाओं (analogies) का उपयोग करके इसका विवरण दिया गया है।

समस्या: "एक इनाम" वाली लॉटरी

पहले, जब शोधकर्ता इन रोबोट्स को प्रशिक्षित करने की कोशिश करते थे, तो वे एक ऐसी विधि का उपयोग करते थे जो एक लॉटरी के समान थी।

  • यह कैसे काम करता था: रोबोट पूरी बातचीत के दौरान सैकड़ों चरणों (पढ़ना, सोचना, खोजना, नोट्स लिखना) से गुजरता था। केवल अंत में, जब इंसान एक अंतिम प्रश्न पूछता था, तब रोबता को इनाम मिलता था: "अच्छा काम किया!" (1 अंक) या "गलत उत्तर" (0 अंक)।
  • दोष: रोबोट को यह पता नहीं होता था कि किस विशिष्ट चरण की वजह से वह जीता। क्या वह चरण 10 में "जीना" नाम याद रखने के कारण जीता? या क्या वह चरण 50 में सही डेटाबेस खोजने के कारण जीता? यह एक रहस्य था। इसे "स्पार्स रिवॉर्ड" (Sparse Reward) समस्या कहा जाता है। रोबोट अंधेरे में अनुमान लगा रहा था।

समाधान: Mem-T (एक स्मार्ट लाइब्रेरियन)

लेखकों ने Mem-T बनाया है, जो एक ऐसा रोबोट है जो तीन अलग-अलग प्रकार की अलमारियों वाले एक सुव्यवस्थित लाइब्रेरियन (पुस्तकालयाध्यक्ष) की तरह कार्य करता है:

  1. तथ्यात्मक स्मृति (Factual Memory): ठोस तथ्य (जैसे, "जीना का जन्म 1990 में हुआ था")।
  2. अनुभवात्मक स्मृति (Experiential Memory): सीखे गए सबक (जैसे, "यदि जीना थकी हुई है, तो वह छोटी मीटिंग्स पसंद करती है") है।
  3. कच्ची स्मृति (Raw Memory): बातचीत का बिना संपादित ट्रांसक्रिप्ट (बस सुरक्षा के लिए)।

Mem-T केवल चीजों को स्टोर नहीं करता है; यह सक्रिय रूप से निर्णय लेता है कि क्या लिखना है, क्या अपडेट करना है और क्या हटा देना है, और यह सब बातचीत के दौरान ही करता है।

असली मंत्र: MoT-GRPO ("विकल्पों का वृक्ष")

असली जादू केवल इसकी मेमोरी शेल्फ नहीं है; बल्कि यह है कि उन्होंने रोबलेट को कैसे प्रशिक्षित किया। उन्होंने एक नई प्रशिक्षण विधि विकसित की जिसे MoT-GRPO कहा जाता है।

कल्पना कीजिए कि रोबोट एक सवाल का जवाब देने के लिए एक विशाल लाइब्रेरी में एक विशिष्ट किताब खोजने की कोशिश कर रहा है।

  • पुराना तरीका: रोबोट एक रास्ता चुनता है, एक गलियारे में चलता है, और यदि वह विफल हो जाता है, तो उसे "गेम ओवर" का संकेत मिलता है। वह यह नहीं सीख पाता कि वह क्यों विफल हुआ।
  • Mem-T का तरीका (वृक्ष):
    1. शाखाएं निकलना (Branching Out): केवल एक रास्ता चलने के बजाय, रोबोट एक ही समय में तीन अलग-अलग गलियारों में चलते हुए अपने तीन अलग-अलग संस्करणों की कल्पना करता है।
    2. सघन पुरस्कार (Dense Rewards): जैसे-जैसे प्रत्येक संस्करण चलता है, उसे रास्ते में उपयोगी सुराग मिलने के लिए छोटे पुरस्कार मिलते हैं (जैसे, "अच्छा काम किया, 'तथ्य' वाला सेक्शन ढूंढ लिया!")।
    3. बैकट्रैकिंग (Backtracking): यदि एक रास्ता बंद गली की ओर ले जाता है, तो सिस्टम अन्य रास्तों को देखता है। यह कहता है, "आह, वह संस्करण जिसने पहले 'अनुभव' वाली शेल्फ को खोजा, उसने उत्तर ढूंढ लिया!"
    4. दृष्टिकोण श्रेय (Hindsight Credit): सिस्टम फिर से शुरुआत में जाता है और रोबोट को बताता है: "तुम अनुभव वाली शेल्फ को पहले देखने के लिए सही थे। वही मुख्य कदम था।"

यह "अंत में एक बड़ा इनाम" मिलने की प्रक्रिया को एक निरंतर फीडबैक स्ट्रीम में बदल देता है, जिससे रोबोट को ठीक से पता चलता है कि कौन से कार्य महत्वपूर्ण हैं।

परिणाम: स्मार्ट और सस्ता

चूंकि Mem-T जानता है कि कौन से चरण महत्वपूर्ण हैं:

  • यह स्मार्ट है: यह जटिल, दीर्घकालिक प्रश्नों पर पिछले शीर्ष-स्तरीय मेमोरी सिस्टमों को महत्वपूर्ण अंतर (15% तक बेहतर) से पीछे छोड़ देता है।
  • यह कुशल है: यह हर जगह खोजने में ऊर्जा बर्बाद नहीं करता है। इसे ठीक पता है कि कहाँ देखना है, जिससे एक प्रश्न का उत्तर देने के लिए आवश्यक कंप्यूटर पावर (टोकन) में लगभग 24% की बचत होती है।

निचोड़

Mem-T को एक गोल्डफिश (जो 10 सेकंड के बाद सब कुछ भूल जाती है) से एक अनुभवी जासूस (जो एक विस्तृत केस फाइल रखता है, सुरागों को क्रॉस-रेफरेंस करना जानता है, और अपनी हर गलती से सीखता है) में अपग्रेड करने के रूप में देखें।

"विकल्पों के वृक्ष" का उपयोग करके रोबोट को अंत तक इंतजार करने के बजाय निरंतर फीडबैक देने के माध्यम से, शोधकर्ताओं ने एआई को केवल आखिरी वाक्य ही नहीं, बल्कि पूरी लंबी कहानी को याद रखने का तरीका सिखाने की समस्या को हल कर दिया है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →