← नवीनतम पेपर
💻 computer science

MESA:Task-Adaptive Multi-Structure Evidence Selection for Long-Horizon Agent Memory

MESA एक टास्क-एडेप्टिव फ्रेमवर्क है जो लॉन्ग-होरिज़न एजेंट्स के लिए क्वेरी-विशिष्ट पूरक मेमोरी स्ट्रक्चर्स के एक डायनामिकली चयनित और फ्यूज्ड सबसेट को चुनता है, जो फिक्स्ड-कॉन्टेक्स्ट अप्रोचेस के शोर से बचते हुए और विविध साक्ष्यों के संयोजन को सक्षम करते हुए AMA-Bench पर प्रदर्शन और दक्षता में महत्वपूर्ण सुधार करता है।

मूल लेखक: Beidi Zhao, Yaoqi Chen, Yuru Feng, Menghao Li, Qianxi Zhang, Baotong Lu, Jianan Lu, Zhirui Wang, Xinjiang Wang, Shusen Xu, Zengzhong Li, Xiaoxiao Li, Qi Chen

प्रकाशित 2026-08-12
📖 8 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Beidi Zhao, Yaoqi Chen, Yuru Feng, Menghao Li, Qianxi Zhang, Baotong Lu, Jianan Lu, Zhirui Wang, Xinjiang Wang, Shusen Xu, Zengzhong Li, Xiaoxiao Li, Qi Chen

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक जासूस हैं जो कई दिनों में सुलझी हुई एक पहेली को हल करने की कोशिश कर रहे हैं। आपके पास एक विशाल नोटबुक है जिसमें आपने जो कुछ भी किया, देखा, सोचा और कहा, वह सब दर्ज है। कुछ पन्ने दिन का संक्षिप्त विवरण हैं, कुछ कदमों की एक कच्ची सूची हैं, कुछ उन लोगों का नक्शा हैं जिनसे आप मिले, और कुछ वे कीवर्ड्स हैं जिन्हें आपने खोजा था। यदि आप एक साधारण से सवाल का जवाब देने के लिए जैसे कि "मैंने अपनी चाबियाँ कब खोईं?" के लिए पूरा नोटबुक पढ़ने की कोशिश करेंगे, तो आपका दिमाग बहुत सारी जानकारी से अभिभूत हो जाएगा। लेकिन यदि आप केवल एक विशिष्ट पन्ना पढ़ते हैं, तो आप किसी दूसरे भाग में छिपे एक महत्वपूर्ण सुराग को मिस कर सकते हैं। यह आधुनिक "AI एजेंट्स" (AI agents)—जो कंप्यूटर प्रोग्राम डिजिटल सहायकों की तरह काम करते हैं—के सामने आने वाली चुनौती है। उन्हें जटिल समस्याओं को हल करने के लिए घटनाओं की लंबी श्रृंखलाओं को याद रखने की आवश्यकता होती है, लेकिन वे अक्सर अपनी ही यादों में खो जाते हैं। वैज्ञानिक इन यादों को व्यवस्थित करने के सबसे अच्छे तरीके को खोजने की कोशिश कर रहे हैं: क्या AI को सब कुछ पढ़ना चाहिए? क्या इसे केवल एक प्रकार के नोट को चुनना चाहिए? या क्या कोई स्मार्ट तरीका है?

यह शोध पत्र एक चतुर नया सिस्टम पेश करता है जिसे MESA (Multi-structure Evidence Selection for long-horizon Agent) कहा जाता है, जो इन AI जासूसों के लिए एक सुपर-स्मार्ट लाइब्रेरियन की तरह काम करता है। यह AI को अपना पूरा नोटबुक पढ़ने के लिए मजबूर करने या अंधे होकर किसी एक पन्ने को चुनने के बजाय, प्रत्येक विशिष्ट प्रश्न के लिए नोट्स का परफेक्ट कॉम्बिनेशन (सही मिश्रण) चुनना सिखाता है। इसे एक ऐसे शेफ की तरह समझें जो न तो सिर्फ पहला मसाल का डिब्बा उठाता है और न ही पूरे मसालों के रैक को बर्तन में डाल देता है। इसके बजाय, वह पकवान को चखता है, महसूस करता है कि इसमें थोड़ा नमक और चुटकी भर काली मिर्च की जरूरत है, और ठीक उन्हीं दो डिब्बों को उठा लेता है। शोधकर्ताओं ने इसका परीक्षण AMA-Bench नामक एक बेंचमार्क पर किया, जो यह जांचने का एक विशाल टेस्ट है कि AI लंबे समय तक कितनी अच्छी तरह याद रख सकता है और तर्क दे सकता है। उन्होंने पाया कि MESA पिछले तरीकों की तुलना में सवालों के जवाब देने में बहुत बेहतर है। वास्तव में, इसने मौजूदा सर्वोत्तम प्रणाली की तुलना में 8.5% अधिक बार सही उत्तर दिया, और ऐसा करते हुए इसने मेमोरी से 41% कम शब्द (या "टोकन") पढ़े। यह सुझाव देता है कि लंबी पहेलियों को सुलझाने की कुंजी केवल सब कुछ पढ़ने या केवल एक चीज़ चुनने में नहीं, बल्कि चयनात्मक होने और विभिन्न प्रकार के मेमोरी व्यूज को मिलाने में है।

समस्या: बहुत अधिक शोर, पर्याप्त संकेत नहीं

कल्पना कीजिए कि आप एक वीडियो गेम खेल रहे हैं जहाँ आपको एक ऐसी पहेली सुलझानी है जिसके लिए आपको 50 कदम पहले किए गए काम को याद रखने की आवश्यकता है। आपका पात्र इधर-उधर दौड़ रहा है, राक्षसों से लड़ रहा है, NPCs से बात कर रहा है, और चीजें इकट्ठा कर रहा है। यदि आप गेम से पूछते हैं, "दरवाजा क्यों लॉक हुआ?" तो उत्तर 40 कदम पहले के एक छोटे से विवरण में छिपा हो सकता है, जैसे कि एक विशिष्ट चाबी जो आपने गिरा दी थी।

AI की दुनिया में, इन "कदमों" को ट्रैजेक्टरीज (trajectories) कहा जाता है। ये कार्यों, अवलोकनों और विचारों की लंबी, अस्त-व्यस्त श्रृंखलाएं हैं। समस्या यह है कि ये श्रृंखलाएं सैकड़ों कदम लंबी हो सकती हैं। यदि आप पूरी श्रृंखला को AI को देते हैं, तो यह महंगा और भ्रमित करने वाला हो जाता है। यदि आप इसका सारांश बनाने की कोशिश करते हैं, तो आप उस छोटे से विवरण को खो सकते हैं जो महत्वपूर्ण है।

वैज्ञानिकों ने इसे अलग-अलग "स्ट्रक्चर" या प्रारूपों में व्यवस्थित करके ठीक करने की कोशिश की है, ठीक वैसे ही जैसे एक बिखरे हुए कमरे को अलग-अलग डिब्बों में व्यवस्थित किया जाता है:

  • सारांश (Summaries): जैसे एक डायरी प्रविष्टि जो दिन का "सार" देती है लेकिन छोटे विवरणों को छोड़ देती है।
  • टेम्पोरल स्टोर्स (Temporal Stores): जैसे एक टाइमलाइन या कैलेंडर जो घटनाओं को सख्त क्रम में रखता है।
  • नॉलेज ग्राफ्स (Knowledge Graphs): जैसे लोगों और चीजों के बीच संबंधों का एक जाल, जो दिखाता है कि वे कैसे संबंधित हैं।
  • वेक्टर डेटाबेस (Vector Databases): जैसे एक सर्च इंजन जो "वाइब" या अर्थ के आधार पर चीजों को ढूंढता है, भले ही शब्द अलग हों।
  • रॉ ट्रेस (Raw Traces): जैसे एक सुरक्षा कैमरा रिकॉर्डिंग जो आपकी हर हरकत को दिखाती है, लेकिन यह शोर से भरी होती है और इसे स्कैन करना कठिन होता है।

बड़ा सवाल यह था: AI को कौन सा डिब्बा खोलना चाहिए?

पुराने तरीके: बहुत अधिक या बहुत कम

MESA से पहले, AI इस समस्या को संभालने के दो मुख्य तरीके अपनाता था:

  1. "सब कुछ पढ़ने" वाला दृष्टिकोण: AI एक साथ सभी डिब्बे खोल देता था और अपने दिमाग में हर एक नोट डाल देता था। यह एक ही समय में अपनी पूरी डायरी, अपना कैलेंडर, अपना नक्शा और अपना सुरक्षा फुटेज पढ़ने की कोशिश करने जैसा है ताकि यह पता लगाया जा सके कि आपने नाश्ते में क्या खाया था। यह बहुत अधिक जानकारी है, और महत्वपूर्ण सुराग शोर में खो जाते हैं।
  2. "एक चुनने" वाला दृष्टिकोण: AI अनुमान लगाने की कोशिश करता था कि कौन सा एकल डिब्बा सबसे अच्छा है और केवल उसी को पढ़ता था। यह यह तय करने जैसा है कि नाश्ते में आपने क्या खाया था यह जानने के लिए केवल अपने कैलेंडर को देखना चाहिए। आप इस तथ्य को मिस कर सकते हैं कि आपने अपनी डायरी में इसके बारे में एक नोट लिखा था।

शोधकर्ताओं ने पाया कि दोनों में से कोई भी चरम स्थिति अच्छी नहीं है। कभी-कभी आपको टाइमलाइन की आवश्यकता होती है; कभी-कभी आपको नक्शे की आवश्यकता होती है; अक्सर, आपको दोनों के मिश्रण की आवश्यकता होती है। लेकिन "सबसे अच्छा मिश्रण" प्रश्न के आधार पर बदल जाता है। "पहले क्या हुआ" के बारे में प्रश्न के लिए टाइमलाइन की आवश्यकता होती है, जबकि "किसने किससे बात की" के बारे में प्रश्न के लिए नक्शे की आवश्यकता होती है।

समाधान: MESA, एक अनुकूलनशील लाइब्रेरियन

MESA एक गतिशील लाइब्रेरियन बनने के लिए डिज़ाइन किया गया सिस्टम है। यह केवल एक डिब्बा नहीं चुनता या सभी को नहीं खोलता। इसके बजाय, यह प्रश्न को देखता है और कहता है, "आह, इस प्रश्न के लिए थोड़े से टाइमलाइन और थोड़े से नक्शे की आवश्यकता है, लेकिन मैं कच्चे वीडियो फुटेज को छोड़ सकता हूँ।"

यह सरल शब्दों में कैसे काम करता है:

  1. लाइब्रेरी: सबसे पहले, AI अपने इतिहास से पांच अलग-अलग प्रकार के मेमोरी स्ट्रक्चर (Summary, Timeline, Map, Search, और Raw Video) बनाता है। ये सभी पहले से बनाए जाते हैं और समान रहते हैं।
  2. सेलेक्टर (Selector): जब कोई प्रश्न आता है, तो सिस्टम का एक विशेष "सेलेक्टर" हिस्सा तय करता है कि किन स्ट्रक्चर्स का उपयोग करना है। यह एक स्मार्ट सहायक की तरह है जो प्रश्न को देखता है और सही उपकरण चुनता है।
  3. सीखना (Learning): सेलेक्टर को सिखाना कठिन काम है। सिस्टम के पास कोई शिक्षक नहीं है जो हर प्रश्न के लिए उसे ठीक-ठीक नहीं बताता कि कौन से डिब्बे चुनने हैं। इसके बजाय, यह अंतिम परिणाम से सीखता है: "क्या AI ने सही उत्तर दिया?" यदि उत्तर गलत था, तो सिस्टम अपनी चयन रणनीति को बदल देता है। यह UCB (Upper Confidence Bound) नामक एक चतुर गणितीय ट्रिक का उपयोग करता है ताकि नए संयोजनों को आज़माने (exploration) और जो काम करता है उस पर टिके रहने (exploitation) के बीच संतुलन बनाया जा सके।

उन्होंने क्या पाया

शोधकर्ताओं ने MESA का परीक्षण AMA-Bench पर किया, जो लंबे, जटिल कार्यों से भरा एक डेटासेट है। उन्होंने इसकी तुलना मौजूदा सर्वोत्तम तरीकों से की।

  • बेहतर सटीकता: MESA ने 65.1% बार सही उत्तर दिया, जो पिछले सर्वोत्तम सिस्टम (AMA-Agent) से 8.5% अधिक था।
  • स्मार्ट दक्षता: भले ही MESA अधिक सटीक था, फिर भी इसने मेमोरी से 41% कम शब्द (टोकन) का उपयोग किया। इसका मतलब है कि यह केवल अधिक नहीं पढ़ रहा था; यह बेहतर पढ़ रहा था।
  • कोई एक विजेता नहीं: अध्ययन ने पुष्टि की कि कोई "एक आकार सभी के लिए उपयुक्त" (one size fits all) मेमोरी स्ट्रक्चर नहीं है। मेमोरी प्रकारों का सबसे अच्छा संयोजन विशिष्ट कार्य और विशिष्ट प्रश्न के आधार पर बदल जाता है।

यह क्यों मायने रखता है

यह शोध पत्र बताता है कि AI मेमोरी का भविष्य बड़े और बड़े पुस्तकालय बनाने या केवल एक प्रकार के नोट को चुनने के बारे में नहीं है। यह लचीलेपन (flexibility) के बारे में है। ठीक वैसे ही जैसे एक मानव जासूस जानता है कि तारीखों के लिए कैलेंडर, स्थानों के लिए नक्शा और भावनाओं के लिए डायरी की जाँच करनी चाहिए, एक AI को भी समस्या को हल करने के लिए अपने विभिन्न मेमोरी व्यूज को मिलाने और जोड़ने की आवश्यकता होती है।

MESA दिखाता है कि AI को चयनात्मक और अनुकूलनशील बनाकर, हम इसे बिना उसकी सोचने की प्रक्रिया या उसके स्टोर करने के तरीके को बदले, अधिक स्मार्ट और कुशल बना सकते हैं। यह एक ऐसे AI की ओर एक कदम है जिसके पास केवल बहुत सारा डेटा नहीं है, बल्कि उसे पता है कि जब सबसे अधिक आवश्यकता हो, तो सही डेटा का टुकड़ा बिल्कुल कहाँ से ढूँढना है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →