← नवीनतम पेपर
💬 NLP

Total Recall at What Cost? Benchmarking the Serving Cost of Agentic Memory Systems

यह शोध पत्र तीन एजेंटिक मेमोरी सिस्टम्स की सर्विंग लागत और सटीकता का मानक रणनीतियों के विरुद्ध बेंचमार्क करता है, जिससे यह पता चलता है कि लागत केवल बातचीत की लंबाई के बजाय आंतरिक सिस्टम व्यवहारों द्वारा संचालित होती है, विभिन्न बैकबोन और सिस्टम्स के बीच काफी भिन्न होती है, और इसमें एक ऐसा ट्रेड-ऑफ शामिल है जहाँ कोई भी एकल समाधान लागत और सटीकता दोनों को अनुकूलित नहीं करता है।

मूल लेखक: Natchanon Pollertlam, Witchayut Kornsuwannawit

प्रकाशित 2026-08-13
📖 7 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Natchanon Pollertlam, Witchayut Kornsuwannawit

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक बहुत बुद्धिमान, लेकिन थोड़े भुलक्कड़, रोबोट दोस्त से बात कर रहे हैं। आप हफ्तों से उससे बातें कर रहे हैं, अपनी कहानियाँ, योजनाएँ और राज साझा कर रहे हैं। अब, आप पूछना चाहते हैं, "याद है उस पिज्जा की जगह के बारे में जो हमने तीन हफ्ते पहले चर्चा की थी?" यदि रोबोट की कोई याददाश्त नहीं है, तो आपको हर बार अपनी दोस्ती की पहली कहानी से लेकर आज तक की पूरी कहानी फिर से सुनानी होगी। यह ऐसा है जैसे आप हर बार एक विशाल, भारी बैकपैक जिसमें आपके द्वारा कहे गए हर शब्द समाए हुए हैं, रोबोट को भेजने की कोशिश कर रहे हों। यह काम तो करता है, लेकिन यह बहुत जल्दी भारी, धीमा और महंगा हो जाता है।

इसे ठीक करने के लिए, इंजीनियरों ने इन रोबोटों के लिए "मेमोरी सिस्टम" (स्मृति प्रणाली) बनाए। इस भारी बैकपैक को ढोने के बजाय, रोबोट एक विशेष नोटबुक में छोटे नोट्स, तथ्य या सारांश लिख लेता है। जब आप कोई प्रश्न पूछते हैं, तो वह बस सही पन्ना पलटता है और नोट पढ़ लेता है। यह सुनने में एकदम सही लगता है: हल्का, तेज़ और सस्ता। लेकिन यहाँ एक पेंच है: नोट्स लिखना, उन्हें व्यवस्थित करना और सही पन्ना ढूँढने में भी काम लगता है। बड़ा सवाल यह है: क्या रोबोट नोटबुक का उपयोग करके पैसे बचाता है, या नोटबुक को प्रबंधित करने की लागत वास्तव में उस भारी बैकपैक को ढोने से भी अधिक महंगी हो जाती है? यह शोध उसी सटीक रहस्य की गहराई में जाता है, और इन मेमोरी ट्रिक्स की वास्तविक दुनिया की कीमत को मापता है ताकि यह देखा जा सके कि क्या वे वास्तव में लागत के लायक हैं।


द ग्रेट मेमोरी कॉस्ट शोडाउन (स्मृति लागत का महासंग्राम)

इस अध्ययन में, शोधकर्ताओं ने यह देखने के लिए एक बड़ी दौड़ आयोजित की कि चैटबॉट की याददाश्त को जीवित रखने की वास्तविक लागत कितनी है। उन्होंने केवल अनुमान नहीं लगाया; उन्होंने तीन अलग-अलग "मेमोरी सिस्टम" (सोचिए कि ये आपके नोटबुक को व्यवस्थित करने के तीन अलग तरीके हैं) के साथ एक नियंत्रित प्रयोग चलाया: Mem0, Hindsight, और Mastra Observational Memory

परीक्षण को निष्पक्ष बनाने के लिए, उन्होंने इन मेमोरी सिस्टम की तुलना दो चरम रणनीतियों से की:

  1. "रोलिंग विंडो" (द चीप बेसलाइन): यह केवल आपकी कही गई पिछली 10 बातों को याद रखने जैसा है। यह बहुत सस्ता है लेकिन बाकी सब कुछ भूल जाता है।
  2. "फुल ट्रांसक्रिप्ट" (द एक्सपेंसिव बेसलाइन): यह "भारी बैकपैक" वाला तरीका है। हर बार जब आप कोई प्रश्न पूछते हैं, तो रोबोट आपकी बातचीत के इतिहास को पहले शब्द से लेकर अंत तक फिर से पढ़ता है।

उन्होंने इन सिस्टम्स को 400 टर्न (यानी 400 बार बातचीत का आदान-प्रदान) तक की बातचीत के माध्यम से चलाया और यह देखने के लिए 665 विशिष्ट प्रश्नों का परीक्षण किया कि क्या रोबोट वास्तव में सही चीजों को याद रख पाया। उन्होंने यह देखने के लिए रोबोट के दो अलग-अलग "मस्तिष्क" (बैकबोन मॉडल्स) का भी परीक्षण किया कि क्या मस्तिष्क के प्रकार से लागत बदलती है।

सबसे बड़ा आश्चर्य: आप कीमत का अनुमान नहीं लगा सकते

पहली बड़ी खोज यह है कि आप केवल बातचीत की लंबाई या संदेशों के आकार को देखकर लागत का अनुमान नहीं लगा सकते। शोधकर्ताओं ने बातचीत की लंबाई और संदेश के आकार के आधार पर लागत का अनुमान लगाने के लिए एक सरल गणितीय सूत्र बनाने की कोशिश की।

  • "फुल ट्रांसक्रिप्ट" और "रोलिंग विंडो" रणनीतियों के लिए, गणित पूरी तरह से काम करता है। यदि आप जानते हैं कि आपने कितने शब्द भेजे हैं, तो आप जानते हैं कि इसकी लागत कितनी है।
  • मेमोरी सिस्टम के लिए, गणित बुरी तरह विफल रहा। सूत्र वास्तविक लागत से 18% से 69% तक चूक गया।

क्यों? क्योंकि मेमोरी सिस्टम की लागत केवल इस बारे में नहीं है कि आप कितना बात कर रहे हैं; बल्कि यह इस बारे में है कि आप बात करते समय सिस्टम आंतरिक रूप से क्या कर रहा है। कभी-कभी सिस्टम एक लंबा सारांश लिखने का निर्णय लेता है, तो कभी वह बस एक त्वरित तथ्य पकड़ लेता है। कभी-कभी यह अपने पूरे नोटबुक को पुनर्गठित करता है। ये आंतरिक निर्णय बातचीत की सामग्री से संचालित होते हैं, न कि केवल लंबाई से। यह कुछ ऐसा है जैसे आप केवल मानचित्र को देखकर सड़क यात्रा की लागत का अनुमान लगाने की कोशिश कर रहे हों, बिना यह जाने कि ड्राइवर एक शानदार लंच करने के लिए रुकेगा या बस एक ग्रेनोला बार लेगा। "लंच" (आंतरिक प्रसंस्करण) बहुत अधिक भिन्न होता है, जिससे कुल बिल अप्रत्याशित हो जाता है।

"ब्रेक-इवन" पॉइंट: नोटबुक कब फायदेमंद होता है?

शोधकर्ताओं ने एक महत्वपूर्ण प्रश्न पूछा: किस बिंदु पर एक मेमोरी सिस्टम का उपयोग करना पूरी बातचीत को फिर से पढ़ने की तुलना में सस्ता हो जाता है?

उत्तर है: यह पूरी तरह से सिस्टम और रोबोट के मस्तिष्क पर निर्भर करता है।

  • Mastra Observational Memory सबसे तेज़ था। कुछ मामलों में, यह पहले ही टर्न (टर्न 0) से "फुल ट्रांसक्रिप्ट" विधि की तुलना में सस्ता था।
  • Mem0 को थोड़ा अधिक समय लगा, आमतौर पर यह टर्न 82 के आसपास बराबर पहुँचता है, लेकिन केवल तभी जब संदेश पर्याप्त लंबे हों।
  • Hindsight सबसे धीमा था। कई मामलों में, यह 400 टर्न के बाद भी "फुल ट्रांसक्रिप्ट" विधि से सस्ता नहीं हुआ। वास्तव में, कुछ सेटअपों के लिए, यह परीक्षण के अंत में भी अधिक महंगा था।

इसका अर्थ यह है कि यदि आपकी बातचीत छोटी है, तो एक जटिल मेमोरी सिस्टम का उपयोग करना वास्तव में पूरी चैट हिस्ट्री को फिर से भेजने की तुलना में अधिक महंगा हो सकता है। आपको पैसे बचाने के लिए एक निश्चित समय तक (जिसे "ब्रेक-इवन" पॉइंट कहते हैं) बात करनी होगी।

सटीकता बनाम लागत: मुफ्त में कुछ नहीं मिलता

अध्ययन ने यह भी जांचा कि क्या मेमोरी सिस्टम प्रश्न पूछने में वास्तव में अच्छे थे। परिणामों ने प्रदर्शन की एक विस्तृत श्रृंखला दिखाई:

  • सटीकता (Accuracy) 21% से 54% के बीच भिन्न थी।
  • Mem0 में सटीकता के सबसे बड़े उतार-चढ़ाव देखे गए, जो कुछ रोबोट मस्तिष्क पर अच्छा और दूसरों पर खराब प्रदर्शन करता था।
  • Hindsight आम तौर पर सबसे सटीक (अक्सर 50% से ऊपर) था, लेकिन इसे चलाना सबसे महंगा भी था।
  • Mastra एक मध्यम स्तर का प्रदर्शन करने वाला था लेकिन जब आपने सही उत्तरों की संख्या को ध्यान में रखा, तो यह अक्सर सबसे अधिक लागत प्रभावी था।

शोधकर्ताओं ने पाया कि रोबोट के "मस्तिष्क" (बैकबोन मॉडल) का चुनाव मेमोरी सिस्टम के चुनाव जितना ही महत्वपूर्ण था। एक मेमोरी सिस्टम जो एक रोबोट मस्तिष्क पर सस्ता था, दूसरे पर महंगा हो सकता था।

अंतिम निर्णय

यह शोध पत्र निष्कर्ष निकालता है कि कोई एक "सर्वश्रेष्ठ" मेमोरी सिस्टम नहीं है।

  • यदि आप किसी विशिष्ट रोबोट मस्तिष्क पर प्रति सही उत्तर सबसे सस्ता विकल्प चाहते हैं, तो gpt-oss-20b मस्तिष्क पर Mastra विजेता था (100 टर्न पर लगभग $0.028 प्रति सही उत्तर की लागत)।
  • यदि आप एक अलग रोबोट मस्तिष्क (Gemma 4 26B A4B) का उपयोग करते हैं, तो Mem0 सबसे सस्ता विकल्प बन जाता है।
  • Hindsight, सटीक होने के बावजूद, अक्सर बहुत महंगा होता है जब तक कि बातचीत बहुत लंबी न हो।

मुख्य निष्कर्ष यह है कि आप केवल इसलिए मेमोरी सिस्टम नहीं चुन सकते क्योंकि यह सुनने में अच्छा लगता है। आपको अपनी विशिष्ट स्थिति को देखना होगा: बातचीत कितनी लंबी होगी? संदेश कितने बड़े हैं? और आप कौन सा रोबोट मस्तिष्क उपयोग कर रहे हैं? केवल तभी आप जान पाएंगे कि मेमोरी सिस्टम आपके पैसे बचाएगा या आपके बिल में और वृद्धि करेगा। एक मेमोरी सिस्टम की "पूर्ण स्मरण शक्ति" (Total Recall) की एक कीमत होती है, और वह कीमत केवल आपके द्वारा टाइप किए गए शब्दों को गिनने से कहीं अधिक जटिल है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →