← नवीनतम पेपर
💬 NLP

DynamicMem: A Long-Horizon Memory Benchmark in Real-World Settings

यह शोध पत्र DynamicMem को प्रस्तुत करता है, जो एक सिंथेटिक लॉन्ग-होराइजन बेंचमार्क है जिसमें विकसित, निहित प्रोफाइल्स के साथ 15 महीनों की मल्टी-ऐप उपयोगकर्ता गतिविधि शामिल है, ताकि वास्तविक दुनिया के परिवेश में दीर्घकालिक स्मृति बनाए रखने और उसे अपडेट करने की वर्तमान LLM एजेंटों की क्षमता में महत्वपूर्ण सीमाओं का मूल्यांकन और अनावरण किया जा सके।

मूल लेखक: Wenya Xie, Shengming Zhou, Zelin Li, Pouya Parsa, Shuang Zhou, Xinheng Ding, Chinmay Arvind, Guanchu Wang, Vladimir Braverman, Ali Payani, Yantao Zheng, Zirui Liu

प्रकाशित 2026-06-23
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Wenya Xie, Shengming Zhou, Zelin Li, Pouya Parsa, Shuang Zhou, Xinheng Ding, Chinmay Arvind, Guanchu Wang, Vladimir Braverman, Ali Payani, Yantao Zheng, Zirui Liu

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आपने अपने जीवन में मदद के लिए एक व्यक्तिगत सहायक (personal assistant) नियुक्त किया है। आप चाहते हैं कि वह याद रखे कि आप कौन हैं, आप हर दिन क्या करते हैं, और आपको क्या पसंद है। लेकिन यहाँ एक पेंच है: आप बदलते रहते हैं। आपको नई नौकरी मिल सकती है, आप मैराथन दौड़ना शुरू कर सकते हैं, या अचानक आप कॉफी से नफरत करने लग सकते हैं। एक अच्छे सहायक को यह याद रखने की जरूरत है कि आपका पुराना स्वरूप क्या था जब वह महत्वपूर्ण हो, लेकिन उसे यह भी पता होना चाहिए कि अपने नए स्वरूप को दर्शाने के लिए अपनी याददाश्त को कब अपडेट करना है।

"DynamicMem" नामक शोध पत्र तर्क देता है कि जबकि हम इन एआई (AI) सहायकों का परीक्षण कर रहे हैं, हम उन्हें बहुत ही अनुचित और अवास्तविक परीक्षण दे रहे हैं। यहाँ इसका एक सरल विवरण दिया गया है कि उन्होंने क्या पाया और इसे ठीक करने के लिए क्या बनाया।

समस्या: "स्टैटिक स्नैपशॉट" का जाल (The "Static Snapshot" Trap)

कल्पना कीजिए कि आप एक लाइब्रेरियन को यह परखने की कोशिश कर रहे हैं कि उसे आपकी पढ़ने की आदतों के बारे में कितनी याद है।

  • पुराना तरीका: आप लाइब्रेरियन को उन 10 किताबों की सूची देते हैं जो आपने पिछले सप्ताह पढ़ी थीं और पूछते हैं, "आपने क्या पढ़ा?" वह सही जवाब देता है। फिर, आप पूछते हैं, "अब आप क्या पढ़ रहे हैं?" वह अभी भी पुरानी किताबों के बारे में ही कहता है क्योंकि परीक्षण कभी बदला ही नहीं।
  • वास्तविकता: असल जिंदगी में, आपकी "याददाश्त" केवल तथ्यों की एक सूची नहीं है। यह सुरागों का एक बिखरा हुआ, अस्त-व्यस्त रास्ता है। आप यह नहीं कहते, "मुझे स्वस्थ भोजन पसंद है।" इसके बजाय, आप सोमवार को केल (kale) खरीदते हैं, मंगलवार को स्मूदी रेसिपी खोजते हैं, और शुक्रवार को पिज्जा सब्सक्रिप्शन रद्द कर देते हैं। सुराग 16 अलग-अलग ऐप्स (Amazon, Spotify, Google, आपका फिटनेस ट्रैकर) में बिखरे हुए हैं।

लेखकों का कहना है कि मौजूदा परीक्षण बहुत सरल हैं। वे आपके जीवन को एक चलती हुई फिल्म के बजाय एक स्थिर फोटो की तरह मानते हैं। वे यह परीक्षण नहीं करते कि क्या एक एआई संभाल सकता है:

  1. परिवर्तन की विभिन्न गति: कुछ चीजें तुरंत बदल जाती हैं (नई कार खरीदना), कुछ धीरे-धीरे बदलती हैं (आपका संगीत का स्वाद), और कुछ केवल दिनचर्या होती हैं (आपकी सुबह की कॉफी)।
  2. बाहरी कारण: आप बिना किसी कारण के कॉफी पसंद करना बंद नहीं करते। शायद सर्दियों का मौसम है, या आपको नई नौकरी मिली है। वास्तविक परिवर्तनों के पीछे कारण होते हैं।
  3. बिखरे हुए साक्ष्य: एआई को 16 अलग-अलग ऐप्स में आपके छोटे-छोटे, असंबद्ध कार्यों से आपकी प्रोफाइल तैयार करनी होती है।

समाधान: DynamicMem ("15-महीने की फिल्म")

इसे ठीक करने के लिए, टीम ने DynamicMem बनाया। इसे 10 अलग-अलग लोगों के लिए एक सिम्युलेटेड जीवन की फिल्म के रूप में समझें, जो 15 महीनों तक चलती है।

  • पात्र (The Cast): उन्होंने 10 अद्वितीय "पर्सोना" बनाए (जैसे पिट्सबर्ग में एक सॉफ्टवेयर इंजीनियर या लंदन में एक छात्र)।
  • कथानक (The Plot): ये लोग 15 महीनों तक अपना जीवन जीते हैं। वे नौकरी बदलते हैं, घर बदलते हैं, अपने वर्कआउट रूटीन बदलते हैं, और अपनी पसंद बदलते हैं।
  • सुराग (The Clues): प्रत्येक क्रिया को 16 अलग-अलग ऐप्स (जैसे Amazon, Spotify, Gmail, UberEats) में रिकॉर्ड किया जाता है। यदि कोई उपयोगकर्ता नया शौक शुरू करता है, तो एआई उन्हें सामान खोजते हुए, उसे खरीदते हुए और फिर उसका उपयोग करते हुए देखता है।
  • पैमाना (The Scale): यह बहुत बड़ा है। प्रत्येक उपयोगकर्ता के पास लगभग 22 लाख शब्दों का इतिहास है। यह एक व्यक्ति के लिए 10 पूर्ण-लंबाई वाले उपन्यास पढ़ने जैसा है।

परीक्षण: सहायक को जांचने के दो तरीके

उन्होंने केवल यह नहीं पूछा, "क्या आपको याद है?" उन्होंने 15 महीनों के विभिन्न बिंदुओं पर दो तरीकों से सहायकों का परीक्षण किया:

  1. "स्टेट कंप्लीशन" टेस्ट (क्विज़):
    • प्रश्न: "उपयोगकर्ता का वर्तमान वर्कआउट रूटीन क्या है?"
    • लक्ष्य: क्या एआई सभी बिखरे हुए लॉग्स को देखकर खाली जगहों को सही ढंग से भर सकता है? (जैसे, "वे मंगलवार और गुरुवार को सुबह 6 बजे दौड़ते हैं।")
  2. "पर्सनलाइज्ड सर्विस" टेस्ट (काम):
    • प्रश्न: "रविवार की सुबह है। उपयोगकर्ता ने अभी कॉफी पी है। सहायक को उन्हें क्या करने के लिए याद दिलाना चाहिए?"
    • लक्ष्य: क्या एआई उस याददाश्त का उपयोग वास्तव में मदद करने के लिए कर सकता है? (जैसे, "अपना 9:30 का बजट रिव्यू करना न भूलें!")

उन्होंने क्या पाया (The "Gotchas")

उन्होंने 5 अलग-अलग एआई मेमोरी सिस्टम का परीक्षण किया। यहाँ बताया गया है कि कहाँ वे विफल रहे:

1. "लॉन्ग मेमोरी" का विरोधाभास (The "Long Memory" Paradox)

  • आश्चर्य: जैसे-जैसे इतिहास लंबा होता गया (अधिक महीनों का डेटा), एआई "क्विज़" (स्टेट कंप्लीशन) का उत्तर देने में बदतर होता गया। लेकिन वह "काम" (पर्सनलाइज्ड सर्विस) करने में अच्छा बना रहा।
  • क्यों? "क्विज़" के लिए डेटा के पहाड़ में से एक विशिष्ट, सटीक तथ्य खोजने की आवश्यकता होती है। जैसे-जैसे पहाड़ बढ़ता है, उस एक सुई को ढूंढना कठिन हो जाता है। लेकिन "काम" अधिक लचीला है; एआई अच्छा काम करने के लिए किसी भी संबंधित सुराग का उपयोग कर सकता है, इसलिए अधिक डेटा वास्तव में इसकी मदद करता है।

2. "अपडेट" का संघर्ष (The "Update" Struggle)

  • समस्या: एआई सिस्टम उन चीजों को याद रखने में बहुत अच्छे हैं जो स्थिर रहती हैं, लेकिन उन चीजों को भूलने में बहुत खराब हैं जो बदल जाती हैं।
  • रूपक: एक व्हाइटबोर्ड की कल्पना करें। यदि आप लिखते हैं "मुझे जैज़ पसंद है" और बाद में लिखते हैं "मुझे रॉक पसंद है," तो एक बुरा एआई दोनों को रखता है। वह भ्रमित हो जाता है। वह विशेष रूप से पसंद (Preferences) (आपको क्या पसंद है) और आदतों (Habits) (आप क्या करते हैं) पर विफल होता है, क्योंकि ये अक्सर स्पष्ट रूप से बताए जाने के बजाय निहित होते हैं।

3. "रिट्रीवल" की बाधा (The "Retrieval" Bottleneck)

  • बड़ी खोज: 93% से अधिक विफलताओं में, समस्या यह नहीं थी कि एआई "मूर्ख" था या एक अच्छा उत्तर नहीं लिख सका। समस्या यह थी कि मेमोरी सिस्टम ने सही सुराग ढूंढे ही नहीं।
  • सबक: इससे कोई फर्क नहीं पड़ता कि उत्तर देने वाला कितना स्मार्ट है यदि लाइब्रेरियन गलत किताबें डेस्क पर लेकर आता है। सबसे बड़ा सुधार मेमोरी रिट्रीवल (स्मृति पुनर्प्राप्ति) में ही है, न कि एआई के दिमाग में।

निष्कर्ष (The Bottom Line)

DynamicMem एआई सहायकों के परीक्षण के लिए एक नया, यथार्थवादी जिम है। यह दिखाता है कि हालांकि एआई याद रखने में बेहतर हो रहा है, फिर भी इसे निम्नलिखित में संघर्ष करना पड़ता है:

  • बिखरे हुए सुरागों से उपयोगकर्ता के जीवन को जोड़ना।
  • जब उपयोगकर्ता का जीवन बदलता है (जैसे नई नौकरी या नया शौक), तो अपनी याददाश्त को अपडेट करना।
  • इस बात के बीच अंतर करना कि क्या अभी सच है और क्या पिछले साल सच था।

शोध पत्र निष्कर्ष निकालता है कि वास्तव में सहायक एआई बनाने के लिए, हमें उन्हें स्थिर सूचियों पर परीक्षण करना बंद करना होगा और वास्तविक जीवन की लंबी, बिखरी हुई और विकसित होती कहानियों पर उनका परीक्षण करना शुरू करना होगा।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →