← नवीनतम पेपर
🤖 AI

Learning What to Remember: Observability-Safe Memory Retention via Constrained Optimization for Long-Horizon Language Agents

यह शोध पत्र OSL-MR प्रस्तुत करता है, जो एक नवीन फ्रेमवर्क है जो सख्त अवलोकन संबंधी बाधाओं के तहत क्वेरी-कंडीशन्ड एविडेंस वैल्यू सीखने के लिए लॉन्ग-होरिजन लैंग्वेज एजेंट्स हेतु मेमोरी रिटेंशन को एक कंस्ट्रेंड स्टोकेस्टिक ऑप्टिमाइज़ेशन समस्या के रूप में सूत्रबद्ध करता है, जो LOCOMO और LongMemEval जैसे बेंचमार्क पर मौजूदा ह्यूरिस्टिक और रिसेंसी-आधारित विधियों की तुलना में बेहतर प्रदर्शन प्रदर्शित करता है।

मूल लेखक: Qingcan Kang, Liu Mingyang, Shixiong Kai, Kaichao Liang, Tao Zhong, Mingxuan Yuan

प्रकाशित 2026-06-10
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Qingcan Kang, Liu Mingyang, Shixiong Kai, Kaichao Liang, Tao Zhong, Mingxuan Yuan

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक जासूस हैं जो एक विशाल, कई दिनों के रहस्य को सुलझाने की कोशिश कर रहे हैं। आपके पास अपने नोटबुक में सुराग, गवाहों के बयान और तथ्यों को लिखने के लिए सीमित जगह है। हर बार जब आप कुछ नया लिखते हैं, तो आपको कुछ पुराना मिटाना पड़ सकता है। यदि आप गलत चीज़ मिटा देते हैं, तो आप बाद में एक महत्वपूर्ण सुराग खो सकते हैं। यदि आप बहुत अधिक फालतू चीजें रखते हैं, तो आपकी नोटबुक भर जाएगी, और आप नई, महत्वपूर्ण चीज़ें नहीं लिख पाएंगे।

यह ठीक वही समस्या है जिसे OSL-MR AI एजेंटों (कंप्यूटर प्रोग्राम जो मनुष्यों की तरह बात और सोच सकते हैं) के लिए हल करता है जब वे लंबी बातचीत करते हैं।

यहाँ सरल उपमाओं (analogies) का उपयोग करके पेपर के विचारों का विवरण दिया गया है:

1. समस्या: "बहुत अधिक चीज़ों" की दुविधा

वर्तमान AI एजेंट उन जासूसों की तरह हैं जो या तो अपनी नोटबुक में सब कुछ रखने की कोशिश करते हैं, या वे बस सबसे हालिया नोट्स रखते हैं और बाकी को फेंक देते हैं।

  • समस्या: यदि बातचीत बहुत लंबी है, तो नोटबुक (जिसे "कॉन्टेक्स्ट विंडो" कहा जाता है) की जगह खत्म हो जाती है।
  • गलती: पुराने तरीके यह तय करने के लिए सरल नियमों का उपयोग करते हैं, जैसे "नया नोट रखें" या "वह नोट रखें जो अभी सबसे महत्वपूर्ण लगता है।" लेकिन यह एक ऐसे जासूस की तरह है जो मौसम के बारे में एक नोट रखता है क्योंकि वह कल लिखा गया था, जबकि वह एक संदिग्ध के अलबी (alibi) के बारे में नोट फेंक देता है क्योंकि वह तीन दिन पहले लिखा गया था। वह पुराना नोट बेकार हो सकता है, लेकिन वह पुराना अलबी बाद में केस सुलझाने की कुंजी हो सकता है।

2. समाधान: एक "स्मार्ट बजट मैनेजर"

लेखकों ने एक नया सिस्टम बनाया है जिसे OSL-MR कहा जाता है। इसे अपने जासूस की नोटबुक के लिए एक सुपर-स्मार्ट बजट मैनेजर के रूप में समझें।

सिर्फ अंदाज़ा लगाने के बजाय, OSL-MR मेमोरी रिटेंशन (स्मृति प्रतिधारण) को एक गणितीय पहेली की तरह मानता है। यह पूछता है: "यदि मैं इस नोट को अभी रखता हूँ, तो क्या यह बाद में रहस्य सुलझाने में मेरी मदद करेगा? यदि मैं इसे फेंक देता हूँ, तो क्या मुझे इसे फिर से खोजने के लिए भारी कीमत चुकानी पड़ेगी?"

यह तीन मुख्य लागतों पर विचार करता है:

  • "मिस" पेनल्टी (छूट जाने का दंड): यदि मैं एक सुराग को फेंक देता हूँ और बाद में उसे नहीं ढूँढ पाता, तो मैं केस हार जाता हूँ।
  • "री-अक्विजिशन" कॉस्ट (पुनः प्राप्ति की लागत): यदि मैं इसे फेंक देता हूँ लेकिन मुझे बाद में इसकी आवश्यकता होती है, तो मुझे इसे फिर से खोजने के लिए समय और ऊर्जा खर्च करनी पड़ती है।
  • "स्टेल" रिस्क (पुराना होने का जोखिम): यदि मैं एक ऐसा नोट रखता हूँ जो पुराना हो चुका है (जैसे शहर का एक पुराना नक्शा जो बदल गया है), तो यह मुझे गुमराह कर सकता है।

3. "क्रिस्टल बॉल नहीं है" का नियम (Observability)

यह इस पेपर का सबसे महत्वपूर्ण हिस्सा है।

  • जाल: एक आदर्श दुनिया में, जासूस एक क्रिस्टल बॉल में देख सकता है कि कल किस सुराग की आवश्यकता होगी। लेकिन वास्तविक दुनिया में, आप भविष्य नहीं देख सकते।
  • नियम: OSL-MR सिस्टम को इस तरह डिज़ाइन किया गया है कि AI कभी भी "भविष्य के ज्ञान" का उपयोग निर्णय लेने के लिए नहीं करता है। यह केवल उसी का उपयोग करता है जो वह अभी देख सकता है (वर्तमान प्रश्न, मेमोरी की उम्र और विषय)।
  • यह क्यों मायने रखता है: कई अन्य AI सिस्टम "गोल्ड लेबल्स" (उत्तर को पहले से जानना) का उपयोग करके प्रशिक्षण लेते हैं और धोखा देते हैं। OSL-MR सख्ती से "जो हम अभी जानते हैं" को "जो हम बाद में जानते हैं" से अलग करता है। यह सुनिश्चित करता है कि AI वास्तव में वास्तविक जीवन में उपयोग किया जा सके, जहाँ उसके पास कोई क्रिस्टल बॉल नहीं होती।

4. यह कैसे सीखता है: "चेला और उस्ताद" (Apprentice and the Master)

चूंकि AI भविष्य नहीं देख सकता, इसलिए यह अच्छे निर्णय लेना कैसे सीखता है? पेपर दो-चरणीय प्रशिक्षण प्रक्रिया का उपयोग करता है:

  • चरण 1: "मिक्सड-स्कोर" ह्यूरिस्टिक (चेला/Apprentice)
    इससे पहले कि AI के पास कोई अनुभव हो, यह एक सरल, सुरक्षित नियम पुस्तिका ("मिक्सड-स्कोर") का उपयोग करता है। यह एक जूनियर डिटेक्टिव की तरह है जो एक चेकलिस्ट के आधार पर नोट्स रखता है: "क्या यह हालिया है? क्या यह प्रासंगिक है? क्या यह बहुत बड़ा है?" यह सुनिश्चित करता है कि सिस्टम शून्य डेटा के साथ भी तुरंत काम करे। यह सीखने के लिए हर इंटरैक्शन को लॉग करता है।

  • चरण 2: "एविडेंस लर्नर" (उस्ताद/Master)
    एक बार जब सिस्टम वास्तविक बातचीत के पर्याप्त लॉग एकत्र कर लेता है, तो यह एक स्मार्ट मॉडल को प्रशिक्षित करता है। यह मॉडल लॉग को देखता है और सीखता है: "हे, इस विशिष्ट स्थिति में, उस पुराने नोट को रखना वास्तव में बाद में समस्या को सुलझाने में मदद आया।"

    • यह समझने के लिए सीधे गोल्ड एविडेंस (सही उत्तरों) से सीखता है कि वास्तव में क्या महत्वपूर्ण था।
    • महत्वपूर्ण रूप से, वास्तविक दुनिया में निर्णय लेते समय यह अभी भी "चेले" के सुरक्षित इनपुट (कोई भविष्य का ज्ञान नहीं) का ही उपयोग करता है।

5. परिणाम: बेहतर मेमोरी, कम बर्बादी

लेखकों ने इसका परीक्षण दो बड़े डेटासेट्स (LoCoMo और LongMemEval) पर किया जहाँ AI एजेंटों को लंबी, जटिल बातचीत को संभालना था।

  • विजेता: OSL-MR ने अन्य तरीकों (जैसे "Recency" या "Generative Agents") को लगातार मात दी।
  • "तंग बजट" टेस्ट: जब नोटबुक की जगह बहुत कम थी (एक तंग बजट), तब OSL-MR सबसे अधिक चमका। जहाँ अन्य तरीके अपनी नोटबुक को बेकार की चीजों से भर देते थे, वहीं OSL-MR ने सावधानीपूर्वक केवल सबसे मूल्यवान सुरागों का चयन किया।
  • प्रिसिजन बनाम रिकॉल (सटीकता बनाम पुनरुद्धार): इसने केवल अधिक चीजें नहीं रखीं; इसने सही चीजें रखीं। यह बिल्कुल सही उत्तर पाने के लिए सही चीज़ों को चुनने में बेहतर था, बिना अप्रासंगिक विवरणों पर जगह बर्बाद किए।

सारांश

OSL-MR AI के लिए अपनी मेमोरी प्रबंधित करने का एक नया तरीका है। यह AI को अनुमान लगाने या भविष्य के ज्ञान से धोखाधड़ी करने से रोकता है। इसके बजाय, यह AI को एक स्मार्ट रिसोर्स मैनेजर की तरह कार्य करना सिखाता है: यह पिछले अनुभवों से सीखता है कि कौन से सुराग वास्तव में मूल्यवान हैं, यह सुनिश्चित करता है कि जब AI के पास सीमित स्थान हो, तो वह उस स्थान को समस्या को हल करने के लिए सबसे महत्वपूर्ण जानकारी से भरे।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →