SAM: State-Adaptive Memory for Long-Horizon Reasoning Agent
यह शोध पत्र स्टेट-अडेप्टिव मेमोरी (SAM) का प्रस्ताव करता है, जो एक स्टैंडअलोन फ्रेमवर्क है जो इंटरैक्शन इतिहास को संक्षिप्त, इरादा-संचालित मेमोरी क्यूज़ में समेकित करके दीर्घकालिक एजेंटिक तर्क (long-horizon agentic reasoning) को बढ़ाता है, जिससे एजेंटों को अंतर्निहित मॉडल को पुन: प्रशिक्षित किए बिना दूरस्थ जानकारी को गतिशील रूप से पुनर्गठित करने की अनुमति मिलती है, और विविध बेंचमार्क पर बेहतर प्रदर्शन प्राप्त होता है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
बड़ी समस्या: "पढ़ने के लिए बहुत लंबा" नोटबुक
कल्पना कीजिए कि आप एक जासूस हैं जो एक बहुत ही जटिल रहस्य को सुलझाने की कोशिश कर रहे हैं जिसे सुलझाने में कई दिन लग सकते हैं। हर बार जब आपको कोई सुराग मिलता है, किसी गवाह से बात होती है, या कोई दस्तावेज़ जांचना होता है, तो आप उसे एक विशाल नोटबुक में लिख लेते हैं।
जैसे-जैसे दिन बीतते हैं, आपकी नोटबुक बहुत बड़ी हो जाती है—सैकड़ों पन्नों लंबी। जब आपको आज कोई निर्णय लेना होता है, तो आपको उन सभी पन्नों को पलटना पड़ता है ताकि आप वह एक छोटा सा सुराग ढूंढ सकें जो आपने तीन दिन पहले पाया था।
वर्तमान समस्या: अधिकांश AI एजेंट (कंप्यूटर प्रोग्राम जो मनुष्यों की तरह कार्य करते हैं) इसे हल करने के लिए या तो:
- पुराने पन्नों को फेंक देते हैं: वे नए पन्नों के लिए जगह बनाने के लिए नोटबुक का शुरुआती हिस्सा हटा देते हैं। लेकिन कभी-कभी, उत्तर उसी हिस्से में होता था जिसे उन्होंने फेंक दिया था!
- एक सारांश लिखते हैं: वे पूरे इतिहास को एक छोटे पैराग्राफ में समेटने की कोशिश करते हैं। लेकिन सारांश अक्सर उन सूक्ष्म, विशिष्ट विवरणों को छोड़ देता है जिनकी बाद में पहेली सुलझाने के लिए आवश्यकता होती है।
समाधान: SAM (स्टेट-एडेप्टिव मेमोरी)
लेखकों ने SAM नामक एक नई प्रणाली प्रस्तावित की है। SAM को केवल एक नोटबुक के रूप में नहीं, बल्कि एक जादुई इंडेक्स कार्ड सिस्टम वाले स्मार्ट फाइलिंग कैबिनेट के रूप में सोचें।
यह कैसे काम करता है, इसे तीन सरल चरणों में विभाजित किया गया है:
1. "फाइलिंग" (कंसोलिडेशन/समेकन)
अपने हालिया इतिहास के कच्चे, बिखरे हुए पन्जों को अपने तत्काल कार्यक्षेत्र (workspace) में रखने के बजाय, SAM आपके इतिहास के एक हिस्से (मान लीजिए, पिछले 50 पन्ने) को लेता है और उसे एक स्टोरेज कैबिनेट में फाइल कर देता है।
- कच्चे पन्ने (The Raw Pages): वास्तविक विवरण कैबिनेट में सुरक्षित रखे जाते हैं, बिना बदले।
- इंडेक्स कार्ड: SAM आपके उन 50 पन्नों का एक छोटा, उच्च-गुणवत्ता वाला "इंडेक्स कार्ड" (जिसे मेमोरी क्यू कहा जाता है) लिखता है जो यह सारांश देता है कि क्या हुआ था। यह महत्वपूर्ण चीजों को उजागर करता है: "हमें एक संदिग्ध मिला," "हमने बटलर को संदिग्धों से बाहर कर दिया," या "हम इस सुराग पर अटक गए हैं।"
- परिणाम: आपका तत्काल कार्यक्षेत्र साफ और हल्का रहता है, लेकिन आपके पास अभी भी इंडेक्स कार्डों की एक सूची होती है जो आपको बताती है कि कैबिनेट में क्या है।
2. "खोज" (इन्टेंट-ड्रिवन रिकॉल/इच्छा-संचालित पुनरावृत्ति)
यही जादुई हिस्सा है। पुराने सिस्टमों में, यदि आपको जानकारी की आवश्यकता होती थी, तो आप शायद सबसे हालिया पन्ने लेते या पूरा सारांश पढ़ते।
SAM के साथ, एजेंट खुद से पूछता है: "इस विशिष्ट समस्या को हल करने के लिए मुझे अभी अभी किस चीज़ की आवश्यकता है?"
- यदि एजेंट "लाल कार" के बारे में एक सुराग पर अटका हुआ है, तो वह अपने इंडेक्स कार्डों को देखता है।
- वह उस विशिष्ट कार्ड को चुनता है जिसमें लाल कार का उल्लेख है।
- वह फाइलिंग कैबिनेट से पूछता है: "मुझे उस लाल कार से संबंधित सटीक पन्ने ला कर दो।"
- सिस्टम केवल उन विशिष्ट पन्नों को निकालता है, उन्हें फिर से पढ़ता है, और एजेंट को केवल उस जानकारी का एक ताज़ा, केंद्रित सारांश देता है।
उपमा (Analogy): कल्पना कीजिए कि आप एक जटिल भोजन बना रहे हैं। हर बार जब आपको प्याज काटने का तरीका जानने की आवश्यकता होती है, तो आप पूरी 500 पन्नों की कुकबुक पढ़ने के बजाय, इंडेक्स कार्डों का एक सेट रखते हैं। जब आपको प्याज काटने की जरूरत होती है, तो आप "प्याज" वाला कार्ड निकालते हैं, जो आपको बताता है कि रेसिपी प्राप्त करने के लिए आपको बड़ी किताब के कौन से पन्ने पलटने हैं। आप पूरी किताब नहीं पढ़ते; आप केवल वही पढ़ते हैं जिसकी आपको आवश्यकता होती है।
3. "प्रशिक्षण" (बेहतर लाइब्रेरियन बनना सीखना)
पेपर यह भी बताता है कि उन्होंने इस सिस्टम को स्मार्ट कैसे बनाया। उन्होंने AI को केवल "सारांशित करना" नहीं सिखाया। उन्होंने इसे दो तरीकों से प्रशिक्षित किया:
- विशेषज्ञ शिक्षक: उन्होंने सुपर-स्मार्ट AI मॉडल का उपयोग करके सिस्टम को दिखाया कि सर्वोत्तम संभव इंडेक्स कार्ड कैसे लिखे जाएं और सही पन्ने कैसे खोजे जाएं।
- "कोशिश करो और सीखो" गेम: उन्होंने सिस्टम को हजारों बार जासूसी का खेल खेलने दिया। यदि सिस्टम ने गलत कार्ड चुना या कोई सुराग छोड़ दिया, तो उसे "कम स्कोर" मिला। यदि उसने सही कार्ड चुना और रहस्य सुलझा लिया, तो उसे "अच्छा स्कोर" मिला। समय के साथ, इसने सीखा कि खेल जीतने के लिए अपनी मेमोरी को ठीक से कैसे प्रबंधित किया जाए।
यह क्यों मायने रखता है (परिणाम)
लेखकों ने SAM का परीक्षण चार कठिन "लॉन्ग-होराइजन" कार्यों (जैसे जटिल तथ्यों के लिए वेब खोजना या वैज्ञानिक पहेलियाँ सुलझाना) पर किया।
- परिणाम: SAM ने लगातार अन्य तरीकों को हराया।
- कारण: इसने न केवल पुरानी जानकारी को फेंका, और न ही केवल सारांशित किया। इसने कच्चे डेटा को सुरक्षित रखा और वर्तमान स्थिति के आधार पर ठीक वही चीज़ निकालने का एक स्मार्ट तरीका बनाया जिसकी आवश्यकता थी।
- उपमा: यह एक ऐसे छात्र के बीच अंतर की तरह है जो पाठ्यपुस्तक को रट लेता है (और विवरण भूल जाता है) बनाम एक ऐसे छात्र के बीच जिसके पास एक आदर्श लाइब्रेरी सिस्टम है जहाँ वह किसी विशिष्ट प्रश्न का उत्तर देने के लिए तुरंत आवश्यक पैराग्राफ ढूंढ सकता है।
सारांश
SAM लंबी बातचीत को संभालने के लिए AI का एक नया तरीका है। इतिहास को सब कुछ एक साथ याद रखने या अतीत को भूल जाने के बजाय, यह इतिहास को एक फाइलिंग सिस्टम में व्यवस्थित करता है। यह कच्चे विवरणों को सुरक्षित रखता है और वर्तमान निर्णय के लिए आवश्यक विशिष्ट जानकारी को निकालने के लिए स्मार्ट इंडेक्स कार्ड का उपयोग करता है। यह AI को भ्रमित हुए बिना या सुरागों का पीछा छोड़े बिना बहुत कठिन, लंबे कार्यों को हल करने में सक्षम बनाता है।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।