Nous: A Predictive World Model for Long-Term Agent Memory
Nous एक नवीन एजेंट मेमोरी आर्किटेक्चर पेश करता है जो पारंपरिक तथ्य भंडारण को श्रेणीगत संभाव्यता वितरणों (categorical probability distributions) के एक भविष्य कहने वाले विश्व मॉडल से बदल देता है, जहाँ सूचना को विश्वास अपडेट (डेल्टा) के रूप में बनाए रखा जाता है और विस्मरण स्वाभाविक रूप से एंट्रॉपी क्षय (entropy decay) के माध्यम से होता है, जिससे बिना किसी बाहरी वेक्टर डेटाबेस या ग्राफ इंजन की आवश्यकता के दीर्घकालिक संवादात्मक बेंचमार्क पर प्रतिस्पर्धी प्रदर्शन प्राप्त होता है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आप अपने एक दोस्त के साथ हुई बातचीत को याद करने की कोशिश कर रहे हैं। अधिकांश कंप्यूटर प्रोग्राम जो यह करने की कोशिश करते हैं, वे एक फाइलिंग कैबिनेट (file cabinet) की तरह काम करते हैं। वे आपके द्वारा कही गई हर बात ("मुझे पिज्जा पसंद है," "मैं गूगल में काम करता हूँ") को एक फोल्डर में ठूस देते हैं। यदि आप बाद में कहते हैं, "दरअसल, मुझे पिज्जा पसंद नहीं है और मैं अमेज़न में काम करता हूँ," तो फाइलिंग कैबिनेट बस एक नया नोट जोड़ देता है। इसे संघर्ष (conflict) को कैसे सुलझाना है, यह नहीं पता होता, इसलिए इसमें विरोधाभासी कागजों से भरा एक अस्त-व्यस्त दराज बन जाता है।
यह शोध पत्र Nous को पेश करता है, जो AI एजेंटों के लिए चीजों को याद रखने का एक नया तरीका है। फाइलिंग कैबिनेट के बजाय, Nous एक जीवित, सांस लेते हुए मस्तिष्क की तरह काम करता है।
यह कैसे काम करता है, इसके लिए सरल उपमाओं (analogies) का उपयोग किया गया है:
1. मूल विचार: भंडारण नहीं, बल्कि भविष्यवाणी (Prediction, Not Storage)
लेखकों का तर्क है कि मानव स्मृति अतीत का एक सटीक ट्रांसक्रिप्ट स्टोर करने के बारे में नहीं है। यह दुनिया का एक मॉडल होने के बारे में है जो यह अनुमान लगा सके कि आगे क्या होगा।
- पुराना तरीका: "मेरे पास एक डेटाबेस रिकॉर्ड है जो कहता है 'प्रणव गूगल में काम करता है'।"
- Nous का तरीका: "मेरे पास प्रणव की नौकरी की एक मानसिक तस्वीर है। अभी, मैं 87% निश्चित हूँ कि वह गूगल में काम करता है, 8% निश्चित हूँ कि वह अमेज़न में है, और 5% निश्चित हूँ कि मुझे नहीं पता।"
2. यह कैसे सीखता है: "आश्चर्य" का मीटर (The "Surprise" Meter)
हर बार जब AI कुछ नया सुनता है, तो वह अपनी मानसिक तस्वीर की तुलना उस चीज़ से करता है जो उसने अभी सुना है।
- कम आश्चर्य (Low Surprise): यदि AI सोचता है "प्रणव को कॉफी पसंद है" और आप कहते हैं "प्रणव को कॉफी पसंद है," तो AI कहता है, "ठीक है, यह मेरे अनुमान से मेल खाता है।" इससे ज्यादा कुछ नहीं बदलता।
- उच्च आश्चर्य (High Surprise): यदि AI सोचता है "प्रणव को कॉफी पसंद है" और आप कहते हैं "प्रणव को कॉफी पसंद नहीं है," तो AI को एक झटका (shock) लगता है। पेपर में, इसे "आश्चर्य" (surprise) कहा गया है।
- अपडेट: केवल नया तथ्य लिखने के बजाय, AI अपनी मानसिक तस्वीर को गणितीय रूप से बदल देता है। तस्वीर का "कॉफी प्रेमी" वाला हिस्सा छोटा हो जाता है, और "कॉफी नफरत करने वाला" हिस्सा बढ़ जाता है। AI यह याद रखता है कि उसका मन कितना बदला, न कि केवल नया तथ्य।
3. भूलना: एक फीकी होती गूँज (The Fading Echo)
एक डेटाबेस में, आपको पुराने फाइलों को मैन्युअल रूप से हटाना पड़ता है। Nous में, भूलना स्वाभाविक रूप से होता है, जैसे एक बड़े कमरे में ध्वनि की गूँज धीरे-धीरे कम हो जाती है।
- यदि AI ने लंबे समय से किसी विशिष्ट तथ्य के बारे में नहीं सुना है, तो उस तथ्य के बारे में उसकी निश्चितता धीरे-धीरे "मुझे नहीं पता" की ओर बढ़ने लगती है।
- पेपर इसे एन्ट्रॉपी डिके (entropy decay) कहता है। यह एक रबर बैंड की तरह है जो धीरे-धीरे अपना तनाव खो देता है यदि आप उसे खींचते नहीं हैं। यदि आप किसी स्मृति को सुदृढ़ (reinforce) नहीं करते हैं, तो वह स्वाभाविक रूप से धुंधली और अनिश्चित हो जाती है।
4. संघर्षों को सुलझाना: "डेल्टा" (The "Delta")
जब AI अपने मन को अपडेट करता है, तो यह केवल पुराने फ़ाइल को ओवरराइट नहीं करता है। यह एक डेल्टा (Delta) सुरक्षित करता है (डेल्टा एक ग्रीक अक्षर है जिसका उपयोग अक्सर "परिवर्तन" के लिए किया जाता है)।
- डेल्टा को एक डायरी प्रविष्टि के रूप में सोचें जो कहती है: "मंगलवार को, मैंने सोचा था कि प्रणव गूगल में काम करता है। फिर मैंने सुना कि वह अमेज़न में चला गया, इसलिए मैंने अपनी धारणा बदल दी।"
- यह AI को यह याद रखने की अनुमति देता है कि उसने कैसे सीखा, न कि केवल स्थिर तथ्यों की एक सूची।
5. सूचियों को संभालना (The "Aggregation" Trick)
इसमें एक पेचीदा हिस्सा है। यदि आप पूछते हैं, "प्रणव ने किन स्थानों की यात्रा की है?" तो एक साधारण "सर्वश्रेष्ठ अनुमान" मॉडल केवल "पेरिस" कह सकता है क्योंकि वह सबसे संभावित उत्तर है। लेकिन आप सभी स्थानों की एक सूची चाहते हैं।
- समाधान: Nous प्रत्येक बार जब वह किसी नए स्थान से "आश्चर्यचकित" हुआ था, उसका एक विशेष लॉग रखता है। जब आप एक सूची मांगते हैं, तो यह पूरी हिस्ट्री देने के लिए उस लॉग की जांच करता है, जबकि साधारण प्रश्नों के लिए अपनी "सर्वश्रेष्ठ अनुमान" वाली पद्धति बनाए रखता है।
परिणाम: यह कितना अच्छा काम करता है?
लेखकों ने Nous का परीक्षण LoCoMo नामक बेंचमार्क पर किया, जिसमें कई प्रश्नों के साथ लंबी बातचीत शामिल है। उन्होंने अन्य सिस्टमों (जैसे A-MEM और BeliefMem) के साथ तुलना की, जिसमें एक मानक AI मॉडल (GPT-4o-mini) का उपयोग किया गया।
- स्कोर: Nous ने चार में से तीन श्रेणियों (Single-hop, Multi-hop, और Open-domain questions) में अन्य सिस्टमों की तुलना में काफी अधिक स्कोर किया।
- तुलना: उन्होंने इसकी तुलना BeliefMem से भी की, जो एक अलग टीम द्वारा बनाया गया सिस्टम है जिसका विचार बहुत समान "विश्वास-आधारित" (belief-based) है। दोनों टीमों द्वारा रिपोर्ट किए गए नंबरों पर, Nous आगे निकला।
- चेतावनी: लेखक बहुत ईमानदार हैं। वे स्वीकार करते हैं कि BeliefMem के साथ अपने परिणामों की तुलना करना एक पूर्ण "सेम-टू-सेम" (apples-to-apples) परीक्षण नहीं है क्योंकि दोनों टीमों ने प्रश्न पूछने और उत्तरों को ग्रेड करने के लिए थोड़े अलग तरीकों का उपयोग किया है। वे भविष्य में एक सख्त, साथ-साथ (side-by-side) परीक्षण करने की योजना बना रहे हैं।
सारांश
Nous एक AI मेमोरी सिस्टम है जो ज्ञान को एक संभावना (एक अनुमान जो बेहतर या बदतर होता रहता है) के रूप में मानता है, न कि एक तथ्य (एक कठोर रिकॉर्ड) के रूप में।
- यह आश्चर्य को मापकर सीखता है।
- यह अनिश्चितता बढ़ने के साथ भूल जाता है।
- यह फाइलों को हटाने के बजाय संभावनाओं को बदलकर संघर्षों को सुलझाता है।
पेपर का दावा है कि यह दृष्टिकोण AI को लंबी बातचीत को याद रखने, विरोधाभासों को संभालने और जटिल प्रश्नों के उत्तर देने में बेहतर बनाता है, और वह भी बिना किसी विशाल बाहरी डेटाबेस की आवश्यकता के। इसे एक नए, ओपन-सोर्स टूल के रूप में प्रस्तुत किया गया है जिसे लेखक अभी भी परिष्कृत (refine) कर रहे हैं।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।