M: Dual-Memory Augmentation for Long-Horizon Web Agents via Trajectory Summarization and Insight Retrieval
यह शोध पत्र M का प्रस्ताव करता है, जो एक प्रशिक्षण-मुक्त (training-free), दोहरा-मेमोरी ढांचा है जो आंतरिक अवस्था संपीड़न (internal state compression) के लिए गतिशील प्रक्षेपवक्र सारांश (dynamic trajectory summarization) को बाहरी मार्गदर्शन के लिए ऑफलाइन अंतर्दृष्टि पुनर्प्राप्ति (offline insight retrieval) के साथ जोड़कर लॉन्ग-होरइजन वेब एजेंटों को उन्नत करता है, जिससे कई बेंचमार्क में सफलता दर और टोकन दक्षता में महत्वपूर्ण सुधार होता है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आप एक बहुत ही विशिष्ट पुस्तक खोजने के लिए एक विशाल, अराजक पुस्तकालय में रास्ता खोजने की कोशिश कर रहे हैं। एक AI एजेंट तब ऐसा करता है जब वह किसी कार्य को पूरा करने के लिए (जैसे "एक विशिष्ट लैपटॉप खरीदना" या "फ्लाइट खोजना") वेब ब्राउज़ करने की कोशिश करता है।
वर्तमान AI एजेंटों के साथ समस्या यह है कि उनके पास कोई स्मृति (memory) और कोई अनुभव नहीं होता। वे उस क्षण से जो कुछ भी देखते हैं, उसे याद रखने की कोशिश करते हैं जब से उन्होंने शुरुआत की थी।
समस्या: "जमाखोरी" करने वाला एजेंट (The "Hoarding" Agent)
कल्पना कीजिए कि आप पुस्तकालय में घूम रहे हैं। हर बार जब आप कोई कोना मुड़ते हैं, तो आप पूरे कमरे की एक फोटो लेते हैं, हर साइन पर लिखे हर शब्द को लिख लेते हैं, और उसे एक नोटबुक में चिपका देते हैं।
- परिणाम: स्टेप 10 तक, आपकी नोटबुक 500 पन्नों की हो जाती है। आप खाली गलियारों, विज्ञापनों और अप्रासंगिक संकेतों की सभी तस्वीरों से इतने अभिभूत (overwhelmed) हो जाते हैं कि आप भूल जाते हैं कि आप क्या ढूंढ रहे थे। आप फंस जाते हैं, भ्रमित हो जाते हैं और हार मान लेते हैं।
- AI के संदर्भ में: इसे "कॉन्टेक्स्ट एक्सप्लोजन" (Context Explosion) कहा जाता है। AI पिछले 100 स्टेप्स के हर स्क्रीनशॉट और टेक्स्ट क्लिक को अपने दिमाग में डालने की कोशिश करता है। यह महंगा हो जाता है (कंप्यूटर पावर/पैसे की बहुत खपत होती है) और AI उस शोर के बीच "बीच में खो" (lost in the middle) जाता है।
समाधान: M2 ("स्मार्ट लाइब्रेरियन" सिस्टम)
यह पेपर M2 (डुअल-मेमोरी ऑग्मेंटेशन) नामक एक नया सिस्टम प्रस्तावित करता है। सब कुछ जमा करने के बजाय, M2 AI को दो महाशक्तियाँ देता है: एक व्यक्तिगत डायरी (Personal Journal) और एक मेंटर की चीट शीट (Mentor's Cheat Sheet)।
1. आंतरिक स्मृति: "व्यक्तिगत डायरी" (ट्रैजेक्टरी समराइजेशन)
पुस्तकालय की 50 तस्वीरें नोटबुक में चिपकाने के बजाय, AI को हर स्टेप के बाद एक वाक्य का सारांश लिखने के लिए सिखाया जाता है।
- यह कैसे काम करता है:
- पुराना तरीका: "मैंने एक लाल दरवाजा देखा, फिर एक नीला दरवाजा, फिर एक साइन देखा जिसमें 'एग्जिट' लिखा था, फिर एक बिल्ली, फिर एक पोस्टर..." (बहुत अधिक विवरण)।
- M2 का तरीका: "स्टेप 1: मैंने मुख्य हॉल में प्रवेश किया। स्टेप 2: मैं टेक्नोलॉजी सेक्शन की ओर बाईं ओर मुड़ा। स्टेप 3: अब मैं लैपटॉप आइल (aisle) देख रहा हूँ।"
- उपमा (Analogy): यह एक वीडियो गेम खेलने जैसा है। पूरे 10 घंटे के गेमप्ले वीडियो को रिकॉर्ड करने के बजाय कि आप कहाँ हैं यह याद रखें, आप बस अपनी डायरी में लिख देते हैं: "मैं किले के गेट पर हूँ, मेरे पास चाबी है, और मुझे ड्रैगन को खोजना है।"
- लाभ: AI वर्तमान स्थिति (current state) और लक्ष्य (goal) पर केंद्रित रहता है, और उन विजुअल शोर (विज्ञापनों, साइडबार) को अनदेखा कर देता है जो मायने नहीं रखते। इससे कंप्यूटर पावर की भारी बचत होती है।
2. बाहरी स्मृति: "मेंटर की चीट शीट" (इनसाइट रिट्रीवल)
कभी-कभी, एक अच्छी डायरी होने के बावजूद भी आप फंस सकते हैं क्योंकि आपको पुस्तकालय के "नुस्खे" (tricks) नहीं पता होते। शायद वहां कोई गुप्त शॉर्टकट हो, या लाइब्रेरियन से पूछने का कोई विशेष तरीका काम करता हो।
- यह कैसे काम करता है:
- सिस्टम के पास अतीत में अन्य AI द्वारा की गई सफल यात्राओं का एक विशाल डेटाबेस होता है।
- जब आपका AI फंस जाता है या कोई नया कार्य शुरू करता है, तो वह पूछता है: "क्या किसी और ने पहले इस वेबसाइट पर लैपटॉप खोजने की कोशिश की है? क्या काम आया?"
- यह एक "चीट शीट" निकालता है जिसमें सुझाव होते हैं जैसे: "हमेशा पहले 'Sort by Price' बटन पर क्लिक करें," या "यदि सर्च बार शून्य परिणाम देता है, तो ब्रांड का नाम हटाकर प्रयास करें।"
- उपमा (Analogy): यह एक बुद्धिमान पुराने लाइब्रेरियन के आपके कान में फुसफुसाने जैसा है: "हे, हिस्ट्री आइल की ओर मत जाओ; जो किताबें तुम्हें चाहिए वे पीछे हैं। साथ ही, यदि दरवाजा लॉक है, तो हैंडल के बजाय साइड हैंडल को आजमाएं।"
- लाभ: AI को ये नुस्खे शून्य से सीखने की आवश्यकता नहीं होती। वह तुरंत जानता है कि सामान्य जाल और डेड एंड्स (dead ends) से कैसे बचना है।
परिणाम: एक सुपर-एफिशिएंट एजेंट
इन दो उपकरणों को मिलाकर, M2 सिस्टम एक ऐसा एजेंट बनाता है जो है:
- हल्का (Lighter): यह बेकार तस्वीरों के भारी बैकपैक को नहीं ढोता (कंप्यूटर लागत में 50-60% की बचत करता है)।
- स्मार्टर (Smarter): इसे काम के नुस्खे पता हैं और यह विकर्षणों (distractions) से भ्रमित नहीं होता।
- ट्रेनिंग-फ्री (Training-Free): सबसे अच्छी बात? आपको AI को नई स्किल्स सिखाने के लिए महीनों खर्च करने की आवश्यकता नहीं है। आप बस इसे डायरी और चीट शीट दे देते हैं, और यह तुरंत काम करने लगता है।
संक्षेप में: M2 एक भ्रमित, अभिभूत पर्यटक को एक अनुभवी गाइड में बदल देता जिसे पता है कि वह कहाँ है, उसे आगे क्या करना है, और टूरिस्ट ट्रैप्स से कैसे बचना है।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।