WebChallenger: A Reliable and Efficient Generalist Web Agent
WebChallenger एक सामान्यज्ञ वेब एजेंट फ्रेमवर्क है जो PageMem और तीन वास्तुशिल्प तंत्रों को पेश करके, जो चयनात्मक ध्यान, निरंतर स्मृति और प्रक्रियात्मक प्रवाह में मानव संज्ञानात्मक लाभों की नकल करते हैं, कई बेंचमार्क पर लागत प्रभावी, ऑफ-द-शेल्फ मॉडलों का उपयोग करके अत्याधुनिक प्रदर्शन प्राप्त करता है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने नहीं लिखा है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आप एक बहुत ही बुद्धिमान, लेकिन थोड़े अनाड़ी रोबोट को इंटरनेट पर नेविगेट करना सिखाने की कोशिश कर रहे हैं, जैसे कि "फ्लाइट बुक करना" या "कोई विशिष्ट उत्पाद ढूँढना"।
वर्तमान AI एजेंट उसी रोबोट की तरह हैं: उनके पास एक शक्तिशाली मस्तिष्क (एक Large Language Model) है, लेकिन वे संघर्ष करते हैं क्योंकि वे पूरी वेबसाइट को एक साथ पढ़ने की कोशिश करते हैं, जैसे कि एक ही बार में पूरी लाइब्रेरी निगलने की कोशिश करना। वे घबरा जाते हैं, भूल जाते हैं कि वे कहाँ हैं, और महत्वपूर्ण बटनों को मिस कर देते हैं क्योंकि वे पूरे पेज को एक बड़े, बिखरे हुए हिस्से के रूप में देख रहे होते हैं बजाय इसके कि वे केवल उस विशिष्ट भाग पर ध्यान दें जिसकी उन्हें आवश्यकता है।
यह पेपर WebChallenger पेश करता है, जो ऐसे एजेंट बनाने का एक नया तरीका है। एजेंट के मस्तिष्क को बड़ा या अधिक महंगा बनाने के बजाय, लेखकों ने उसके चारों ओर एक बेहतर "स्कैफोल्डिंग" (ढांचा) या ऑपरेटिंग सिस्टम बनाया है। उनका तर्क है कि इंसान ब्राउज़ करने में अच्छे होते हैं क्योंकि हम स्वाभाविक रूप से तीन चीजें करते हैं, और WebChallenger रोबोट को भी यही तीन चीजें करना सिखाता है।
यह इस प्रकार काम करता है, सरल उपमाओं का उपयोग करते हुए:
1. "विषय-सूची" वाली ट्रिक (चयनात्मक ध्यान - Selective Attention)
समस्या: जब कोई इंसान वेबपेज देखता है, तो वह हर एक शब्द नहीं पढ़ता। वह हेडलाइंस को स्कैन करता है, एक ऐसा सेक्शन देखता है जो दिलचस्प लगता है, और फिर केवल उसी भाग पर ज़ूम इन करता है। AI एजेंट आमतौर पर पूरी पेज को एक विशाल, अव्यवจัด टेक्स्ट ब्लॉक के रूप में पढ़ने की कोशिश करते हैं।
समाधान: WebChallenger PageMem नामक एक टूल का उपयोग करता है। इसे हर वेबपेज के लिए स्वचालित रूप से "विषय-सूची" (Table of Contents) बनाने के रूप में समझें।
- यह पेज को साफ-सुथरे सेक्शन में विभाजित करता है (जैसे "नेविगेशन बार," "प्रोडक्ट लिस्ट," "फुटर")।
- यह प्रत्येक सेक्शन के लिए एक वाक्य का सारांश लिखता है।
- उपमा: कल्पना करें कि आप एक बहुत बड़े डिपार्टमेंट स्टोर में हैं। हर गलियारे में जाने और हर टैग को पढ़ने के बजाय, आप प्रवेश द्वार पर लगे बड़े मैप को देखते हैं। आप देखते हैं "इलेक्ट्रॉनिक्स," "कपड़े," "होम गुड्स।" आप तय करते हैं कि आपको इलेक्ट्रॉनिक्स चाहिए, इसलिए आप बाकी स्टोर को अनदेखा कर देते हैं और केवल उस विशिष्ट गलियारे में जाते हैं। WebChल्ेंजर ऐसा तुरंत करता है, "शोर" को अनदेखा करता है और केवल प्रासंगिक सेक्शन पर ध्यान केंद्रित करता है।
2. "मानसिक मानचित्र" (स्थिर स्मृति - Persistent Memory)
समस्या: यदि आप किसी नई वेबसाइट पर जाते हैं, तो आपको हर बार वापस आने पर यह सीखना पड़ता है कि "लॉगिन" बटन कहाँ है। वर्तमान AI एजेंट अक्सर ऐसे व्यवहार करते हैं जैसे उन्हें भूलने की बीमारी (अमनेसिया) हो; वे हर वेबसाइट विज़िट को ऐसे देखते हैं जैसे कि वह पहली बार हो, और उस लेआउट को भूल जाते हैं जो उन्होंने अभी देखा था।
समाधान: एजेंट द्वारा कोई कार्य करने से पहले, वह एक "स्कौटिंग मिशन" (टोही मिशन) पर जाता है। यह WebsiteMem बनाने के लिए एक बार वेबसाइट के माध्यम से क्लिक करता है।
- उपमा: इसे एक पर्यटक के रूप में सोचें जो एक नए शहर का दौरा कर रहा है। किसी विशिष्ट रेस्टोरेंट को खोजने की कोशिश करने से पहले, वे मोहल्ले में घूमकर यह सीखते हैं कि सड़कें कहाँ हैं, सबवे स्टॉप कहाँ हैं, और पार्क कहाँ हैं। वे एक मानसिक मानचित्र बनाते हैं।
- WebChallenger हर वेबसाइट के लिए एक बार यह मानचित्र बनाता है। जब एजेंट को बाद में उस साइट पर वापस जाने की आवश्यकता होती है, तो उसे लेआउट को फिर से सीखने की आवश्यकता नहीं होती; वह बस अपना सेव किया हुआ मैप निकाल लेता है। इससे समय बचता है और भ्रम की स्थिति पैदा नहीं होती।
3. "कॉम्बो मूव" (प्रक्रियात्मक प्रवाह - Procedural Fluency)
समस्या: इंसानों में सामान्य कार्यों के लिए "मसल्स मेमोरी" (Muscle Memory) होती है। यदि आप एक ड्रॉपडाउन मेनू का उपयोग करना चाहते हैं, तो आप यह नहीं सोचते कि, "मैं माउस हिलाऊंगा, क्लिक करूँगा, लिस्ट दिखने के लिए इंतज़ार करूँगा, लिस्ट को स्कैन करूँगा, और फिर से क्लिक करूँगा।" आप बस सोचते हैं, "विकल्प चुनें।" AI एजेंट अक्सर छोटे चरणों पर अटक जाते हैं, एक-एक करके अगले सूक्ष्म-एक्शन को समझने की कोशिश करते हैं।
समाधान: WebChallenger Compound Actions (संयुक्त क्रियाएं) बनाता है।
- उपमा: कल्पना करें कि आप एक वीडियो गेम खेल रहे हैं। एक "कॉम्बो मूव" तब होता है जब आप एक बटन दबाते हैं, और आपका पात्र एक ही सहज गति में जंप, स्पिन और किक करता है।
- WebChallenger में, यदि कार्य "फॉर्म भरना" है, तो एजेंट हर एक बॉक्स के बारे में सोचने के लिए नहीं रुकता। इसके पास फॉर्मों के लिए एक प्री-प्रोग्राम्ड "कॉम्बो मूव" है। वह जानता है कि फील्ड पर क्लिक करना है, टेक्स्ट टाइप करना है, अगले फील्ड पर जाना है और सबमिट बटन दबाना है, यह सब एक एकल निर्णय के रूप में। यह स्वचालित रूप से बीच के जटिल हिस्सों को संभाल लेता है।
परिणाम
लेखकों ने इस सिस्टम का परीक्षण मानक, ओपन-सोर्स AI मॉडल का उपयोग करके किया (जो बड़ी टेक कंपनियों द्वारा उपयोग किए जाने वाले विशाल, महंगे मॉडलों की तुलना में सस्ते और छोटे हैं)।
- परिणाम: इस "स्कैफोल्डिंग" (विषय-सूची, मानसिक मानचित्र और कॉम्बो मूव्स) का उपयोग करके, उनका सिस्टम लगभग सभी अन्य ओपन-सोर्स एजेंटों से बेहतर प्रदर्शन करता है और सबसे महंगे, प्रोप्रायटरी (मालिकाना) सिस्टम के प्रदर्शन के बहुत करीब पहुँच जाता है।
- मुख्य बात: एक अच्छा वेब नेविगेटर बनने के लिए आपको जरूरी नहीं कि एक सुपर-इंटेलिजेंट, महंगा मस्तिष्क चाहिए। आपको बस जानकारी को व्यवस्थित करने, यह याद रखने की एक स्मार्ट विधि और उबाऊ चरणों को ऑटोमेट करने की आवश्यकता है। WebChallenger वह संगठन प्रदान करता है।
संक्षेप में, WebChallenger AI को अधिक स्मार्ट नहीं बनाता; यह बस उसे उसकी मौजूदा बुद्धिमत्ता का उपयोग करने के लिए बेहतर उपकरण देता है।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।