WebRetriever: A Large-Scale Comprehensive Benchmark for Efficient Web Agent Evaluation
यह शोधपत्र WebRetriever प्रस्तुत करता है, जो 800 विविध वेबसाइटों में 1,550 कार्यों वाला एक बड़े पैमाने का बेंचमार्क है, साथ ही एक नवीन NavEval फ्रेमवर्क और तीन पूरक मूल्यांकन प्रोटोकॉल भी प्रदान करता है, ताकि वास्तविक दुनिया के परिदृश्यों में वेब एजेंट के प्रदर्शन का अधिक व्यापक और सूक्ष्म मूल्यांकन प्रदान करके मौजूदा बेंचमार्क की सीमाओं को संबोधित किया जा सके।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
यहाँ "WebRetriever" पेपर का सरल भाषा और रचनात्मक उपमाओं (analogies) का उपयोग करते हुए विवरण दिया गया है।
बड़ी तस्वीर: "ड्राइवर लाइसेंस" की समस्या
कल्पisिए कि आप एक रोबोट को कार चलाना सिखा रहे हैं। अतीत में, शोधकर्ताओं ने इन रोबोटों का परीक्षण एक छोटे, खाली पार्किंग स्थल पर किया था जहाँ न कोई ट्रैफिक था, न पैदल यात्री और न ही मौसम में बदलाव। रोबोट इस परीक्षण में बहुत अच्छे से पास हो गए। लेकिन जब आप उन्हें एक वास्तविक हाईवे पर निर्माण क्षेत्रों (construction zones), भ्रमित करने वाले संकेतों और आक्रामक ड्राइवरों के बीच रखते हैं, तो वे तुरंत दुर्घटनाग्रस्त हो जाते हैं।
यह पेपर तर्क देता है कि "वेब एजेंटों" (AI जो आपके लिए इंटरनेट ब्राउज़ करता है) के लिए वर्तमान परीक्षण उस खाली पार्किंग स्थल की तरह हैं। वे बहुत छोटे, बहुत सरल हैं और वास्तविक वेब की अव्यवתי वास्तविकता को नहीं दर्शाते हैं। लेखकों ने एक नया, विशाल परीक्षण बनाया है जिसे WebRetriever कहा जाता है, ताकि यह देखा जा सके कि क्या ये AI ड्राइवर वास्तव में वास्तविक दुनिया के ट्रैफिक को संभाल सकते हैं।
1. नया टेस्ट ट्रैक: WebRetriever
लेखकों ने AI एजेंटों के लिए एक विशाल बाधा दौड़ (obstacle course) बनाई है।
- पुराना तरीका: पिछले परीक्षणों में शायद 4 से 100 वेबसाइटें होती थीं। यह एक ड्राइवर का परीक्षण एक अकेली सड़क पर करने जैसा था।
- नया तरीका (WebRetriever): उन्होंने 800 अलग-अलग वेबसाइटों और 1,550 विशिष्ट कार्यों वाला एक ट्रैक बनाया।
- विविधता: यह केवल खरीदारी तक सीमित नहीं है। इसमें स्टॉक मार्केट की जाँच करना, कानूनी दस्तावेज़ पढ़ना और सरकारी पोर्टल्स को नेविगेट करने जैसे पेशेवर कार्य शामिल हैं।
- उपमा: यदि पुराने परीक्षण एक शांत गली में ड्राइविंग टेस्ट की तरह थे, तो WebRetriever व्यस्त शहर के दौरान रश ऑवर में एक टेस्ट ड्राइव है, जिसमें जटिल चौराहे, वन-वे सड़कें और निर्माण संबंधी डायवर्जन शामिल हैं।
2. नया जज: NavEval
आप एक रोबोट ड्राइवर को कैसे ग्रेड देंगे? आप हर एक टेस्ट ड्राइव को देखने के लिए मानव विशेषज्ञ नहीं रख सकते; यह बहुत महंगा और धीमा है।
- पुराना तरीका: पिछले स्वचालित जज एक ऐसे रेफरी की तरह थे जो केवल कार की अंतिम फोटो देखते थे। "क्या कार फिनिश लाइन तक पहुँची?" यदि हाँ, तो पास। लेकिन इसने इस तथ्य को अनदेखा कर दिया कि ड्राइवर ने तीन रेड लाइट पार की होगी या सही जगह पहुँचने के लिए गलत मोड़ लिया होगा।
- नया तरीका (NavEval): लेखकों ने NavEval नामक एक स्मार्ट जज बनाया है। केवल अंतिम फोटो देखने के बजाय, NavEval एक विमान के ब्लैक बॉक्स रिकॉर्डर की तरह काम करता है।
- यह इंजन की आवाज़ (नेटवर्क रिक्वेस्ट) सुनता है।
- यह स्टीयरिंग व्हील की गतिविधियों (क्लिक और एक्शन) को देखता है।
- यह GPS इतिहास (विजिट किए गए URL) की जाँच करता है।
- परिणाम: यह जज इतना सटीक है कि यह मानव विशेषज्ञों के साथ 90% समय सहमत होता है। यह बता सकता है कि क्या रोबोट ने "चीटिंग" की या उसने वास्तव में पहेली को सुलझाया।
3. कठिनाई के तीन स्तर
पेपर एजेंटों को टेस्ट करने के तीन अलग-अलग तरीके पेश करता है, जैसे कि बढ़ते कठिनाई स्तरों वाला एक वीडियो गेम:
स्तर 1: "दरवाजा ढूंढो" टेस्ट (प्रोटोकॉल I)
- कार्य: "'Informed Consent' के बारे में पेज पर जाओ।"
- लक्ष्य: क्या एजेंट बिना किसी मदद के सही पेज खोजने के लिए वेबसाइट को नेविगेट कर सकता है?
- वास्तविकता: इस सरल लक्ष्य के साथ भी, अधिकांश AI एजेंट विफल रहे। वे लिंक्स के भूलभुलैया में खो गए।
स्तर 2: "मैप के साथ" टेस्ट (प्रोटोकॉल II)
- कार्य: "'Informed Consent' के बारे में पेज पर जाओ।"
- ट्विस्ट: इस बार, हम एजेंट को एक चरण-दर-चरण निर्देश पुस्तिका (जैसे वॉयस निर्देशों वाला GPS) देते हैं।
- परिणाम: एजेंट बेहतर हुए, लेकिन पूर्ण नहीं। वे अभी भी निर्देशों का पूरी तरह से पालन करने में संघर्ष करते रहे, जिससे पता चलता है कि उन्हें जटिल निर्देशों को समझने के लिए अधिक प्रशिक्षण की आवश्यकता है।
स्तर 3: "फुल मिशन" टेस्ट (प्रोटोकॉल III)
- कार्य: "पेज पर जाओ, दस्तावेज़ को पढ़ो, और मुझे बताओ कि तीसरा पैराग्राफ बिल्कुल क्या कहता है।"
- ट्विस्ट: केवल पेज तक पहुँचना ही काफी नहीं है। एजेंट को विशिष्ट जानकारी को पढ़ना, समझना और निकालना होगा।
- वास्तविकता: यहीं पर एजेंटों को वास्तव में संघर्ष करना पड़ा। कई लोग पेज तो ढूँढ लेते हैं लेकिन बारीक अक्षरों को नहीं पढ़ पाते। यह एक ऐसे ड्राइवर की तरह है जो कार पार्क तो कर सकता है लेकिन पार्किंग टिकट नहीं पढ़ सकता।
4. चौंकाने वाले परिणाम
जब लेखकों ने अपने परीक्षण चलाए, तो परिणाम AI उद्योग के लिए विनम्रता भरा थे:
- पार्किंग लॉट बनाम हाईवे: जो एजेंट पुराने, आसान परीक्षणों पर 90% स्कोर करते थे, वे इस नए, यथार्थवादी परीक्षण पर 20% से नीचे स्कोर करते हैं।
- "आगमन" का जाल (The "Arrival" Trap): केवल इसलिए कि एक एजेंट सही वेबपेज तक पहुँच गया है, इसका मतलब यह नहीं है कि उसने काम पूरा कर लिया है। सबसे कठिन परीक्षण में, एजेंट पूरे कार्य (पेज खोजना + सही उत्तर प्राप्त करना) को पूरा करने में केवल लगभग 12% बार सफल हुए।
सारांश
पेपर का दावा है कि हम AI वेब एजेंटों के बारे में उनकी क्षमता का बहुत अधिक आकलन कर रहे थे क्योंकि हम उन्हें एक "बाँझ" (sterile) वातावरण में टेस्ट कर रहे थे। WebRetriever एक नया, विशाल और यथार्थवादी परीक्षण मैदान है जो दिखाता है कि ये एजेंट वास्तविक दुनिया में अभी भी काफी अनाड़ी हैं। वे कभी-कभी सही दरवाजा तो ढूँढ लेते हैं, लेकिन अक्सर रास्ता भटक जाते हैं, और एक बार वहाँ पहुँचने के बाद बारीक विवरण पढ़ने में वे बहुत खराब हैं।
लेखकों ने एक नया, अत्यधिक सटीक "रेफरी" (NavEval) भी प्रदान किया है ताकि भविष्य में, हम इन एजेंटों का स्वचालित रूप से परीक्षण कर सकें और जान सकें कि वे वास्तव में कितने अच्छे हैं, बिना हर एक गतिविधि को देखने के लिए किसी मानव की आवश्यकता के।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।