Where Did It Go Wrong? Process-Level Evaluation of Web Agents with Semantic State Tracking
यह शोधपत्र WebStep प्रस्तुत करता है, जो वेब एजेंटों के प्रक्रिया-स्तरीय मूल्यांकन को सक्षम करने के लिए स्वचालित सिमेंटिक स्टेट ट्रैकिंग वाला एक नवीन बेंचमार्क है, जो उन विशिष्ट कौशल कमियों और त्रुटि प्रकारों में सूक्ष्म, कार्रवाई योग्य अंतर्दृष्टि प्रकट करता है जिन्हें पारंपरिक परिणाम-आधारित मेट्रिक्स पकड़ने में विफल रहते हैं।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आप अपने लिए काम करने के लिए एक व्यक्तिगत सहायक (personal assistant) रख रहे हैं, जो आपके लिए ऑनलाइन कोई विशिष्ट शर्ट खरीदने या फ्लाइट बुक करने जैसे काम कर सके।
पुराना तरीका: "क्या उन्हें मिल गया?" टेस्ट
वर्तमान में, AI वेब एजेंटों के लिए अधिकांश परीक्षण एक शिक्षक की तरह हैं जो केवल अंतिम उत्तर देखकर छात्र के होमवर्क को ग्रेड देते हैं।
- परिदृश्य: आप दो सहायकों को "डेविड" का एक विशिष्ट ईमेल खोजने और उसे स्टार (star) करने के लिए कहते हैं।
- सहायक A तुरंत सही ईमेल ढूंढ लेता है और उसे स्टार कर देता है। (पास)
- सहायक B भटक जाता है, गलत ईमेल खोलता है, भ्रमित हो जाता है, लेकिन अंततः सही ईमेल ढूंढ ही लेता है और उसे स्टार कर देता है। (पास)
- सहायक C सही ईमेल तो ढूंढ लेता है लेकिन "स्टार" करने के बजाय गलती से "डिलीट" पर क्लिक कर देता है। (फेल)
पुराने सिस्टम के तहत, सहायक A और सहायक B को एक ही ग्रेड मिलता है: 100%। लेकिन सहायक B एक गड़बड़ी भरा प्रदर्शन कर रहा था और सहायक C ने एक छोटी सी गलती की थी। पुराना सिस्टम यह नहीं बता सकता कि वे क्यों फेल हुए या उन्हें सुधारने में कैसे मदद की जाए। यह ऐसा है जैसे कहना, "आपने सही उत्तर दिया, इसलिए आप जीनियस हैं," बिना यह ध्यान दिए कि उस जीनियस ने केवल तुक्का मारा था जबकि दूसरे छात्र ने वास्तव में गणित को समझा था।
नया तरीका: "जीपीएस ट्रैकर" (WEBSTEP)
यह पेपर WEBSTEP नामक एक नया बेंचमार्क पेश करता है। इसे हर AI एजेंट को एक जीपीएस ट्रैकर देने के रूप में समझें जो न केवल यह रिकॉर्ड करता है कि वे कहाँ पहुँचे, बल्कि उनके द्वारा उठाए गए हर कदम को भी रिकॉर्ड करता है।
केवल अंतिम परिणाम की जाँच करने के बजाय, WEBSTEP वेबसाइट का एक "डिजिटल ट्विन" (digital twin) बनाता है। जब AI बटन क्लिक कर रहा होता है या स्क्रीन पर टाइप कर रहा होता है, तब सिस्टम बैकग्राउंड में उन कार्यों के अर्थ को गुप्त रूप से रिकॉर्ड करता है।
- क्या AI को सर्च (Search) करना पता था?
- क्या उसे चीज़ों को सीमित करने के लिए परिणामों को फ़िल्टर (Filter) करना पता था?
- क्या उसे कुछ खरीदने से पहले किसी आइटम के विवरण का निरीक्षण (Inspect) करना पता था?
- क्या उसे कमिट (Commit) करना पता था (जैसे अंतिम "खरीदें" या "स्टार" बटन पर क्लिक करना)?
उन्होंने क्या खोजा
विभिन्न AI मॉडलों के "जीपीएस ट्रैक" को देखकर, शोधकर्ताओं ने कुछ आश्चर्यजनक बातें पाईं जो पुराने "पास/फेल" परीक्षणों में छूट गई थीं:
"साहसी लेकिन अनाड़ी" बनाम "सावधान लेकिन धीमा":
दो AI मॉडल का सफलता दर (success rate) बिल्कुल समान (जैसे, 32%) हो सकता है। लेकिन जब आप जीपीएस देखते हैं, तो एक मॉडल वास्तव में एक्सप्लोरिंग (exploring) (सही आइटम ढूंढने) में बहुत अच्छा है लेकिन एग्जीक्यूटिंग (executing) (सही बटन दबाने) में बहुत खराब है। दूसरा मॉडल बटन दबाने में बहुत अच्छा है लेकिन आसानी से भटक जाता है। पुराना टेस्ट उन्हें एक जैसा देखता था; नया टेस्ट देखता है कि उन्हें पूरी तरह से अलग प्रशिक्षण की आवश्यकता है।विशिष्ट कमजोरियां:
एक AI फ़िल्टरिंग (सबसे सस्ता आइटम ढूंढने) में माहिर हो सकता है लेकिन निरीक्षण (यह जांचने में कि क्या उस पर वारंटी है) में बहुत खराब हो सकता है। दूसरा इसके विपरीत हो सकता है। नया सिस्टम कह सकता है, "हे, यह AI सर्च करने में बहुत अच्छा है, लेकिन यह विवरणों की जांच करने वाला चरण छोड़ देता है।" यह एक कोच की तरह है जो धावक को कहता है, "आपका स्टार्ट बहुत अच्छा है, लेकिन आप अंतिम बाधा पर लड़खड़ा जाते हैं," बजाय इसके कि केवल यह कहे, "आप दौड़ हार गए।""गलत मोड़" का क्षण:
सिस्टम सटीक रूप से उस सेकंड को पहचान सकता है जब AI पटरी से उतर जाता है। क्या उसने गलत दरवाजा खोला? क्या उसने बहुत जल्दी गलत आइटम खरीदने की कोशिश की? क्या वह एक लूप (loop) में फंस गया? इससे डेवलपर्स को यह जानने में मदद मिलती है कि AI के मस्तिष्क के किस हिस्से को ठीक करने की आवश्यकता है।कठिन कार्य वास्तविक कौशल को उजागर करते हैं:
आसान कार्यों पर, सभी AI लगभग एक जैसे दिखते हैं। लेकिन जैसे-जैसे कार्य कठिन होते जाते हैं (जैसे सैकड़ों मिलते-जुलते आइटमों के बीच एक विशिष्ट आइटम ढूंढना), अंतर स्पष्ट होने लगते हैं। सबसे अच्छा AI शांत रहता है और मानचित्र का पालन करता है, जबकि अन्य भीड़ में खो जाते हैं।
निष्कर्ष
यह पेपर तर्क देता है कि हमें AI वेब एजेंटों को केवल इस आधार पर आंकना बंद कर देना चाहिए कि उन्होंने अंत में "सफलता" प्राप्त की या नहीं। जिस तरह एक कोच केवल स्कोरबोर्ड को नहीं देखता, हमें पूरा खेल देखना होगा। WEBSTEP हमें खेल देखने, विशिष्ट गलतियों को पहचानने और AI एजेंटों को सुधारने के लिए आवश्यक विशिष्ट कोचिंग देने के उपकरण प्रदान करता है। यह एक साधारण "पास/फेल" ग्रेड को एक विस्तृत रिपोर्ट कार्ड में बदल देता है जो आपको बताता है कि एजेंट कहाँ गलत हुआ और उसे कैसे ठीक किया जाए।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।