WebDS: An End-to-End Benchmark for Web-based Data Science
यह शोध पत्र WebDS को प्रस्तुत करता है, जो विविध वेबसाइटों में 870 जटिल, बहु-चरणीय कार्यों वाला वेब-आधारित डेटा विज्ञान का पहला एंड-टू-एंड बेंचमार्क है, जो वास्तविक दुनिया के डेटा अधिग्रहण, विश्लेषण और अंतर्दृष्टि पीढ़ी में वर्तमान LLM एजेंटों और मानव क्षमताओं के बीच महत्वपूर्ण प्रदर्शन अंतराल को प्रकट करता है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आपने एक बहुत ही बुद्धिमान, सुपर-फास्ट इंटर्न "AI" को एक जटिल रिसर्च प्रोजेक्ट के लिए काम पर रखा है। आप उसे बताते हैं: "जाओ नवीनतम बेरोजगारी के आंकड़े ढूंढो, उनकी तुलना तीन अलग-अलग सरकारी वेबसाइटों से स्वास्थ्य सांख्यिकी (health statistics) के साथ करो, पता लगाओ कि क्या उनके बीच कोई संबंध है, और हमारे बॉस के लिए एक रिपोर्ट लिखो।"
अतीत में, हमने इन AI इंटर्न का बहुत सरल कार्यों के लिए परीक्षण किया था, जैसे "एक विशिष्ट वेबसाइट पर एक विशेष जूते की कीमत ढूंढना" या "मौसम के बारे में एक वाक्य लिखना।" वे इनमें बहुत अच्छे थे। लेकिन वास्तविक दुनिया में, डेटा साइंस बहुत अव्यवस्थित होता है। यह ऐसा है जैसे एक शानदार भोजन बनाने की कोशिश करना जबकि रसोई में आग लगी हो, सामग्री तीन अलग-अलग किराने की दुकानों में बिखरी हुई हो, और रेसिपी बार-बार बदल रही हो।
यह पेपर WebDS पेश करता है, जो एक नया, अत्यंत कठिन टेस्ट है यह देखने के लिए कि क्या AI वास्तव में उस अव्यवस्थित, वास्तविक दुनिया के काम को संभाल सकता है।
यहाँ बताया गया है कि उन्होंने क्या किया और उन्हें क्या मिला, कुछ रोजमर्रा के उदाहरणों का उपयोग करते हुए:
1. समस्या: "वीडियो गेम" बनाम "वास्तविक दुनिया"
पिछले AI परीक्षणों को वीडियो गेम की तरह समझें। एक वीडियो गेम में, नियम तय होते हैं, मैप नहीं बदलता, और आइटम हमेशा एक ही जगह पर होते हैं। यदि आप पर्याप्त अभ्यास करते हैं, तो आप लेवल जीत सकते हैं।
- पुराने टेस्ट: ये वीडियो गेम की तरह थे। इन्होंने AI को एक स्थिर पेज पर एक बटन क्लिक करने या एक नंबर खोजने के लिए कहा।
- वास्तविक दुनिया: इंटरनेट एक जीवंत शहर की तरह है। इमारतें नवीनीकृत होती हैं, साइन बोर्ड बदलते हैं, ट्रैफिक जाम होता है, और पूरी तस्वीर समझने के लिए आपको एक मोहल्ले से दूसरे मोहल्ले में जाना पड़ता है।
लेखकों ने महसूस किया कि वर्तमान AI एजेंट ऐसे वीडियो गेम चैंपियंस की तरह हैं जो वास्तविक शहर में छोड़े जाने पर पूरी तरह से खो जाते हैं। वे डेटा साइंस की अराजकता को नहीं संभाल सकते।
2. समाधान: "WebDS" बाधा दौड़ (Obstacle Course)
शोधकर्ताओं ने WebDS (Web Data Science) बनाया। एक वीडियो गेम के बजाय, उन्होंने वास्तविक इंटरनेट पर एक विशाल, 29-स्टॉप वाली बाधा दौड़ बनाई।
- कोर्स: इसमें 870 अलग-अलग कार्य शामिल हैं। कुछ आसान हैं (जैसे फोन नंबर ढूंढना), लेकिन अधिकांश कठिन हैं।
- चुनौती: AI को यह करना होगा:
- नेविगेट करना: विभिन्न वेबसाइटों के माध्यम से घूमना (जैसे लाइब्रेरी से बैंक और फिर न्यूज़स्टैंड तक जाना)।
- सामग्री मिलाना: एक साइट से स्प्रेडशीट और दूसरी साइट से समाचार लेख लेकर उन्हें आपस में मिलाना।
- टूल्स का उपयोग करना: कभी-कभी इसे एक फ़ाइल डाउनलोड करनी पड़ती है, गणितीय गणना करनी पड़ती है, या कोड स्क्रिप्ट लिखनी पड़ती है।
- डिलीवर करना: अंत में, इसे एक सारांश या रिपोर्ट लिखनी होती है।
यह वैसा ही है जैसे इंटर्न को किराने की दुकान, हार्डवेयर स्टोर और लाइब्रेरी जाने के लिए कहना, विशिष्ट चीजें खरीदने के लिए कहना, उन्हें ब्लेंडर में मिलाने के लिए कहना, और फिर केक बेक करने के लिए कहना, और वह भी बिना गलियों में चमकते खिलौनों से विचलित हुए।
3. परिणाम: "AI बनाम मानव" का अंतर
शोधकर्ताओं ने उपलब्ध सबसे स्मार्ट AI मॉडलों (जैसे GPT-4o और अन्य) को इस टेस्ट पर उतारा। परिणाम चौंकाने वाले थे:
- AI का प्रदर्शन: सबसे अच्छा AI केवल लगभग 13% से 22% कार्य सही कर पाया।
- उदाहरण: कल्पना कीजिए कि एक छात्र फाइनल परीक्षा दे रहा है और उसे D- मिला। उसे सवाल पढ़ना तो आता था, लेकिन वह समस्या को हल करने के लिए कड़ियों को जोड़ नहीं पाया।
- मानव का प्रदर्शन: असली इंसानों (जिन्हें समान टूल्स और समय दिया गया था) ने लगभग 90% कार्य सही किए।
- उदाहरण: इंसानों को A+ मिला। वे जानते थे कि जब वेबसाइट भ्रमित करने वाली हो तो कैसे अनुकूलित होना है, कैसे अपने काम की दोबारा जांच करनी है, और यह कैसे पहचानना है कि वे गलत रास्ते पर जा रहे हैं।
दूरी (The Gap): सबसे अच्छे AI और इंसान के बीच 75+ अंकों का भारी अंतर है। यह बताता है कि हालांकि AI बात करने में स्मार्ट हो रहा है, लेकिन यह वास्तविक दुनिया में जटिल, बहु-चरणीय (multi-step) काम करने में अभी भी बहुत खराब है।
4. AI क्यों विफल हुआ? ("Failure Modes")
पेपर ने विश्लेषण किया कि AI क्यों विफल हुआ, और इसे कुछ मजेदार और निराशाजनक कारणों का पता चला:
- "भ्रमित लाइब्रेरियन" (The Hallucinating Librarian): AI सही दस्तावेज़ तो ढूंढ लेता था लेकिन फिर उसमें से गलत नंबर पढ़ लेता था। यह ऐसा है जैसे किसी किताब का सही पन्ना ढूंढना लेकिन पिछले पन्ने का पैराग्राफ पढ़ लेना।
- "अटक जाने वाला रिकॉर्ड" (The Stuck Record): यदि कोई बटन काम नहीं करता था, तो AI बस उसे 50 बार क्लिक करता रहता था, इस उम्मीद में कि अगली बार यह काम कर जाएगा। उसे यह नहीं पता था कि कहना है, "ठीक है, यह काम नहीं कर रहा है, चलिए दूसरा रास्ता आजमाते हैं।"
- "शॉर्टकट लेने वाला" (The Shortcut Taker): फ़ाइल डाउनलोड करने और उसका विश्लेषण करने की कड़ी मेहनत करने के बजाय, AI अक्सर एक त्वरित गूगल सर्च के आधार पर उत्तर का अनुमान लगा लेता था, जिससे वह अक्सर गलत हो जाता था।
- "खोया हुआ पर्यटक" (The Lost Tourist): AI समान नामों से भ्रमित हो जाता था (जैसे, "Physical Therapy" के बजाय "Public Transportation" साइट पर चले जाना) और गलत मोहल्ले में भटक जाता था।
5. यह क्यों महत्वपूर्ण है
यह पेपर एक चेतावनी है। लंबे समय से, हमें लगा था कि AI हमारे काम संभालने के लिए लगभग तैयार है। यह टेस्ट दिखाता है कि हालांकि AI सरल सवालों के जवाब देने में बहुत अच्छा है, लेकिन यह अभी भी एक विश्वसनीय डेटा साइंटिस्ट या ऑफिस वर्कर बनने के लिए तैयार नहीं है।
निष्कर्ष:
हमें AI का परीक्षण आसान "वीडियो गेम" कार्यों पर करना बंद करना चाहिए और उन्हें इन अव्यवस्थित, वास्तविक दुनिया के "बाधा दौड़" (obstacle courses) पर परखना शुरू करना चाहिए। यदि हम चाहते हैं कि भविष्य में AI वास्तव में उपयोगी हो, तो हमें इसे वास्तविक इंटरनेट की अराजकता में नेविगेट करना सिखाना होगा, न कि केवल वीडियो गेम की साफ-सुथरी और अनुमानित दुनिया में।
संक्षेप में: AI एक ऐसा विद्वान है जो डिक्शनरी सुना सकता है लेकिन किराने का सामान खरीदने के लिए व्यस्त शहर में रास्ता नहीं खोज सकता। WebDS वह नक्शा है जिसकी हमें उसे वहां तक पहुँचने में मदद करने के लिए आवश्यकता है।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।