WCXB: A Multi-Type Web Content Extraction Benchmark
यह शोध पत्र WCXB को प्रस्तुत करता है, जो उच्च गुणवत्ता वाले एनोटेशन के साथ सात विशिष्ट प्रकारों के 2,008 वेब पृष्ठों का एक व्यापक बेंचमार्क डेटासेट है, जिसे मौजूदा केवल-लेख (article-only) बेंचमार्क की सीमाओं को दूर करने और वर्तमान वेब सामग्री निष्कर्षण प्रणालियों में महत्वपूर्ण प्रदर्शन अंतराल को प्रकट करने के लिए डिज़ाइन किया गया है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
इंटरनेट की कल्पना एक विशाल, अराजक पुस्तकालय के रूप में करें जहाँ हर वेबपेज एक किताब है। कुछ पेज साफ-सुथरे, अच्छी तरह से लिखे गए उपन्यास (समाचार लेख) हैं। कुछ बिखरे हुए बुलेटिन बोर्ड जैसे हैं जहाँ हर जगह स्टिकी नोट्स लगे हैं (फोरम), कुछ कैटलॉग हैं जिनमें मूल्य टैग और विवरण दिए गए हैं (उत्पाद), या कुछ निर्देश मैनुअल हैं जिनमें साइडबार और कोड ब्लॉक हैं (डॉक्यूमेंटेशन)।
वर्षों तक, कंप्यूटर जो इन पेजों को पढ़ने की कोशिश करते थे, उनमें एक बड़ी कमी रही। उन्हें "उपन्यास" पढ़ने में तो उत्कृष्ट बनाया गया था, लेकिन वे अव्यवस्थित कैटलॉग या बुलेटिन बोर्ड को समझने में बहुत खराब थे। वे अक्सर गलती से मूल्य टैग, "Add to Cart" बटन, या उपयोगकर्ता की टिप्पणियों को मुख्य कहानी समझकर पढ़ लेते थे।
समस्या: "केवल समाचार" परीक्षण (The "News-Only" Test)
लेखक, मुर्रघ फोली (Murrough Foley), तर्क देते हैं कि कंप्यूटरों को वेब कैसे पढ़ने में सक्षम है, यह मापने के लिए उपयोग किए जाने वाले पिछले परीक्षण खाली, सीधे राजमार्गों पर ड्राइवर के टेस्ट देने जैसे थे।
- पुराने परीक्षण: उन्होंने छोटे डेटासेट (100-800 पेज) का उपयोग किया जो लगभग पूरी तरह से समाचार लेखों से भरे थे।
- परिणाम: कंप्यूटर सुपर-प्रतिभाशाली दिखाई देते थे, और लगभग पूर्ण अंक प्राप्त करते थे। लेकिन यह भ्रामक था। यह हमें यह नहीं बताता था कि वे बाकी इंटरनेट के साथ कैसे व्यवहार करेंगे, जो उत्पाद लिस्टिंग या फोरम जैसे जटिल, संरचित पेजों से भरा हुआ है।
समाधान: WCXB (एक "ऑल-टेरेन" ड्राइविंग टेस्ट)
फोली एक नया बेंचमार्क पेश करते हैं जिसे WCXB (वेब कंटेंट एक्सट्रैक्शन बेंचमार्क) कहा जाता है। इसे एक नए, बहुत कठिन ड्राइविंग टेस्ट के रूप में समझें जिसमें राजमार्गों के साथ-साथ कीचड़ भरे ऑफ-रोड रास्ते, भीड़भाड़ वाली शहर की सड़कें और निर्माण क्षेत्र भी शामिल हैं।
- डेटासेट: इसमें 1,600 से अधिक विभिन्न वेबसाइटों के 2,008 वेब पेज शामिल हैं।
- विविधता: केवल समाचार के बजाय, यह 7 विशिष्ट "प्रकारों" के पेजों को कवर करता है:
- लेख (Articles) (आसान हाईवे ड्राइविंग की तरह)।
- फोरम (Forums) (उपयोगकर्ता टिप्पणियों के साथ बिखरे हुए बुलेटिन बोर्ड)।
- उत्पाद (Products) (छिपे हुए विवरण और कीमतों वाले कैटलॉग)।
- संग्रह (Collections) (फिल्टर्स के साथ वस्तुओं के ग्रिड)।
- लिस्टिंग (Listings) (सारांशों वाले दोहराते हुए कार्ड)।
- डॉक्यूमेंटेशन (Documentation) (कोड के साथ तकनीकी मैनुअल)।
- सर्विस पेजेस (Service Pages) (बिखरे हुए सेक्शन वाले मार्केटिंग पेज)।
उन्होंने इसे कैसे बनाया (द "गोल्ड स्टैंडर्ड" रेसिपी)
यह सुनिश्चित करने के लिए कि उत्तर सही हों, उन्होंने केवल एक व्यक्ति से पेपर ग्रेड नहीं करवाए। उन्होंने एक पाँच-चरणीय असेंबली लाइन का उपयोग किया:
- AI ड्राफ्टिंग: एक स्मार्ट AI ने पहला ड्राफ्ट लिखा कि "मुख्य सामग्री" क्या होनी चाहिए।
- ऑटो-चेक: स्क्रिप्ट्स ने स्पष्ट गलतियों की जाँच की।
- AI समीक्षा: चार अलग-अलग AI विशेषज्ञों ने काम की समीक्षा की, जो अलग-अलग प्रकार की गलतियों को देख रहे थे।
- स्निपेट चेक: उन्होंने स्क्रिप्ट्स चलाईं ताकि यह सुनिश्चित हो सके कि विशिष्ट आवश्यक वाक्यांश शामिल हैं और विशिष्ट "कचरा" वाक्यांशों (जैसे विज्ञापन) को बाहर रखा गया है।
- मानवीय अंतिम निर्णय: एक मानव विशेषज्ञ ने गुणवत्ता सुनिश्चित करने और किसी भी विवाद को सुलझाने के लिए अंतिम उत्पाद की समीक्षा की।
परिणाम: "समाचार" हल हो गया, बाकी सब टूटा हुआ है
फोली ने 13 अलग-अलग कंप्यूटर प्रोग्रामों (11 पुराने नियमों का उपयोग करने वाले, 2 आधुनिक AI का उपयोग करने वाले) का इस नए परीक्षण के विरुद्ध परीक्षण किया। यहाँ उन्होंने क्या पाया:
- समाचार लेख: सभी ने शानदार प्रदर्शन किया। शीर्ष प्रोग्रामों ने 93% सटीकता प्राप्त की। लेखक का निष्कर्ष है कि समाचार लेख पढ़ना अनिवार्यतः एक "हल हो चुकी समस्या" (solved problem) है।
- शेष वेब: स्कोर नाटकीय रूप से गिर गया।
- फोरम पर, सबसे अच्छे और सबसे खराब प्रोग्रामों के बीच का अंतर बहुत बड़ा था (27 अंकों का अंतर)।
- उत्पाद पेजों पर, सबसे अच्छे प्रोग्राम ने केवल 67% सही जानकारी दी, जबकि अन्य संघर्ष कर रहे थे।
- संग्रहों (Collections) पर, सबसे अच्छा स्कोर केवल 71% था, जबकि सबसे खराब 41% था।
बड़ी हैरानी: बड़ा AI कोई जादुई समाधान नहीं है
कई लोग मानते हैं कि नए, बड़े आर्टिफिशियल इंटेलिजेंस मॉडल (न्यूरल सिस्टम) स्वचालित रूप से हर चीज़ में बेहतर होंगे।
- वास्तविकता: बड़े AI मॉडल ने समस्या को हल नहीं किया। वास्तव में, वे गैर-समाचार पेजों पर पुराने नियम-आधारित प्रोग्रामों की तुलना में अक्सर बदतर प्रदर्शन करते थे।
- क्यों? AI मॉडल मुख्य रूप से समाचार लेखों पर प्रशिक्षित थे, इसलिए उन्होंने उसी पूर्वाग्रह को विरासत में प्राप्त किया। वे उपन्यासों के लिए बेहतरीन हैं लेकिन अभी भी अव्यवस्थित बुलेटिन बोर्ड और उत्पाद कैटलॉग से भ्रमित हो जाते हैं।
गति बनाम बुद्धिमत्ता
पेपर ने गति पर भी विचार किया।
- नियम-आधारित प्रोग्राम: बिजली की तरह तेज़ (प्रति पेज मिलीसेकंड में)।
- AI प्रोग्राम: घोंघे की तरह धीमे (प्रति पेज हजारों मिलीसेकंड में), जिन्हें चलाने के लिए महंगे ग्राफिक्स कार्ड की आवश्यकता होती है।
निष्कर्ष
इंटरनेट केवल समाचार कहानियों का संग्रह नहीं है। यह कई अलग-अलग संरचनाओं का मिश्रण है। पुराने परीक्षण हमें झूठ बोल रहे थे क्योंकि वे केवल समाचारों का परीक्षण कर रहे थे। यह नया बेंचमार्क (WCXB) प्रकट करता है कि हालांकि कंप्यूटर समाचार पढ़ने में माहिर हैं, वे अभी भी वेब के जटिल, संरचित और अव्यवस्थित हिस्सों को समझने के लिए संघर्ष कर रहे हैं। आगे बढ़ने के लिए, हमें सभी वेब पेजों को समाचार लेखों की तरह मानने से बचना होगा।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।