← नवीनतम पेपर
💬 NLP

WCXB: A Multi-Type Web Content Extraction Benchmark

यह शोध पत्र WCXB को प्रस्तुत करता है, जो उच्च गुणवत्ता वाले एनोटेशन के साथ सात विशिष्ट प्रकारों के 2,008 वेब पृष्ठों का एक व्यापक बेंचमार्क डेटासेट है, जिसे मौजूदा केवल-लेख (article-only) बेंचमार्क की सीमाओं को दूर करने और वर्तमान वेब सामग्री निष्कर्षण प्रणालियों में महत्वपूर्ण प्रदर्शन अंतराल को प्रकट करने के लिए डिज़ाइन किया गया है।

मूल लेखक: Murrough Foley

प्रकाशित 2026-05-21
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Murrough Foley

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

इंटरनेट की कल्पना एक विशाल, अराजक पुस्तकालय के रूप में करें जहाँ हर वेबपेज एक किताब है। कुछ पेज साफ-सुथरे, अच्छी तरह से लिखे गए उपन्यास (समाचार लेख) हैं। कुछ बिखरे हुए बुलेटिन बोर्ड जैसे हैं जहाँ हर जगह स्टिकी नोट्स लगे हैं (फोरम), कुछ कैटलॉग हैं जिनमें मूल्य टैग और विवरण दिए गए हैं (उत्पाद), या कुछ निर्देश मैनुअल हैं जिनमें साइडबार और कोड ब्लॉक हैं (डॉक्यूमेंटेशन)।

वर्षों तक, कंप्यूटर जो इन पेजों को पढ़ने की कोशिश करते थे, उनमें एक बड़ी कमी रही। उन्हें "उपन्यास" पढ़ने में तो उत्कृष्ट बनाया गया था, लेकिन वे अव्यवस्थित कैटलॉग या बुलेटिन बोर्ड को समझने में बहुत खराब थे। वे अक्सर गलती से मूल्य टैग, "Add to Cart" बटन, या उपयोगकर्ता की टिप्पणियों को मुख्य कहानी समझकर पढ़ लेते थे।

समस्या: "केवल समाचार" परीक्षण (The "News-Only" Test)
लेखक, मुर्रघ फोली (Murrough Foley), तर्क देते हैं कि कंप्यूटरों को वेब कैसे पढ़ने में सक्षम है, यह मापने के लिए उपयोग किए जाने वाले पिछले परीक्षण खाली, सीधे राजमार्गों पर ड्राइवर के टेस्ट देने जैसे थे।

  • पुराने परीक्षण: उन्होंने छोटे डेटासेट (100-800 पेज) का उपयोग किया जो लगभग पूरी तरह से समाचार लेखों से भरे थे।
  • परिणाम: कंप्यूटर सुपर-प्रतिभाशाली दिखाई देते थे, और लगभग पूर्ण अंक प्राप्त करते थे। लेकिन यह भ्रामक था। यह हमें यह नहीं बताता था कि वे बाकी इंटरनेट के साथ कैसे व्यवहार करेंगे, जो उत्पाद लिस्टिंग या फोरम जैसे जटिल, संरचित पेजों से भरा हुआ है।

समाधान: WCXB (एक "ऑल-टेरेन" ड्राइविंग टेस्ट)
फोली एक नया बेंचमार्क पेश करते हैं जिसे WCXB (वेब कंटेंट एक्सट्रैक्शन बेंचमार्क) कहा जाता है। इसे एक नए, बहुत कठिन ड्राइविंग टेस्ट के रूप में समझें जिसमें राजमार्गों के साथ-साथ कीचड़ भरे ऑफ-रोड रास्ते, भीड़भाड़ वाली शहर की सड़कें और निर्माण क्षेत्र भी शामिल हैं।

  • डेटासेट: इसमें 1,600 से अधिक विभिन्न वेबसाइटों के 2,008 वेब पेज शामिल हैं।
  • विविधता: केवल समाचार के बजाय, यह 7 विशिष्ट "प्रकारों" के पेजों को कवर करता है:
    1. लेख (Articles) (आसान हाईवे ड्राइविंग की तरह)।
    2. फोरम (Forums) (उपयोगकर्ता टिप्पणियों के साथ बिखरे हुए बुलेटिन बोर्ड)।
    3. उत्पाद (Products) (छिपे हुए विवरण और कीमतों वाले कैटलॉग)।
    4. संग्रह (Collections) (फिल्टर्स के साथ वस्तुओं के ग्रिड)।
    5. लिस्टिंग (Listings) (सारांशों वाले दोहराते हुए कार्ड)।
    6. डॉक्यूमेंटेशन (Documentation) (कोड के साथ तकनीकी मैनुअल)।
    7. सर्विस पेजेस (Service Pages) (बिखरे हुए सेक्शन वाले मार्केटिंग पेज)।

उन्होंने इसे कैसे बनाया (द "गोल्ड स्टैंडर्ड" रेसिपी)
यह सुनिश्चित करने के लिए कि उत्तर सही हों, उन्होंने केवल एक व्यक्ति से पेपर ग्रेड नहीं करवाए। उन्होंने एक पाँच-चरणीय असेंबली लाइन का उपयोग किया:

  1. AI ड्राफ्टिंग: एक स्मार्ट AI ने पहला ड्राफ्ट लिखा कि "मुख्य सामग्री" क्या होनी चाहिए।
  2. ऑटो-चेक: स्क्रिप्ट्स ने स्पष्ट गलतियों की जाँच की।
  3. AI समीक्षा: चार अलग-अलग AI विशेषज्ञों ने काम की समीक्षा की, जो अलग-अलग प्रकार की गलतियों को देख रहे थे।
  4. स्निपेट चेक: उन्होंने स्क्रिप्ट्स चलाईं ताकि यह सुनिश्चित हो सके कि विशिष्ट आवश्यक वाक्यांश शामिल हैं और विशिष्ट "कचरा" वाक्यांशों (जैसे विज्ञापन) को बाहर रखा गया है।
  5. मानवीय अंतिम निर्णय: एक मानव विशेषज्ञ ने गुणवत्ता सुनिश्चित करने और किसी भी विवाद को सुलझाने के लिए अंतिम उत्पाद की समीक्षा की।

परिणाम: "समाचार" हल हो गया, बाकी सब टूटा हुआ है
फोली ने 13 अलग-अलग कंप्यूटर प्रोग्रामों (11 पुराने नियमों का उपयोग करने वाले, 2 आधुनिक AI का उपयोग करने वाले) का इस नए परीक्षण के विरुद्ध परीक्षण किया। यहाँ उन्होंने क्या पाया:

  • समाचार लेख: सभी ने शानदार प्रदर्शन किया। शीर्ष प्रोग्रामों ने 93% सटीकता प्राप्त की। लेखक का निष्कर्ष है कि समाचार लेख पढ़ना अनिवार्यतः एक "हल हो चुकी समस्या" (solved problem) है।
  • शेष वेब: स्कोर नाटकीय रूप से गिर गया।
    • फोरम पर, सबसे अच्छे और सबसे खराब प्रोग्रामों के बीच का अंतर बहुत बड़ा था (27 अंकों का अंतर)।
    • उत्पाद पेजों पर, सबसे अच्छे प्रोग्राम ने केवल 67% सही जानकारी दी, जबकि अन्य संघर्ष कर रहे थे।
    • संग्रहों (Collections) पर, सबसे अच्छा स्कोर केवल 71% था, जबकि सबसे खराब 41% था।

बड़ी हैरानी: बड़ा AI कोई जादुई समाधान नहीं है
कई लोग मानते हैं कि नए, बड़े आर्टिफिशियल इंटेलिजेंस मॉडल (न्यूरल सिस्टम) स्वचालित रूप से हर चीज़ में बेहतर होंगे।

  • वास्तविकता: बड़े AI मॉडल ने समस्या को हल नहीं किया। वास्तव में, वे गैर-समाचार पेजों पर पुराने नियम-आधारित प्रोग्रामों की तुलना में अक्सर बदतर प्रदर्शन करते थे।
  • क्यों? AI मॉडल मुख्य रूप से समाचार लेखों पर प्रशिक्षित थे, इसलिए उन्होंने उसी पूर्वाग्रह को विरासत में प्राप्त किया। वे उपन्यासों के लिए बेहतरीन हैं लेकिन अभी भी अव्यवस्थित बुलेटिन बोर्ड और उत्पाद कैटलॉग से भ्रमित हो जाते हैं।

गति बनाम बुद्धिमत्ता
पेपर ने गति पर भी विचार किया।

  • नियम-आधारित प्रोग्राम: बिजली की तरह तेज़ (प्रति पेज मिलीसेकंड में)।
  • AI प्रोग्राम: घोंघे की तरह धीमे (प्रति पेज हजारों मिलीसेकंड में), जिन्हें चलाने के लिए महंगे ग्राफिक्स कार्ड की आवश्यकता होती है।

निष्कर्ष
इंटरनेट केवल समाचार कहानियों का संग्रह नहीं है। यह कई अलग-अलग संरचनाओं का मिश्रण है। पुराने परीक्षण हमें झूठ बोल रहे थे क्योंकि वे केवल समाचारों का परीक्षण कर रहे थे। यह नया बेंचमार्क (WCXB) प्रकट करता है कि हालांकि कंप्यूटर समाचार पढ़ने में माहिर हैं, वे अभी भी वेब के जटिल, संरचित और अव्यवस्थित हिस्सों को समझने के लिए संघर्ष कर रहे हैं। आगे बढ़ने के लिए, हमें सभी वेब पेजों को समाचार लेखों की तरह मानने से बचना होगा।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →