← नवीनतम पेपर
🔬 physics

Estimating Absolute Web Crawl Coverage From Longitudinal Set Intersections

यह शोध पत्र एक सरल, ग्राउंड-ट्रुथ-मुक्त विधि प्रस्तावित करता है जो क्रमिक क्रॉल के बीच अनुदैर्ध्य (longitudinal) URL ओवरलैप को एक अर्न प्रोसेस (urn process) के रूप में मॉडल करके एक वेब क्रॉल के पूर्ण कवरेज का अनुमान लगाती है, जिसे जर्मन एकेडेमिक वेब पर लगभग 46% कवरेज प्रकट करने के लिए लागू किया गया था।

मूल लेखक: Michael Paris, Grigori Paris, Fabian Baumann

प्रकाशित 2026-03-17
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Michael Paris, Grigori Paris, Fabian Baumann

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक विशाल, निरंतर बदलते हुए पुस्तकालय के मुख्य लाइब्रेरियन हैं, जिसे जर्मन एकेडेमिक वेब (German Academic Web) कहा जाता है। हर छह महीने में, आपकी टीम इस पुस्तकालय से किताबें कॉपी करने के लिए रोबोटों का एक बेड़ा भेजती है। आप जानते हैं कि इस बार आपके रोबोटों ने कितनी किताबें कॉपी कीं (मान लीजिए 10 करोड़), लेकिन आपके मन में एक सवाल कौंध रहा है: "पुस्तकालय में वास्तव में कितनी किताबें हैं?"

चूंकि यह पुस्तकालय अनंत है और लगातार बदल रहा है (नई किताबें आ रही हैं, पुरानी गायब हो रही हैं), आप उन सभी को गिन नहीं सकते। आपके पास कोई मास्टर लिस्ट नहीं है, और न ही आप अपने काम की तुलना किसी अन्य लाइब्रेरियन के काम से कर सकते हैं क्योंकि आप ही इस विशिष्ट कार्य को करने वाले एकमात्र व्यक्ति हैं।

यह शोध पत्र इस प्रश्न का उत्तर देने के लिए एक चतुर और सरल तरीका प्रस्तुत करता है, जिसका उपयोग आप केवल अपने पिछले रिकॉर्ड के माध्यम से कर सकते हैं।

मूल विचार: "फिशिंग नेट" (मछली पकड़ने का जाल) सादृश्य

वेब को मछलियों (URL) से भरे एक विशाल तालाब के रूप में सोचें।

  • समस्या: आप अपना जाल (क्रॉल) फेंकते हैं और 10 करोड़ मछलियाँ पकड़ते हैं। लेकिन आपको नहीं पता कि पूरे तालाब में कुल कितनी मछलियाँ हैं।
  • पुराना तरीका: आमतौर पर, पूरे मछलियों की संख्या का अनुमान लगाने के लिए, आपको दो अलग-अलग लोगों की आवश्यकता होगी जो एक ही समय में जाल फेंकें और देखें कि उन्होंने कितनी मछलियाँ समान रूप से पकड़ी हैं। या, आपको "प्रसिद्ध मछलियों" की एक सूची की आवश्यकता होगी ताकि आप देख सकें कि आपने कितनी छोड़ दीं।
  • नया तरीका (यह शोध पत्र): आप आज जाल फेंकते हैं। फिर, आप छह महीने बाद फिर से जाल फेंकते हैं, और फिर एक साल बाद। आप आज पकड़ी गई मछलियों को देखते हैं और पूछते हैं: "इनमें से कितनी वही मछलियाँ हैं जो मैंने पिछली बार पकड़ी थीं?"

जादुई सूत्र: "अर्न" (Urn) मॉडल

लेखक एक गणितीय अवधारणा का उपयोग करते हैं जिसे "अर्न मॉडल" कहा जाता है। कल्पना कीजिए कि एक विशाल कलश (जार) है जो हर संभव वेबसाइट का प्रतिनिधित्व करने वाली रंगीन गेंदों से भरा है।

  1. टर्नओवर (बदलाव की दर): जब भी आप तालाब में वापस आते हैं, कुछ मछलियाँ मर जाती हैं या तैरकर चली जाती हैं, और नई मछलियाँ जन्म लेती हैं। लेखकों ने पाया कि लगभग 27% वेबसाइटें हर साल गायब हो जाती हैं या बदल जाती हैं, जबकि 73% वैसी ही रहती हैं।
  2. ओवरलैप (जुड़ाव): जब आप दो बार जाल फेंकते हैं, तो आपके दोनों जालों में पकड़ी गई मछलियों की संख्या दो चीजों पर निर्भर करती है:
    • तालाब में वास्तव में कितनी मछलियाँ हैं (कुल आकार)।
    • प्रत्येक बार आपने कितनी मछलियाँ पकड़ीं (आपके जाल का आकार)।

वर्षों के दौरान आपकी विभिन्न पकड़ के बीच के ओवरलैप के पैटर्न को देखकर, आप पीछे की ओर गणना कर सकते हैं ताकि तालाब के आकार का पता लगाया जा सके।

"सेल्फ-इंटरसेक्शन" (स्व-प्रतिच्छेदन) की तरकीब

यहाँ चतुर हिस्सा है:

  • यदि आप आज एक मछली पकड़ते हैं, और अगली बार भी वही सटीक मछली पकड़ते हैं, तो इसका मतलब है कि आपका जाल बहुत अच्छा है या तालाब छोटा है।
  • यदि आप अपनी पिछली पकड़ के साथ लगभग कोई भी मछली साझा नहीं करते हैं, तो इसका मतलब है कि या तो आपका जाल बहुत छोटा है, या तालाब इतना विशाल है कि आप केवल उसकी सतह को ही छू पा रहे हैं।

लेखकों ने अपने डेटा को एक ग्राफ पर अंकित किया। उन्होंने देखा कि समय के अंतराल के बढ़ने के साथ "ओवरलैप" कैसे कम होता गया।

  • ढलान (Slope): गिरावट की तीव्रता ने बताया कि वेब कितनी तेजी से बदलता है (27% टर्नओवर दर)।
  • इंटरसेप्ट (Intercept): रेखा का शुरुआती बिंदु (यदि वे जादुई रूप से एक ही क्षण में दो जाल पकड़ पाते) उन्हें कवरेज (Coverage) बताता।

परिणाम: आपने 46% पकड़ा

जब उन्होंने इस गणित को जर्मन एकेडेमिक वेब पर लागू किया, तो उन्हें एक आश्चर्यजनक उत्तर मिला:

  • कवरेज: उनके रोबोट वास्तव में उन सभी एकेडेमिक वेबसाइटों का लगभग 46% हिस्सा कैप्चर कर रहे हैं जिन्हें कैप्चर किया जा सकता है।
  • स्थिरता: वेब अपेक्षाकृत स्थिर है; साल-दर-साल लगभग 4 में से 3 वेबसाइटें वैसी ही रहती हैं।

यह क्यों महत्वपूर्ण है

यह एक बड़ी बात है क्योंकि:

  1. बाहरी मदद की आवश्यकता नहीं: आपको तुलना करने के लिए वेबसाइटों की किसी "परफेक्ट लिस्ट" की आवश्यकता नहीं है। आपको बस अपने स्वयं के इतिहास की आवश्यकता है।
  2. कोई प्रतिद्वंद्वी लाइब्रेरियन नहीं: आपको नोट्स की तुलना करने के लिए किसी अन्य संगठन के साथ टीम बनाने की आवश्यकता नहीं है।
  3. आत्मविश्वास: अब, यदि कोई शोधकर्ता इस डेटा का उपयोग AI को प्रशिक्षित करने के लिए करता है, तो वे जानते हैं, "ठीक है, हमारे पास लगभग आधा चित्र है। यह काफी अच्छा है, लेकिन हम दूसरा आधा हिस्सा खो चुके हैं।"

सीमाएँ (बारीक विवरण)

लेखक स्वीकार करते हैं कि यह जादू नहीं है। यह मान लेता है कि:

  • "तालाब" का आकार अध्ययन के दौरान बहुत अधिक विस्फोट नहीं कर रहा है या सिकुड़ नहीं रहा है।
  • आपका जाल मछलियों को कुछ हद तक यादृच्छिक (randomly) तरीके से पकड़ता है (केवल सबसे बड़ी, आसानी से पकड़ में आने वाली मछलियों को नहीं)।
  • यह तब सबसे अच्छा काम करता है जब आपके पास कई स्नैपशॉट्स हों (जैसे कि वे 15 क्रॉल जिनका उन्होंने उपयोग किया)।

संक्षेप में

यह शोध पत्र हमें सिखाता है कि कैसे एक चलते हुए लक्ष्य के आकार का अनुमान लगाया जाए, यह देखकर कि हमने पहले ही कितनी बार उस पर प्रहार किया है। यह इंटरनेट के "युद्ध के कोहरे" (fog of war) को एक स्पष्ट, गणना योग्य मानचित्र में बदल देता है, जो हमें दिखाता है कि हमने शैक्षणिक दुनिया के कितने हिस्से को सफलतापूर्वक संग्रहित किया है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →