← नवीनतम पेपर
💬 NLP

Robust, Scalable Detection of Text Containment in Large Web-Crawled Corpora

यह शोध पत्र FindMyText को प्रस्तुत करता है, जो एक स्केलेबल, ओपन-सोर्स पायथन टूल है जो बड़े वेब-क्रॉल किए गए कॉर्पोरा में सटीक रूप से 'नियर-वर्बेटिम' (लगभग शब्दशः) टेक्स्ट की मौजूदगी का पता लगाने के लिए डिस्ट्रिब्यूटेड फिंगरप्रिंट चेनिंग का लाभ उठाता है, और कई डेटासेट्स पर मौजूदा तरीकों से बेहतर प्रदर्शन करता है।

मूल लेखक: Lars Henry Berge Olsen, Pierre Lison, Martin Jullum, Mark Anderson

प्रकाशित 2026-07-14
📖 7 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Lars Henry Berge Olsen, Pierre Lison, Martin Jullum, Mark Anderson

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आपके पास अरबों किताबों, वेबसाइटों और लेखों वाला एक विशाल, धूल भरा पुस्तकालय है—इतना अधिक कि इसे पढ़ने में एक इंसान का पूरा जीवन बीत जाएगा। अब, कल्पना कीजिए कि कोई आपको एक प्रसिद्ध उपन्यास का एक एकल अनुच्छेद (paragraph) देता है और पूछता है: "क्या यह सटीक अनुच्छेद उस विशाल पुस्तकालय में मौजूद है?"

यह वह पहेली है जिसे FindMyText हल करता है। यह एक नया डिजिटल जासूसी उपकरण है जिसे यह पता लगाने के लिए डिज़ाइन किया गया है कि क्या टेक्स्ट का एक विशिष्ट हिस्सा डेटा के एक विशाल संग्रह के भीतर मौजूद है, भले ही उस टेक्स्ट को थोड़ा बदला गया हो, पुनर्गठित किया गया हो, या अन्य शब्दों के ढेर के बीच छिपाया गया हो।

समस्या: "देखना" पर्याप्त क्यों नहीं है

अतीत में, यदि आप घास के ढेर में सुई ढूँढना चाहते थे, तो आप शायद सुई के आकार की वस्तु को ही देखते थे। लेकिन क्या होगा यदि सुई नीली रंगी हुई हो, थोड़ी मुड़ी हुई हो, या उसका छेद एक बटन से बदल दिया गया हो? इंटरनेट को स्कैन करते समय कंप्यूटर के साथ ऐसा ही होता है।

जब बड़े AI मॉडल को प्रशिक्षित किया जाता है, तो वे वेब से टेराबाइट्स टेक्स्ट को "खा" जाते हैं। लेकिन खाने से पहले, टेक्स्ट को "पकाया" जाता है: विराम चिह्न बदल दिए जाते हैं, वाक्य काट दिए जाते हैं, और फॉर्मेटिंग हटा दी जाती है। यदि आप पुराने तरीकों का उपयोग करके शब्दों के इस अस्त-व्यस्त ढेर में किसी कॉपीराइट वाली किताब के वाक्य को खोजने की कोशिश करते हैं, तो आप धोखा खा सकते हैं।

पुराने उपकरण अक्सर ऐसे फिंगरप्रिंट स्कैनर की तरह काम करते हैं जो केवल यह गिनते हैं कि कितने फिंगप्रिंट मेल खाते हैं, यह अनदेखा करते हुए कि वे फिंगप्रिंट कहाँ हैं। यदि आपके पास बिल्लियों के बारे में एक किताब है और कुत्तों के बारे में एक किताब है, और दोनों में ही "the", "cat", और "dog" जैसे शब्द (बस अलग क्रम में) मौजूद हैं, तो एक पुराना उपकरण कह सकता है, "अरे, ये समान दिखते हैं!" लेकिन यह एक गलत अलार्म है। यह यह कहने जैसा है कि दो लोग जुड़वां हैं क्योंकि दोनों की दो आँखें और एक नाक है, यह अनदेखा करते हुए कि उनमें से एक शेफ है और दूसरा पायलट।

पेपर स्पष्ट रूप से इन "समानता" वाले उपकरणों (जैसे कि वे जो केवल मेल खाने वाले शब्दों को गिनते हैं या "डेंस" वेक्टर मैप का उपयोग करते हैं) पर निर्भर रहने के खिलाफ तर्क देता है। उन्होंने पाया कि ये तरीके इस विशिष्ट कार्य के लिए आसानी से चकमा खा जाते हैं जो दिखने में समान हैं लेकिन वास्तव में एक जैसे नहीं हैं। उन्होंने यह भी दिखाया कि सरल "सटीक मिलान" (exact match) खोज विफल हो जाती है क्योंकि पुस्तकालय में मौजूद टेक्स्ट मूल टेक्स्ट के साथ 100% समान नहीं होता; उसे साफ और रीफॉर्मेट किया गया होता है।

समाधान: "चेन रिएक्शन" जासूस

यहाँ FindMyText आता है। केवल फिंगप्रिंट गिनने के बजाय, यह उपकरण श्रंखलाओं (chains) की तलाश करता है।

कल्पना कीजिए कि आप कागज के दो लंबे, फटे हुए टुकड़ों को मिलाने की कोशिश कर रहे हैं।

  1. पुराना तरीका: आप गिनते हैं कि दोनों कागजों पर कितने अक्षर समान हैं। यदि उनमें 50 अक्षर समान हैं, तो आप अनुमान लगाते हैं कि वे संबंधित हो सकते हैं।
  2. FindMyText का तरीका: आप एक अनुक्रम (sequence) की तलाश करते हैं। आप पहले कागज पर एक अक्षर "A" पाते हैं, फिर दूसरे कागज पर "A" की तलाश करते हैं। फिर आप अगले अक्षर, "B" की तलाश करते हैं, और जांचते हैं कि क्या यह दूसरे कागज पर "A" के ठीक बाद आता है, बिल्कुल वैसे ही जैसे यह पहले कागज पर था। फिर आप "C" की तलाश करते हैं, और इसी तरह आगे बढ़ते हैं।

यदि आप अक्षरों की एक लंबी, अटूट श्रृंखला पाते हैं जो एक ही क्रम में दिखाई देती है, तो आप जानते हैं कि आपने एक वास्तविक मिलान ढूंढ लिया है। भले ही कागजों को इधर-उधर कर दिया गया हो, यदि अक्षरों की एक लंबी श्रृंखला एक साथ रहती है, तो यह एक पुख्ता सबूत (smoking gun) है।

यह उपकरण इन "फिंगरप्रिंट्स" (टेक्स्ट के टुकड़ों के छोटे डिजिटल सारांश) को बनाने के लिए विन्नोइंग (winnowing) नामक एक चतुर तकनीक का उपयोग करता है। इसके बाद यह उन्हें एक ग्राफ पर मैप करता है। यदि फिंगरप्रिंट ग्राफ पर एक सीधी, तिरछी रेखा बनाते हैं, तो इसका मतलब है कि वे एक निरंतर श्रृंखला का हिस्सा हैं—एक वास्तविक प्रति। यदि वे यादृच्छिक रूप से बिखरे हुए हैं, तो यह केवल एक संयोग है।

वे कितने आश्वस्त हैं?

शोधकर्ताओं ने केवल अनुमान नहीं लगाया; उन्होंने एक सिंथेटिक बेंचमार्क (एक नकली परीक्षण वातावरण) बनाया ताकि यह देखा जा सके कि क्या उनका उपकरण काम करता है। उन्होंने हजारों "पॉजिटिव" मामले (जहाँ टेक्स्ट निश्चित रूप से कॉपी किया गया था लेकिन संपादित किया गया था) और "नेगेटिव" मामले (जहाँ टेक्स्ट को समान दिखने के लिए फिर से लिखा गया था लेकिन वह वास्तव में कॉपी नहीं था) बनाए।

उन्होंने तीन विशाल डेटासेट के विरुद्ध FindMyText का परीक्षण किया:

  • Wikipedia: 381,000 लेख।
  • ArXiv: 245,000 वैज्ञानिक शोध पत्र।
  • HPLT: एक विशाल वेब क्रॉल जिसमें 50.7 मिलियन से अधिक सामग्री के टुकड़े शामिल हैं।

परिणाम चौंकाने वाले थे। इन परीक्षणों में, पुराने तरीकों (जैसे साझा फिंगरप्रिंट गिनना या AI एम्बेडिंग का उपयोग करना) ने अक्सर विफलता दिखाई, और उनके स्कोर यादृच्छिक अनुमान (AUC-ROC लगभग 0.5 से 0.6) के करीब थे। लेकिन FindMyText के "चेन-आधारित" तरीके ने अविश्वसनीय रूप से उच्च स्कोर किया, Wikipedia पर 0.998 का AUC-ROC और HPLT डेटासेट पर 1.00 का स्कोर प्राप्त किया।

साधारण भाषा में: जब टूल ने कहा "हाँ, यह टेक्स्ट इसमें मौजूद है," तो वह लगभग हर बार सही था, भले ही टेक्स्ट को टुकड़ों में बांटा गया हो, उसका केस (casing) बदला गया हो, या उसमें रैंडम कचरा डाला गया हो। यह 50 मिलियन आइटमों के डेटाबेस में आधे सेकंड से भी कम समय (450 ms) में मिलान ढूंढ सकता था।

यह क्यों महत्वपूर्ण है

यह केवल "छिपे हुए टेक्स्ट को खोजने" का खेल नहीं है। पेपर इस बात पर प्रकाश डालता है कि यह कॉपीराइट के लिए अत्यंत महत्वपूर्ण है। यदि कोई कंपनी दावा करती है कि उन्होंने अपने AI को प्रशिक्षित करने के लिए किसी विशिष्ट कॉपीराइट वाली पुस्तक का उपयोग नहीं किया है, तो FindMyText उस विशाल प्रशिक्षण डेटा की जांच कर सकता है कि क्या उस पुस्तक का टेक्स्ट उसके अंदर छिपा हुआ है, भले ही उसे थोड़ा बदला गया हो।

यह टूल मजबूत (robust) होने के लिए डिज़ाइन किया गया है। यह समझता है कि वास्तविक दुनिया का डेटा अव्यवस्थित होता है। इसे इस बात से फर्क नहीं पड़ता कि कोई कॉमा गायब है या किसी शब्द को बड़े अक्षर (capitalization) में लिखा गया है; यह फिंगरप्रिंट की श्रृंखला पर ध्यान केंद्रित करता है।

यह क्या नहीं है

यह ध्यान रखना महत्वपूर्ण है कि यह टूल क्या नहीं करता है। यह आपको यह नहीं बताता कि क्या दो टेक्स्ट का अर्थ (meaning) समान है (semantic similarity)। यदि आप एक उदास कुत्ते के बारे में कविता लिखते हैं और कोई दूसरा व्यक्ति पूरी तरह से अलग शब्दों का उपयोग करके एक खुश कुत्ते के बारे में कविता लिखता है, तो FindMyText उन्हें मैच के रूप में फ्लैग नहीं करेगा। यह केवल इस बात की परवाह करता है कि क्या शब्दों का सटीक क्रम (या उसका एक बहुत करीबी संस्करण) लाइब्रेरी में मौजूद है।

लेखक इन परिणामों पर अपने प्रयोगों के आधार पर आश्वस्त हैं, लेकिन वे यह भी बताते हैं कि यह टूल वर्तमान में टेक्स्ट कंटेनमेंट (text containment) के लिए एक "सर्च इंजन" है। वे भविष्य में प्रसिद्ध डेटासेट के लिए प्री-मेड इंडेक्स जारी करने की योजना बना रहे हैं, लेकिन फिलहाल, यह एक शक्तिशाली, ओपन-सोर्स टूल है जो साबित करता है कि आप घास के ढेर में सुई को ढूंढ सकते हैं, भले ही सुई मुड़ी हुई और रंगी हुई हो।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →