MajinBook: An open catalogue of digitally mediated world literature
यह शोध पत्र माजिनबुक (MajinBook) का परिचय देता है, जो एक खुला कैटलॉग है जो 539,000 से अधिक डिजिटल रूप से मध्यस्थता वाले अंग्रेजी-भाषा की पुस्तकों के उच्च-परिशुद्धता, मशीन-पठनीय संग्रह को बनाने के लिए शैडो लाइब्रेरीज़ के मेटाडेटा को गुडरीड्स (Goodreads) डेटा के साथ जोड़ता है, जबकि पारंपरिक कॉर्पस पूर्वाग्रहों को संबोधित करता है और यूरोपीय संघ एवं अमेरिकी ढांचों के तहत अनुसंधान के लिए परियोजना की कानूनी अनुमेयता पर चर्चा करता है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
यहाँ MajinBook पेपर का स्पष्टीकरण दिया गया है, जिसे रोजमर्रा की भाषा में अनुवादित किया गया है ताकि अवधारणाओं को स्पष्ट करने के लिए उपमाओं (analogies) का उपयोग किया जा सके।
मुख्य विचार: एक बेहतर लाइब्रेरी मैप बनाना
कल्पना कीजिए कि आप यह अध्ययन करना चाहते हैं कि लोग कैसे पढ़ते हैं और दुनिया के लिए कौन सी कहानियाँ महत्वपूर्ण हैं। इसके लिए, आपको किताबों का एक विशाल मानचित्र (map) चाहिए।
लंबे समय से, शोधकर्ता HathiTrust का उपयोग कर रहे थे, जो विश्वविद्यालयों द्वारा बनाई गई एक विशाल, आधिकारिक लाइब्रेरी की तरह है। इसमें लाखों किताबें हैं, लेकिन इसकी दो बड़ी समस्याएँ हैं:
- यह लॉक है: कई किताबें कॉपीराइट के अधीन हैं, इसलिए आप पूरा टेक्स्ट नहीं पढ़ सकते; आप उन्हें केवल एक सुरक्षित, प्रतिबंधित खिड़की के माध्यम से देख सकते हैं।
- यह अव्यवस्थित है: कई किताबें केवल भौतिक कागज से स्कैन की गई थीं। कंप्यूटर अक्सर अक्षरों को गलत पढ़ लेता है (जैसे 'o' को '0' समझ लेना), जिससे उन्नत कंप्यूटर विश्लेषण के लिए टेक्स्ट का उपयोग करना कठिन हो जाता है।
इस पेपर के लेखकों को एक बेहतर मैप चाहिए था। वे "शैडो लाइब्रेरीज" (जैसे Library Genesis और Z-Library) की ओर मुड़े। इन्हें विशाल, भूमिगत डिजिटल बाजारों के रूप में सोचें जहाँ लाखों किताबें मुफ्त में साझा की जाती हैं। इनमें आधिकारिक लाइब्रेरी की तुलना में बहुत अधिक किताबें हैं, लेकिन ये अराजक हैं। इनके "शेल्फ" अव्यवस्थित हैं, लेबल अक्सर गलत या गायब होते हैं, और यह बताना मुश्किल है कि कौन सी किताब कौन सी है।
MajinBook वह प्रोजेक्ट है जिसने इस अराजकता को साफ किया। इसने Goodreads (किताब प्रेमियों के सोशल नेटवर्क) के व्यवस्थित डेटा के साथ "शैडो लाइब्रेरी" की अस्त-व्यस्त फाइलों को जोड़कर 5,39,000 अंग्रेजी किताबों (साथ ही फ्रेंच, जर्मन और स्पेनिश में लाखों अन्य) का एक उच्च-गुणवत्ता वाला, व्यवस्थित कैटलॉग बनाया।
सामग्री: उन्होंने इसे कैसे बनाया
1. "डिजिटल-ओनली" नियम (छलनी)
शैडो लाइब्रेरीज में कई प्रारूपों (formats) में किताबें हैं। कुछ PDF (कागज के पन्नों के डिजिटल स्कैन) हैं, और कुछ EPUB (नेटिव डिजिटल फाइलें, जैसे एक साफ वेबपेज) हैं।
लेखकों ने सभी PDFs को फेंकने का निर्णय लिया।
- उपमा: कल्पना कीजिए कि आप सूप के स्वाद का अध्ययन करने की कोशिश कर रहे हैं। PDF सूप की फोटो लेने और उस फोटो को चखने की कोशिश करने जैसा है। यह धुंधला और असंगत है। EPUB एक कटोरे में रखे वास्तविक सूप की तरह हैं; आप हर सामग्री का स्वाद स्पष्ट रूप से ले सकते हैं।
- परिणाम: केवल "साफ" डिजिटल फाइलों (EPUBs) को रखकर, उन्होंने कुछ बहुत पुरानी किताबें खो दीं (क्योंकि वे अभी तक डिजिटाइज़ नहीं हुई थीं), लेकिन उन्हें एक ऐसा डेटासेट मिला जो बहुत अधिक स्वच्छ, कंप्यूटर के लिए पढ़ने में आसान और आश्चर्यजनक रूप से विभिन्न भाषाओं में विविध है।
2. "वर्क बनाम एडिशन" की समस्या
किताबों की दुनिया में, एक वर्क (कहानी स्वयं, जैसे The Odyssey) और एक एडिशन (एक विशिष्ट संस्करण, जैसे 1990 का अनुवाद या 2020 का ऑडियोबुक) के बीच अंतर होता है।
- समस्या: शैडो लाइब्रेरीज में The Odyssey के लिए 50 अलग-अलग फाइलें हो सकती हैं। यदि आप उन सभी को 50 अलग किताबें मानकर गिनते हैं, तो आपका डेटा पक्षपाती हो जाएगा।
- समाधान: लेखकों ने Goodreads का उपयोग एक "कंकाल" या "फाइलिंग सिस्टम" के रूप में किया। Goodreads पहले से ही जानता है कि वे सभी 50 संस्करण एक ही "वर्क" से संबंधित हैं। उन्होंने इस जानकारी का उपयोग करके अव्यवस्थित शैडो लाइब्रेरी फाइलों को एक साथ समूहबद्ध किया, जिससे उन्हें सही कहानी और उसके मूल प्रकाशन की तारीख से जोड़ा जा सका।
3. मिलान का खेल (भूसे के ढेर में सुई ढूँढना)
आप एक अव्यवस्थित शैडो लाइब्रेरी फाइल को Goodreads के सही एंट्री से कैसे जोड़ सकते हैं?
- रणनीति: उन्होंने कवर आर्ट या पेज काउंट (जो अक्सर बदल जाता है) जैसे सटीक मिलान की कोशिश नहीं की। इसके बजाय, उन्होंने आइडेंटिफायर (जैसे ISBN नंबर) और शीर्षक पर ध्यान दिया।
- फजी लॉजिक (Fuzzy Logic): कभी-कभी शैडो लाइब्रेरी में शीर्षक थोड़ा गलत लिखा होता है (जैसे, "Harry Pottter")। लेखकों ने "फजी मैचिंग" नामक एक कंप्यूटर ट्रिक का उपयोग किया ताकि यह महसूस किया जा सके कि, "हे, यह शायद Harry Potter है।"
- सुरक्षा जांच: उन्होंने इस पद्धति का परीक्षण करने के लिए मनुष्यों से 200 रैंडम मैचों की जांच करवाई। उन्होंने पाया कि यदि कंप्यूटर ने 80 या उससे अधिक का "कॉन्फिडेंस स्कोर" दिया, तो वह लगभग हमेशा सही था। उन्होंने यह सुनिश्चित करने के लिए कि उनका कैटलॉग अत्यधिक सटीक है, अपना अंतिम नियम 80-पॉइंट थ्रेशोल्ड रखा।
परिणाम: उन्हें क्या मिला?
- एक विशाल, स्वच्छ संग्रह: उन्होंने 5,39,000 अंग्रेजी किताबों की एक सूची बनाई है जो कंप्यूटर द्वारा विश्लेषण के लिए तैयार है।
- समय का पूर्वाग्रह (लेकिन एक उपयोगी एक): क्योंकि उन्होंने केवल "नेटिव डिजिटल" फाइलें रखीं, उनके संग्रह में 1800 के दशक की कम और 2000 के दशक की अधिक किताबें हैं।
- पेपर का दृष्टिकोण: लेखक स्वीकार करते हैं कि यह सभी साहित्य का पूर्ण इतिहास नहीं है। इसके बजाय, यह 21वीं सदी की डिजिटल संस्कृति का एक पूर्ण इतिहास है। यह हमें दिखाता है कि डिजिटल युग में अभी अभी कौन सी किताबें लोकप्रिय हैं।
- अधिक भाषाएँ: आश्चर्यजनक रूप से, डिजिटल फाइलों के लिए फ़िल्टर करके, उन्हें भाषाओं का अधिक विविध मिश्रण मिला। "PDF" का ढेर मुख्य रूप से अंग्रेजी था, लेकिन "EPUB" के ढेर में फ्रेंच, जर्मन, स्पेनिश और अन्य भाषाओं की अच्छी मात्रा शामिल थी।
कानूनी "बारीकियां"
पेपर एक पेचीदा सवाल का जवाब देता है: क्या शोध के लिए इन शैडो लाइब्रेरीज का उपयोग करना कानूनी है?
- तर्क: लेखक तर्क देते हैं कि वे किताबों को बेच या कहानियों को वितरित नहीं कर रहे हैं। वे केवल तथ्यों की एक सूची (शीर्षक, लेखक, तारीख) प्रकाशित कर रहे हैं।
- उपमा: यह एक लाइब्रेरियन द्वारा कार्ड कैटलॉग बनाने जैसा है। कार्ड कैटलॉग में कहानी नहीं होती; यह केवल आपको बताता है कि कहानी कहाँ है और इसे किसने लिखा है। लेखकों का दावा है कि अनुसंधान उद्देश्यों के लिए इस "कार्ड कैटलॉग" का निर्माण करना अमेरिका और यूरोपीय संघ दोनों में "टेक्स्ट एंड डेटा माइनिंग" के लिए कानूनी अपवादों के अंतर्गत आता है।
सारांश
MajinBook एक ऐसा उपकरण है जो "शैडो लाइब्रेरीज" की अराजक, विशाल और अक्सर अव्यवस्थित दुनिया को Goodreads के सामाजिक ज्ञान का उपयोग करके व्यवस्थित करता है। परिणाम एक अत्यंत स्वच्छ, कंप्यूटर-अनुकूल किताबों की सूची है जो शोधकर्ताओं को डिजिटल युग में संस्कृति, साहित्य और पढ़ने की आदतों का अध्ययन करने में मदद करती है, और साथ ही कॉपीराइट के जटिल कानूनी परिदृश्य को भी संभालती है।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।