← नवीनतम पेपर
📊 statistics

Agreement is not corroboration: bounding the independence of cultural-heritage authority links

यह अध्ययन प्रदर्शित करता है कि विडीडेटा (Wikidata) में गेट्टी यूएलएएन (Getty ULAN) और लाइब्रेरी ऑफ कांग्रेस अथॉरिटी रिकॉर्ड्स के बीच सहमति स्वतंत्र पुष्टिकरण की गारंटी नहीं देती है, क्योंकि लिंक्स का एक महत्वपूर्ण हिस्सा प्रसारित या अप्राप्य है, जिसके परिणामस्वरूप स्वतंत्रता दर सांख्यिकीय रूप से अनिश्चित बनी रहती है और यह लिंक्ड-डेटा वर्कफ़्लो में उत्पत्ति निर्भरता (provenance dependence) को स्पष्ट रूप से मॉडल करने की महत्वपूर्ण आवश्यकता को रेखांकित करती है।

मूल लेखक: Emin Talip Demirkiran

प्रकाशित 2026-09-17
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Emin Talip Demirkiran

मूल पेपर CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

डिजिटल पुस्तकालयों की इस विशाल, परस्पर जुड़ी दुनिया में, सूचना को खोजना और जोड़ना आसान बनाने के लिए एक शांत क्रांति हो रही है। एक ऐसे वैश्विक नेटवर्क की कल्पना करें जहाँ प्रत्येक संग्रहालय, अभिलेखागार और पुस्तकालय एक ही भाषा बोलता हो, जिससे एक देश का शोधकर्ता दूसरे देश में मौजूद किसी पेंटिंग को या तीसरे देश में वर्णित किसी ऐतिहासिक व्यक्तित्व को तुरंत खोज सके। इसे साकार करने के लिए, ये संस्थान "अथॉरिटी फाइल्स" (authority files) पर निर्भर करते हैं—सावधानीपूर्वक तैयार की गई ऐसी सूचियाँ जो यह सुनिश्चित करती हैं कि हर कोई एक ही व्यक्ति या स्थान के लिए एक ही नाम का उपयोग करे। जब विभिन्न प्रणालियाँ एक नाम पर सहमत होती हैं, तो वे अपने रिकॉर्ड्स को आपस में जोड़ देती हैं, जिससे ज्ञान का एक ऐसा जाल बनता है जो किसी भी एकल संग्रह की तुलना में कहीं अधिक शक्तिशाली होता है।

हालाँकि, जब ये लिंक बनते हैं तो एक सूक्ष्म लेकिन महत्वपूर्ण प्रश्न उठता है: क्या सहमति का अर्थ सत्य है? यदि दो अलग-अलग डेटाबेस किसी प्रसिद्ध कलाकार के लिए एक ही पहचानकर्ता (identifier) सूचीबद्ध करते हैं, तो यह मान लेना लुभावना होता है कि दोनों ने स्वतंत्र रूप से कलाकार की पहचान की पुष्टि की है, जिससे जानकारी की विश्वसनीयता दोगुनी हो जाती है। लेकिन डिजिटल क्षेत्र में, एक प्रणाली ने केवल दूसरे से उस पहचानकर्ता को कॉपी किया हो सकता है, या दोनों ने ही किसी तीसरे, सामान्य स्रोत से इसे लिया हो सकता है। इस परिदृश्य में, सहमति वास्तविक है, लेकिन साक्ष्य स्वतंत्र नहीं हैं। एक वास्तविक, दोहरी-जांची गई पुष्टि और केवल नकल की एक साधारण श्रृंखला के बीच अंतर करना यह जानने के लिए आवश्यक है कि डेटा पर कितना भरोसा किया जाए।

एस्किसेहिर तकनीकी विश्वविद्यालय के एमिन तालिप डेमकिरान द्वारा किया गया एक हालिया अध्ययन विकीडेटा (Wikidata) के भीतर ठीक इसी समस्या पर काम करता है, जो एक विशाल, सहयोगात्मक नॉलेज ग्राफ है और विभिन्न पुस्तकालय प्रणालियों को जोड़ने वाले एक केंद्रीय केंद्र के रूप में कार्य करता है। यह शोध गेटी (Getty) की 'यूनियन लिस्ट ऑफ आर्टिस्ट नेम्स' (ULAN) और लाइब्रेरी ऑफ कांग्रेस (LC) के नाम-प्राधिकार फाइलों के बीच के लिंक पर केंद्रित है, जो सांस्कृतिक विरासत की दुनिया में सबसे महत्वपूर्ण मानकों में से दो हैं। लक्ष्य यह देखना नहीं था कि लिंक मौजूद हैं या नहीं, बल्कि यह निर्धारित करना था कि उनमें से कितने लिंक वास्तव में स्वतंत्र खोज थे और कितने केवल एक-दूसरे की नकल मात्र थे।

इसका उत्तर देने के लिए, शोधकर्ता ने विकीडेटा डेटाबेस से 3,000 विशिष्ट संस्थाओं (entities) के एक स्थिर स्नैपशॉट का परीक्षण किया। प्रत्येक इकाई के लिए, अध्ययन ने "प्रोवेनेंस" (provenance), यानी यह लिंक कैसे बनाया गया था, इसके इतिहास की जांच की। टीम ने सहमति के प्रत्येक उदाहरण को तीन श्रेणियों में से एक में वर्गीकृत किया। कुछ लिंक स्पष्ट रूप से "प्रोपैगेटेड" (propagated) थे, जिसका अर्थ था कि डेटा को एक स्रोत से दूसरे स्रोत में आयात या कॉपी किया गया था। अन्य "स्वतंत्र" (independent) थे, जो स्पष्ट संकेत देते थे कि दोनों स्रोतों ने स्वयं उस लिंक को स्थापित किया था। हालाँकि, एक तीसरा समूह "अनट्रेसेबल" (untraceable) था, जहाँ डिजिटल इतिहास गायब या अस्पष्ट था, जिससे समझौते का मूल रहस्य बना रहा।

परिणामों ने एक सरल सहमति के निशान से कहीं अधिक जटिल परिदृश्य का खुलासा किया। विश्लेषण किए गए 1,546 विशिष्ट कथनों में से, केवल लगभग 256 को स्वतंत्र रूप से स्थापित होने के रूप में पुष्टि की जा सकती थी। एक बहुत बड़ा हिस्सा, 728 कथन, स्पष्ट रूप से प्रोपैगेटेड थे, जिसका अर्थ है कि वे प्रतियां थे। सबसे महत्वपूर्ण निष्कर्ष, हालांकि, उन 562 कथनों के बारे में था जो अनट्रेसेबल श्रेणी में आते थे। क्योंकि इन वस्तुओं के लिए डिजिटल निशान टूट गया था, शोधकर्ता निश्चित रूप से यह नहीं कह सकते थे कि वे स्वतंत्र थे या नकल।

इस लुप्त जानकारी ने एक एकल उत्तर के बजाय संभावनाओं की एक श्रृंखला पैदा कर दी। यदि प्रत्येक अनट्रेसेबल कथन वास्तव में एक प्रति होता, तो स्वतंत्र सहमति की समग्र दर बहुत कम, लगभग 16 प्रतिशत होती। यदि प्रत्येक अनट्रेसेबल कथन वास्तव में स्वतंत्र होता, तो यह दर बढ़कर लगभग 56 प्रतिशत हो जाती। वास्तविक उत्तर इनके बीच कहीं स्थित है, लेकिन डेटा इसे सटीक रूप से नहीं बता सकता। महत्वपूर्ण रूप से, अनिश्चितता का यह पूरा दायरा आधे के निशान को पार करता है, जिसका अर्थ है कि साक्ष्य यह दावा करने के लिए पर्याप्त नहीं हैं कि अधिकांश लिंक स्वतंत्र हैं, न ही यह सिद्ध करते हैं कि वे अधिकतर नकल हैं।

जब शोधकर्ताओं ने केवल उन लिंक्स को देखा जिन्हें वे ट्रैक कर सके, तो तस्वीर स्पष्ट थी: लगभग 71 प्रतिशत ट्रैसेबल समझौते प्रोपैगेटेड थे। यह सुझाव देता है कि जब हम दो प्रणालियों को सहमत देखते हैं, तो यह अक्सर इसलिए होता है क्योंकि एक प्रणाली दूसरे का अनुसरण कर रही है, न कि इसलिए कि दोनों ने अपना स्वयं का होमवर्क किया है। इसके अलावा, अध्ययन ने पाया कि यह घटना लगभग पूरी तरह से लोगों के रिकॉर्ड में केंद्रित थी, विशेष रूप से कलाकारों और ऐतिहासिक हस्तियों के मामले में जो गेटी प्रणाली के माध्यम से जुड़े हुए थे। अन्य प्रकार की सांस्कृतिक विरासत, जैसे स्थानों या वस्तुओं को जोड़ने वाली प्रणालियाँ, इस विशिष्ट संदर्भ में बहुत कम सक्रिय थीं।

अध्ययन यह निष्कर्ष निकालता है कि यद्यपि अथॉरिटी फाइल्स के बीच सहमति डेटा को जोड़ने और उसे उपयोगी बनाने के लिए मूल्यवान है, लेकिन इसे स्वतंत्र सत्यापन समझने की भूल नहीं करनी चाहिए। डिजिटल पुस्तकालयों की दुनिया में, एक कॉपी किया गया पहचानकर्ता नेविगेशन और खोज के लिए उपयोगी तो है, लेकिन यह एक दोहरी-जांची गई तथ्य के समान साक्ष्य का भार प्रदान नहीं करता है। शोध इस बात पर प्रकाश डालता है कि गायब इतिहास केवल दस्तावेज़ीकरण की कमी नहीं है; यह मौलिक रूप से इस बात को बदल देता है जिसे हम जान सकते हैं। बिना किसी स्पष्ट रिकॉर्ड के कि एक लिंक कहाँ से आया, हम यह मान नहीं सकते कि वह एक नई पुष्टि है।

यह कार्य इस बात की याद दिलाता है कि हमारे तेजी से बढ़ते जुड़े हुए डिजिटल जगत में, सूचना जिस पथ का अनुसरण करती है वह सूचना के स्वयं के महत्व जितना ही मायने रखता है। जिस तरह एक इतिहासकार केवल इसलिए किसी तथ्य को स्वीकार नहीं करेगा क्योंकि दो पुस्तकें उसे कहती हैं, बिना यह जांचे कि क्या एक पुस्तक ने दूसरी की नकल की है, डिजिटल प्रणालियों को भी अपने कनेक्शन के स्रोत का हिसाब रखना चाहिए। अध्ययन यह सुझाव नहीं देता है कि ये लिंक बेकार हैं, बल्कि यह तर्क देता है कि हमें एक ही साक्ष्य को दो बार गिनने में सावधानी बरतनी चाहिए। यह स्पष्ट रूप से मॉडल करके कि डेटा कहाँ से आता है और यह स्वीकार करके कि कहाँ से निशान खत्म हो जाते हैं, डिजिटल पुस्तकालय ज्ञान के भविष्य के लिए एक अधिक ईमानदार और विश्वसनीय आधार बना सकते हैं।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →