The name-collision burden of name-based author attribution is unequal across name origins: a measurement in OpenAlex, and an identifier-based remedy (SigmaCV)
यह अध्ययन ओपनएलेक्स (OpenAlex) डेटाबेस के भीतर एंग्लोफोन और अन्य समकक्षों की तुलना में पूर्वी एशियाई शोधकर्ताओं द्वारा सामना किए जाने वाले नाम टकराव (name collisions) के काफी उच्च बोझ को परिमाणित करता है, जो यह प्रदर्शित करता है कि नाम-आधारित एट्रिब्यूशन स्वाभाविक रूप से असमान है और निष्पक्ष अनुसंधान मूल्यांकन सुनिश्चित करने के लिए सिग्मासीवी (SigmaCV) जैसे पहचानकर्ता-आधारित समाधानों को अपनाने की वकालत करता है।
मूल पेपर CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
तकनीकी सारांश: OpenAlex में नाम-टकराव का बोझ और SigmaCV का समाधान
समस्या विवरण
जिम्मेदार अनुसंधान मूल्यांकन (research assessment) के लिए विद्वत्तापूर्ण कार्यों का विशिष्ट शोधकर्ताओं के साथ सही ढंग से जुड़ा होना आवश्यक है। हालाँकि, वर्तमान अभ्यास का एक महत्वपूर्ण हिस्सा अभी भी निरंतर पहचानकर्ताओं (persistent identifiers) के बजाय नाम की स्ट्रिंग्स (name strings) के आधार पर कार्यों को संबद्ध करता है। यह दृष्टिकोण सामान्य उपनामों (surnames) के लिए और गैर-लैटिन लिपियों (विशेष रूपकर पूर्वी-एशियाई नामों) से रोमन लिप्यंतरित (romanized) नामों के लिए व्यवस्थित रूप से विफल हो जाता है, जिससे "नाम-टकराव" (name collisions) की स्थिति उत्पन्न होती है, जहाँ कई अलग-अलग शोधकर्ता संस्थाएं एक ही सामान्यीकृत नाम साझा करती हैं। यह शोध पत्र तर्क देता है कि यह अस्पष्टता सममित (symmetric) नहीं है; नाम-टकराव का बोझ असमान रूप से पूर्वी-एशियाई नामों वाले शोधकर्ताओं पर पड़ता है, जो असमान मूल्यांकन के लिए एक संरचनात्मक पूर्व शर्त बनाता है। जबकि पूर्ववर्ती कार्यों ने इस प्रभाव की दिशा स्थापित की थी, इस शोध पत्र का लक्ष्य ओपन स्कॉलरली डेटा में ORCID-युक्त लेखकों की पूरी आबादी में इस बोझ की मात्रा को मापना है।
कार्यप्रणाली
यह अध्ययन मार्च की एक पूर्ण स्नैपशॉट (snapshot) का उपयोग करता है जो OpenAlex डेटाबेस से ली गई है, जिसमें लगभग 113.6 मिलियन लेखक संस्थाएं शामिल हैं। विश्लेषण उन ~4.63 मिलियन लेखकों पर केंद्रित है जिनके पास ORCID iD है।
जनसंख्या स्तरीकरण (Population Stratification): लेखकों को उनके अंतिम ज्ञात संस्थान के देश के आधार पर तीन समूहों में विभाजित किया गया है:
- पूर्वी-एशियाई (East-Asian): जापान, चीन, दक्षिण कोरिया, ताइवान, हांगकांग।
- आंग्लोफोन (Anglophone): अमेरिका, यूके, ऑस्ट्रेलिया, कनाडा, न्यूजीलैंड, आयरलैंड।
- अन्य (Other): महाद्वीपीय यूरोप और ब्राजील (एक मोटे तौर पर लैटिन-स्क्रिप्ट बेसलाइन के रूप में कार्य करता है)।
- नोट: देश का उपयोग नाम की उत्पत्ति और रोमन लिप्यंतरण के जोखिम के प्रॉक्सी (proxy) के रूप में किया गया है, न कि स्व-घोषित जातीयता के रूप में।
मैचिंग ऑपरेटर्स (Matching Operators): लेखक तीन अलग-अलग एट्रिब्यूशन रणनीतियों के लिए टकराव गणना (collision counts) की गणना करने के लिए एक पारदर्शी, स्व-परिभाषित सटीक-नाम ऑपरेटर (लोअरकेसिंग, एक्सेंट-फोल्डिंग, व्हाइटस्पेस-कोलैप्सिंग) को परिभाषित करते हैं:
- पूर्ण-नाम संस्था गणना (Full-Name Entity Count - ऊपरी सीमा): उन OpenAlex लेखक संस्थाओं की संख्या जो सटीक सामान्यीकृत पूर्ण नाम साझा करती हैं। इसमें संभावित डेटाबेस ओवर-स्प्लिटिंग (over-splitting) भी शामिल है।
- ORCID-प्रतिबंधित गणना (ORCID-Restricted Count - रूढ़िवादी निचली सीमा): पूर्ण-नाम मिलानों का वह उपसमुच्चय (subset) जिनके पास भी ORCID है। चूंकि अलग-अलग ORCIDs अलग-अलग वास्तविक व्यक्तियों का प्रतिनिधित्व करते हैं, इसलिए यह समान नाम साझा करने वाले वास्तविक व्यक्तियों की संख्या के रूढ़िवादी प्रॉक्सी के रूप में कार्य करता है।
- प्रारंभिक + उपनाम गणना (Initial + Surname Count - लेगेसी सबसे खराब स्थिति): वे संस्थाएं जो एक ही प्रथम-प्रारंभिक (first-initial) और उपनाम साझा करती हैं, जो नाम-स्ट्रिंग-मात्र मिलान के लिए सबसे खराब स्थिति (legacy citation styles) का प्रतिनिधित्व करती हैं।
सांख्यिकीय विश्लेषण: अध्ययन नमूना अनुमानों (sampling estimates) के बजाय सटीक जनसंख्या सांख्यिकी (माध्यिका, इंटरक्वाटाइल रेंज, 90वें पर्सेंटाइल) की गणना करता है। यह प्रभाव आकार (effect sizes) को मापने के लिए रैंक-बाइसेरियल सहसंबंध () का उपयोग करता है और प्रकाशन मात्रा, क्षेत्र और करियर आयु के लिए समायोजन करने हेतु नेगेटिव-बाइनोमियल रिग्रेशन का उपयोग करता है।
मुख्य परिणाम
अध्ययन पाता है कि नाम-टकराव का बोझ बड़ा है और नाम की उत्पत्ति के आधार पर अत्यधिक असमान है, और यह असमानता तब और बढ़ जाती है जब एट्रिब्यूशन रणनीतियां कम विशिष्ट होती जाती हैं।
ORCID-प्रतिबंधित रणनीति (वास्तविक-व्यक्ति प्रॉक्सी):
- माध्य (median) पूर्वी-एशियाई शोधकर्ता अपने नाम को 3 अलग-अलग वास्तविक लोगों के साथ साझा करता है (IQR 1–17)।
- इसके विपरीत, माध्य आंग्लोफोन और "अन्य" शोधकर्ता का नाम अद्वितीय (माध्य 1) होता है।
- 10.5% पूर्वी-एशियाई शोधकर्ता कम से कम 100 अलग-अलग वास्तविक लोगों के साथ नाम साझा करते हैं, जबकि आंग्लोफोन के लिए यह 0.9% और "अन्य" समूह के लिए 0.1% है।
- प्रभाव आकार बड़ा है ( बनाम आंग्लोफोन; बनाम अन्य)।
पूर्ण-नाम संस्था रणनीति:
- माध्य पूर्वी-एशियाई शोधकर्ता 9 संस्थाओं से मेल खाता है (बनाम अन्य के लिए 1), जो डेटाबेस ओवर-स्प्लिटिंग और वास्तविक टकराव दोनों को दर्शाता है।
प्रारंभिक + उपनाम रणनीति (लेगेसी सबसे खराब स्थिति):
- यहाँ असमानता सबसे चरम है। माध्य पूर्वी-एशियाई शोधकर्ता 4,846 विशिष्ट पहचानों के साथ टकराता है (IQR 1,240–16,548)।
- इस रणनीति के तहत 92.3% पूर्वी-एशियाई शोधकर्ता कम से कम 100 पहचानों के साथ टकराते हैं।
- आंग्लोफोन और "अन्य" के माध्य क्रमशः 69 और 34 हैं।
- प्रभाव आकार बहुत बड़े हैं ( और )।
मजबूती जाँच (Robustness Checks):
- प्रकाशन मात्रा: प्रकाशनों की संख्या के लिए समायोजन करने वाला एक नेगेटिव-बाइनोमियल रिग्रेशन दिखाता है कि पूर्वी-एशियाई स्तर अभी भी आंग्लोफोन स्तर की तुलना में अपेक्षित टकराव संख्या से लगभग 6.5 से 8.6 गुना अधिक बोझ वहन करता है। यह अंतर पूर्वी-एशियाई लेखकों के बीच उच्च उत्पादकता का परिणाम नहीं है।
- संवेदनशीलता विश्लेषण: संस्थान के देश के बजाय उपनाम द्वारा लेखकों को पुनर्वर्गीकृत करने से देखा गया अंतर और मजबूत होता है, जो पुष्टि करता है कि देश का प्रॉक्सी एक रूढ़िवादी (conservative) दृष्टिकोण है।
योगदान
- नाम अस्पष्टता का परिमाणीकरण: यह शोध पत्र ओपन स्कॉलरली डेटा में नाम-टकराव के बोझ का पहला प्रत्यक्ष, पूर्ण-जनसंख्या परिमाणीकरण प्रदान करता है। यह बोझ को तीन परतों (पूर्ण-नाम संस्थाएं, ORCID-प्रतिबंधित वास्तविक लोग, और प्रारंभिक-आधारित लेगेसी मिलान) में विभाजित करता है, जो यह प्रदर्शित करता है कि रोमन लिप्यंतरित पूर्वी-एशियाई नामों के लिए, प्रारंभिक-आधारित एट्रिब्यूशन केवल एक मामूली समस्या नहीं बल्कि एक श्रेणीगत विफलता है।
- SigmaCV: लेखक SigmaCV प्रस्तुत करते हैं, जो एक ओपन-सोर्स (Apache-2.0), FAIR वेब एप्लिकेशन है जो नाम के बजाय निरंतर पहचानकर्ता (ORCID) द्वारा शैक्षणिक CV को संकलित करता है। यह इस सिद्धांत के एक तैनात उदाहरण के रूप में कार्य करता है कि नाम-आधारित अस्पष्टता से बचने के लिए एट्रिब्यूशन को पहचानकर्ता-आधारित (identifier-anchored) होना चाहिए।
महत्व और दावे
यह शोध पत्र दावा करता है कि यह नाम अस्पष्टता को मापता है, जो असमान एट्रिब्यूशन के लिए एक आवश्यक पूर्व शर्त है, लेकिन यह स्पष्ट रूप से प्रदर्शित मूल्यांकन हानि (demonstrated assessment harm) से अलग है।
- दावे का दायरा: लेखक कहते हैं कि वे जोखिम के एक्सपोज़र (टकराव का बोझ) को माप रहे हैं, न कि डाउनस्ट्रीम परिणामों (जैसे विशिष्ट उद्धरण विरूपण या मूल्यांकन परिणाम) को। उनका तर्क है कि एक बड़ा, असमान रूप से वितरित बोझ, बढ़ी हुई संकेतकों (indicators) और गलत-श्रेणीबद्ध उद्धरणों को संभव बनाता है, जिससे अनुसंधान मूल्यांकन की निष्पक्षता को खतरा होता है।
- उपचार: यह शोध पत्र एक संरचनात्मक समाधान का समर्थन करता है: एट्रिब्यूशन को नाम स्ट्रिंग्स से हटाकर निरंतर पहचानकर्ताओं की ओर ले जाना। यह इस बात पर जोर देता है कि यह एक क्षेत्र का सर्वसम्मत सिद्धांत है (जिसे OpenAlex, Scopus, Web of Science और ORCID द्वारा लागू किया गया है) न कि कोई नई खोज, और SigmaCV इस सिद्धांत का एक कार्यान्वयन है।
- सीमाएँ और समानता संबंधी ट्रेड-ऑफ: लेखक स्वीकार करते हैं कि उनकी जनसंख्या ORCID धारकों तक सीमित है, जिसका अर्थ है कि प्रस्तावित समाधान (पहचानकर्ता-आधारित एट्रिब्यूशन) वर्तमान में उन लोगों को लाभान्वित करता है जिनके पास पहले से ही पहचानकर्ता हैं। वे नोट करते हैं कि ORCID को अपनाना वैश्विक स्तर पर असमान है, इसलिए जबकि पहचानकर्ता-आधारित एट्रिब्यूशन पहचाने गए लोगों के लिए नाम-अस्पष्टता की समस्या को हल करता है, यह समानता के अंतर को "पहचानकर्ता रखने की अनिवार्यता" में बदल सकता है। वे यह दावा नहीं करते कि यह सभी शोधकर्ताओं के लिए पूर्ण समाधान है, बल्कि तर्क देते हैं कि यह पहचाने गए जनसंख्या के लिए एक आवश्यक सुधारात्मक उपाय है।
संक्षेप में, यह शोध पत्र प्रमाण प्रदान करता है कि नाम-आधारित एट्रिब्यूशन पूर्वी-एशियाई शोधकर्ताओं के लिए अपने आंग्लोफोन और यूरोपीय समकक्षों की तुलना में व्यवस्थित रूप से उच्च टकराव जोखिम पैदा करता है, जो निष्पक्ष अनुसंधान मूल्यांकन सुनिश्चित करने के लिए SigmaCV जैसे पहचानकर्ता-आधारित सिस्टम की ओर बढ़ने के लिए प्रेरित करता है।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।