Author Name Disambiguation in Portuguese Scientific Publications: The SBC-AND dataset
यह शोध पत्र SBC-AND को प्रस्तुत करता है, जो 442 पुर्तगाली वैज्ञानिक प्रकाशन अभिलेखों का एक क्यूरेटेड डेटासेट है, जिसे लेखक नाम विसंगति निवारण (Author Name Disambiguation) अनुसंधान में गैर-अंग्रेजी भाषाओं के कम प्रतिनिधित्व को संबोधित करने और बहुभाषी विसंगति निवारण मॉडलों के मूल्यांकन के लिए एक चुनौतीपूर्ण बेंचमार्क के रूप में कार्य करने के लिए डिज़ाइन किया गया है।
मूल पेपर CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
यहाँ शोध पत्र "Author Name Disambiguation in Portuguese Scientific Publications: The SBC-AND Dataset" का सरल अवधारणाओं और रोज़मर्रा के उदाहरणों के साथ विवरण दिया गया है।
बड़ी समस्या: "नाम की पर्ची" का उलझाव
कल्पना कीजिए कि आप एक विशाल पुस्तकालय में जाते हैं जहाँ लाखों लोगों ने किताबें लिखी हैं। समस्या यह है कि कई लोगों के नाम एक जैसे हैं, जैसे "जॉन स्मिथ" या "मारिया सिल्वा"।
विज्ञान की दुनिया में, यह एक बड़ी सिरदर्दी है। यदि "मारिया सिल्वा" नाम की एक शोधकर्ता कंप्यूटर पर एक पेपर लिखती है, और कोई दूसरी "मारिया सिल्वा" इतिहास पर एक पेपर लिखती है, तो पुस्तकालय गलती से यह सोच सकता है कि वे एक ही व्यक्ति हैं। इससे उनकी प्रतिष्ठा, उनके साइटेशन काउंट (citation counts) और हम यह समझने के तरीके में गड़बड़ी होती है कि कौन किसके साथ सहयोग कर रहा है। यह पता लगाने का कार्य कि कौन सी "मारिया सिल्वा" ने कौन सा पेपर लिखा है, ऑथर नेम डिसएम्बिगुएशन (Author Name Disambiguation - AND) कहलाता है।
अंतराल: "अंग्रेजी-मात्र" पार्टी
लंबे समय से, वैज्ञानिक इस उलझन को सुलझाने के लिए उपकरण बना रहे हैं, लेकिन उन्होंने ज्यादातर अंग्रेजी नामों पर अभ्यास किया है। यह एक ऐसे पार्टी प्लानर की तरह है जो अंग्रेजी बोलने वाले मेहमानों को व्यवस्थित करने में तो माहिर है, लेकिन उसने कभी पुर्तगाली नाम वाले किसी व्यक्ति से मुलाकात नहीं की है।
पुर्तगाली नाम पेचीदा होते हैं। उनमें अक्सर कई उपनाम (जैसे "सिल्वा" या "सांतोस") और जोड़ने वाले छोटे शब्द (जैसे "de", "da", या "dos") होते हैं। इसके अलावा, वैज्ञानिक रिकॉर्ड में, इन नामों को अक्सर छोटा कर दिया जाता है या असंगत रूप से लिखा जाता है (जैसे, "A. Silva" बनाम "Ana Silva")। इस कारण से, मौजूदा उपकरण पुर्तगाली प्रकाशनों के सामने आने पर संघर्ष करते हैं।
समाधान: SBC-AND "ट्रेनिंग जिम"
इस शोध पत्र के लेखकों ने एक नया टूल बनाया है जिसे SBC-AND कहा जाता है। इसे एक विशेष ट्रेनिंग जिम के रूप में समझें जो कंप्यूटर प्रोग्रामों के लिए है।
- इसके अंदर क्या है? यह ब्राज़ीलियाई कंप्यूटर विज्ञान पत्रिकाओं के 442 वास्तविक वैज्ञानिक लेखों का एक संग्रह है।
- इसे कैसे व्यवस्थित किया गया है? लेखकों ने इन लेखों को "एम्बिग्युअस ब्लॉक्स" (ambiguous blocks) में वर्गीकृत किया है। "सिल्वा" लेबल वाले एक बॉक्स की कल्पना करें। इसके अंदर, 232 अलग-अलग वास्तविक लोगों के पेपर हैं जिनका अंतिम नाम (last name) एक ही है।
- लक्ष्य: यह डेटासेट "क्यूरेटेड" (curated) है, जिसका अर्थ है कि एक इंसान ने पहले ही जांच लिया है और लेबल कर दिया है कि कौन सा पेपर किस वास्तविक व्यक्ति का है। यह कंप्यूटर को एक "सही उत्तर कुंजी" (correct answer key) देता है जिससे वह खुद का परीक्षण कर सके।
प्रयोग: कंप्यूटर के दिमाग का परीक्षण
शोधकर्ताओं ने केवल डेटासेट ही नहीं बनाया; उन्होंने इसे परखने के लिए इसे टेस्ट पर भी लगाया। उन्होंने एक लचीली कंप्यूटर प्रणाली (जिसे ADAN कहा जाता है) का उपयोग किया जो पेपरों को वापस सही समूहों में व्यवस्थित करने की कोशिश करती है।
उन्होंने सिस्टम का परीक्षण दो अलग-अलग "दिमाग" मॉडल (भाषा को समझने वाले AI मॉडल) का उपयोग करके किया:
- BAAI/bge-m3: एक बहुभाषी (multilingual) मॉडल।
- IBM Granite: एक अन्य बहुभाषी मॉडल।
उन्होंने सिस्टम की "गहराई" (सोचने के कितने स्तर/layers) और इसके अभ्यास की अवधि (training epochs) को भी बदला।
परिणाम: एक कठिन चुनौती
जब कंप्यूटर ने पेपरों को छाँटने की कोशिश की, तो जो हुआ वह यहाँ है:
- "बड़ी तस्वीर" बनाम "विवरण": कंप्यूटर समूहों को एक-दूसरे से अलग रखने में काफी अच्छा था (जैसे "सिल्वा" के बॉक्स को "ओलिवेरा" के बॉक्स से दूर रखना)। हालांकि, यह "सिल्वा" बॉक्स के अंदर के पेपरों को सही ढंग से छाँटने में संघर्ष करता रहा।
- स्कोर: कंप्यूटर ने समग्र संरचना पर एक अच्छा स्कोर (लगभग 90% सटीकता) प्राप्त किया, लेकिन जब बात विशिष्ट पेपरों को सही लेखक के साथ मिलाने की आई, तो स्कोर काफी गिर गया (लगभग 45%)।
- क्यों? शोध पत्र बताता है कि ऐसा इसलिए है क्योंकि डेटासेट में कई वास्तविक लेखकों के पास केवल एक या दो पेपर सूचीबद्ध हैं। यह किसी पार्टी में किसी व्यक्ति को पहचानने की कोशिश करने जैसा है जब आप उन्हें केवल एक बार देखते हैं; उन्हें किसी अन्य समान दिखने वाले व्यक्ति से अलग करना बहुत कठिन होता है।
- विजेता: IBM Granite मॉडल दूसरे की तुलना में थोड़ा बेहतर प्रदर्शन करता है, विशेष रूप से तब जब इसने एक विशिष्ट "सोचने की गहराई" (दो परतें/layers) का उपयोग किया। सिस्टम को "गहरा" (तीन परतें) बनाने से मदद नहीं मिली; वास्तव में, इसने चीजों को और अधिक शोर भरा (noisy) बना दिया।
निष्कर्ष (Takeaway)
शोध पत्र यह निष्कर्ष निकालता है कि SBC-AND वर्तमान तकनीक के लिए एक बहुत कठिन परीक्षण है। यह इस बात पर प्रकाश डालता है कि हालांकि कंप्यूटर वैज्ञानिक डेटा को व्यवस्थित करने में बेहतर हो रहे हैं, फिर भी वे उन भाषाओं के साथ संघर्ष करते हैं जहाँ नाम जटिल होते हैं या जहाँ लेखकों के पास पहचान करने के लिए बहुत कम प्रकाशन होते हैं।
लेखकों ने इस डेटासेट को ऑनलाइन उपलब्ध करा दिया है ताकि अन्य शोधकर्ता बेहतर उपकरण बनाने के लिए इसका उपयोग कर सकें, जिससे यह सुनिश्चित हो सके कि भविष्य में, हर "मारिया सिल्वा" को उनके अपने काम का उचित श्रेय मिले।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।