← नवीनतम पेपर
💬 NLP

Cross-Source Reasoning-based Correction for Author Name Disambiguation

यह शोध पत्र CrossND को प्रस्तुत करता है, जो एक फुल-स्टैक फ्रेमवर्क है जो विशेषज्ञ एनोटेशन की आवश्यकता के बिना विभिन्न स्रोतों में पेपर-लेखक असाइनमेंटों के बीच विसंगतियों की पहचान करके और उन्हें हल करके, क्रॉस-सोर्स रीजनिंग का लाभ उठाकर लेखक नाम विसंगति (disambiguation) त्रुटियों को स्वचालित रूप से सुधारता है।

मूल लेखक: Fanjin Zhang, Yunhe Pang, Bo Chen, Zhiyu Shen, Yanghui Rao, Evgeny Kharlamov, Jie Tang

प्रकाशित 2026-06-09
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Fanjin Zhang, Yunhe Pang, Bo Chen, Zhiyu Shen, Yanghui Rao, Evgeny Kharlamov, Jie Tang

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

यहाँ "Cross-Source Reasoning-based Correction for Author Name Disambiguation" पेपर का सरल भाषा और रोज़मर्रा के उदाहरणों के साथ हिंदी अनुवाद दिया गया है।

बड़ी समस्या: "नाम के जुड़वां" का भ्रम

कल्पना कीजिए कि आप एक विशाल डिजिटल लाइब्रेरी में "क्वानक्वान गु" (Quanquan Gu) नामक एक विशिष्ट लेखक को खोज रहे हैं। समस्या यह है कि उसी नाम के दो अलग-अलग व्यक्ति हैं।

  • व्यक्ति A यूसीएलए (UCLA) में एक कंप्यूटर वैज्ञानिक हैं जो एल्गोरिदम पर लिखते हैं।
  • व्यक्ति B झेजियांग यूनिवर्सिटी में एक डॉक्टर हैं जो पार्किंसंस रोग पर लिखते हैं।

कई शैक्षणिक डेटाबेस में, कंप्यूटर सिस्टम भ्रमित हो जाता है। यह गलती से व्यक्ति A के कंप्यूटर विज्ञान के शोध पत्रों को व्यक्ति B को दे सकता है, या इसके विपरीत। इसे ऑथर नेम डिसएम्बिग्यूएशन (Author Name Disambiguation) कहा जाता है। जब ये गलतियाँ जमा होती हैं, तो यह लेखकों की रैंकिंग, पुरस्कार निर्णयों और अनुसंधान रिकॉर्ड को बिगाड़ देती है।

पुराना तरीका: अकेले अनुमान लगाना

पहले, कंप्यूटर इन गलतियों को सुधारने के लिए केवल एक ही लाइब्रेरी (जैसे AMiner) को देखने की कोशिश करते थे और यह समझने का प्रयास करते थे कि कौन से शोध पत्र किस व्यक्ति के हैं। वे शोध पत्रों के शीर्षक और कीवर्ड्स को देखते थे।

  • कमी: यदि लाइब्रेरी में ही कोई गलती है, तो कंप्यूटर बार-बार वही गलती करता रहेगा। यह एक किताब में टाइपो (लिखने की गलती) खोजने के लिए केवल उसी एक किताब को पढ़ने जैसा है; यदि वह गलती वहां मौजूद है, तो आप उसे सही मान सकते हैं क्योंकि आपके पास कोई दूसरा संदर्भ नहीं है।

नया समाधान: "क्रॉस-चेक" करने वाला जासूस (CrossND)

यह पेपर CrossND नामक एक नई प्रणाली पेश करता है। केवल एक लाइब्रेरी को देखने के बजाय, यह एक ऐसे जासूस की तरह काम करता है जो सच्चाई का पता लगाने के लिए दो अलग-अलग लाइब्रेरीज़ (जैसे AMiner और MAG) की आपस में जांच करता है।

यहाँ बताया गया है कि CrossND कैसे काम करता है, जिसे तीन सरल चरणों में विभाजित किया गया है:

1. "सफाई दल" (Chain-of-Refinement)

जासूस द्वारा केस सुलझाने से पहले, उन्हें अपने सबूतों की सफाई करनी होती है।

  • उदाहरण: एक मेज की कल्पना करें जो कागजों से भरी हुई है। कुछ सही हैं, लेकिन कुछ कचरा हैं या किसी और के हैं।
  • CrossND क्या करता है: यह एक बहुत ही स्मार्ट AI (एक लार्ज लैंग्वेज मॉडल) का उपयोग करता है जो किसी लेखक के शोध पत्रों की सूची को देखता है और कहता है, "यह पेपर निश्चित रूप से यहाँ होना चाहिए," और "यह थोड़ा अजीब लग रहा है, चलो इसे अभी के लिए हटा देते हैं।" यह उस लेखक के लिए शोध पत्रों की एक साफ और विश्वसनीय "कोर" सूची बनाता है।

2. "क्रॉस-एग्जामिनेशन" (Cross-Source Reasoning)

अब जासूस दोनों लाइब्रेरी की तुलना करता है।

  • उदाहरण: कल्पना कीजिए कि आपके पास दो गवाह (लाइब्रेरी A और लाइब्रेरी B) हैं जो किसी अपराध के बारे में बता रहे हैं।
    • यदि दोनों गवाह कहते हैं, "संदिग्ध ने लाल टोपी पहनी थी," तो आप बहुत आश्वस्त हैं कि यह सच है।
    • यदि गवाह A कहता है "लाल टोपी" लेकिन गवाह B कहता है "नीली टोपी," तो आप जानते हैं कि कुछ गलत है।
  • CrossND क्या करता है: यह लाइब्रेरी A के शोध पत्रों को देखता है और उनकी तुलना लाइब्रेरी B से करता है।
    • यदि दोनों लाइब्रेरी में लेखक बहुत समान दिखते हैं (एक ही शोध विषय), तो सिस्टम मिलान पर भरोसा करता है।
      // यदि वे बिल्कुल अलग दिखते हैं (एक AI के बारे में लिखता है और दूसरा चिकित्सा के बारे में), तो सिस्टम उस पेपर को एक संभावित गलती के रूप में चिह्नित करता है।
    • जादुई ट्रिक: यह एक विशेष लॉजिक टूल (जिसे प्रोबेबिलिस्टिक सॉफ्ट लॉजिक कहा जाता है) का उपयोग करता है जो AI को भ्रम के माध्यम से तर्क करने में मदद करता है। यह केवल "हाँ" या "नहीं" नहीं कहता; यह एक न्यायाधीश की तरह साक्ष्यों को तौलता है, यह पूछते हुए, "यदि लेखक A, लेखक B से मेल खाता है, और पेपर X, लेखक B से मेल खाता है, तो क्या पेपर X वास्तव में लेखक A से मेल खाता है?"

3. "दूसरी राय" (Test-Time Scaling)

कभी-कभी, यहाँ तक कि स्मार्ट जासूस भी थक जाते हैं या गलत अनुमान लगा लेते हैं।

  • उदाहरण: यदि आप किसी गणित के सवाल को लेकर अनिश्चित हैं, तो आप यह देखने के लिए कि क्या आपको वही उत्तर मिलता है, इसे लगातार तीन बार हल कर सकते हैं।
  • CrossND क्या करता है: यह जांच को कई बार चलाता है, जिसमें उन शोध पत्रों के क्रम को बदला जाता है जिन्हें वह देख रहा है। ऐसा करके, यह अपने स्वयं के आत्मविश्वास को "बूटस्ट्रैप" (मजबूत) करता है। यदि इसे बार-बार एक ही परिणाम मिलता है, तो यह बहुत आश्वस्त हो जाता है। यदि परिणाम डगमगाते हैं, तो इसे पता चल जाता है कि इसे अधिक सावधान रहने की आवश्यकता है।

यह बेहतर क्यों है?

लेखकों ने वास्तविक दुनिया के डेटा (हजारों शोध पत्र और लेखक) पर इस प्रणाली का परीक्षण किया।

  • परिणाम: CrossND ने 17 अन्य मौजूदा तरीकों को पछाड़ दिया। इसने अधिक त्रुटियों को पाया और उन्हें ठीक किया, बिना मनुष्यों द्वारा हर एक पेपर की मैन्युअल जांच किए।
  • लागत: इसे चलाना आश्चर्यजनक रूप से सस्ता है। इस तरह के जटिल कार्य के लिए इस सिस्टम की लागत $0.002 प्रति पेपर से भी कम है, जो बहुत कम है।
  • वास्तविक उपयोग: इस प्रणाली का उपयोग पहले से ही एक प्रोटोटाइप टूल में किया जा रहा है जो शोधकर्ताओं को विभिन्न डेटाबेस (AMiner, MAG और Google Scholar) में अपनी प्रोफाइल की जांच करने में मदद करता है।

सारांश

CrossND को एक सुपर-स्मार्ट लाइब्रेरियन के रूप में समझें जो केवल किताबों की एक शेल्फ पर निर्भर नहीं रहता। इसके बजाय, वे दूसरी लाइब्रेरी में जाते हैं, सूचियों की तुलना करते हैं, और यह पता लगाने के लिए तर्क का उपयोग करते हैं कि कौन सी किताबें गलत शेल्फ पर रखी गई हैं। स्रोतों को क्रॉस-चेक करके और डेटा को पहले साफ करके, वे किसी भी अन्य व्यक्ति की तुलना में लाइब्रेरी के कैटलॉग को बहुत तेज़ी से और अधिक सटीकता से ठीक कर सकते हैं।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →