← नवीनतम पेपर
💬 NLP

NameBERT: Scaling Name-Based Nationality Classification with LLM-Augmented Open Academic Data

यह शोधपत्र NameBERT को प्रस्तुत करता है, जो एक ऐसा ढांचा है जो कम प्रतिनिधित्व वाले देशों के लिए सिंथेटिक नामों के साथ एक बड़े पैमाने के Open Academic Graph डेटासेट को संवर्धित करने के लिए बड़े भाषा मॉडलों (LLMs) का लाभ उठाता है, जिसके परिणामस्वरूप एक अत्यधिक सटीक और कुशल राष्ट्रीयता क्लासिफायर प्राप्त होता है जो प्रत्यक्ष LLM इन्फरेंस की कम्प्यूटेशनल लागतों से बचते हुए अत्याधुनिक बेसलाइनों से बेहतर प्रदर्शन करता है।

मूल लेखक: Cong Ming, Ruixin Shi, Yifan Hu

प्रकाशित 2026-04-14
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Cong Ming, Ruixin Shi, Yifan Hu

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप केवल किसी के नाम को देखकर यह अनुमान लगाने की कोशिश कर रहे हैं कि वह व्यक्ति कहाँ से है। यह बिल्कुल वैसा ही है जैसे किसी के नाम के टैग को देखकर उसके पसंदीदा भोजन का अनुमान लगाना। यदि आप "Bao" देखते हैं, तो आप चीन का अनुमान लगा सकते हैं; यदि आप "O'Malley" देखते हैं, तो आप आयरलैंड का अनुमान लगा सकते हैं।

यह शोध पत्र, जिसका शीर्षक NameBERT है, एक सुपर-स्मार्ट कंप्यूटर प्रोग्राम बनाने की चुनौती से निपटता है जो यह अनुमान लगाने में सक्षम हो सके—न केवल सबसे आम नामों के लिए, बल्कि सभी के लिए। यह इसे करने का तरीका है, जिसे सरल भाषा में समझाया गया है।

1. समस्या: नामों की "लॉन्ग टेल" (Long Tail)

दुनिया की जनसंख्या को एक विशाल पुस्तकालय की तरह सोचें।

  • लोकप्रिय खंड (The Popular Section): अधिकांश पुस्तकें (नाम) कुछ प्रसिद्ध देशों जैसे अमेरिका, चीन या फ्रांस के बारे में हैं। हमारे पास इनके लाखों उदाहरण हैं।
  • "लॉन्ग टेल" खंड (The "Long Tail" Section): यहाँ छोटे या कम सामान्य देशों (जैसे भूटान या लाओस) के बारे में हजारों पुस्तकें भी हैं। हमारे डेटा में, ये "लॉन्ग टेल" हैं। इनके बहुत कम उदाहरण हैं—कभी-कभी केवल कुछ ही।

समस्या: पुराने कंप्यूटर प्रोग्राम मुख्य रूप से "लोकप्रिय खंड" पर प्रशिक्षित थे। वे "Smith" या "Wang" का अनुमान लगाने में तो माहिर थे, लेकिन वे "लॉन्ग टेल" वाले नामों के लिए बहुत खराब थे क्योंकि उन्होंने पैटर्न सीखने के लिए पर्याप्त उदाहरण नहीं देखे थे।

2. समाधान: एक नया पुस्तकालय (OAG)

लेखक एक विशाल डिजिटल लाइब्रेरी में गए जिसे ओपन एकेडेमिक ग्राफ (OAG) कहा जाता है। इस लाइब्रेरी में 130 मिलियन से अधिक शोध पत्रों और 35 मिलियन वैज्ञानिकों के रिकॉर्ड शामिल हैं।

  • ट्रिक: उन्होंने वैज्ञानिकों से यह नहीं पूछा, "आपकी राष्ट्रीयता क्या है?" (क्योंकि यह निजी जानकारी है!)। इसके बजाय, उन्होंने वैज्ञानिकों के संबद्धों (affiliations) (जैसे, "टोक्यो विश्वविद्यालय, जापान") को देखा।
  • परिणाम: उन्होंने देश के साथ जुड़े 1.4 मिलियन नामों का एक नया, विशाल प्रशिक्षण डेटासेट बनाया। यह "नाम + देश" के जोड़ों की एक विशाल सूची की तरह है जिससे कंप्यूटर को सिखाया जा सके।

3. सीक्रेट सॉस: काल्पनिक लेखन के लिए AI का उपयोग (LLM Augmentation)

1.4 मिलियन नामों के साथ भी, "लॉन्ग टेल" वाले देशों के पास अभी भी पर्याप्त उदाहरण नहीं थे। कंप्यूटर अभी भी उनके लिए संघर्ष कर रहा था।

इसलिए, लेखकों ने एक चतुर ट्रिक आजमाई। एक विशाल AI (लार्ज लैंग्वेज मॉडल या LLLLM) का उपयोग करके हर एक नाम की राष्ट्रीयता का अनुमान लगाने के बजाय (जो धीमा और महंगा है, जैसे हर सवाल के लिए एक मानव विशेषज्ञ को काम पर रखना), उन्होंने AI का उपयोग एक रचनात्मक लेखक के रूप में किया।

  • उपमा: कल्पना कीजिए कि आप एक छात्र को दुर्लभ फलों को पहचानना सिखा रहे हैं। आपके पास "ड्रैगन फ्रूट" की केवल 5 तस्वीरें हैं। छात्र विफल हो जाएगा।
  • समाधान: आप एक पेशेवर कलाकार (LLM) से ड्रैगन फ्रूट की 5,000 नई, वास्तविक दिखने वाली तस्वीरें बनाने के लिए कहते हैं। आप कलाकार से छात्र का मूल्यांकन करने के लिए नहीं कह रहे हैं; आप बस उन चित्रों का उपयोग छात्र को अध्ययन करने में मदद करने के लिए कर रहे हैं।
  • परिणाम: उन्होंने उन दुर्लभ देशों के लिए हजारों नकली लेकिन वास्तविक दिखने वाले नाम उत्पन्न करने के लिए एक AI का उपयोग किया। उन्होंने इन नकली नामों को अपने प्रशिक्षण कार्यक्रम में डाला। इसने पुस्तकालय के "अंतरालों को भरने" का काम किया।

4. स्टार प्लेयर: NameBERT

लेखकों ने NameBERT नामक एक नया मॉडल बनाया।

  • यह क्या करता है: यह एक नाम पढ़ता है और देश का अनुमान लगाता है।
  • तुलना: उन्होंने इसकी तुलना "पुराने चैंपियनों" (अन्य प्रसिद्ध नाम-अनुमान लगाने वाले प्रोग्रामों) से की।
  • स्कोर: NameBERT आसानी से जीत गया। यह बहुत अधिक सटीक था, विशेष रूप से दुर्लभ, "लॉन्ग टेल" वाले देशों के लिए।

5. गति बनाम बुद्धि: रेस कार बनाम सुपरकंप्यूटर

एक बड़ा सवाल था: "क्यों न सभी के लिए राष्ट्रीयता का अनुमान लगाने के लिए विशाल AI (जैसे GPT-5) का उपयोग किया जाए? वह बहुत स्मार्ट है!"

  • विशाल AI (LLM): यह एक सुपरकंप्यूटर की तरह है। यह अविश्वसनीय रूप से स्मार्ट है और अच्छी भविष्यवाणी कर सकता है, लेकिन यह धीमा और महंगा है। यदि आप 1 मिलियन लोगों की राष्ट्रीयता का अनुमान लगाना चाहते हैं, तो इसमें बहुत समय लगेगा और बहुत पैसा खर्च होगा।
  • NameBERT: यह एक फॉर्मूला 1 रेस कार की तरह है। यह विशिष्ट है। यह सुपरकंप्यूटर जितना "गहरा सोचने वाला" नहीं है, लेकिन यह अत्यधिक तेज़ है और बनने के बाद इसे चलाना मुफ्त है।
  • परिणाम: NameBERT, विशाल AI की तुलना में 1,000 गुना तेज़ है और इसे चलाना व्यावहारिक रूप से मुफ्त है। यह उन वास्तविक दुनिया के ऐप्स के लिए एकदम सही है जिन्हें तुरंत लाखों नामों को प्रोसेस करने की आवश्यकता होती है।

6. वास्तविक दुनिया का परीक्षण: क्या इससे मदद मिली?

उन्होंने दो तरीकों से NameBERT का परीक्षण किया:

  1. वास्तविक नाम: जब उन्होंने प्रशिक्षण में AI-जनरेटेड "नकली" नामों को जोड़ा, तो यह दुर्लभ राष्ट्रीयताओं का अनुमान लगाने में बेहतर हो गया।
  2. आउट-ऑफ-डोमेन (Out-of-Domain): जब उन्होंने उन नामों पर परीक्षण किया जिन्हें उन्होंने पहले कभी नहीं देखा था (जैसे विकिपीडिया के नाम), तब भी इसने पुराने मॉडलों को पछाड़ दिया, हालांकि "नकली नाम" वाली ट्रिक ने विशेष रूप से दुर्लभ देशों के लिए मदद की।

7. यह क्यों मायने रखता है?

यह केवल एक खेल नहीं है। नाम से किसी की संभावित राष्ट्रीयता जानना इसमें मदद करता है:

  • निष्पक्षता (Fairness): यह जांचना कि क्या कोई कंपनी विविध पृष्ठभूमियों के लोगों को काम पर रख रही है।
  • पूर्वाग्रह का पता लगाना (Bias Detection): यह देखना कि क्या कोई AI विभिन्न देशों के लोगों के साथ अनुचित व्यवहार कर रहा है।
  • अनुसंधान: समाजशास्त्रियों को निजी डेटा मांगे बिना प्रवास और जनसांख्यिकी का अध्ययन करने में मदद करना।

निष्कर्ष

लेखकों ने एक तेज़, सस्ता और अत्यंत सटीक टूल (NameBERT) बनाया है जो नामों से राष्ट्रीयता का अनुमान लगाता है। उन्होंने "दुर्लभ नामों" की समस्या को हल किया है, यह उपयोग करके कि एक स्मार्ट AI कंप्यूटर को अध्ययन करने के लिए अभ्यास अभ्यास (नकली नाम) लिखे। परिणाम एक ऐसा सिस्टम है जो मानव विशेषज्ञ से तेज़ है और पुराने कंप्यूटर प्रोग्रामों से अधिक स्मार्ट है, जो एक निष्पक्ष डिजिटल दुनिया बनाने के लिए एक शक्तिशाली उपकरण बनाता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →