← नवीनतम पेपर
💬 NLP

Do LLMs Judge Distantly Supervised Named Entity Labels Well? Constructing the JudgeWEL Dataset

यह शोध पत्र JudgeWEL को प्रस्तुत करता है, जो विकिपीडिया-विकीडेटा लिंक्स का कमजोर पर्यवेक्षण (weak supervision) के लिए लाभ उठाकर और बड़े भाषा मॉडलों (LLMs) का उपयोग करके सत्यापन के माध्यम से शोर वाले लेबल (noisy labels) को परिष्कृत करने वाले एक नवीन पाइपलाइन के माध्यम से निर्मित, एक काफी बड़ा और अधिक संतुलित लक्ज़मबर्गिश नाम संस्था पहचान (Named Entity Recognition) डेटासेट है।

मूल लेखक: Alistair Plum, Laura Bernardy, Tharindu Ranasinghe

प्रकाशित 2026-03-13
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Alistair Plum, Laura Bernardy, Tharindu Ranasinghe

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक रोबोट को एक विशिष्ट भाषा—लक्समबर्गिश (Luxembourgish)—पढ़ना सिखाने की कोशिश कर रहे हैं। यह भाषा लगभग 4,00,000 लोगों द्वारा बोली जाती है, लेकिन आर्टिफिशियल इंटेलिजेंस (AI) की दुनिया में, इसे "अल्प-संसाधित" (under-resourced) माना जाता है। इसे ऐसे समझें जैसे कोई छोटा, दूरदराज का गाँव जिसे बड़े जीपीएस (GPS) कंपनियों द्वारा अभी तक मैप नहीं किया गया है। रोबोट को सिखाने के लिए, आपको किताबों के एक विशाल पुस्तकालय की आवश्यकता है जहाँ महत्वपूर्ण नाम (जैसे लोग, स्थान और संगठन) पहले से ही हाइलाइट किए गए और लेबल किए गए हों। लेकिन अभी तक किसी ने लक्समबर्गिश के लिए ऐसी किताबें नहीं लिखी हैं, और इंसानों को उन्हें लिखने के लिए काम पर रखना महंगा और धीमा है।

यह पेपर उस लाइब्रेरी को स्वचालित रूप से बनाने के लिए एक चतुर, तीन-चरणीय रेसिपी पेश करता है, जो विकिपीडिया (Wikipedia), विकीडाटा (Wikidata) और AI जजों (AI Judges) के मिश्रण का उपयोग करता है।

यहाँ बताया गया है कि उन्होंने इसे कैसे किया, जिसे सरल अवधारणाओं में विभाजित किया गया है:

1. समस्या: "खाली बुकशेल्फ़" (The Empty Bookshelf)

अंग्रेजी या फ्रेंच जैसी बड़ी भाषाओं के लिए, हमारे पास पहले से लेबल किए गए डेटा के विशाल पुस्तकालय हैं। लक्समबर्गिश के लिए, बुकशेल्फ़ लगभग खाली है। लेखक बिना मानव भाषाविदों की एक सेना को काम पर रखे, इस शेल्फ को भरना चाहते थे।

2. पहला चरण: "खजाने की खोज" (The Scavenger Hunt - Distant Supervision)

वाक्यों को शून्य से लिखने के बजाय, टीम ने लक्समबर्गिश विकिपीडिया का रुख किया।

  • उपमा: कल्पना कीजिए कि आप एक खजाने के नक्शे में सुराग ढूंढ रहे हैं। विकिपीडिया में, जब कोई शब्द एक "लिंक" होता है (जैसे किसी व्यक्ति के इतिहास को देखने के लिए नाम पर क्लिक करना), तो वह एक सुनहरा सुराग होता है।
  • चाल: उन्होंने लेखों में प्रत्येक लिंक किए गए नाम को खोजने के लिए एक टूल का उपयोग किया। फिर, उन्होंने विकीडाटा (तथ्यों का एक विशाल डेटाबेस) की जांच की कि वह लिंक वास्तव में क्या है।
    • यदि लिंक किसी व्यक्ति के पेज पर जाता है, तो वे उसे PER (व्यक्ति) के रूप में टैग करते हैं।
    • यदि वह किसी शहर का है, तो वे उसे LOC (स्थान) के रूप में टैग करते हैं।
    • यदि वह किसी कंपनी का है, तो वे उसे ORG (संगठन) के रूप में टैग करते हैं।
  • परिणाम: उन्होंने तेजी से लेबल वाले हजारों वाक्य तैयार किए। लेकिन, बिल्कुल एक खजाने की खोज (scavenger hunt) की तरह, कुछ सुराग भ्रामक थे। कुछ लिंक टूटे हुए थे, या संदर्भ अजीब था। डेटा "शोर भरा" (noisy) था।

3. दूसरा चरण: "सख्त संपादक" (The Strict Editors - LLM-as-a-Judge)

यही सबसे अभिनव हिस्सा है। उन्होंने हर एक वाक्य को जांचने के लिए इंसानों को काम पर नहीं रखा। इसके बजाय, उन्होंने लार्ज लैंग्वेज मॉडल्स (LLMs) को संपादक के रूप में काम करने के लिए कहा।

  • उपमा: कल्पना कीजिए कि आपके पास एक छात्र द्वारा लिखे गए 75,000 निबंधों का ढेर है। आप उन सभी को पढ़ नहीं सकते। इसलिए, आप एक सुपर-स्मार्ट AI ( "जज") को नियुक्त करते हैं जो उन्हें पढ़ता है और कहता है, "इसे रखें, यह अच्छा है," या "इसे फेंक दें, यह बकवास है।"
  • प्रयोग: उन्होंने कई अलग-अलग AI जजों (कुछ OpenAI द्वारा बनाए गए, कुछ Google द्वारा, कुछ ओपन-सोर्स) का परीक्षण किया। उन्होंने AI से पूछा: "इस वाक्य और इसके लेबल को देखें। क्या लेबलिंग सही है? हाँ या नहीं?"
  • विजेता: उन्होंने पाया कि सबसे उन्नत AI मॉडल (जैसे GPT-5) आश्चर्यजनक रूप से अच्छे थे। वे मानव विशेषज्ञों के साथ 62% बार सहमत हुए। यह कहने के लिए पर्याप्त है कि, "ठीक है, यह AI एक विश्वसनीय संपादक है।"

4. तीसरा चरण: अंतिम लाइब्रेरी (The judgeWEL Dataset)

AI संपादकों द्वारा खराब वाक्यों को छानने के बाद, उनके पास एक साफ, उच्च-गुणवत्ता वाला डेटासेट बचा, जिसे judgeWEL कहा जाता है।

  • इसमें 28,866 वाक्य हैं।
  • यह लक्समबर्गिश के पिछले सर्वश्रेष्ठ डेटासेट से 5 गुना बड़ा है।
  • यह केवल समाचारों तक ही सीमित नहीं है, बल्कि विभिन्न विषयों को कवर करता है।

5. क्या यह काम आया? (The Test Drive)

लेखकों ने इस नई लाइब्रेरी को लिया और विभिन्न AI मॉडल्स को लक्समबर्गिश में नामों को पहचानना सिखाया।

  • परिणाम: इस नए, AI-क्लीन किए गए लाइब्रेरी पर प्रशिक्षित मॉडल, मानव-लेबल वाले डेटा पर प्रशिक्षित मॉडलों के लगभग समान प्रदर्शन करते हैं।
  • चुनौती: जबकि AI संपादक गलतियों को पकड़ने में बेहतरीन थे, AI लेखक (generative models) खुद लेबल बनाने में थोड़े अव्यवस्थित थे। एक AI के लिए यह कहना आसान है कि "यह गलत है" बजाय इसके कि वह कह सके "यहाँ एकदम सही लेबल है।"

मुख्य निष्कर्ष (The Big Takeaway)

यह पेपर साबित करता है कि कम प्रतिनिधित्व वाली भाषाओं के लिए, आपको सब कुछ लेबल करने के लिए इंसानों का इंतजार करने की आवश्यकता नहीं है। आप विकिपीडिया को एक कच्चे ड्राफ्ट के रूप में और AI जजों को उसे पॉलिश करने के लिए उपयोग कर सकते हैं।

रूपक (Metaphor):
भाषा संसाधन बनाने को घर बनाने की तरह समझें।

  • पुराना तरीका: हर ईंट को हाथ से रखने के लिए राजमिस्त्रियों (इंसानों) की एक टीम को काम पर रखें। धीमा और महंगा।
  • नया तरीका: ईंटों का ढेर (विकिपीडिया डेटा) डालने के लिए एक मशीन का उपयोग करें। फिर, एक बहुत ही स्मार्ट फोरमैन (AI जज) को नियुक्त करें जो वहां से गुजरे, टूटी हुई ईंटों को बाहर निकाले, और अच्छी ईंटों को व्यवस्थित करे। घर 5 गुना तेजी से बनता है, और यह रहने के लिए पर्याप्त मजबूत भी है।

यह दृष्टिकोण हर भाषा को, यहाँ तक कि छोटी भाषाओं को भी, AI की दुनिया में समान अवसर देने के लिए एक टिकाऊ मार्ग प्रदान करता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →