Do LLMs Judge Distantly Supervised Named Entity Labels Well? Constructing the JudgeWEL Dataset
यह शोध पत्र JudgeWEL को प्रस्तुत करता है, जो विकिपीडिया-विकीडेटा लिंक्स का कमजोर पर्यवेक्षण (weak supervision) के लिए लाभ उठाकर और बड़े भाषा मॉडलों (LLMs) का उपयोग करके सत्यापन के माध्यम से शोर वाले लेबल (noisy labels) को परिष्कृत करने वाले एक नवीन पाइपलाइन के माध्यम से निर्मित, एक काफी बड़ा और अधिक संतुलित लक्ज़मबर्गिश नाम संस्था पहचान (Named Entity Recognition) डेटासेट है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आप एक रोबोट को एक विशिष्ट भाषा—लक्समबर्गिश (Luxembourgish)—पढ़ना सिखाने की कोशिश कर रहे हैं। यह भाषा लगभग 4,00,000 लोगों द्वारा बोली जाती है, लेकिन आर्टिफिशियल इंटेलिजेंस (AI) की दुनिया में, इसे "अल्प-संसाधित" (under-resourced) माना जाता है। इसे ऐसे समझें जैसे कोई छोटा, दूरदराज का गाँव जिसे बड़े जीपीएस (GPS) कंपनियों द्वारा अभी तक मैप नहीं किया गया है। रोबोट को सिखाने के लिए, आपको किताबों के एक विशाल पुस्तकालय की आवश्यकता है जहाँ महत्वपूर्ण नाम (जैसे लोग, स्थान और संगठन) पहले से ही हाइलाइट किए गए और लेबल किए गए हों। लेकिन अभी तक किसी ने लक्समबर्गिश के लिए ऐसी किताबें नहीं लिखी हैं, और इंसानों को उन्हें लिखने के लिए काम पर रखना महंगा और धीमा है।
यह पेपर उस लाइब्रेरी को स्वचालित रूप से बनाने के लिए एक चतुर, तीन-चरणीय रेसिपी पेश करता है, जो विकिपीडिया (Wikipedia), विकीडाटा (Wikidata) और AI जजों (AI Judges) के मिश्रण का उपयोग करता है।
यहाँ बताया गया है कि उन्होंने इसे कैसे किया, जिसे सरल अवधारणाओं में विभाजित किया गया है:
1. समस्या: "खाली बुकशेल्फ़" (The Empty Bookshelf)
अंग्रेजी या फ्रेंच जैसी बड़ी भाषाओं के लिए, हमारे पास पहले से लेबल किए गए डेटा के विशाल पुस्तकालय हैं। लक्समबर्गिश के लिए, बुकशेल्फ़ लगभग खाली है। लेखक बिना मानव भाषाविदों की एक सेना को काम पर रखे, इस शेल्फ को भरना चाहते थे।
2. पहला चरण: "खजाने की खोज" (The Scavenger Hunt - Distant Supervision)
वाक्यों को शून्य से लिखने के बजाय, टीम ने लक्समबर्गिश विकिपीडिया का रुख किया।
- उपमा: कल्पना कीजिए कि आप एक खजाने के नक्शे में सुराग ढूंढ रहे हैं। विकिपीडिया में, जब कोई शब्द एक "लिंक" होता है (जैसे किसी व्यक्ति के इतिहास को देखने के लिए नाम पर क्लिक करना), तो वह एक सुनहरा सुराग होता है।
- चाल: उन्होंने लेखों में प्रत्येक लिंक किए गए नाम को खोजने के लिए एक टूल का उपयोग किया। फिर, उन्होंने विकीडाटा (तथ्यों का एक विशाल डेटाबेस) की जांच की कि वह लिंक वास्तव में क्या है।
- यदि लिंक किसी व्यक्ति के पेज पर जाता है, तो वे उसे PER (व्यक्ति) के रूप में टैग करते हैं।
- यदि वह किसी शहर का है, तो वे उसे LOC (स्थान) के रूप में टैग करते हैं।
- यदि वह किसी कंपनी का है, तो वे उसे ORG (संगठन) के रूप में टैग करते हैं।
- परिणाम: उन्होंने तेजी से लेबल वाले हजारों वाक्य तैयार किए। लेकिन, बिल्कुल एक खजाने की खोज (scavenger hunt) की तरह, कुछ सुराग भ्रामक थे। कुछ लिंक टूटे हुए थे, या संदर्भ अजीब था। डेटा "शोर भरा" (noisy) था।
3. दूसरा चरण: "सख्त संपादक" (The Strict Editors - LLM-as-a-Judge)
यही सबसे अभिनव हिस्सा है। उन्होंने हर एक वाक्य को जांचने के लिए इंसानों को काम पर नहीं रखा। इसके बजाय, उन्होंने लार्ज लैंग्वेज मॉडल्स (LLMs) को संपादक के रूप में काम करने के लिए कहा।
- उपमा: कल्पना कीजिए कि आपके पास एक छात्र द्वारा लिखे गए 75,000 निबंधों का ढेर है। आप उन सभी को पढ़ नहीं सकते। इसलिए, आप एक सुपर-स्मार्ट AI ( "जज") को नियुक्त करते हैं जो उन्हें पढ़ता है और कहता है, "इसे रखें, यह अच्छा है," या "इसे फेंक दें, यह बकवास है।"
- प्रयोग: उन्होंने कई अलग-अलग AI जजों (कुछ OpenAI द्वारा बनाए गए, कुछ Google द्वारा, कुछ ओपन-सोर्स) का परीक्षण किया। उन्होंने AI से पूछा: "इस वाक्य और इसके लेबल को देखें। क्या लेबलिंग सही है? हाँ या नहीं?"
- विजेता: उन्होंने पाया कि सबसे उन्नत AI मॉडल (जैसे GPT-5) आश्चर्यजनक रूप से अच्छे थे। वे मानव विशेषज्ञों के साथ 62% बार सहमत हुए। यह कहने के लिए पर्याप्त है कि, "ठीक है, यह AI एक विश्वसनीय संपादक है।"
4. तीसरा चरण: अंतिम लाइब्रेरी (The judgeWEL Dataset)
AI संपादकों द्वारा खराब वाक्यों को छानने के बाद, उनके पास एक साफ, उच्च-गुणवत्ता वाला डेटासेट बचा, जिसे judgeWEL कहा जाता है।
- इसमें 28,866 वाक्य हैं।
- यह लक्समबर्गिश के पिछले सर्वश्रेष्ठ डेटासेट से 5 गुना बड़ा है।
- यह केवल समाचारों तक ही सीमित नहीं है, बल्कि विभिन्न विषयों को कवर करता है।
5. क्या यह काम आया? (The Test Drive)
लेखकों ने इस नई लाइब्रेरी को लिया और विभिन्न AI मॉडल्स को लक्समबर्गिश में नामों को पहचानना सिखाया।
- परिणाम: इस नए, AI-क्लीन किए गए लाइब्रेरी पर प्रशिक्षित मॉडल, मानव-लेबल वाले डेटा पर प्रशिक्षित मॉडलों के लगभग समान प्रदर्शन करते हैं।
- चुनौती: जबकि AI संपादक गलतियों को पकड़ने में बेहतरीन थे, AI लेखक (generative models) खुद लेबल बनाने में थोड़े अव्यवस्थित थे। एक AI के लिए यह कहना आसान है कि "यह गलत है" बजाय इसके कि वह कह सके "यहाँ एकदम सही लेबल है।"
मुख्य निष्कर्ष (The Big Takeaway)
यह पेपर साबित करता है कि कम प्रतिनिधित्व वाली भाषाओं के लिए, आपको सब कुछ लेबल करने के लिए इंसानों का इंतजार करने की आवश्यकता नहीं है। आप विकिपीडिया को एक कच्चे ड्राफ्ट के रूप में और AI जजों को उसे पॉलिश करने के लिए उपयोग कर सकते हैं।
रूपक (Metaphor):
भाषा संसाधन बनाने को घर बनाने की तरह समझें।
- पुराना तरीका: हर ईंट को हाथ से रखने के लिए राजमिस्त्रियों (इंसानों) की एक टीम को काम पर रखें। धीमा और महंगा।
- नया तरीका: ईंटों का ढेर (विकिपीडिया डेटा) डालने के लिए एक मशीन का उपयोग करें। फिर, एक बहुत ही स्मार्ट फोरमैन (AI जज) को नियुक्त करें जो वहां से गुजरे, टूटी हुई ईंटों को बाहर निकाले, और अच्छी ईंटों को व्यवस्थित करे। घर 5 गुना तेजी से बनता है, और यह रहने के लिए पर्याप्त मजबूत भी है।
यह दृष्टिकोण हर भाषा को, यहाँ तक कि छोटी भाषाओं को भी, AI की दुनिया में समान अवसर देने के लिए एक टिकाऊ मार्ग प्रदान करता है।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।