Universal NER v2: Towards a Massively Multilingual Named Entity Recognition Benchmark
यह शोध पत्र यूनिवर्सल एनईआर (Universal NER) v2 को प्रस्तुत करता है, जो एक निरंतर चलने वाली पहल है जो अपने 2024 के पूर्ववर्ती का विस्तार करती है ताकि बहुभाषी भाषा मॉडलों के लिए मूल्यांकन संसाधनों की कमी को दूर करते हुए, एक विशाल बहुभाषी भाषाओं के सेट में गोल्ड-स्टैंडर्ड, मानकीकृत नाम इकाई पहचान (Named Entity Recognition) बेंचमार्क प्रदान किया जा सके।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आप एक रोबोट को 22 अलग-अलग भाषाओं में लिखी गई किताबों के पुस्तकालय को पढ़ना सिखाने की कोशिश कर रहे हैं। रोबोट बुद्धिमान है, लेकिन वह विशिष्ट नामों पर बार-बार ठोकर खा जाता है। वह शायद "द व्हाइट हाउस" (The White House) को एक इमारत (एक स्थान) समझ सकता है जब वाक्य राष्ट्रपति (एक संगठन) के बारे में हो, या वह किसी व्यक्ति के नाम को पूरी तरह से मिस कर सकता है क्योंकि उस भाषा में व्याकरण अलग तरह से काम करता है।
यह शोध पत्र Universal NER v2 पेश करता है, जो अनिवार्य रूप से एक विशाल, उच्च-गुणवत्ता वाला "प्रशिक्षण मैनुअल" और "अंतिम परीक्षा" है जिसे इन गलतियों को सुधारने के लिए डिज़ाइन किया गया है।
यहाँ इसका विवरण दिया गया है, जिसे रोजमर्रा के उदाहरणों का उपयोग करके समझाया गया है:
1. समस्या: रोबोट का "नाम के प्रति अंधापन"
नेम्ड एंटिटी रिकग्निशन (NER) टेक्स्ट में विशिष्ट चीजों को पहचानने और लेबल करने की कंप्यूटर की क्षमता है: लोग (People), स्थान (Places), और संगठन (Organizations)।
- पुराना तरीका: अधिकांश रोबोट मुख्य रूप से अंग्रेजी पर प्रशिक्षित थे। जब उन्होंने जापानी, कोरियाई या हिब्रू पढ़ने की कोशिश की, तो वे भ्रमित हो गए क्योंकि वे भाषाएँ शब्दों को अलग तरह से बनाती हैं (जैसे ब्लॉक्स को एक के ऊपर एक रखने बनाम उन्हें आपस में चिपकाने जैसा)।
- अंतराल: कोई निष्पक्ष, मानकीकृत परीक्षण नहीं था यह देखने के लिए कि ये रोबोट इन सभी विभिन्न भाषाओं को कितनी अच्छी तरह पढ़ सकते हैं। यह एक तैराक को केवल एक पूल में टेस्ट करने जैसा था और फिर यह उम्मीद करना कि वह बिना किसी अभ्यास के समुद्र, नदी और झील में भी तैर सके।
2. समाधान: एक वैश्विक "गोल्ड स्टैंडर्ड" लाइब्रेरी
लेखकों (विश्व भर के विश्वविद्यालयों और कंपनियों के शोधकर्ताओं की एक बड़ी टीम) ने Universal NER v2 बनाया है। इसे AI के लिए एक यूनिवर्सल जिम के रूप में समझें।
- विस्तार: उन्होंने अपने पिछले संस्करण (v1) को लिया और इसमें 11 नई भाषाएँ (जैसे ग्रीक, हिब्रू, इंडोनेशियाई और रोमानियाई) जोड़ीं।
- विविधता: उन्होंने केवल अधिक अंग्रेजी किताबें नहीं जोड़ीं। उन्होंने जोड़ा:
- विभिन्न लिपियाँ: लैटिन अक्षरों से लेकर हिब्रू लिपि और जापानी पात्रों तक।
- विभिन्न शैलियाँ: समाचार लेखों और विकिपीडिया से लेकर कानूनी दस्तावेजों और यहाँ तक कि बोले गए ट्रांसक्रिप्ट तक।
- विभिन्न व्याकरण: कुछ भाषाएँ शब्दों को आपस में जोड़ती हैं (agglutinative), जबकि अन्य शब्दों के अंत को बदल देती हैं (fusional)।
- परिणाम: अब उनके पास 22 भाषाओं को कवर करने वाले 30 डेटासेट और 3 मिलियन एनोटेटेड शब्द हैं। यह एक विशाल, विविध संग्रह है जिसे AI का परीक्षण करने के लिए डिज़ाइन किया गया है।
3. उन्होंने इसे कैसे बनाया: "मानवीय रेफरी" प्रणाली
यह सुनिश्चित करने के लिए कि प्रशिक्षण डेटा सटीक हो, उन्होंने केवल एक व्यक्ति को टेक्स्ट लेबल करने के लिए नहीं कहा।
- डबल-चेक: प्रत्येक नए डेटासेट के लिए, कम से कम दो मनुष्यों ने एक ही 5% टेक्स्ट को लेबल किया।
- सहमति स्कोर: यदि दोनों मनुष्यों के बीच असहमति हुई, तो टीम ने इसकी जांच की कि क्यों। क्या नियम अस्पष्ट था? क्या इंसान थक गया था? इसने सुनिश्चित किया कि "गोल्ड स्टैंडर्ड" वास्तव में सोना था, न कि केवल चमकता हुआ पीतल।
- नियम: उन्होंने नियमों को सरल रखा: केवल लोग, स्थान, और संगठन को लेबल करें। यदि यह कोई तारीख या धनराशि है, तो उसे अनदेखा करें। यह परीक्षण को केंद्रित रखने के लिए है।
4. बड़ा टेस्ट: रोबोट कितने स्मार्ट हैं?
लेखकों ने इस नए एग्जाम में दो प्रकार के AI को रखा:
A. "पारंपरिक" रोबोट (एनकोडर मॉडल)
- प्रदर्शन: ये रोबोट उन भाषाओं को पढ़ते समय काफी अच्छा प्रदर्शन करते थे जो उनके प्रशिक्षण के समान थीं (जैसे यूरोपीय भाषाएं)।
- संघर्ष: जब उन्होंने टाइपोलॉजिकल रूप से भिन्न भाषाओं (जैसे जापानी या कोरियाई) को पढ़ने की कोशिश की, तो उनका प्रदर्शन काफी गिर गया। यह स्पेनिश बोलने वाले व्यक्ति द्वारा मंदारिन पढ़ने जैसा है; वे कुछ आकृतियों को पहचानते हैं, लेकिन अर्थ खो जाता है।
- कमज़ोर कड़ी: वे लगातार संगठनों (Organizations) के साथ संघर्ष करते रहे। यह समझना एक रोबोट के लिए कठिन है कि "द व्हाइट हाउस" इमारत को संदर्भित करता है या प्रशासन को, बिना गहरे संदर्भ के।
B. "सुपर-इंटेलिजेंट" रोबोट (लार्ज लैंग्वेज मॉडल्स / LLMs)
- प्रयोग: हमने दुनिया के तीन सबसे स्मार्ट AI मॉडलों (जैसे कि ChatGPT या Gemini के पीछे के मॉडल) को टेक्स्ट पढ़ने और नामों को लेबल करने के लिए कहा, उन्हें ठीक वही नियम दिए जो मनुष्यों ने उपयोग किए थे।
- परिणाम: आश्चर्यजनक रूप से, यहाँ तक कि सबसे स्मार्ट AI भी मनुष्यों को हराने में विफल रहे।
- सबसे अच्छे AI ने औसतन लगभग 50% स्कोर किया, जबकि मनुष्य एक-दूसरे के साथ 74% सहमति रखते थे।
- भ्रम (Hallucination): AI "ओवर-लेबलिंग" करने लगे। उन्होंने "सरकार" जैसे सामान्य शब्द को देखा और उसे एक संगठन के रूप में लेबल किया, भले ही वह कोई विशिष्ट संगठन नहीं था।
- अंध बिंदु: कुछ भाषाओं (जैसे हिब्रू और कोरियाई) में, AI ने वास्तव में अंडर-लेबलिंग की, यानी उन्होंने उन नामों को मिस कर दिया जो स्पष्ट रूप से वहां मौजूद थे।
5. यह क्यों महत्वपूर्ण है
यह शोध पत्र केवल यह दिखाने के बारे में नहीं है कि AI अपूर्ण है (हम पहले से ही यह जानते हैं)। यह उस रूलर (माप दंड) के बारे में है जिसकी हमें प्रगति को मापने के लिए आवश्यकता है।
- डेवलपर्स के लिए: यदि आप एक ऐसा AI बनाना चाहते हैं जो इंडोनेशिया के किसान या रोमानिया के वकील के लिए काम करे, तो आप उसे केवल अंग्रेजी समाचारों पर प्रशिक्षित नहीं कर सकते। आपको यह देखने के लिए इस विशिष्ट डेटासेट की आवश्यकता है कि आपका मॉडल कहाँ विफल हो रहा है।
- भविष्य के लिए: लेखक आशा करते हैं कि यह परियोजना "यूनिवर्सल डिपेंडेंसीज" (व्याकरण के लिए एक समान परियोजना) जितनी बड़ी और प्रसिद्ध बनेगी। वे सुनिश्चित करना चाहते हैं कि भाषा तकनीक केवल "समृद्ध" भाषाओं के लिए नहीं, बल्कि हर किसी के लिए, हर जगह के लिए हो।
निचोड़
Universal NER v2 एक विशाल, बहुभाषी बाधा दौड़ (obstacle course) है। यह हमें दिखाता है कि हालांकि हमारा AI स्मार्ट हो रहा है, फिर भी यह विभिन्न मानव भाषाओं की अनूठी बारीकियों में ठोकर खाता है। शोधकर्ताओं को इन रोबोटों का परीक्षण करने के लिए एक मानकीकृत तरीका प्रदान करके, यह परियोजना हमें एक ऐसा AI बनाने में मदद करती है जो वास्तव में पूरी दुनिया को समझता है, न कि केवल इसके एक छोटे से कोने को।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।