← नवीनतम पेपर
💬 NLP

YoNER: A New Yorùbá Multi-domain Named Entity Recognition Dataset

यह शोध पत्र YoNER को प्रस्तुत करता है, जो योरोबा भाषा के लिए पाँच विविध डोमेन में 5,000 वाक्यों वाला एक नया उच्च-गुणवत्ता वाला, बहु-डोमेन नामयुक्त इकाई पहचान (Named Entity Recognition) डेटासेट है, साथ ही इसमें OyoBERT भाषा मॉडल की रिलीज़ और एक व्यापक बेंचमार्क भी शामिल है जो क्रॉस-डोमेन सामान्यीकरण की चुनौतियों और इस कार्य के लिए अफ्रीकी-केंद्रित मॉडलों की श्रेष्ठता को प्रदर्शित करता है।

मूल लेखक: Peace Busola Falola, Jesujoba O. Alabi, Solomon O. Akinola, Folashade T. Ogunajo, Emmanuel Oluwadunsin Alabi, David Ifeoluwa Adelani

प्रकाशित 2026-04-08
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Peace Busola Falola, Jesujoba O. Alabi, Solomon O. Akinola, Folashade T. Ogunajo, Emmanuel Oluwadunsin Alabi, David Ifeoluwa Adelani

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक रोबोट को कहानी की किताब पढ़ना सिखाने की कोशिश कर रहे हैं। आप चाहते हैं कि रोबोट विशिष्ट चीजों को पहचान सके जैसे कि लोगों के नाम, स्थानों के नाम, और संस्थाओं के नाम (जैसे कोई स्कूल या कंपनी)। इस कार्य को नेमड एंटिटी रिकग्निशन (NER) कहा जाता है।

अंग्रेजी जैसी भाषाओं के लिए, हमारे पास रोबोट को सिखाने के लिए लाखों कहानी की किताबें, समाचार लेख और वेबसाइटें हैं। लेकिन योरूबा (एक प्रमुख भाषा जो नाइजीरिया और पड़ोसी देशों में 5 करोड़ से अधिक लोगों द्वारा बोली जाती है) के लिए, रोबोट के पास सीखने के लिए बहुत कम सामग्री है। अब तक, रोबोट के लिए उपलब्ध एकमात्र "किताबें" मुख्य रूप से समाचार रिपोर्ट और विकिपीडिया लेख थे।

यह शोध पत्र एक नया, बहुत बड़ा पुस्तकालय पेश करता है जिसे YoNER कहा जाता है।

यहाँ बताया गया है कि शोधकर्ताओं ने क्या किया, कुछ मजेदार उपमाओं का उपयोग करते हुए:

1. समस्या: रोबोट केवल "समाचार" जानता है

कल्पना कीजिए कि आपने एक रोबोट को जानवरों को पहचानने के लिए प्रशिक्षित किया, लेकिन आपने उसे केवल चिड़ियाघर के शेर और बाघों की तस्वीरें दिखाईं। यदि आप फिर उसे जंगल में एक शेर या कार्टून में एक बाघ दिखाते हैं, तो रोबोट भ्रमित हो सकता है।

इसी तरह, पिछले योरूबा डेटासेट उस "चिड़ियाघर" की तरह थे। उनमें केवल समाचार (बहुत औपचारिक) और विकिपीडिया (विश्वकोश संबंधी) शामिल थे। उनमें निम्नलिखित नहीं थे:

  • बाइबल की कहानियाँ (प्राचीन नाम और स्थान)।
  • ब्लॉग (कैजुअल स्लैंग और इंटरनेट की बातें)।
  • फिल्में (नाटकीय संवाद और चिल्लाना)।
  • रेडियो शो (औपचारिक और अनौपचारिक का मिश्रण)।

जब रोबोट इन विभिन्न "दुनियाओं" को समझने की कोशिश करता था, तो वह विफल हो रहा था।

2. समाधान: YoNER (नया पुस्तकालय)

शोधकर्ताओं ने YoNER बनाया, जो एक नया डेटासेट है जो एक विशाल, विविध पुस्तकालय की तरह कार्य करता है। उन्होंने पांच अलग-अलग "पड़ोसों" से लगभग 5,000 वाक्य एकत्र किए:

  • बाइबल: प्राचीन नामों और स्थानों से भरपूर।
  • ब्लॉग: स्लैंग, चुटकुलों और अनौपचारिक बातचीत से भरपूर।
  • फिल्में: नाटकीय संवादों से भरपूर।
  • रेडियो: समाचार और बातचीत का मिश्रण।
  • विकिपीडिया: औपचारिक विश्वकोश।

उन्होंने तीन मूल निवासी योरूबा वक्ताओं को काम पर रखा ताकि वे इन वाक्यों को मैन्युअल रूप से पढ़ सकें और नामों, स्थानों और संस्थाओं को हाइलाइट कर सकें। यह एक विशेषज्ञ लाइब्रेरियन द्वारा रोबोट के होमवर्क की दोबारा जांच करने जैसा है ताकि यह सुनिश्चित किया जा सके कि वह 100% सही है।

3. प्रयोग: रोबोट का परीक्षण करना

एक बार जब उनके पास यह नया पुस्तकालय आ गया, तो उन्होंने यह देखने के लिए तीन मुख्य परीक्षण चलाए कि रोबोट कितनी अच्छी तरह सीख सकता है:

परीक्षण A: क्या एक "समाचार" शिक्षक "फिल्म" के छात्रों को पढ़ा सकता है?
उन्होंने केवल समाचार डेटा (पुराने तरीके) का उपयोग करके एक रोबोट को प्रशिक्षित किया और उससे फिल्में और ब्लॉग पढ़ने के लिए कहा।

  • परिणाम: रोबोट संघर्ष करता रहा। यह एक छात्र को कानूनी अनुबंधों पर ट्यूटोरियल देकर रैप गाना लिखने सिखाने जैसा था। रोबोट स्लैंग और ड्रामा से भ्रमित हो गया।
  • अच्छी खबर: जब वह समाचार से विकिपीडिया की ओर बढ़ा, तो उसने ठीक-ठाक प्रदर्शन किया, क्योंकि दोनों औपचारिक और गंभीर हैं।

परीक्षण B: क्या "छोटा नमूना" मदद करता है?
उन्होंने रोबोट को किसी विशिष्ट डोमेन (जैसे केवल 200 फिल्म वाक्य) का एक छोटा सा हिस्सा दिया ताकि यह देखा जा सके कि क्या थोड़ी सी मदद से समस्या हल हो सकती है।

  • परिणाम: हाँ! विशिष्ट अभ्यास के थोड़े से अंश ने भी रोबोट को उस विशिष्ट दुनिया को बहुत बेहतर ढंग से समझने में मदद की।

परीक्षण C: "विशेषज्ञ" बनाम "सामान्यज्ञ"
उन्होंने दो प्रकार के रोबोटों की तुलना की:

  1. सामान्यज्ञ (बहुभाषी): एक रोबोट जो 100+ भाषाएँ बोलता है लेकिन किसी एक भाषा का विशेषज्ञ नहीं है।
  2. विशेषज्ञ (एकभाषी): एक रोबोट जिसे उन्होंने शून्य से बनाया जो केवल योरूबा बोलता है (जिसे OyoBERT कहा जाता है)।
  • परिणाम: विशेषज्ञ (OyoBERT) योरूबा के विशिष्ट सांस्कृतिक बारीकियों को समझने में बेहतर था, विशेष रूप से फिल्मों और रेडियो में। हालाँकि, सामान्यज्ञ विभिन्न विषयों के बीच जाने में बहुत अच्छा था क्योंकि उसने अन्य भाषाओं से बहुत सारा डेटा देखा था।

4. मुख्य निष्कर्ष

  • एक ही आकार सबके लिए उपयुक्त नहीं है: आप केवल समाचार पर एक रोबोट को प्रशिक्षित नहीं कर सकते और उम्मीद नहीं कर सकते कि वह फिल्मों या बाइबल को समझ लेगा। आपको उन सभी अलग-अलग "पड़ोसों" से डेटा की आवश्यकता है।
  • स्थानीय विशेषज्ञ जीतते हैं: एक मॉडल जो विशेष रूप से योरूबा के लिए बनाया गया है (OyoBERT), वह सामान्य वैश्विक मॉडलों की तुलना में बेहतर प्रदर्शन करता है, जो यह सिद्ध करता है कि हमें अफ्रीकी भाषाओं के लिए विशेष उपकरण बनाने की आवश्यकता है, न कि केवल अंग्रेजी से अनुवाद करने वाले उपकरण।
  • "अंतराल" वास्तविक है: औपचारिक पाठ (समाचार) से अनौपचारिक पाठ (ब्लॉग/फिल्में) की ओर जाना सबसे कठिन चुनौती है। रोबोट स्लैंग और ड्रामा में खो जाता है।

यह क्यों मायने रखता है?

AI को एक कक्षा में नए छात्र के रूप में सोचें। यदि आप उन्हें केवल पाठ्यपुस्तकें देते हैं, तो वे खेल के मैदान की स्लैंग वाली अचानक परीक्षा (पॉप क्विज़) में विफल हो जाएंगे। YoNER बनाकर, ये शोधकर्ता AI छात्र को एक पूर्ण शिक्षा दे रहे हैं—चर्च से लेकर सिनेमा तक, रेडियो से लेकर ब्लॉग तक।

वे OyoBERT मॉडल (विशेषज्ञ रोबोट) को भी जनता के लिए जारी कर रहे हैं। इसका मतलब है कि अन्य डेवलपर्स अब योरूबा बोलने वालों के लिए बेहतर ऐप बना सकते हैं, जैसे कि वॉइस असिस्टेंट जो स्थानीय स्लैंग को समझते हैं या सर्च इंजन जो केवल समाचार सुर्खियों को ही नहीं, बल्कि सही फिल्म पात्रों को भी खोजते हैं।

संक्षेप में: उन्होंने एक विविध शब्दकोश और एक कस्टम-प्रशिक्षित रोबोट बनाया है ताकि AI अंततः योरूबा भाषा की समृद्ध, विविध और सुंदर दुनिया को समझ सके।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →