← नवीनतम पेपर
💬 NLP

Malaysian English News Decoded: A Linguistic Resource for Named Entity and Relation Extraction

यह शोध पत्र मलेशियाई अंग्रेजी समाचार (MEN) डेटासेट प्रस्तुत करता है, जो 20 समाचार लेखों से 6,061 संस्थाओं और 3,268 संबंधों वाला एक मैन्युअल रूप से एनोटेटेड संसाधन है, जो मलेशियाई अंग्रेजी के लिए अनुकूलित डेटा की कमी को संबोधित करता है और एनएलपी (NLP) मॉडल को फाइन-ट्यून करने के लिए उपयोग किए जाने पर नामित इकाई पहचान (Named Entity Recognition) प्रदर्शन में महत्वपूर्ण सुधार करता है।

मूल लेखक: Mohan Raj Chanthran, Lay-Ki Soon, Huey Fang Ong, Bhawani Selvaretnam

प्रकाशित 2026-06-02
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Mohan Raj Chanthran, Lay-Ki Soon, Huey Fang Ong, Bhawani Selvaretnam

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आपके पास SpaCy नाम का एक बहुत ही बुद्धिमान, विद्वान लाइब्रेरियन है। इस लाइब्रेरियन ने "स्टैंडर्ड इंग्लिश" (वह प्रकार जो आप ब्रिटिश या अमेरिकी पाठ्यपुस्तकों में पाते हैं) में लिखी गई लाखों किताबें पढ़ने में अपने वर्ष बिताए हैं। इस कारण, वह उन मानक किताबों में लोगों, स्थानों और संगठनों के नाम खोजने में उत्कृष्ट है।

हालाँकि, इस शोध पत्र के शोधकर्ताओं ने एक समस्या का पता लगाया: SpaCy "मलेशियाई अंग्रेजी" पढ़ते समय भ्रमित हो जाता है।

समस्या: "लोकल फ्लेवर" का भ्रम

मलेशियाई अंग्रेजी एक स्वादिष्ट, अनूठे स्टू (stew) की तरह है। यह स्टैंडर्ड इंग्लिश के आधार से बनी है, लेकिन इसे मलय, चीनी और तमिल संस्कृतियों के स्थानीय मसालों के साथ तैयार किया गया है। इसमें विशेष शब्द (जैसे nasi lemak या ang pow) और अनूठी वाक्य संरचनाएं हैं।

जब शोधकर्ताओं ने SpaCy को मलेशियाई समाचार लेख पढ़ने के लिए कहा, तो वह संघर्ष करने लगा। यह ऐसा था जैसे किसी ऐसे लाइब्रेरियन से स्ट्रीट फूड की रेसिपी को व्यवस्थित करने के लिए कहना जो केवल लाइब्रेरी की किताबों को छांटना जानता हो। लाइब्रेरियन महत्वपूर्ण सामग्रियों को पहचानने में चूक गया।

केवल 30 वाक्यों के एक परीक्षण में, SpaCy और अन्य समान उपकरणों ने नामों और स्थानों को केवल लगभग 58% सही पहचाना। वे स्थानीय उपाधियों (जैसे Datuk या Tan Sri) और विशिष्ट मलेशियाई संगठनों जैसी चीजों को पहचानने में विफल रहे। शोधकर्ताओं ने महसूस किया कि किसी ने भी विशेष रूप से मलेशियाई अंग्रेजी के लिए कोई "प्रशिक्षण नियमावली" (training manual) नहीं बनाई थी, इसलिए AI अनुमान लगा रहा था, और वह गलत अनुमान लगा रहा था।

समाधान: एक कस्टम प्रशिक्षण नियमावली बनाना

इसे ठीक करने के लिए, टीम ने अपना खुद का "प्रशिक्षण नियमावली" बनाने का निर्णय लिया, जिसे वे MEN डेटासेट (मलेशियाई अंग्रेजी समाचार डेटासेट) कहते हैं।

इस प्रक्रिया को एक नए प्रशिक्षु (apprentice) को प्रशिक्षित करने की तरह समझें:

  1. सामग्री एकत्र करना: उन्होंने प्रमुख मलेशियाई समाचार साइटों से 14,320 समाचार लेख एकत्र किए।
  2. मानवीय स्पर्श: उन्होंने उन्हें केवल कंप्यूटर द्वारा छांटने के लिए उपयोग नहीं किया। उन्होंने चार मानव विशेषज्ञों को काम पर रखा जो मलेशियाई अंग्रेजी और स्थानीय भाषा (Bahasa Malaysia) दोनों में कुशल थे।
  3. एनोटेशन (Annotation): इन मनुष्यों ने 200 लेखों को पढ़ा और प्रत्येक व्यक्ति, स्थान, संगठन और उनके बीच के संबंधों को मैन्युअल रूप से हाइलाइट किया। उन्होंने स्थानीय चीजों के लिए विशेष श्रेणियां भी बनाईं, जैसे TITLE (शाही या सम्मानजनक उपाधियों के लिए) और ROLE (मलेशिया में सामान्य विशिष्ट नौकरी के पदों के लिए)।
  4. गुणवत्ता नियंत्रण: यह सुनिश्चित करने के लिए कि मनुष्य एक-दूसरे के काम से सहमत हैं, उन्होंने एक-दूसरे के काम की जांच की। जब वे असहमत हुए, तो एक वरिष्ठ विशेषज्ञ ने निर्णायक (referee) के रूप में अंतिम निर्णय लिया।

परिणाम क्या रहा? एक विशाल, उच्च-गुणवत्ता वाला डेटासेट जिसमें 6,061 नामित संस्थाएं (named entities) और 3,268 संबंध (जैसे "व्यक्ति X संगठन Y में काम करता है") शामिल थे।

प्रयोग: लाइब्रेरियन को एक नया करतब सिखाना

एक बार जब उनके पास यह कस्टम नियमावली आ गई, तो वे वापस लाइब्रेरियन (SpaCy) के पास गए और कहा, "यहाँ, यह नियमावली पढ़ो और सीखो कि मलेशियाई नामों को कैसे पहचाना जाता है।"

उन्होंने मानक SpaCy मॉडल को लिया और उसे अपने नए मलेशियाई डेटासेट का उपयोग करके फाइन-ट्यून (fine-tune) किया। यह लाइब्रेरियन को फिर से रेसिपी छांटने के लिए कहने से पहले उसे मलेशियाई संस्कृति का क्रैश कोर्स देने जैसा है।

परिणाम: एक नाटकीय सुधार

अंतर दिन और रात जैसा था:

  • प्रशिक्षण से पहले: मानक मॉडल एक ऐसे पर्यटक की तरह था जो स्थानीय बाजार में रास्ता खोजने की कोशिश कर रहा हो; वह भटक गया और अधिकांश दुकानों को मिस कर गया।
  • प्रशिक्ण के बाद: फाइन-ट्यून्ड मॉडल एक स्थानीय विशेषज्ञ बन गया।
    • शोधकर्ताओं ने पाया कि उनके नए डेटा का उपयोग करके शून्य से एक मॉडल को प्रशिक्षित करने (spacy-blank) से 94% सटीकता स्कोर प्राप्त हुआ।
    • यहाँ तक कि वे मॉडल जो पहले से ही स्मार्ट थे लेकिन जिन्हें नए डेटा के साथ केवल "ताज़ा" किया गया था, उन्होंने अपने पिछले प्रयासों की तुलना में 200% से अधिक प्रदर्शन सुधार दिखाया।

निष्कर्ष

शोध पत्र यह निष्कर्ष निकालता है कि आप केवल स्टैंडर्ड इंग्लिश के लिए बनाए गए उपकरण को लेकर यह उम्मीद नहीं कर सकते कि वह मलेशियाई अंग्रेजी पर पूरी तरह से काम करेगा। जिस तरह आप लंदन के नक्शे का उपयोग करके कुआलालंपुर में रास्ता नहीं खोज सकते, आपको उसी तरह के क्षेत्र (terrain) के लिए विशेष रूप से निर्मित मानचित्र (डेटासेट) की आवश्यकता होती है।

इस MEN डेटासेट को बनाकर और यह दिखाकर कि यह AI प्रदर्शन में नाटकीय रूप से सुधार कैसे करता है, शोधकर्ताओं ने NLP (प्राकृतिक भाषा प्रसंस्करण) समुदाय को एक नया, आवश्यक उपकरण सौंप दिया है। उन्होंने इस डेटासेट और इसे बनाने के नियमों को GitHub पर प्रकाशित किया है, ताकि अन्य शोधकर्ता बेहतर AI बनाने के लिए इसका उपयोग कर सकें जो वास्तव में मलेशियाई आवाज को समझ सके।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →