← नवीनतम पेपर
💬 NLP

Expanding the Lexicon of Ge'ez Based African Languages: A Comparative Study of Amharic and Tigrinya

यह शोधपत्र VEXMLM को प्रस्तुत करता है, जो अम्हारिक और तिग्रिन्या जैसी गीज़-लिपि वाली भाषाओं के लिए विशेष रूप से तैयार किया गया XLM-R का एक शब्दावली-विस्तारित संस्करण है, जो एक विशिष्ट दो-चरणीय प्रशिक्षण रणनीति के माध्यम से आउट-ऑफ-वोकेबुलरी दरों और अत्यधिक सबवर्ड विखंडन को कम करके प्रश्न उत्तर, भावना विश्लेषण और नामित इकाई पहचान जैसे डाउनस्ट्रीम कार्यों पर प्रदर्शन में महत्वपूर्ण सुधार करता है, जो 17 अन्य कम-संसाधन वाली अफ्रीकी भाषाओं को भी लाभान्वित करता है।

मूल लेखक: Hailay Kidu Teklehaymanot, Debela Desalegn Yadeta, Wolfgang Nejdl

प्रकाशित 2026-07-17
📖 7 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Hailay Kidu Teklehaymanot, Debela Desalegn Yadeta, Wolfgang Nejdl

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

इंटरनेट की कल्पना एक विशाल, हलचल भरी लाइब्रेरी के रूप में करें जहाँ हज़ारों अलग-अलग भाषाओं में किताबें लिखी गई हैं। लंबे समय तक, लाइब्रेरियन (स्मार्ट कंप्यूटर प्रोग्राम जिन्हें हम आर्टिफिशियल इंटेलिजेंस कहते हैं) केवल लैटिन वर्णमाला वाली किताबों को पढ़ना जानते थे—जिसका उपयोग अंग्रेजी, स्पेनिश और फ्रेंच के लिए किया जाता है। उनके पास इन भाषाओं के लिए एक विशाल शब्दकोश था, लेकिन जब उन्होंने गीज़ (Ge'ez) लिपि में लिखी गई किताबें पढ़ने की कोशिश की, जो इथियोपिया और इरिट्रिया में उपयोग की जाती है, तो वे भ्रमित हो गए। वे शब्दों को छोटे, अर्थहीन टुकड़ों में काट देते थे या बस हाथ खड़े कर देते थे और कहते, "मुझे यह शब्द नहीं पता!" यह एक समस्या है क्योंकि यह लाखों लोगों को डिजिटल बातचीत से बाहर कर देता है, जिससे वे टेक्स्ट को समझने, उत्तर खोजने या महत्वपूर्ण नामों को पहचानने के लिए बेहतरीन उपकरणों का उपयोग करने में असमर्थ हो जाते हैं।

इसे ठीक करने के लिए, शोधकर्ताओं ने एआई मॉडल को नए शब्द सिखाने की कोशिश की है। लेकिन यह पेचीदा है। यदि आप केवल पुराने शब्दकोश में नए शब्दों को बिना यह सिखाए डाल देते हैं कि वे कैसे जुड़ते हैं, तो एआई खो जाता है। यह शोध उसी विशिष्ट चुनौती में डूबता है: एक सुपर-स्मार्ट एआई को अपग्रेड कैसे किया जाए ताकि वह अंततः अमहारिक (Amharic) और टिग्रिन्या (Tigrinya) को पढ़ और समझ सके, जो गीज़ लिपि में लिखी जाने वाली दो प्रमुख भाषाएँ हैं, और वह बाकी के 'दिमाग' को खराब किए बिना यह काम कर सके।

समस्या: वह "गोंद" जो चिपकता नहीं है

एक आधुनिक एआई भाषा मॉडल को 100 अलग-अलग भाषाओं में अद्भुत भोजन बनाने वाले एक मास्टर शेफ की तरह समझें। लेकिन इस शेफ का एक बहुत ही विशिष्ट नियम है: वे केवल पहले से पैक किए गए सामग्री के सेट (जिसे टोकन कहा जाता है) का उपयोग करते हैं जो मुख्य रूप से लैटिन-लिपि वाली भाषाओं के लिए डिज़ाइन किए गए थे। जब शेफ अमहारिक या टिग्रिन्या में व्यंजन बनाने की कोशिश करता है, तो सामग्रियाँ फिट नहीं बैठतीं। लिपि अलग है; यह एक "सिलेबिक अबुगिडा" (syllabic abugida) है, जिसका अर्थ है कि प्रत्येक प्रतीक एक व्यंजन और एक स्वर को एक साथ दर्शाता है, न कि केवल एक एकल अक्षर को।

क्योंकि शेफ की सामग्री की सूची इन भाषाओं के लिए गलत है, इसलिए वे शब्दों को छोटे, बेकार टुकड़ों में काट देते हैं। एक एकल शब्द को पाँच या छह टुकड़ों में विभाजित किया जा सकता है, और कई शब्द शेफ के भंडार में मौजूद ही नहीं होते। जब एआई किसी ऐसे शब्द का सामना करता है जिसे वह नहीं जानता, तो वह इसे केवल "UNK" (अज्ञात) के रूप में लेबल कर देता है, जिससे सारा अर्थ नष्ट हो जाता है। यह एआई को समाचार लेख में किसी व्यक्ति का नाम खोजने या यह समझने जैसे कार्यों में बहुत खराब बना देता है कि कोई ट्वीट खुशी वाला है या दुख वाला।

समाधान: VEXMLM, एक कस्टम टेलर

शोधकर्ताओं ने VEXMLM नामक एक नया दृष्टिकोण पेश किया है। कल्पना करें कि VEXMLM एक मास्टर टेलर है जो शेफ के मौजूदा, उच्च-गुणवत्ता वाले सूट (एआई मॉडल) को लेता है और उसे एक नए शरीर के प्रकार के लिए कस्टम-फिट करता है। उन्होंने केवल भंडार में नई सामग्रियाँ नहीं डालीं; उन्होंने इसे एक विशिष्ट, सावधानीपूर्वक रेसिपी के साथ किया।

सबसे पहले, उन्होंने विशेष रूप से अमहारिक और टिग्रिन्या के लिए एक नया, कस्टम शब्दकोश बनाया। उन्होंने गीज़ लिपि के साथ पूरी तरह से मेल खाने वाले 30,000 नए सबवर्ड पीस (शब्दों के टुकड़े) लिए और उन्हें एआई की शब्दावली में जोड़ दिया। यह शेफ को चाकू और मसालों का एक नया सेट देने जैसा है जो वास्तव में उन सामग्रियों के लिए उपयुक्त हैं जिन्हें वे पकाने की कोशिश कर रहे हैं।

लेकिन यहाँ चालाकी भरी बात यह है: आप केवल रेसिपी में नए घटक नहीं डाल सकते और उम्मीद नहीं कर सकते कि वे तुरंत सही स्वाद देंगे। नए शब्दों को यह जानने की आवश्यकता है कि उन्हें कैसे व्यवहार करना चाहिए। शोधकर्ताओं ने "मीन इनिशियलाइजेशन" (mean initialization) ट्रिक का उपयोग किया। नए शब्दों को क्या अर्थ होना चाहिए, इसका अंदाज़ा लगाने के बजाय, उन्होंने एआई के दिमाग में मौजूद सभी मौजूदा शब्दों के औसत "स्वाद" की गणना की और नए शब्दों को शुरुआत के लिए वही औसत स्वाद दिया। यह सुनिश्चित करता है कि नए शब्द सिस्टम को झटका दिए बिना सहजता से फिट हो जाएं।

अंत में, वे केवल शब्द जोड़ने तक ही नहीं रुके। उन्होंने एआई को अमहारिक और टिग्रिन्या टेक्स्ट के बड़े संग्रहों का उपयोग करके कुछ समय के लिए "पढ़ाई" करने दिया। यह "कंटीन्यूड प्रीट्रेनिंग" (continued pretraining) चरण है। यह शेफ को नए घटकों के साथ खाना पकाने का अभ्यास करने देने जैसा है जब तक कि वह स्वाद में महारत हासिल न कर ले। इस अध्ययन सत्र के बाद, उन्होंने एआई का विशिष्ट कार्यों जैसे प्रश्न पूछने, नाम पहचानने और भावना का पता लगाने पर परीक्षण किया।

परिणाम: एक बड़ी छलांग

परिणाम प्रभावशाली थे। अमहारिक और टिग्रिन्या पर परीक्षण किए जाने पर, नया VEXMLM मॉडल स्पष्ट विजेता था।

  • प्रश्न उत्तर (Question Answering): जब टेक्स्ट में उत्तर खोजने के लिए पूछा गया, तो पुराने मॉडल (XLM-R) ने 66% बार सटीक मिलान प्राप्त किया। VEXMLM ने इसे बढ़ाकर 87% कर दिया। यह एक बहुत बड़ा सुधार है, जिसका अर्थ है कि एआई वाक्य के पूर्ण संदर्भ को समझने में बहुत बेहतर है।
  • भावना विश्लेषण (Sentiment Analysis): यह पता लगाने के लिए कि कोई संदेश सकारात्मक है या नकारात्मक, VEXMLM ने 80% सटीकता प्राप्त की, जिसने पुराने मॉडल के 77% को पीछे छोड़ दिया और एक विशाल प्रतिस्पर्धी मॉडल (Glot500) को ध्वस्त कर दिया जिसने केवल 46% प्राप्त किया था।
  • नामों की पहचान (NER): यहीं पर "अज्ञात शब्द" की समस्या आमतौर पर सबसे अधिक नुकसान पहुँचाती है। पुराना मॉडल उन शब्दों के साथ संघर्ष करता था जिन्हें वह नहीं जानता था, और उन्हें केवल 81.4% बार सही पाता था। VEXMLM ने इसे बढ़ाकर 94.3% कर दिया।

दिलचस्प बात यह है कि शोधकर्ताओं ने पाया कि जबकि नई शब्दावली विशेष रूप से अमहारिक और टिग्रिन्या के लिए बनाई गई थी, इसके लाभ अन्य अफ्रीकी भाषाओं को भी मिले। यहाँ तक कि वे भाषाएँ भी जिन्होंने गीज़ लिपि का उपयोग नहीं किया, उनमें भी अज्ञात शब्दों को पहचानने में सुधार देखा गया। लेखकों का सुझाव है कि ऐसा इसलिए हुआ क्योंकि "अध्ययन सत्र" (कंटीन्यूड प्रीट्रेनिंग) ने एआई को केवल नए शब्दों के बजाय सामान्य रूप से जटिल शब्द संरचनाओं को संभालने में बेहतर बनाने में मदद की।

इसका क्या अर्थ है

यह शोध पत्र दिखाता है कि कम संसाधन वाली भाषाओं की मदद करने के लिए आपको शून्य से एक विशाल, महंगी एआई बनाने की आवश्यकता नहीं है। इसके बजाय, आप एक शक्तिशाली मौजूदा मॉडल ले सकते हैं, उसे अपनी विशिष्ट लिपि के लिए अनुकूलित शब्दावली दे सकते हैं, और उसे वास्तविक टेक्स्ट के साथ अभ्यास करने दे सकते हैं। अध्ययन साबित करता है कि यह लक्षित दृष्टिकोण मॉडल को बड़ा बनाने या खुद सीखने की उम्मीद करने से बेहतर काम करता है।

हालाँकि, शोधकर्ता सावधानी बरतते हुए कहते हैं कि यह हर समस्या के लिए जादू की छड़ी नहीं है। सुधार विशेष रूप से उन भाषाओं के लिए सबसे नाटकीय थे जिन पर उन्होंने प्रशिक्षण दिया था (अमहारिक और टिग्रिन्या)। अन्य भाषाओं के लिए, लाभ प्रशिक्षण प्रक्रिया का एक सहायक प्रभाव था, न कि नए शब्दकोश का सीधा परिणाम। वे यह भी बताते हैं कि उनके मॉडल की अभी भी सीमाएँ हैं, जैसे कि एक बार में पढ़ सकने वाली अधिकतम वाक्य लंबाई, जो इसे बहुत लंबे दस्तावेज़ों के साथ संघर्ष करने में डाल सकती है।

अंत में, VEXMLM एक प्रमाण है: सही उपकरणों और थोड़े केंद्रित अभ्यास के साथ, हम एआई को बहुत अधिक समावेशी बना सकते हैं, यह सुनिश्चित करते हुए कि गीज़-लिपि वाली भाषाओं के बोलने वाले डिजिटल युग में पीछे न छूट जाएँ।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →