← नवीनतम पेपर
💬 NLP

ANGOFA: Leveraging OFA Embedding Initialization and Synthetic Data for Angolan Language Model

यह शोधपत्र ANGOFA को प्रस्तुत करता है, जो अंगोलन भाषाओं के लिए चार प्री-ट्रेंड लैंग्वेज मॉडल्स का एक समूह है, जो मौजूदा स्टेट-ऑफ-द-आर्ट मॉडल्स से काफी बेहतर प्रदर्शन करने के लिए मल्टीलिंगुअल एडेप्टिव फाइन-ट्यूनिंग फ्रेमवर्क के भीतर इन्फॉर्म्ड एम्बेडिंग इनिशियलाइजेशन और सिंथेटिक डेटा का लाभ उठाता है।

मूल लेखक: Osvaldo Luamba Quinjica, David Ifeoluwa Adelani

प्रकाशित 2026-05-08
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Osvaldo Luamba Quinjica, David Ifeoluwa Adelani

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

मुख्य चित्र: मेज पर खाली सीटों को भरना

कल्पना कीजिए कि आर्टिफिशियल इंटेलिजेंस (AI) भाषा मॉडलों की दुनिया एक विशाल, हाई-टेक लाइब्रेरी (पुस्तकालय) की तरह है। लंबे समय से, यह लाइब्रेरी अंग्रेजी, स्पेनिश और मंदारिन जैसी प्रमुख भाषाओं में अपनी अलमारियों को भर रही है। हालाँकि, कई अफ्रीकी भाषाओं के लिए ये अलमारियाँ लगभग खाली हैं।

यह शोध पत्र अंगोला पर केंद्रित है, जो 40 से अधिक भाषाओं वाला एक देश है। जबकि AI लाइब्रेरी के पास कुछ अफ्रीकी भाषाओं के लिए किताबें हैं, इसने अंगोला की पांच सबसे अधिक बोली जाने वाली भाषाओं को काफी हद तक अनदेखा किया है: उम्बुंडु (Umbundu), किम्बुंडु (Kimbundu), किकोंगो (Kikongo), चोक्वे (Chokwe) और लुबा-कासाई (Luba-Kasai)

लेखकों ने इसे ठीक करने का प्रयास किया। उन्होंने शून्य से एक बिल्कुल नई लाइब्रेरी बनाने की कोशिश नहीं की (जो अविश्वसनीय रूप से महंगी और धीमी है)। इसके बजाय, उन्होंने एक मौजूदा, अच्छी तरह से सुसज्जित लाइब्रेरी ली और विशेष रूप से इन अंगोला की भाषाओं के लिए नए खंड सावधानीपूर्वक जोड़े।

समस्या: "आउट ऑफ वोकैबुलरी" (Out of Vocabulary) ग्लिच

जब आप कंप्यूटर को एक नई भाषा सिखाते हैं, तो उसे अक्सर "आउट ऑफ वोकैबुलरी" (OOV) नामक समस्या का सामना करना पड़ता है। कल्पना कीजिए कि आप एक शेफ को सिखाने की कोशिश कर रहे हैं जो केवल फ्रेंच जानता है कि एक पारंपरिक अंगोला व्यंजन कैसे बनाया जाए। यदि शेफ को स्थानीय सामग्रियों (जैसे ndanda या mucoque) के नाम नहीं पता हैं, तो वह भोजन नहीं बना पाएगा।

AI के संदर्भ में, मॉडल उन शब्दों को देखता है जिन्हें उसने पहले कभी नहीं देखा है और उन्हें निरर्थक (gibberish) मान लेता है। इसे ठीक करने के लिए, लेखकों को इन नए शब्दों को शामिल करने के लिए मॉडल के "शब्दकोश" का विस्तार करना पड़ा।

तीन गुप्त सामग्रियाँ

यह शोध पत्र ANGOFA नामक एक नया मॉडल पेश करता है। इस मॉडल को पिछले प्रयासों की तुलना में बेहतर बनाने के लिए, लेखकों ने तीन विशिष्ट "गुप्त सामग्रियों" का उपयोग किया:

1. स्मार्ट डिक्शनरी एक्सपेंशन (शब्दकोश विस्तार)

शब्दकोश में नए शब्द बेतरतीब ढंग से जोड़ने के बजाय, उन्होंने यह सुनिश्चित किया कि मॉडल वास्तव में नई लिपियों को पढ़ और समझ सके। यह शेफ को खाना शुरू करने से पहले स्थानीय सामग्रियों की एक शब्दावली देने जैसा है।

2. "OFA" शॉर्टकट (एम्बेडिंग इनिशियलाइजेशन)

यह सबसे तकनीकी हिस्सा है, लेकिन यहाँ उपमा दी गई है:
कल्पना कीजिए कि आप एक छात्र को एक नया विषय सिखा रहे हैं।

  • रैंडम इनिशियलाइजेशन (Random Initialization): आप छात्र को एक खाली नोटबुक थमाते हैं और कहते हैं, "शुभकामनाएं, खुद ही समझ लो।" यह धीमा और अक्षम है।
  • OFA (पेपर का तरीका): आप छात्र को एक ऐसी नोटबुक देते हैं जिसमें पहले से ही नए विषय का ढांचा है, लेकिन वह एक समान विषय के नोट्स से भरा हुआ है जिसे वह पहले से जानता है। आप उनसे कहते हैं, "यह नया विषय उस विषय के बहुत समान है जो आपने पिछले साल पढ़ा था; उन कनेक्शनों का उपयोग तेजी से सीखने के लिए करें।"

लेखकों ने OFA तकनीक का उपयोग किया (OFA का अर्थ एक विशिष्ट "एम्बेडिंग इनिशियलाइजेशन" विधि है)। नए भाषा के डेटा को शून्य से शुरू करने के बजाय, उन्होंने उस "ज्ञान" का उपयोग किया जो AI के पास पहले से ही समान भाषाओं के बारे में था ताकि नए डेटा को "प्राइम" किया जा सके। यह एक पड़ोसी देश के मानचित्र का उपयोग करके एक नए देश में रास्ता खोजने में मदद करने जैसा है।

3. सिंथेटिक डेटा (द "नकली" अभ्यास टेस्ट)

अंगोला की भाषाओं के साथ सबसे बड़ी समस्या यह है कि उनमें बहुत कम वास्तविक किताबें, समाचार लेख या वेबसाइटें उपलब्ध हैं। यह एक मैराथन धावक को प्रशिक्षित करने की कोशिश करने जैसा है लेकिन उसके पास अभ्यास करने के लिए केवल 10 मीटर का ट्रैक है।

इस समस्या को हल करने के लिए, लेखकों ने सिंथेटिक डेटा का उपयोग किया। उन्होंने अंग्रेजी में मौजूद मौजूदा समाचार कहानियों को लिया और एक अनुवाद उपकरण का उपयोग करके उन्हें अंगोला की भाषाओं में "अनुवादित" किया।

  • उपमा: यह एक भाषा छात्र के अभ्यास करने जैसा है जो अंग्रेजी से अनुवादित की गई पाठ्यपुस्तक के साथ अभ्यास कर रहा है। यह कोई मूल वक्ता (native speaker) नहीं है जो किताब लिख रहा है, लेकिन यह व्याकरण और शब्दावली सीखने के लिए पर्याप्त अभ्यास सामग्री प्रदान करता है।
  • उन्होंने इस "अभ्यास" सामग्री को उस बहुत कम मात्रा में मिली "वास्तविक" सामग्री के साथ जोड़ा जो उन्हें मिल सकी थी।

परिणाम: दौड़ में कौन जीता?

लेखकों ने अपने नए मॉडल (ANGOFA) का परीक्षण अन्य मौजूदा मॉडलों के विरुद्ध एक "टेक्स्ट क्लासिफिकेशन" (पाठ वर्गीकरण) परीक्षण का उपयोग करके किया (मूल रूप से AI से यह अनुमान लगाने के लिए कहना कि क्या वाक्य खेल, राजनीति या स्वास्थ्य के बारे में है)।

यहाँ तुलना दी गई है:

  1. "फ्रॉम स्क्रैच" (शून्य से शुरू होने वाले) मॉडल: ये वे मॉडल हैं जिन्हें एक साथ सैकड़ों भाषाओं पर प्रशिक्षित किया गया है। वे ठीक थे, लेकिन अंगोला की भाषाओं के लिए बहुत अच्छे नहीं थे क्योंकि वे बहुत अधिक फैले हुए थे।
  2. "एडेप्टेड" (अनुकूलित) मॉडल (MAFT): ये वे मॉडल हैं जिन्होंने अफ्रीकी भाषाओं के लिए मौजूदा AI को थोड़ा बदला (tweak किया) था। इन्होंने बेहतर प्रदर्शन किया।
  3. "OFA" मॉडल: इन्होंने ऊपर बताए गए "स्मार्ट शॉर्टकट" का उपयोग किया। इन्होंने और भी बेहतर प्रदर्शन किया।
  4. ANGOFA (विजेता): इस मॉडल ने दोनों का उपयोग किया—स्मार्ट शॉर्टकट (OFA) और सिंथेटिक डेटा (अनुवादित अभ्यास टेस्ट)।

परिणाम:

  • ANGOFA ने पिछले सर्वश्रेष्ठ मॉडल को एक महत्वपूर्ण अंतर (लगभग 12.3 अंक) से पीछे छोड़ दिया।
  • इसने साबित कर दिया कि आपको शून्य से एक विशाल लाइब्रेरी बनाने की आवश्यकता नहीं है। यदि आप एक अच्छी मौजूदा लाइब्रेरी लेते हैं, स्मार्ट शॉर्टकट का उपयोग करके उसे नई भाषाएँ सिखाते हैं, और उसे पर्याप्त अभ्यास सामग्री (भले ही वह सिंथेटिक हो) देते हैं, तो वह बहुत जल्दी विशेषज्ञ बन सकती है।

निष्कर्ष

शोध पत्र निष्कर्ष निकालता है कि बहुत कम डेटा वाली भाषाओं (जैसे अंगोला में) के लिए, सबसे अच्छी रणनीति मल्टीलिंगुअल एडेप्टिव फाइन-ट्यूनिंग (MAFT) है, जिसे OFA इनिशियलाइजेशन और सिंथेटिक डेटा के साथ जोड़ा गया है।

उन्होंने पाया कि:

  • क्षेत्र-विशिष्ट मॉडल (कुछ संबंधित भाषाओं पर केंद्रित) अक्सर विशाल वैश्विक मॉडलों की तुलना में बेहतर काम करते हैं।
  • "स्मार्ट" इनिशियलाइजेशन (OFA) का उपयोग करना रैंडम अनुमान लगाने से कहीं बेहतर है।
  • भले ही "वास्तविक" डेटा कम हो, सिंथेटिक डेटा जोड़ने से मॉडल को काफी अधिक सीखने में मदद मिलती है।

संक्षेप में, उन्होंने अंगोला की भाषाओं के लिए एक विशेष, उच्च-प्रदर्शन वाला AI बनाया क्योंकि वे इस बारे में स्मार्ट थे कि वे इसे कैसे सिखाते हैं, न कि केवल एक बड़ा मॉडल बनाने के लिए अधिक पैसा खर्च करने के बारे में।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →