← नवीनतम पेपर
💻 computer science

AfriqueLLM: How Data Mixing and Model Architecture Impact Continued Pre-training for African Languages

यह शोध पत्र AfriqueLLM को प्रस्तुत करता है, जो निरंतर प्री-ट्रेनिंग (continued pre-training) के माध्यम से 20 अफ्रीकी भाषाओं के अनुकूलित ओपन लार्ज लैंग्वेज मॉडल्स का एक समूह है, जो यह प्रदर्शित करता है कि रणनीतिक डेटा मिश्रण—जिसमें गणित, कोड और सिंथेटिक अनुवाद शामिल हैं—प्रदर्शन में वृद्धि का प्राथमिक चालक है और कि बेस मॉडल के पैमाने या प्रारंभिक बहुभाषी क्षमताओं की तुलना में मजबूत आर्किटेक्चर और कार्य-संरेखित डेटा अधिक महत्वपूर्ण हैं।

मूल लेखक: Hao Yu, Tianyi Xu, Michael A. Hedderich, Wassim Hamidouche, Syed Waqas Zamir, David Ifeoluwa Adelani

प्रकाशित 2026-05-06
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Hao Yu, Tianyi Xu, Michael A. Hedderich, Wassim Hamidouche, Syed Waqas Zamir, David Ifeoluwa Adelani

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

यहाँ AfriqueLLM पेपर का विवरण दिया गया है, जिसे रोज़मर्रा की भाषा और रचनात्मक उपमाओं (analogies) के साथ अनुवादित किया गया है।

बड़ी तस्वीर: AI की दुनिया में खाली जगहों को भरना

कल्पना कीजिए कि लार्ज लैंग्वेज मॉडल्स (LLMs) की दुनिया ज्ञान का एक विशाल पुस्तकालय है। लंबे समय से, यह पुस्तकालय मुख्य रूप से अंग्रेजी, चीनी और कुछ अन्य प्रमुख भाषाओं की किताबों से भरा रहा है। यदि आप पुस्तकालय के "स्मार्ट लाइब्रेरियन" (AI) से स्वाहिली, हौसा या योरूबा में कोई सवाल पूछते हैं, तो लाइब्रेरियन अक्सर लड़खड़ा जाता है, अस्पष्ट उत्तर देता है, या बस कहता है, "मुझे वह भाषा नहीं पता।"

जबकि कुछ "प्रोपराइटरी" (मालिकाना) लाइब्रेरियन (जैसे बड़ी टेक कंपनियों के) इसमें बेहतर हो रहे हैं, "ओपन-सोर्स" लाइब्रेरियन (मुफ्त मॉडल जिनका उपयोग कोई भी कर सकता है) अफ्रीकी भाषाओं के साथ अभी भी काफी संघर्ष कर रहे हैं।

लक्ष्य: शोधकर्ताओं ने 20 अफ्रीकी भाषाओं में पारंगत होने वाली ओपन-सोर्स लाइब्रेरियन की एक टीम बनाने का लक्ष्य रखा, जो न केवल बातचीत करने में सक्षम हों, बल्कि गणित करने, कोड लिखने और जटिल दस्तावेजों को समझने में भी सक्षम हों।

रेसिपी: उन्होंने इसे कैसे किया (कंटीन्यूड प्री-ट्रेनिंग)

एक नया लाइब्रेरियन शुरू से बनाने के बजाय (जिसमें वर्षों और करोड़ों डॉलर लगते हैं), उन्होंने मौजूदा, स्मार्ट लाइब्रेरियन (जैसे Llama 3.1, Gemma 3, और Qwen 3) को लिया और उन्हें एक "रिफ्रेशर कोर्स" दिया। इस प्रक्रिया को कंटीन्यूड प्री-ट्रेनिंग (CPT) कहा जाता है।

इसे एक ऐसे कुशल शेफ को लेने जैसा समझें जो फ्रांसीसी व्यंजन बनाना जानता है, और फिर उसे प्रामाणिक अफ्रीकी व्यंजन बनाना सीखने के लिए एक विशेष प्रशिक्षण शिविर में भेजना।

गुप्त सामग्री: डेटा मिक्सिंग (Data Mixing)

इस पेपर की सबसे महत्वपूर्ण खोज यह है कि आप मॉडल को क्या खिलाते हैं, यह इस बात से अधिक मायने रखता है कि मॉडल कितना बड़ा है।

शोधकर्ताओं ने प्रशिक्षण शिविर के लिए अलग-अलग "मेन्यू" (डेटा मिश्रण) आजमाए:

  1. मोनोलिंगुअल मेन्यू (Monolingual Menu): इंटरनेट से अफ्रीकी भाषाओं में केवल कच्चा टेक्स्ट (raw text)।
    • परिणाम: बुनियादी बातचीत के लिए अच्छा, लेकिन मॉडल गणित या तर्क (logic) करना भूलने लगे। यह एक छात्र को केवल कॉमिक बुक्स खिलाने जैसा है; वे कॉमिक्स पढ़ने में तो अच्छे हो जाते हैं लेकिन अपने गणित कौशल को खो देते हैं।
  2. "सुपरचार्ज्ड" मेन्यू (CMS): उन्होंने इसमें कोड (प्रोग्रामिंग), मैथ (शैक्षिक समस्याएं), और सिंथेटिक डेटा (अंग्रेजी से अफ्रीकी भाषाओं में उच्च गुणवत्ता वाले अनुवादित टेक्स्ट) जोड़ा।
    • परिणाम: यह विजेता रहा। कोड और गणित जोड़ने से वे "संज्ञानात्मक एंकर" (cognitive anchors) के रूप la काम करते हैं। जिस तरह वजन उठाने से आपकी मांसपेशियां मजबूत होती हैं, उसी तरह गणित की समस्याओं को हल करने और कोड लिखने ने मॉडल की तर्क करने की क्षमता को मजबूत किया, भले ही वह अफ्रीकी भाषाओं में बोल रहा हो।

उपमा: कल्पना कीजिए कि आप केवल रैंडम ट्वीट्स पढ़कर एक नई भाषा सीखने की कोशिश कर रहे हैं। आप स्लैंग (slang) सीख सकते हैं, लेकिन आप व्याकरण या तर्क नहीं सीखेंगे। लेकिन यदि आप उसी भाषा में गणित की पाठ्यपुस्तकें और कोडिंग मैनुअल भी पढ़ते हैं, तो आपका मस्तिष्क मजबूत संबंध बनाता है, जिससे आप समग्र रूप से अधिक बुद्धिमान बनते हैं।

आश्चर्यजनक निष्कर्ष

1. "ज़ीरो-टू-हीरो" प्रभाव (The "Zero-to-Hero" Effect)

शोधकर्ताओं ने तीन अलग-अलग "बेस" लाइब्रेरियन का परीक्षण किया। उनमें से एक, Qwen 3, मूल रूप से अफ्रीकी भाषाओं में बहुत खराब था (उसे लगभग कुछ भी नहीं पता था)। हालांकि, "सुपरचार्ज्ड मेन्यू" प्रशिक्षण के बाद, Qwen 3 केवल बेहतर ही नहीं हुआ; वह सर्वश्रेष्ठ प्रदर्शन करने वाला बन गया, यहाँ तक कि उन मॉडल्स को भी पीछे छोड़ दिया जो मूल रूप से उन भाषाओं में बहुत मजबूत थे।

  • रूपक: यह उस छात्र को लेने जैसा है जो गणित की क्लास में मुश्किल से पास हुआ था लेकिन उसमें तर्क (logic) के लिए जीनियस-स्तर की क्षमता थी, और फिर उसे सही अध्ययन सामग्री दी। वे केवल बराबरी पर नहीं आए; उन्होंने उन छात्रों को भी पीछे छोड़ दिया जो पहले से ही गणित में अच्छे थे लेकिन जिनका तार्किक आधार कमजोर था।
  • सबक: एक मॉडल की अंतर्निहित "ब्रेन पावर" (आर्किटेक्चर) उस जानकारी से अधिक महत्वपूर्ण है जो वह प्रशिक्षण से पहले पहले से जानता था।

2. आकार ही सब कुछ नहीं है

आमतौर पर, AI में, बड़ा बेहतर होता है। एक 14-बिलियन पैरामीटर वाला मॉडल 8-बिलियन वाले से बेहतर होने की उम्मीद की जाती है। लेकिन यहाँ, Qwen 3 8B मॉडल (छोटा) प्रशिक्षण के बाद Gemma 3 12B मॉडल (बड़ा) के लगभग बराबर या उससे बेहतर प्रदर्शन करता है।

  • रूपक: यह सबसे बड़े दिमाग के बारे में नहीं है; यह सही तरह के दिमाग और सही भोजन के बारे में है। एक छोटा, अच्छी तरह से संरचित दिमाग जिसे सही डेटा खिलाया गया, उसने एक बड़े, कम-संरचित दिमाग से बेहतर प्रदर्शन किया।

3. "कैटास्ट्रोफिक फॉरगेटिंग" (विस्मृति) की समस्या

जब आप किसी मॉडल को एक नई भाषा सिखाते हैं, तो वह कभी-कभी अपनी मूल भाषाएं (जैसे अंग्रेजी) भूल जाता है।

  • निष्कर्ष: "सुपरचार्ज्ड मेन्यू" (कोड + मैथ + सिंथेटिक डेटा) के साथ प्रशिक्षित मॉडल अफ्रीकी भाषाएँ सीखते समय अंग्रेजी को याद रखने में बहुत बेहतर थे।
  • रूपक: यदि आप केवल फ्रेंच का अध्ययन करते हैं, तो आप अपनी मातृभाषा अंग्रेजी को भूल सकते हैं। लेकिन यदि आप फ्रेंच के साथ-साथ उन्नत तर्क पहेलियों (गणित/कोड) का अध्ययन करते हैं, तो आपका मस्तिष्क दोनों क्षेत्रों में तेज रहता है।

परिणाम: वे अब क्या कर सकते हैं?

अंतिम मॉडल्स, जिन्हें AfriqueLLM कहा जाता है, अब किसी के भी उपयोग के लिए उपलब्ध हैं। वे:

  • पूरे दस्तावेजों का अनुवाद कर सकते हैं (केवल वाक्यों का नहीं) उच्च सटीकता के साथ।
  • अफ्रीकी भाषाओं में गणित की समस्याओं को हल कर सकते हैं (एक ऐसा कार्य जहाँ पिछले मॉडल्स विफल रहे थे)।
  • लंबे टेक्स्ट पर संदर्भ (context) को समझ सकते हैं (जैसे पूरा समाचार लेख पढ़ना और उसका सारांश बनाना)।

सीमाएं (उन्होंने क्या नहीं किया)

लेखक अपने काम की सीमाओं के प्रति ईमानदार हैं:

  • दायरा (Scope): उन्होंने 20 भाषाओं को कवर किया, लेकिन सैकड़ों अफ्रीकी भाषाएं ऐसी हैं जहाँ वे अभी तक नहीं पहुँच सके हैं।
  • पैमाना (Scale): वे 14 बिलियन पैरामीटर्स तक ही रुके। उन्होंने विशाल 30+ बिलियन मॉडल्स का परीक्षण नहीं किया, इसलिए हमें नहीं पता कि परिणाम और भी बेहतर होंगे या नहीं।
  • इंस्ट्रक्शन ट्यूनिंग (Instruction Tuning): ये मॉडल "बेस" मॉडल हैं। वे एक ऐसे छात्र की तरह हैं जिन्होंने सभी पाठ्यपुस्तकें पढ़ ली हैं लेकिन उन्हें अभी तक विशिष्ट निर्देशों का पालन करने या एक सहायक की तरह चैट करने के लिए नहीं सिखाया गया है। यह अगला चरण है।

सारांश

यह पेपर तर्क देता है कि अफ्रीकी भाषाओं के लिए AI को काम करने योग्य बनाने के लिए, हमें केवल उस पर अधिक कच्चा टेक्स्ट नहीं डालना चाहिए। इसके बजाय, हमें इसे कोड, गणित और उच्च गुणवत्ता वाले अनुवादों का एक संतुलित आहार देना चाहिए। जब आप ऐसा करते हैं, तो एक ऐसा मॉडल भी जो भाषा के शून्य ज्ञान के साथ शुरू हुआ था, एक शक्तिशाली मॉडल बन सकता है, जो बेहतर शुरुआत पाने वाले बड़े मॉडल्स से भी बेहतर प्रदर्शन करता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →