← नवीनतम पेपर
💬 NLP

TranslatePsy-AfriSLM: High-Quality Data Scaling For Low-Resource Machine Translation

यह शोध पत्र TranslatePsy-AfriSLM को प्रस्तुत करता है, जो 19 उप-सहारा अफ्रीकी भाषाओं के लिए क्यूरेटेड और सिंथेटिक समानांतर डेटा से युक्त एक ओपन-सोर्स रिसोर्स सुइट है, जो प्रभावी गुणवत्ता-अनुमान फ़िल्टरिंग के माध्यम से 0.8B पैरामीटर वाले कॉम्पैक्ट मॉडलों को काफी बड़े सिस्टमों से बेहतर प्रदर्शन करने में सक्षम बनाता है।

मूल लेखक: Milan Gritta, Patrik Lambert, Jihye Back, Amril Nazir

प्रकाशित 2026-08-20
📖 7 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Milan Gritta, Patrik Lambert, Jihye Back, Amril Nazir

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

भाषा वह सेतु है जो लोगों को जोड़ती है, जिससे वे सीमाओं के पार व्यापार, सीखने और विचारों को साझा करने में सक्षम होते हैं। फिर भी, अफ्रीकी महाद्वीप के एक अरब से अधिक लोगों के लिए, यह सेतु डिजिटल दुनिया में अक्सर टूटा हुआ या पूरी तरह से गायब रहता है। हालांकि आर्टिफिशियल इंटेलिजेंस ने हाल के वर्षों में अविश्वसनीय प्रगति की है, जिससे कंप्यूटर कई भाषाओं को समझने और बोलने में सक्षम हुए हैं, लेकिन इसने उप-सहारा अफ्रीका की विविध भाषाओं को काफी हद तक छोड़ दिया है। यह अंतर एक डिजिटल विभाजन पैदा करता है, जिससे कई समुदाय उन उत्पादकता और सहयोग उपकरणों तक पहुँचने में असमर्थ हो जाते हैं जो एआई (AI) प्रदान करता है। मुख्य समस्या केवल रुचि की कमी नहीं है, बल्कि उच्च गुणवत्ता वाले डेटा की कमी है। कंप्यूटर को अनुवाद करना सिखाने के लिए, शोधकर्ताओं को बड़ी मात्रा में ऐसे टेक्स्ट की आवश्यकता होती है जहाँ एक भाषा के वाक्यों को दूसरी भाषा के उनके सटीक अनुवादों के साथ जोड़ा गया हो। कई अफ्रीकी भाषाओं के लिए, ऐसा स्वच्छ, बड़े पैमाने पर उपलब्ध डेटा खुले जगत में मौजूद नहीं है, जिससे शोधकर्ताओं को अव्यवस्थित, अनस्ट्रक्चर्ड इंटरनेट के टुकड़ों या महंगे, छोटे डेटासेट पर निर्भर रहना पड़ता है जो कंप्यूटर को अच्छी तरह से सिखाने के लिए बहुत सीमित हैं।

टेदर एआई रिसर्च (Tether AI Research) के शोधकर्ताओं की एक टीम ने मशीन अनुवाद के लिए एक नया आधार तैयार करके इस असंतुलन को ठीक करने का संकल्प लिया है। उन्होंने 'ट्रांसलेटप्सी-अफ्रीएसएलएम' (TranslatePsy-AfriSLM) नामक एक परियोजना पेश की, जो अंग्रेजी और उन्नीस अलग-अलग उप-सहारा अफ्रीकी भाषाओं के बीच अनुवाद के लिए एक संपूर्ण टूलकिट प्रदान करती है। एक विशाल, महंगी कंप्यूटर बुद्धि बनाने के बजाय, जो इन भाषाओं के साथ संघर्ष करती है, उन्होंने एक छोटे, अत्यधिक कुशल मॉडल पर ध्यान केंद्रित किया। उनका दृष्टिकोण केवल अधिक डेटा एकत्र करने के बारे में नहीं था, बल्कि अविश्वसनीय रूप से चयनात्मक होने के बारे में था। उन्होंने लाखों वाक्य युग्मों (sentence pairs) को छानने के लिए एक कठोर पद्धति विकसित की, जिसमें अधिकांश शोर वाले या खराब गुणवत्ता वाले उदाहरणों को हटा दिया गया, और केवल सर्वोत्तम उदाहरणों को रखा गया। इस सावधानीपूर्वक क्यूरेट किए गए डेटा को एक विशिष्ट प्रकार के कंप्यूटर-जनित टेक्स्ट के साथ जोड़कर, उन्होंने केवल 0.8 बिलियन पैरामीटर्स वाला एक मॉडल प्रशिक्षित किया। प्रमुख तकनीकी कंपनियों द्वारा उपयोग किए जाने वाले विशाल मॉडलों की तुलना में छोटा होने के बावजूद, उनके छोटे मॉडल ने दर्जनों गुना बड़े सिस्टम्स को पछाड़ दिया, जिससे यह सिद्ध हुआ कि डेटा की गुणवत्ता कंप्यूटर के आकार से कहीं अधिक महत्वपूर्ण है।

इस परिणाम तक पहुँचने की यात्रा इस पहचान के साथ शुरू हुई कि मौजूदा डेटा स्रोत त्रुटिपूर्ण थे। शोधकर्ताओं ने इंटरनेट पर उपलब्ध टेक्स्ट के विशाल पुस्तकालयों का अध्ययन किया, जिनमें अरबों वाक्य युग्म शामिल हैं। हालाँकि, उन्होंने पाया कि ये संग्रह एक ऐसे पुस्तकालय की तरह हैं जहाँ किताबों को बिना किसी क्रम के ढेर कर दिया गया है; इनमें डुप्लिकेट, त्रुटियाँ और ऐसे वाक्य थे जो आपस में मेल नहीं खाते थे। उन्होंने छोटे, मानव-निर्मित डेटासेट का भी परीक्षण किया, जो स्वच्छ तो थे लेकिन एक मॉडल को प्रभावी ढंग से सिखाने के लिए बहुत छोटे थे। इस समस्या को हल करने के लिए, टीम ने डेटा को साफ करने और व्यवस्थित करने के लिए एक बहु-चरणीय पाइपलाइन बनाई। उन्होंने खुले स्रोतों से कच्चा टेक्स्ट एकत्र करना शुरू किया और फिर प्रत्येक एकल वाक्य युग्म की गुणवत्ता का मूल्यांकन करने के लिए एक परिष्कृत स्कोरिंग प्रणाली का उपयोग किया। यह प्रणाली केवल एक तरीके पर निर्भर नहीं थी, बल्कि इसने एक एकल, विश्वसनीय स्कोर बनाने के लिए तीन अलग-अलग मूल्यांकन उपकरणों के अंतर्दृष्टि को संयोजित किया। इसने उन्हें बिना किसी सीखने के मूल्य को खोए, प्रशिक्षण डेटा के 96 प्रतिशत हिस्से को छानने की अनुमति दी। संक्षेप में, उन्होंने महसूस किया कि कंप्यूटर को सीखने के लिए लाखों बुरे उदाहरणों को पढ़ने की आवश्यकता नहीं है; उसे केवल कुछ हजार सटीक उदाहरणों को पढ़ने की आवश्यकता है।

उनकी खोज का एक महत्वपूर्ण हिस्सा यह समझना था कि नया डेटा कैसे उत्पन्न किया जाए। चूंकि उच्च-गुणवत्ता वाले मानव अनुवाद दुर्लभ थे, इसलिए टीम ने एक शक्तिशाली कंप्यूटर मॉडल का उपयोग करके अंग्रेजी से अफ्रीकी भाषाओं में बड़ी मात्रा में टेक्स्ट का अनुवाद करके सिंथेटिक डेटा बनाया। उन्होंने पाया कि यह कंप्यूटर-जनित डेटा, जब उनके सख्त गुणवत्ता जांच के माध्यम से छना गया, तो वास्तव में इंटरनेट पर पाए जाने वाले कच्चे डेटा से बेहतर था। यह अधिक स्वच्छ, सुसंगत था और मॉडल को सीखने के लिए एक मजबूत संकेत प्रदान करता था। उन्होंने यह भी खोजा कि डेटा को स्कोर करने की दिशा अत्यंत महत्वपूर्ण थी। यदि उन्होंने वाक्य युग्म को मॉडल द्वारा अंततः उपयोग किए जाने वाले क्रम के विपरीत दिशा में आंका, तो प्रदर्शन काफी गिर गया। गुणवत्ता जांच को अनुवाद की अंतिम दिशा के साथ संरेखित करके, उन्होंने यह सुनिश्चित किया कि उनके द्वारा मॉडल को दिया गया प्रत्येक डेटा खंड प्रासंगिक और उच्च गुणवत्ता वाला हो।

उनके सावधानीपूर्वक क्यूरेशन के परिणाम चौंकाने वाले थे। टीम ने छोटे भाषा मॉडलों की एक श्रृंखला प्रशिक्षित की, जिसमें सबसे छोटा मॉडल केवल 0ền 0.8 बिलियन पैरामीटर्स का था। मानक बेंचमार्क पर परीक्षण किए जाने पर, इस नन्हे मॉडल ने 27-बिलियन पैरामीटर वाले सिस्टम और एक विशाल 122-बिलियन पैरामीटर वाले मॉडल सहित कई बड़े सिस्टम्स को मात दी, जिन्हें अत्याधुनिक माना जाता है। इसने उन विशेष अनुवाद मॉडलों को भी पीछे छोड़ दिया जो विशेष रूप से इस कार्य के लिए डिज़ाइन किए गए थे। शोधकर्ताओं ने पाया कि उनका मॉडल न केवल बेहतर अनुवाद करता है, बल्कि बातचीत करने की क्षमता भी बनाए रखता है, जो एक ऐसी विशेषता है जो अक्सर उन मॉडलों में खो जाती है जिन्हें केवल अनुवाद डेटा पर प्रशिक्षित किया जाता है। उन्होंने मॉडल का परीक्षण उन भाषाओं पर भी किया जिन्हें उसने पहले कभी नहीं देखा था, और इसने एक उल्लेखनीय सामान्यीकरण क्षमता दिखाई, जिससे अनदेखी भाषाओं पर इसके प्रदर्शन में सुधार हुआ। यह सुझाव देता है कि उन्नीस लक्षित भाषाओं से सीखे गए सबक ने मॉडल को भाषा की अंतर्निहित संरचना को समझने में मदद की, जो अन्य भाषाओं पर भी लागू होती है।

शायद सबसे आश्चर्यजनक खोज यह थी कि एशिया और यूरोप की अन्य भाषाओं से थोड़े से डेटा को जोड़ने से मॉडल को उन भाषाओं को बोलने की याद रखने में मदद मिली, बिना उन्हें भूले। इसने आर्टिफिशियल इंटेलिजेंस की एक आम समस्या को रोका जिसे 'कैटास्ट्रॉफिक फॉरगेटिंग' (catastrophic forgetting) कहा जाता है, जहाँ एक नया कौशल सीखने से कंप्यूटर अपना पुराना कौशल खो देता है। इस विविध मिश्रण को शामिल करके, मॉडल अधिक मजबूत और बहुमुखी बन गया। शोधकर्ताओं ने यह भी नोट किया कि हालांकि उनका डेटा उत्कृष्ट था, फिर भी इसकी कुछ सीमाएँ थीं। उन्होंने स्वीकार किया कि मानवीय मूल्यांकन के बिना, यह जानना कठिन है कि क्या अनुवाद सांस्कृतिक बारीकियों में वास्तव में पूर्ण हैं, और डेटा मानक लिखित रूपों के पक्ष में हो सकता है। हालाँकि, उनका कार्य यह प्रदर्शित करता है कि सही दृष्टिकोण के साथ, उन भाषाओं के लिए शक्तिशाली और कुशल उपकरण बनाना संभव है जिन्हें पीछे छोड़ दिया गया है।

यह कार्य अफ्रीकी भाषाओं के लिए डिजिटल विभाजन को पाटने की दिशा में एक महत्वपूर्ण कदम है। यह दर्शाता है कि आगे का रास्ता अनिवार्य रूप से बड़े और बड़े कंप्यूटर बनाना नहीं है, बल्कि हमें उन्हें दिए जाने वाले डेटा के प्रति अधिक समझदार होना होगा। गुणवत्ता पर मात्रा को ध्यान में रखकर और एक स्वच्छ शिक्षण वातावरण बनाने के लिए कठोर फ़िल्टरिंग का उपयोग करके, शोधकर्ता ऐसे मॉडल बना सकते हैं जो कुशल और प्रभावी दोनों हों। टीम ने अपने डेटा और मॉडल को सार्वजनिक रूप से उपलब्ध कराया है, जिससे दूसरों को इस आधार पर निर्माण करने के लिए आमंत्रित किया गया है। उनकी सफलता बताती है कि निरंतर प्रयास और सावधानीपूर्वक क्यूरेशन के साथ, कम-संसाधन वाली भाषाओं के लिए उच्च-गुणवत्ता वाले मशीन अनुवाद की बाधा को कम किया जा सकता है, जिससे महाद्वीप में संचार और सहयोग की नई संभावनाएं खुल सकती हैं। अफ्रीका में आर्टिफिशियल इंटेलिजेंस का भविष्य सबसे शक्तिशाली हार्डवेयर होने पर नहीं, बल्कि सबसे विचारशील डेटा होने पर निर्भर कर सकता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →