MultiSynt/MT: Trillion-Token Multi-Parallel Pre-Training Data Translated Across 36 Languages
यह शोध पत्र MultiSynt/MT को पेश करता है, जो उच्च गुणवत्ता वाले अंग्रेजी डेटा को अनुवादित करके निर्मित 36 यूरोपीय भाषाओं में 4.8 ट्रिलियन टोकन का एक खुला सिंथेटिक समानांतर संग्रह (parallel corpus) है, जो बहुभाषी LLMs को नेटिव-डेटा बेसलाइन की तुलना में काफी कम प्री-ट्रेनिंग टोकन के साथ बेहतर प्रदर्शन प्राप्त करने में सक्षम बनाता है और साथ ही वर्तमान बेंचमार्क में विशिष्ट मूल्यांकन संबंधी कमियों (blind spots) को भी उजागर करता है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आप एक विशाल, अत्यंत बुद्धिमान रोबोट को 36 अलग-अलग भाषाएँ बोलना और समझना सिखाने की कोशिश कर रहे हैं। समस्या यह है कि रोबोट का पसंदीदा शिक्षक (इंटरनेट) ज्यादातर अंग्रेजी बोलता है। हालांकि अंग्रेजी की किताबों, लेखों और वेबसाइटों का अंबार लगा है, लेकिन माल्टीज़, आयरिश या आइसलैंडिक जैसी भाषाओं के लिए उच्च-गुणवत्ता वाले टेक्स्ट के केवल छोटे, धूल भरे ढेर ही उपलब्ध हैं।
इस शोध पत्र के लेखकों ने MultiSynt/MT ने इसे हल करने का निर्णय लिया है और एक विशाल "अनुवाद कारखाना" (translation factory) बनाने का फैसला किया।
मुख्य विचार: अनुवाद कारखाना
36 अलग-अलग भाषाओं में 4.8 ट्रिलियन नए शब्द लिखने का इंतजार करने के बजाय (जिसमें बहुत समय लगेगा), उन्होंने 100 बिलियन उच्च-गुणवत्ता वाले अंग्रेजी दस्तावेजों (जिसे "Nemotron-CC" डेटासेट कहा जाता है) को लिया और उन्हें एक अति-उन्नत अनुवाद मशीन के माध्यम से चलाया।
इसे इस प्रकार समझें:
- स्रोत (The Source): उपलब्ध सर्वोत्तम अंग्रेजी लेखन का एक पुस्तकालय।
- श्रमिक (The Workers): उन्होंने केवल एक अनुवादक का उपयोग नहीं किया। उन्होंने विभिन्न AI अनुवादकों की एक टीम का उपयोग किया (कुछ विशेषज्ञ भाषाविदों की तरह हैं, अन्य सामान्य-उद्देश्य वाले स्मार्ट रोबोट हैं) ताकि हर एक अंग्रेजी वाक्य को 36 लक्षित भाषाओं में अनुवादित किया जा सके।
- परिणाम: एक नया पुस्तकालय जिसमें उन 36 भाषाओं में 4.8 ट्रिलियन टोकन (शब्द और प्रतीक) शामिल हैं। कई छोटी यूरोपीय भाषाओं के लिए, यह नया पुस्तकालय पहले से मौजूद किसी भी मुफ्त पुस्तकालय की तुलना में 100 गुना बड़ा है।
प्रयोग: क्या "अनुवादित" डेटा काम करता है?
टीम ने इस विशाल अनुवादित पुस्तकालय का उपयोग करके एक नया AI मॉडल प्रशिक्षित किया और इसकी तुलना "नेटिव" डेटा (वह टेक्स्ट जो उन भाषाओं में मूल रूप से मनुष्यों द्वारा लिखा गया था) पर प्रशिक्षित मॉडल से की।
चौंकाने वाला परिणाम:
अनुवादित डेटा पर प्रशिक्षित मॉडल ने "नेटिव" मॉडल की तुलना में बेहतर प्रदर्शन किया, लेकिन उसने यह उपलब्धि 72% कम प्रशिक्षण समय और डेटा का उपयोग करके हासिल की।
- उपमा: कल्पना कीजिए कि दो छात्र एक परीक्षा दे रहे हैं। छात्र A (नेटिव) ने एक मोटी पाठ्यपुस्तक का अध्ययन किया। छात्र B (अनुवादित) ने एक संक्षिप्त, उच्च-गुणवत्ता वाले सारांश का अध्ययन किया। छात्र B न केवल पास हुआ बल्कि उसने अधिक अंक भी प्राप्त किए, और उसने यह सब आधे से भी कम समय में कर दिखाया।
हालांकि, यह शोध पत्र चेतावनी देता है कि यह हर चीज़ के लिए जादुई समाधान नहीं है।
द "अनकैनी वैली" ऑफ लैंग्वेज (भाषा की विचित्रता)
जबकि अनुवादित डेटा सामान्य ज्ञान और तर्क के लिए बहुत अच्छा है, इसमें एक विशिष्ट कमजोरी है: संस्कृति और मुहावरे।
- रूपक: कल्पना कीजिए कि एक पर्यटक जिसने एक वाक्यांश पुस्तिका (phrasebook) का पूरी तरह से अध्ययन किया है। वह भोजन का ऑर्डर दे सकता है और निर्देश पूछ सकता है (सामान्य कार्य) और इसमें वह त्रुटिहीन है। लेकिन यदि आप उससे किसी स्थानीय चुटकुले, किसी विशिष्ट ऐतिहासिक संदर्भ, या किसी ऐसे स्लैंग (बोलचाल के शब्द) के बारे में पूछते हैं जो केवल स्थानीय लोग ही जानते हैं, तो वह गलत हो सकता है क्योंकि उसकी वाक्यांश पुस्तिका अंग्रेजी से अनुवादित थी, न कि स्थानीय संस्कृति से जन्मी थी।
- निष्कर्ष: जब टीम ने नॉर्वेजियन कार्यों पर AI का परीक्षण किया जिनमें स्थानीय मुहावरे या सांस्कृतिक बारीकियां शामिल थीं, तो नेटिव मानव लेखन पर प्रशिक्षित मॉडल ही विजेता रहा। अनुवादित मॉडल प्रवाहपूर्ण तो था, लेकिन उसमें स्थानीय संस्कृति की "आत्मा" की कमी थी।
परीक्षण में "अंध बिंदु" (Blind Spot)
शोध पत्र में एक मजेदार खामी भी मिली कि हम आमतौर पर AI का परीक्षण कैसे करते हैं।
- समस्या: अधिकांश परीक्षण बहुविकल्पीय प्रश्न (जैसे एक मानकीकृत परीक्षा) होते हैं। ये परीक्षण "रिक्त स्थान भरें" वाले खेल की तरह हैं। वे यह अंतर नहीं बता सकते कि एक वाक्य पूरी तरह से स्वाभाविक लगता है या थोड़ा "अजीब" या रोबोटिक (एक घटना जिसे "ट्रांसलेशनिस" कहा जाता है) लगता है।
- खोज: जब शोधकर्ताओं ने एक अलग प्रकार का परीक्षण किया—AI को एक कहानी लिखने के लिए कहना और फिर दूसरे AI से लेखन के प्रवाह और सुंदरता का निर्णय लेने को कहना—तो उन्होंने पाया कि अनुवादित मॉडलों में सूक्ष्म अंतर थे। मानक परीक्षण इन गुणवत्ता अंतराल के प्रति "अंध" थे, लेकिन "कहानी जज" उन्हें स्पष्ट रूप से देख सका।
निष्कर्ष
शोध पत्र निष्कर्ष निकालता है कि अनुवादित डेटा एक शक्तिशाली पूरक है, पूर्ण प्रतिस्थापन नहीं।
- छोटी भाषाओं के लिए: यह एक जीवन रक्षक है। यह वहां भारी मात्रा में उच्च-गुणवत्ता वाला डेटा प्रदान करता है जहां पहले कुछ भी नहीं था।
- बड़ी भाषाओं के लिए: यह अंतराल को भरने का एक शानदार तरीका है।
- सर्वश्रेष्ठ रणनीति: अनुवादित डेटा का उपयोग एक मजबूत नींव बनाने के लिए करें, लेकिन AI को सांस्कृतिक बारीकियों, चुटकुलों और स्थानीय स्वाद को सिखाने के लिए नेटिव मानव डेटा का उपयोग करना जारी रखें जिन्हें मशीनें अपने आप नहीं बना सकतीं।
लेखकों ने इस विशाल "अनुवाद पुस्तकालय" को मुफ्त में जारी किया है, जिससे अन्य शोधकर्ता यह प्रयोग कर सकें कि इन अनुवादित ग्रंथों को नेटिव ग्रंथों के साथ कैसे मिलाया जाए ताकि अगली पीढ़ी के बहुभाषी AI का निर्माण किया जा सके।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।