← नवीनतम पेपर
💻 computer science

MultiSynt/MT: Trillion-Token Multi-Parallel Pre-Training Data Translated Across 36 Languages

यह शोध पत्र MultiSynt/MT को पेश करता है, जो उच्च गुणवत्ता वाले अंग्रेजी डेटा को अनुवादित करके निर्मित 36 यूरोपीय भाषाओं में 4.8 ट्रिलियन टोकन का एक खुला सिंथेटिक समानांतर संग्रह (parallel corpus) है, जो बहुभाषी LLMs को नेटिव-डेटा बेसलाइन की तुलना में काफी कम प्री-ट्रेनिंग टोकन के साथ बेहतर प्रदर्शन प्राप्त करने में सक्षम बनाता है और साथ ही वर्तमान बेंचमार्क में विशिष्ट मूल्यांकन संबंधी कमियों (blind spots) को भी उजागर करता है।

मूल लेखक: Maximilian Idahl, Jörg Tiedemann, Sampo Pyysalo, David Salinas, Tomasz Galica, Shenbin Qian, Tudor Nicolae Mateiu, Zihao Li, Anna Lokrantz, Fedor Vitiugin, André F. T. Martins, Jenna Kanerva, Filip Gi
प्रकाशित 2026-07-02
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Maximilian Idahl, Jörg Tiedemann, Sampo Pyysalo, David Salinas, Tomasz Galica, Shenbin Qian, Tudor Nicolae Mateiu, Zihao Li, Anna Lokrantz, Fedor Vitiugin, André F. T. Martins, Jenna Kanerva, Filip Ginter, Matthias Lindemann, Tim Isbister, Birger Moell, Jonas Lindh, Jan Hajič, Jenia Jitsev, Andrey Kutuzov, Stephan Oepen, Gema Ramírez-Sánchez

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक विशाल, अत्यंत बुद्धिमान रोबोट को 36 अलग-अलग भाषाएँ बोलना और समझना सिखाने की कोशिश कर रहे हैं। समस्या यह है कि रोबोट का पसंदीदा शिक्षक (इंटरनेट) ज्यादातर अंग्रेजी बोलता है। हालांकि अंग्रेजी की किताबों, लेखों और वेबसाइटों का अंबार लगा है, लेकिन माल्टीज़, आयरिश या आइसलैंडिक जैसी भाषाओं के लिए उच्च-गुणवत्ता वाले टेक्स्ट के केवल छोटे, धूल भरे ढेर ही उपलब्ध हैं।

इस शोध पत्र के लेखकों ने MultiSynt/MT ने इसे हल करने का निर्णय लिया है और एक विशाल "अनुवाद कारखाना" (translation factory) बनाने का फैसला किया।

मुख्य विचार: अनुवाद कारखाना

36 अलग-अलग भाषाओं में 4.8 ट्रिलियन नए शब्द लिखने का इंतजार करने के बजाय (जिसमें बहुत समय लगेगा), उन्होंने 100 बिलियन उच्च-गुणवत्ता वाले अंग्रेजी दस्तावेजों (जिसे "Nemotron-CC" डेटासेट कहा जाता है) को लिया और उन्हें एक अति-उन्नत अनुवाद मशीन के माध्यम से चलाया।

इसे इस प्रकार समझें:

  • स्रोत (The Source): उपलब्ध सर्वोत्तम अंग्रेजी लेखन का एक पुस्तकालय।
  • श्रमिक (The Workers): उन्होंने केवल एक अनुवादक का उपयोग नहीं किया। उन्होंने विभिन्न AI अनुवादकों की एक टीम का उपयोग किया (कुछ विशेषज्ञ भाषाविदों की तरह हैं, अन्य सामान्य-उद्देश्य वाले स्मार्ट रोबोट हैं) ताकि हर एक अंग्रेजी वाक्य को 36 लक्षित भाषाओं में अनुवादित किया जा सके।
  • परिणाम: एक नया पुस्तकालय जिसमें उन 36 भाषाओं में 4.8 ट्रिलियन टोकन (शब्द और प्रतीक) शामिल हैं। कई छोटी यूरोपीय भाषाओं के लिए, यह नया पुस्तकालय पहले से मौजूद किसी भी मुफ्त पुस्तकालय की तुलना में 100 गुना बड़ा है।

प्रयोग: क्या "अनुवादित" डेटा काम करता है?

टीम ने इस विशाल अनुवादित पुस्तकालय का उपयोग करके एक नया AI मॉडल प्रशिक्षित किया और इसकी तुलना "नेटिव" डेटा (वह टेक्स्ट जो उन भाषाओं में मूल रूप से मनुष्यों द्वारा लिखा गया था) पर प्रशिक्षित मॉडल से की।

चौंकाने वाला परिणाम:
अनुवादित डेटा पर प्रशिक्षित मॉडल ने "नेटिव" मॉडल की तुलना में बेहतर प्रदर्शन किया, लेकिन उसने यह उपलब्धि 72% कम प्रशिक्षण समय और डेटा का उपयोग करके हासिल की।

  • उपमा: कल्पना कीजिए कि दो छात्र एक परीक्षा दे रहे हैं। छात्र A (नेटिव) ने एक मोटी पाठ्यपुस्तक का अध्ययन किया। छात्र B (अनुवादित) ने एक संक्षिप्त, उच्च-गुणवत्ता वाले सारांश का अध्ययन किया। छात्र B न केवल पास हुआ बल्कि उसने अधिक अंक भी प्राप्त किए, और उसने यह सब आधे से भी कम समय में कर दिखाया।

हालांकि, यह शोध पत्र चेतावनी देता है कि यह हर चीज़ के लिए जादुई समाधान नहीं है।

द "अनकैनी वैली" ऑफ लैंग्वेज (भाषा की विचित्रता)

जबकि अनुवादित डेटा सामान्य ज्ञान और तर्क के लिए बहुत अच्छा है, इसमें एक विशिष्ट कमजोरी है: संस्कृति और मुहावरे।

  • रूपक: कल्पना कीजिए कि एक पर्यटक जिसने एक वाक्यांश पुस्तिका (phrasebook) का पूरी तरह से अध्ययन किया है। वह भोजन का ऑर्डर दे सकता है और निर्देश पूछ सकता है (सामान्य कार्य) और इसमें वह त्रुटिहीन है। लेकिन यदि आप उससे किसी स्थानीय चुटकुले, किसी विशिष्ट ऐतिहासिक संदर्भ, या किसी ऐसे स्लैंग (बोलचाल के शब्द) के बारे में पूछते हैं जो केवल स्थानीय लोग ही जानते हैं, तो वह गलत हो सकता है क्योंकि उसकी वाक्यांश पुस्तिका अंग्रेजी से अनुवादित थी, न कि स्थानीय संस्कृति से जन्मी थी।
  • निष्कर्ष: जब टीम ने नॉर्वेजियन कार्यों पर AI का परीक्षण किया जिनमें स्थानीय मुहावरे या सांस्कृतिक बारीकियां शामिल थीं, तो नेटिव मानव लेखन पर प्रशिक्षित मॉडल ही विजेता रहा। अनुवादित मॉडल प्रवाहपूर्ण तो था, लेकिन उसमें स्थानीय संस्कृति की "आत्मा" की कमी थी।

परीक्षण में "अंध बिंदु" (Blind Spot)

शोध पत्र में एक मजेदार खामी भी मिली कि हम आमतौर पर AI का परीक्षण कैसे करते हैं।

  • समस्या: अधिकांश परीक्षण बहुविकल्पीय प्रश्न (जैसे एक मानकीकृत परीक्षा) होते हैं। ये परीक्षण "रिक्त स्थान भरें" वाले खेल की तरह हैं। वे यह अंतर नहीं बता सकते कि एक वाक्य पूरी तरह से स्वाभाविक लगता है या थोड़ा "अजीब" या रोबोटिक (एक घटना जिसे "ट्रांसलेशनिस" कहा जाता है) लगता है।
  • खोज: जब शोधकर्ताओं ने एक अलग प्रकार का परीक्षण किया—AI को एक कहानी लिखने के लिए कहना और फिर दूसरे AI से लेखन के प्रवाह और सुंदरता का निर्णय लेने को कहना—तो उन्होंने पाया कि अनुवादित मॉडलों में सूक्ष्म अंतर थे। मानक परीक्षण इन गुणवत्ता अंतराल के प्रति "अंध" थे, लेकिन "कहानी जज" उन्हें स्पष्ट रूप से देख सका।

निष्कर्ष

शोध पत्र निष्कर्ष निकालता है कि अनुवादित डेटा एक शक्तिशाली पूरक है, पूर्ण प्रतिस्थापन नहीं।

  • छोटी भाषाओं के लिए: यह एक जीवन रक्षक है। यह वहां भारी मात्रा में उच्च-गुणवत्ता वाला डेटा प्रदान करता है जहां पहले कुछ भी नहीं था।
  • बड़ी भाषाओं के लिए: यह अंतराल को भरने का एक शानदार तरीका है।
  • सर्वश्रेष्ठ रणनीति: अनुवादित डेटा का उपयोग एक मजबूत नींव बनाने के लिए करें, लेकिन AI को सांस्कृतिक बारीकियों, चुटकुलों और स्थानीय स्वाद को सिखाने के लिए नेटिव मानव डेटा का उपयोग करना जारी रखें जिन्हें मशीनें अपने आप नहीं बना सकतीं।

लेखकों ने इस विशाल "अनुवाद पुस्तकालय" को मुफ्त में जारी किया है, जिससे अन्य शोधकर्ता यह प्रयोग कर सकें कि इन अनुवादित ग्रंथों को नेटिव ग्रंथों के साथ कैसे मिलाया जाए ताकि अगली पीढ़ी के बहुभाषी AI का निर्माण किया जा सके।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →