← नवीनतम पेपर
💬 NLP

Enhancing Multilingual LLM Pretraining with Model-Based Data Selection

यह शोध पत्र बहुभाषी डेटासेट के लिए एक पारदर्शी और कुशल मॉडल-आधारित फ़िल्टरिंग फ्रेमवर्क प्रस्तुत करता है जो, विविध और ज्ञान-समृद्ध नमूनों का चयन करने के लिए ट्रांसफॉर्मर और फास्टटेक्स्ट क्लासिफायर का लाभ उठाकर, 1 बिलियन-पैरामीटर वाले एलएलएम (LLM) को केवल 15% प्रशिक्षण टोकन के साथ बेसलाइन प्रदर्शन के बराबर सक्षम बनाता है और 20 भाषाओं में बहुभाषात्मकता के अभिशाप (curse of multilinguality) को कम करता है।

मूल लेखक: Bettina Messmer, Vinko Sabolčec, Martin Jaggi

प्रकाशित 2026-02-20
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Bettina Messmer, Vinko Sabolčec, Martin Jaggi

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक बहुत ही बुद्धिमान लेकिन बहुत भूखे छात्र (एक लार्ज लैंग्वेज मॉडल, या LLM) को दुनिया को समझने और बोलने का तरीका सिखाने की कोशिश कर रहे हैं। आपके पास किताबों, वेबसाइटों और लेखों की एक विशाल लाइब्रेरी (इंटरनेट) है जिसे आपको इस छात्र को खिलाना है।

समस्या क्या है? वह लाइब्रेरी बिखरी हुई है। वह स्पैम, दोहराव वाले विज्ञापनों, कम गुणवत्ता वाले फोरम पोस्ट और कचरे से भरी है। यदि आप पूरी लाइब्रेरी को सीधे छात्र के सामने फेंक देते हैं, तो वे भ्रमित हो जाएंगे, कचरे पर समय बर्बाद करेंगे और वे बेहतर तरीके से सीख नहीं पाएंगे।

लंबे समय तक, शोधकर्ताओं ने केवल इस लाइब्रेरी के "अंग्रेजी" हिस्से को साफ करने का तरीका खोजा था। लेकिन बाकी दुनिया का क्या? छात्र अन्य भाषाओं में एक बहुत ही खराब शिक्षा प्राप्त कर रहा था क्योंकि किसी ने उनके लिए फिल्टर नहीं बनाया था।

यह पेपर एक यूनिवर्सल, स्मार्ट फिल्टर बनाने के बारे में है जो केवल अंग्रेजी नहीं, बल्कि 20 अलग-अलग भाषाओं के लिए काम करता है। उन्होंने इसे कैसे किया, इसके लिए कुछ सरल उपमाओं का उपयोग किया गया है:

1. समस्या: "शोर भरा पुस्तकालय" (The Noisy Library)

इंटरनेट को एक विशाल, अराजक कबाड़ी बाजार (flea market) की तरह समझें।

  • अच्छी चीजें: विश्वकोश, अच्छी तरह से लिखे गए समाचार लेख, और स्पष्ट निर्देश (संरचित और ज्ञान-समृद्ध)।
  • बुरी चीजें: स्पैम, टूटे हुए लिंक, और बेमतलब की बकवास।

पहले, शोधकर्ता नियम-आधारित फिल्टर (Rule-Based Filters) का उपयोग करते थे (जैसे एक बाउंसर जिसके पास एक चेकलिस्ट है: "यदि टेक्स्ट बहुत छोटा है, तो इसे बाहर निकालो" या "यदि इसमें विराम चिह्न नहीं हैं, तो इसे बाहर निकालो")। यह ठीक-ठाक काम करता है, लेकिन यह मूर्खतापूर्ण है। यह एक बेहतरीन छोटी कविता को बाहर निकाल सकता है या एक लंबे, उबाऊ विज्ञापन को अंदर रख सकता है।

2. समाधान: "स्मार्ट लाइब्रेरियन" (The Smart Librarian)

चेकलिस्ट के बजाय, लेखकों ने एक स्मार्ट लाइब्रेरियन (एक मशीन लर्निंग मॉडल) बनाया जो वास्तव में यह तय करने के लिए टेक्स्ट को पढ़ता है कि वह अच्छा है या नहीं।

उन्होंने इस लाइब्रेरियन को एक विशेष "प्रशिक्षण नियमावली" का उपयोग करके प्रशिक्षित किया जो उच्च-गुणवत्ता वाले उदाहरणों से बनी थी। उन्होंने एकत्र किया:

  • MMLU: यह कठिन सामान्य ज्ञान के प्रश्नों और परीक्षाओं के संग्रह की तरह है।
  • Aya Dataset: मददगार मानवीय बातचीत और निर्देशों का एक बड़ा संग्रह।
  • OpenAssistant: मनुष्यों और AI के बीच चैट लॉग।

उन्होंने लाइब्रेरियन को बताया: "इन उदाहरणों को देखो। ये अच्छे टेक्स्ट के 'गोल्ड स्टैंडर्ड' हैं। अब, उस बिखरे हुए कबाड़ी बाजार में जाओ और कुछ भी ऐसा ढूंढो जो इन स्वर्ण उदाहरणों जैसा दिखता हो या महसूस होता हो।"

3. दो उपकरण: "तेज स्कैनर" बनाम "गहरा विचारक"

लेखकों ने यह देखने के लिए इस लाइब्रेरियन के दो संस्करण बनाए कि कौन सा सबसे अच्छा काम करता है:

  • तेज स्कैनर (FastText): यह एक त्वरित विजुअल स्कैन की तरह है। यह यह अनुमान लगाने के लिए शब्दों और पैटर्न को देखता है कि क्या कोई दस्तावेज़ अच्छा है। यह बहुत तेज है, चलाने में सस्ता है, और सामान्य कंप्यूटरों पर काम करता है। यह एक ऐसे बाउंसर की तरह है जो एक अच्छी बातचीत के "वाइब" (vibe) को जानता है।
  • गहरा विचारक (Transformer/MLP): यह एक प्रोफेसर की तरह है जो वास्तव में वाक्य संरचना को पढ़ता है और संदर्भ को समझता है। यह अधिक सटीक है लेकिन इसके लिए अधिक कंप्यूटिंग पावर की आवश्यकता होती है। यह एक ऐसे लाइब्रेरियन की तरह है जो गुणवत्ता का निर्णय लेने के लिए किताब के पहले कुछ पन्नों को पढ़ता है।

4. जादुई परिणाम: "कम ही अधिक है" (Less is More)

यहाँ सबसे आश्चर्यजनक बात है। लेखकों ने एक विशाल डेटासेट (FineWeb-2) लिया और अपने स्मार्ट लाइब्रेरियन का उपयोग करके 85% से 90% डेटा को हटा दिया

  • पुराना तरीका: छात्र को 100% बिखरी हुई लाइब्रेरी खिलाना।
  • नया तरीका: छात्र को केवल शीर्ष 10% सबसे स्वच्छ और सबसे दिलचस्प किताबें खिलाना।

परिणाम: छात्र ने केवल 15% डेटा का उपयोग करके उतना ही (या उससे भी बेहतर!) सीखा।

  • उपमा: कल्पना कीजिए कि आपके पास देखने के लिए 100 घंटे का टीवी है। पुराने तरीके में आप विज्ञापन और खराब रियलिटी शो सहित सब कुछ देखते हैं। नए तरीके में आपके पास एक स्मार्ट गाइड होता है जो आपको केवल 15 सबसे अच्छे एपिसोड दिखाता है। आप कहानी को तेजी से सीखते हैं और इसे बेहतर तरीके से याद रखते हैं क्योंकि आप कचरे से विचलित नहीं हुए।

5. यह दुनिया के लिए क्यों मायने रखता है

  • "बहुभाषावाद के अभिशाप" (Curse of Multilinguality) को ठीक करना: आमतौर पर, जब आप एक मॉडल को एक साथ कई भाषाएं सिखाते हैं, तो वह भ्रमित हो जाता है और प्रत्येक भाषा में खराब प्रदर्शन करता है (जैसे एक छात्र जो एक साथ 20 भाषाएं सीखने की कोशिश करता है और उन्हें भूल जाता है)। इस पेपर ने पाया कि डेटा को पहले साफ करने से, मॉडल वास्तव में सभी भाषाओं में एक साथ बेहतर हो गया। "अभिशाप" एक "वरदान" में बदल गया।
  • AI का लोकतंत्रीकरण: इस फिल्टर को अरबी, डेनिश, चीनी और फ्रेंच जैसी भाषाओं के लिए काम करने में सक्षम बनाकर, वे उन लोगों के लिए AI को स्मार्ट बना रहे हैं जो अंग्रेजी नहीं बोलते।
  • ओपन सोर्स: उन्होंने इसे गुप्त नहीं रखा। उन्होंने "साफ किया गया" डेटासेट और कोड जारी किया ताकि कोई भी इसका उपयोग कर सके।

सारांश

लेखकों ने एक स्मार्ट, भाषा-जागरूक फिल्टर बनाया है जो एक उच्च-गुणवत्ता वाले संपादक के रूप में कार्य करता है। उन्होंने साबित किया कि आपको बेहतर AI बनाने के लिए अधिक डेटा की आवश्यकता नहीं है; आपको बस बेहतर डेटा की आवश्यकता है। शोर को हटाकर और केवल "संरचित और ज्ञान-समृद्ध" नमूनों को रखकर, उन्होंने AI मॉडल को कई अलग-अलग भाषाओं में दुनिया को समझने में अधिक स्मार्ट, तेज़ और सक्षम बनाया।

एक वाक्य में: उन्होंने AI को शोर को अनदेखा करने और संकेत (signal) पर ध्यान केंद्रित करने का तरीका सिखाया, यह साबित करते हुए कि उच्च-गुणवत्ता वाले थोड़े से डेटा की कीमत ढेर सारे कचरे से कहीं अधिक है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →