← नवीनतम पेपर
💬 NLP

HPLT 3.0: Very Large-Scale Multilingual Resources for LLMs and MT. Mono- and Bi-lingual Data, Multilingual Evaluation, and Pre-Trained Models

यह शोध पत्र HPLT 3.0 का परिचय देता है, जो लगभग 200 भाषाओं के लिए 30-ट्रिलियन-टोकन वाले बहुभाषी डेटासेट के साथ एक ओपन पहल है, जिसके साथ एक ओपन-सोर्स प्रोसेसिंग पाइपलाइन, नौ यूरोपीय भाषाओं के लिए व्यापक मूल्यांकन बेंचमार्क, और प्री-ट्रेंड मोनोलिंगुअल एवं पैरेलल मॉडल्स का एक समूह भी उपलब्ध है।

मूल लेखक: Stephan Oepen, Nikolay Arefev, Mikko Aulamo, Marta Bañón, Maja Buljan, Laurie Burchell, Lucas Charpentier, Pinzhen Chen, Mariya Fedorova, Ona de Gibert, Barry Haddow, Jan Hajič, Jindřich Helcl, Andrey
प्रकाशित 2026-04-21
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Stephan Oepen, Nikolay Arefev, Mikko Aulamo, Marta Bañón, Maja Buljan, Laurie Burchell, Lucas Charpentier, Pinzhen Chen, Mariya Fedorova, Ona de Gibert, Barry Haddow, Jan Hajič, Jindřich Helcl, Andrey Kutuzov, Veronika Laippala, Zihao Li, Risto Luukkonen, Bhavitvya Malik, Vladislav Mikhailov, Amanda Myntti, Dayyán O'Brien, Lucie Poláková, Sampo Pyysalo, Gema Ramírez Sánchez, Janine Siewert, Pavel Stepachev, Jörg Tiedemann, Teemu Vahtola, Dušan Variš, Fedor Vitiugin, Tea Vojtěchová, Jaume Zaragoza

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक विशाल, सुपर-स्मार्ट रोबोट को दुनिया की लगभग हर मानवीय भाषा बोलना और समझना सिखाने की कोशिश कर रहे हैं। ऐसा करने के लिए, रोबोट को बहुत बड़ी मात्रा में टेक्स्ट "खाना" होगा—किताबें, वेबसाइटें, लेख और बातचीत। इसे प्री-ट्रेनिंग डेटा (pre-training data) कहा जाता है।

लंबे समय से, इन रोबोटों के लिए सबसे बड़े "बुफे" ज्यादातर अंग्रेजी भोजन से भरे हुए थे, जिसमें अन्य भाषाओं के बस कुछ ही साइड डिश थे। HPLT 3.0 पेपर एक विशाल नए प्रोजेक्ट के बारे में है जिसने विशेष रूप से इन AI रोबोटों को प्रशिक्षित करने के लिए दुनिया का सबसे बड़ा, सबसे विविध और उच्चतम गुणवत्ता वाला डिजिटल पुस्तकालय बनाया है।

यहाँ इसका विवरण दिया गया है, कुछ रोज़मर्रा के उपमाओं (analogies) का उपयोग करते हुए:

1. विशाल पुस्तकालय (डेटा)

कल्पना कीजिए कि इंटरनेट एक विशाल, अस्त-व्यस्त अटारी (attic) है जो पुराने कागजों के अरबों बक्सों से भरी हुई है, जिनमें से कुछ बेहतरीन अंग्रेजी में लिखे गए हैं, कुछ बहुत ही दुर्लभ बोलियों में, और कई धूल या फटे हुए हैं।

  • संग्रह (The Collection): HPLT टीम ने 30 ट्रिलियन "टोकन" (शब्दों के टुकड़े) एकत्र किए। यह एक पुस्तकालय को इतनी किताबों से भरने जैसा है कि यदि आप हर सेकंड एक किताब पढ़ें, तो आपको इसे समाप्त करने में हजारों साल लग जाएंगे।
  • विविधता (The Diversity): पिछले पुस्तकालयों के विपरीत जो 90% अंग्रेजी थे, यह एक सच्चा वैश्विक मेल-जोल (potluck) है। इसमें आधा भोजन अन्य भाषाओं में है, जो लगभग 200 विभिन्न भाषाओं और लिपियों को कवर करता है।
  • स्रोत (The Source): उन्होंने केवल किताबें नहीं खरीदीं; वे इंटरनेट के "अटारी" (इंटरनेट आर्काइव और कॉमन क्रॉल के वेब आर्काइव्स) में गए और जो कुछ भी उन्हें मिल सका, उसे बाहर निकाल लिया।

2. सफाई दल (डेटा प्रोसेसिंग)

आप रोबोट को कच्चा, धूल भरा कबाड़ नहीं खिला सकते। वह भ्रमित हो जाएगा या बुरी आदतें सीख लेगा। टीम ने इस डेटा को साफ करने के लिए एक परिष्कृत असेंबली लाइन (पाइपलाइन) बनाई है:

  • टेक्स्ट एक्सट्रैक्शन (Text Extraction): उन्होंने एक स्मार्ट टूल (एक हाई-टेक वैक्यूम की तरह) का उपयोग किया ताकि वेबपेज से वास्तविक कहानी को खींचा जा सके, विज्ञापनों, पॉप-अप और "यहाँ क्लिक करें" बटनों को अनदेखा करते हुए।
  • लैंग्वेज आईडी (Language ID): उन्होंने एक रोबोट को एक पेज को देखना और कहना सिखाया कि, "आह, यह फिनिश है," या "यह वास्तव में पुर्तगाली नहीं, बल्कि स्पेनिश है।"
  • "डुप्लीकेशन" फ़िल्टर (The "Deduplication" Filter): कल्पना कीजिए कि आपको अपनी अटारी में एक ही विकिपीडिया लेख की 50 प्रतियां मिली हैं। टीम ने इन प्रतियों को हटा दिया ताकि रोबोट यह न सोचे कि एक ही वाक्य 50 अलग-अलग तथ्य हैं। उन्होंने यह वैश्विक स्तर पर किया, यह सुनिश्चित करते हुए कि रोबोट अद्वितीय विचार देखे, न कि केवल दोहराव।
  • गुणवत्ता नियंत्रण (Quality Control): उन्होंने दस्तावेजों पर "स्टैम्प" (मुहरें) लगाए। कुछ स्टैम्प कहते हैं "उच्च गुणवत्ता", अन्य कहते हैं "चेतावनी: वयस्क सामग्री" या "चेतावनी: यह स्पैम लग रहा है।" इससे शोधकर्ता रोबोट को अध्ययन के लिए केवल सर्वश्रेष्ठ पुस्तकें चुन सकते हैं।

3. स्वाद परीक्षण (मूल्यांकन)

आप कैसे जानते हैं कि रोबोट वास्तव में सीख रहा है? आप उससे केवल यह नहीं पूछ सकते, "क्या आप स्मार्ट महसूस करते हैं?" आपको उसे एक परीक्षा देनी होगी।

  • परीक्षा (The Exam): टीम ने नौ अलग-अलग यूरोपीय भाषाओं के लिए एक विशेष परीक्षा (HPLT-e) बनाई। यह एक मानकीकृत परीक्षा (जैसे SATs या IELTS) की तरह है लेकिन AI के लिए।
  • परिणाम (The Results): उन्होंने HPLT 3.0 डेटा पर रोबोट को प्रशिक्षित किया और उनकी तुलना अन्य प्रसिद्ध डेटासेट्स पर प्रशिक्षित रोबोटों से की। HPLT 3.0 वाले रोबोटों ने उच्च स्कोर किया, जिससे यह सिद्ध हुआ कि साफ, बेहतर व्यवस्थित डेटा स्मार्ट रोबोट बनाता है।
  • "गुणवत्ता" का सबक (The "Quality" Lesson): उन्होंने यह भी परीक्षण किया कि क्या इससे फर्क पड़ता है कि आप रोबोट को कौन सी किताबें खिलाते हैं। उन्होंने पाया कि रोबोट को केवल "टॉप 10%" उच्चतम गुणवत्ता वाले दस्तावेजों को खिलाना उतना प्रभावी नहीं था जितना कि उन्हें एक मिश्रण खिलाना। यह एक छात्र की तरह है: केवल सर्वोत्तम पाठ्यपुस्तकें पढ़ना अच्छा है, लेकिन विभिन्न अच्छी किताबें पढ़ने से उन्हें दुनिया को बेहतर ढंग से समझने में मदद मिलती है।

4. विशिष्ट उपकरण (मॉडेल्स)

टीम ने केवल पुस्तकालय ही नहीं दिया; उन्होंने खुद रोबोट भी बनाए।

  • मोनोलिंगुअल मॉडल्स (Monolingual Models): उन्होंने लगभग 60 अलग-अलग भाषाओं के लिए एक विशिष्ट रोबोट बनाया। इसे एक ऐसे विशेषज्ञ को काम पर रखने के रूप में सोचें जो केवल फ्रेंच का मास्टर है, या केवल स्वाहिली का, बजाय एक सामान्य व्यक्ति के जो सब कुछ थोड़ा-बहुत जानता है। ये विशेषज्ञ अपनी विशिष्ट भाषा की बारीकियों को समझने में अविश्वसनीय रूप से अच्छे होते हैं।
  • अनुवाद (Translation): उन्होंने वाक्यों का एक विशाल संग्रह भी बनाया जहाँ एक तरफ भाषा A है और दूसरी तरफ भाषा B है। यह एक विशाल द्विभाषी शब्दकोश की तरह है जो रोबोट को तुरंत अनुवाद करना सीखने में मदद करता है।

5. "सिंथेटिक" रसोई (मशीन ट्रांसलेशन)

कुछ बहुत ही दुर्लभ भाषाओं के लिए, अटारी में पर्याप्त किताबें नहीं हैं। इसलिए, टीम ने एक चतुर तरकीब का उपयोग किया:

  • उन्होंने उच्च-गुणवत्ता वाले अंग्रेजी टेक्स्ट (जैसे शैक्षिक लेख) लिए, उन्हें AI का उपयोग करके दुर्लभ भाषाओं में अनुवादित किया, और उन्हें लाइब्रेरी में जोड़ दिया।
  • उपमा (The Analogy): यह अंग्रेजी में लिखी गई एक आदर्श रेसिपी को एक दुर्लभ बोली में अनुवाद करने और उसे उस शेफ को देने जैसा है जिसने पहले कभी वह व्यंजन नहीं देखा है। यह शेफ को बुनियादी व्यंजनों को सीखने में मदद करता है, भले ही उन्होंने अभी तक असली चीज़ का स्वाद न चखा हो।

6. नैतिक सुरक्षा जाल (The Ethical Safety Net)

यह पेपर नैतिकता के प्रति बहुत सावधान है।

  • गोपनीयता (Privacy): उन्होंने फोन नंबरों और ईमेल पतों जैसी व्यक्तिगत जानकारी को हटाने के लिए डेटा को साफ किया।
  • कॉपीराइट (Copyright): उन्होंने वेबसाइटों पर "प्रवेश निषेध" (robots.txt) संकेतों का सम्मान किया और ऐसी सामग्री को हटा दिया जो स्पष्ट रूप से कॉपीराइट की गई थी या प्रतिबंधित थी।
  • पारदर्शिता (Transparency): कुछ बड़ी तकनीकी कंपनियों के विपरीत जो अपने गुप्त नुस्खे छिपाकर रखती हैं, HPLT एक ओपन-सोर्स प्रोजेक्ट है। वे पुस्तकालय, सफाई उपकरण और रोबोट साझा कर रहे हैं, ताकि कोई भी इनका उपयोग कर सके।

बड़ी तस्वीर (The Big Picture)

HPLT 3.0 प्रोजेक्ट AI के लोकतंत्रीकरण का एक विशाल प्रयास है। ऐसा न करने के बजाय कि केवल बड़े निगमों के पास ही सुपर-स्मार्ट AI बनाने के लिए ईंधन हो, यह प्रोजेक्ट शोधकर्ताओं, विश्वविद्यालयों और डेवलपरों को हर जगह उच्च-गुणवत्ता वाला ईंधन बांट रहा है।

उनका लक्ष्य यह सुनिश्चित करना है कि भविष्य का AI केवल एक "अंग्रेजी बोलने वाला" रोबोट न हो, बल्कि एक वास्तव में बहुभाषी रोबोट हो जो मानव संस्कृति की विविधता का सम्मान करता है और उसे समझता है। वे अनिवार्य रूप से अगली पीढ़ी के कृत्रिम बुद्धिमत्ता के लिए "सार्वजनिक पुस्तकालय" बना रहे हैं।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →