SomaliWeb v1: A Quality-Filtered Somali Web Corpus with a Matched Tokenizer and a Public Language-Identification Benchmark
यह शोध पत्र SomaliWeb v1 को प्रस्तुत करता है, जो लगभग 303 मिलियन टोकन का एक सार्वजनिक रूप से जारी किया गया, गुणवत्ता-फ़िल्टर किया गया सोमाली कॉर्पस है, जिसके साथ एक मैचड BPE-16K टोकेनाइज़र और पहला सार्वजनिक भाषा-पहचान बेंचमार्क भी उपलब्ध है, जो मौजूदा बहुभाषी सोमाली डेटा वितरणों में महत्वपूर्ण गुणवत्ता दोषों को भी उजागर करता है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि इंटरनेट एक विशाल, अराजक पुस्तकालय है जिसमें सैकड़ों अलग-अलग भाषाओं की पुस्तकें हैं। लंबे समय तक, इस पुस्तकालय में "सोमाली" (Somali) अनुभाग एक गड़बबड़ था। यह कोई समर्पित कमरा नहीं था जिस पर स्पष्ट संकेत लगा हो; इसके बजाय, सोमाली पुस्तकें अक्सर विशाल, मिश्रित-भाषा के ढेरों के बीच बेतरतीब ढंग से बिखरी हुई थीं, जो अक्सर कचरे, फटे हुए पन्नों या डुप्लिकेट प्रतियों के साथ मिली हुई थीं।
SomaliWeb v1 पहली बार है जब किसी ने उस अराजक पुस्तकालय में जाकर, केवल सोमाली के लिए एक समर्पित कमरा बनाया है और उसे ठीक से व्यवस्थित किया है। लेखकों ने इसे कैसे किया, इसे सरल भाषा में यहाँ समझाया गया है:
1. समस्या: "शोर वाला" पुस्तकालय
इस परियोजना से पहले, यदि आप कंप्यूटर को सोमाली समझने के लिए सिखाना चाहते थे, तो आपको इंटरनेट से मिश्रित-भाषा के टेक्स्ट का एक बड़ा थैला उठाना पड़ता था।
- मिश्रण: इसमें सोमाली थी, लेकिन इसमें अंग्रेजी, फ्रेंच और अन्य भाषाएँ भी मिली हुई थीं।
- शोर (Noise): यहाँ तक कि "साफ किए गए" संस्करण भी त्रुटियों से भरे थे। लेखकों ने पाया कि एक लोकप्रिय थैले (जिसे HPLT v2 कहा जाता है) में था:
- 17% डुप्लिकेट: जैसे एक ही किताब को 17 बार छापा गया हो और उन्हें आपस में स्टेपल कर दिया गया हो।
- 56% "Mojibake": यह तब होता है जब टेक्स्ट बड़बड़ाने जैसा दिखता है (जैसे,
éके बजायé), क्योंकि कंप्यूटर ने अक्षरों को गलत पढ़ा। यह एक ऐसी किताब की तरह है जहाँ स्याही बिखर कर निरर्थक हो गई है। - लगभग-डुप्लिकेट (Near-duplicates): ऐसी किताबें जो 90% समान हैं, बस कुछ शब्द बदले हुए हैं।
2. समाधान: छह-चरणीय "छलनी" (Sieve)
लेखकों ने कच्चे इंटरनेट टेक्स्ट को केवल अच्छी सामग्री तक फ़िल्टर करने के लिए एक छह-चरणीय मशीन (एक पाइपलाइन) बनाई। इसे सोने को छानने की प्रक्रिया की तरह समझें:
- चरण 1: डुप्लिकेट डिटेक्टर। उन्होंने हर दस्तावेज़ को स्कैन किया और सटीक प्रतियों को बाहर निकाल दिया। परिणाम: उन्होंने ढेर से लगभग 14% हिस्सा हटा दिया।
- चरण 2: ठीक करने वाला स्टेशन (Fix-It Station)। उन्होंने "बड़बड़ाते" (gibberish) टेक्स्ट को सुधारने के लिए एक टूल का उपयोग किया और उन सभी को बाहर निकाल दिया जो बहुत छोटे थे (50 शब्दों से कम)। परिणाम: उन्होंने शेष आधे टेक्स्ट को ठीक किया और छोटे, बेकार अंशों को हटा दिया।
- चरण 3: भाषा पुलिस। उन्होंने यह सुनिश्चित करने के लिए एक परीक्षण चलाया कि टेक्स्ट वास्तव में सोमाली है। यदि कोई दस्तावेज़ ज्यादातर अंग्रेजी में था, तो उसे बाहर निकाल दिया गया। परिणाम: थोड़ा सा "अंग्रेजी रिसाव" (English leakage) हटाया गया।
- चरण 4: "लगभग-क्लोन" शिकारी। उन्होंने एक स्मार्ट गणितीय तकनीक (MinHash) का उपयोग किया ताकि उन दस्तावेजों को खोजा जा सके जो एक-दूसरे से 80% समान हैं और केवल सबसे अच्छे संस्करण को रखा। परिणाम: उन्होंने ढेर से अन्य 10% हिस्सा और हटा दिया।
- चरण 5: गुणवत्ता जांच। उन्होंने टेक्स्ट की तुलना एक "स्वर्ण मानक" (सोमाली विकिपीडिया) से की ताकि यह देखा जा सके कि शब्द और पैटर्न स्वाभाविक रूप से प्रवाहमयी सोमाली की तरह हैं या नहीं। यदि कोई दस्तावेज़ अजीब या टूटा हुआ लगा, तो उसे हटा दिया गया। परिणाम: उन्होंने सबसे कम गुणवत्ता वाले निचले 15% टेक्स्ट को हटा दिया।
- चरण 6: अंतिम पॉलिश। उन्होंने शेष दस्तावेजों को मिलाया (shuffle), उन्हें एक "प्रशिक्षण" (training) सेट और एक "परीक्षण" (testing) सेट में विभाजित किया, और एक कस्टम टोकनाइज़र (tokenizer) बनाया।
3. नए उपकरण: एक कस्टम डिक्शनरी
जब कंप्यूटर टेक्स्ट पढ़ते हैं, तो वे शब्दों को छोटे टुकड़ों में तोड़ देते हैं जिन्हें 'टोकन' कहा जाता है।
- पुराना तरीका: एक सामान्य डिक्शनरी (जैसे GPT-4 की) का उपयोग करने का मतलब था कि सोमाली शब्दों को छोटे, अक्षम टुकड़ों में काट दिया जाता था। यह एक बड़ी पिज्जा को एक छोटे चम्मच से खाने की कोशिश करने जैसा था; उस भोजन को खत्म करने के लिए आपको बहुत सारे, बहुत सारे चम्मचों की आवश्यकता होती है।
- नया तरीका: लेखकों ने विशेष रूप से सोमाली के लिए एक कस्टम डिक्शनरी बनाई।
- परिणाम: उनकी डिक्शनरी 40% अधिक कुशल है। उसी मात्रा में टेक्स्ट को पढ़ने के लिए उन्हें 40% कम "चम्मच" (tokens) की आवश्यकता होती है। इससे भविष्य में इस डेटा का उपयोग करने वाले किसी भी व्यक्ति के लिए पैसा और कंप्यूटिंग शक्ति बचती है।
4. बेंचमार्क: भाषा पहचानकर्ताओं के लिए एक "ड्राइविंग टेस्ट"
लेखकों ने यह देखने के लिए भी एक परीक्षण बनाया कि कौन सा कंप्यूटर प्रोग्राम सोमाली टेक्स्ट को पहचानने में सबसे अच्छा है। उन्होंने तीन लोकप्रिय टूल्स का परीक्षण किया:
- चौंकाने वाला विजेता: सबसे पुराना टूल, जिसे
langdetectकहा जाता है, सोमाली को पहचानने में सबसे अच्छा रहा। - हारने वाला: एक नया, अधिक जटिल टूल (
fastText) बुरी तरह विफल रहा, अक्सर यह सोचकर कि सोमाली एक पूरी तरह से अलग भाषा है। - सीख: सिर्फ इसलिए कि कोई टूल नया है, इसका मतलब यह नहीं है कि वह विशिष्ट भाषाओं के लिए बेहतर है।
क्या जारी किया गया उसका सारांश
लेखकों ने केवल एक पेपर नहीं लिखा; उन्होंने जनता के लिए तीन वास्तविक उपकरण जारी किए हैं:
- द कॉर्पस (The Corpus): 819,000 सोमाली दस्तावेजों (लगभग 303 मिलियन शब्द) का एक साफ, उच्च-गुणवत्ता वाला संग्रह।
- द टोकनाइज़र (The Tokenizer): एक कस्टम "डिक्शनरी" जो सामान्य डिक्शनरी की तुलना में सोमाली को बहुत अधिक कुशलता से पढ़ती है।
- द बेंचमार्क (The Benchmark): एक सार्वजनिक टेस्ट स्कोरकार्ड जो दिखाता है कि कौन से भाषा डिटेक्टर वास्तव में सोमाली के लिए काम करते हैं।
उन्होंने क्या नहीं किया (पेपर के अनुसार):
उन्होंने इस डेटा पर अभी तक कोई नया AI चैटबॉट या लैंग्वेज मॉडल प्रशिक्षित नहीं किया है। उन्होंने केवल सामग्री (साफ डेटा और उपकरण) बनाई है और यह साबित किया है कि सामग्री उच्च गुणवत्ता वाली है। वे "खाना पकाने" (मॉडल को प्रशिक्षित करना और यह देखना कि वह कितना स्मार्ट बनता है) को भविष्य के संस्करण (v2) के लिए बचा रहे हैं।
संक्षेप में: SomaliWeb v1 पहली बार है जब किसी ने इंटरनेट से बिखरे हुए, टूटे हुए सोमाली टेक्स्ट को लिया है, उसे साफ किया है, व्यवस्थित किया है, और शोधकर्ताओं को उनके लिए एक कस्टम टूलसेट के साथ सौंपा है, ताकि वे खुद सफाई करने के बजाय बेहतर AI बना सकें।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।