PashtoCorp: A 1.25-Billion-Word Corpus, Evaluation Suite, and Reproducible Pipeline for Low-Resource Language Development
यह शोधपत्र PashtoCorp को प्रस्तुत करता है, जो पश्तो के लिए 1.25 बिलियन शब्दों का एक कॉर्पस और पुनरुत्पादक पाइपलाइन है जो पिछले डेटासेट की तुलना में काफी बेहतर प्रदर्शन करता है, जिससे इस कम-संसाधन वाली भाषा के लिए लैंग्वेज मॉडल परप्लेक्सिटी, नेम्ड एंटिटी रिकग्निशन और रीडिंग कॉम्प्रिहेन्शन बेंचमार्क में पर्याप्त सुधार होता है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आप एक रोबोट को पश्तो बोलना सिखाने की कोशिश कर रहे हैं, जो 6 करोड़ लोगों द्वारा बोली जाने वाली एक भाषा है। अब तक, रोबोट का पश्तो किताबों का "लाइब्रेरी" बहुत छोटा था—जैसे किसी पूरी भाषा को केवल एक पर्चे से सीखने की कोशिश करना। रोबोट शायद ही कुछ समझ पाता था और वह लगातार गलतियाँ करता था।
यह पेपर PashtoCorp नामक एक विशाल नए प्रोजेक्ट को पेश करता है जो खेल बदल देता है। यहाँ उन्होंने जो किया, उसका सरल विवरण दिया गया है:
1. समस्या: एक प्यासी लाइब्रेरी
पश्तो भाषा को एक विशाल, जीवंत शहर की तरह सोचें। लेकिन कंप्यूटरों (AI) के लिए, यह शहर ज्यादातर खाली था। पश्तो टेक्स्ट के मौजूदा सबसे बड़े संग्रह एक विशाल लाइब्रेरी में कुछ छोटी बुकशेल्फ़ की तरह थे। वे एक स्मार्ट रोबोट को कुछ भी उपयोगी सिखाने के लिए बहुत छोटे थे।
2. समाधान: एक "सुपर-लाइब्रेरी" बनाना
शोधकर्ताओं ने PashtoCorp बनाया, जो 1.25 बिलियन शब्दों वाली एक डिजिटल लाइब्रेरी है।
- यह कितना बड़ा है? यह पिछले सबसे बड़े संग्रह से 40 गुना बड़ा और पुराने रिकॉर्ड-होल्डर से 83 गुना बड़ा है।
- किताबें कहाँ से आईं? उन्होंने केवल एक चीज़ को कॉपी-पेस्ट नहीं किया। उन्होंने 32 कस्टम "रोबोट स्पाइडर" बनाए जो इंटरनेट पर रेंगकर निम्नलिखित से टेक्स्ट इकट्ठा करने के लिए बनाए गए थे:
- समाचार साइटें (जैसे BBC पश्तो या स्थानीय अफगान समाचार)।
- रेडियो ट्रांसक्रिप्ट (जो लोग वास्तव में हवा में बोलते हैं)।
- किताबों और सरकारी रिपोर्टों की PDF ("गहन ज्ञान" वाली चीज़ें)।
- विकिपीडिया (विश्वकोश)।
- मौजूदा इंटरनेट डेटासेट।
3. सफाई की प्रक्रिया: "गोल्ड पन्नर" (सोना छानने वाला)
आप केवल मिट्टी का ढेर डालकर यह उम्मीद नहीं कर सकते कि आपको सोना मिल जाएगा; आपको उसे छानना होगा। शोधकर्ताओं ने डेटा को साफ करने के लिए एक पाइपलाइन बनाई:
- भाषा की जाँच: उन्होंने उस किसी भी चीज़ को फेंक दिया जो वास्तव में पश्तो नहीं थी (जैसे मिला हुआ अंग्रेजी या उर्दू)।
- डुप्लिकेट हटाना: यदि एक ही लेख पांच अलग-अलग वेबसाइटों पर दिखाई देता था, तो उन्होंने केवल एक प्रति रखी।
- गुणवत्ता नियंत्रण: उन्होंने टेक्स्ट के उन छोटे, टूटे हुए टुकड़ों को बाहर कर दिया जो उपयोगी होने के लिए बहुत छोटे थे।
- परिणाम: उन्होंने "सोना" (उच्च गुणवत्ता वाला टेक्स्ट) रखा और "मिट्टी" को फेंक दिया।
4. प्रयोग: रोबोट को सिखाना
उन्होंने एक मानक AI मॉडल (एक रोबोट जो कई भाषाएँ जानता है लेकिन पश्तो में खराब है) को इस नई लाइब्रेरी के साथ फीड किया।
- परिणाम: रोबोट पश्तो व्याकरण और संरचना को समझने में 25% अधिक स्मार्ट हो गया।
- "नाम" परीक्षण: उन्होंने रोबोट का परीक्षण "नेम्ड एंटिटी रिकग्निशन" (लोगों, स्थानों और संगठनों के नाम ढूंढना) नामक कार्य पर किया।
- पहले: रोबोट बेतरतीब ढंग से अनुमान लगा रहा था और बहुत असंगत था (जैसे एक छात्र जिसे एक दिन 'A' ग्रेड मिलता है और अगले दिन 'F')।
- बाद में: रोबोट बहुत अधिक सटीक और 7 गुना अधिक सुसंगत हो गया। उसने अनुमान लगाना बंद कर दिया और जानना शुरू कर दिया।
5. बड़ी हैरानी: यह कितना है, इसके बारे में नहीं, बल्कि क्या है, इसके बारे में है
यह इस पेपर का सबसे दिलचस्प हिस्सा है। शोधकर्ताओं ने एक "लीव-वन-आउट" टेस्ट किया। उन्होंने पूछा: "क्या होता है अगर हम एक विशिष्ट प्रकार के स्रोत को हटा दें?"
- समाचार/रेडियो (मुख्य भाग): ये लाइब्रेरी का 35% हिस्सा थे। इन्हें हटाने से रोबोट को थोड़ा नुकसान हुआ, लेकिन वह फिर भी ठीक था।
- विकिपीडिया (एक छोटा हिस्सा): विकिपीडिया कुल लाइब्रेरी का केवल 0.7% था (एक छोटा सा टुकड़ा)। लेकिन जब उन्होंने इसे हटाया, तो नामों को खोजने की रोबोट की क्षमता 47% तक गिर गई।
- PDF किताबें (एक छोटा हिस्सा): ये केवल 0.6% थे। लेकिन इनमें पूरे संग्रह के सभी अद्वितीय शब्दों में से 35% शामिल थे।
उपमा: कल्पना कीजिए कि आप एक भाषा सीखने की कोशिश कर रहे हैं। 1,000 समान समाचार हेडलाइंस पढ़ना आपको "द", "एंड", और "आज" जैसे सामान्य शब्द सीखने में मदद करता है। लेकिन एक एकल, सघन विश्वकोश प्रविष्टि (Wikipedia) या एक जटिल पुस्तक (PDFs) पढ़ना आपको कठिन शब्द, विशिष्ट नाम और गहरे विचार सिखाता है। उच्च-गुणवत्ता वाले, विविध टेक्स्ट का थोड़ा सा हिस्सा, दोहराव वाले टेक्स्ट के पहाड़ से अधिक मूल्यवान है।
6. जहाँ यह अभी भी संघर्ष करता है
रोबोट समाचार और औपचारिक लेखन को समझने में बहुत अच्छा हो गया। हालाँकि, जब उन्होंने सोशल मीडिया स्लैंग (जैसे संक्षिप्त अक्षरों या अनौपचारिक भाषण वाले ट्विटर या फेसबुक पोस्ट) पर इसका परीक्षण किया, तो रोबोट में कोई सुधार नहीं हुआ।
- क्यों? क्योंकि लाइब्रेरी में "स्ट्रीट स्लैंग" की कमी थी। यह ज्यादातर औपचारिक समाचार था। यह हमें सिखाता है कि यदि आप चाहते हैं कि आपका AI आपके टेक्स्ट मैसेज को समझे, तो आपको उसे टेक्स्ट मैसेज खिलाने होंगे, न कि केवल समाचार लेख।
7. भविष्य के लिए सीख
लेखकों ने सब कुछ मुफ्त में जारी किया: लाइब्रेरी, प्रशिक्षित रोबोट मस्तिष्क और कोड।
- सबक: यदि आप ऐसी भाषा के लिए AI बनाना चाहते है जिसके पास बहुत कम डेटा है, तो केवल पूरे इंटरनेट को खंगालना (scrape) काफी नहीं है। पहले विश्वकोश, किताबें और उच्च-गुणवत्ता वाले लेखों को खोजने पर ध्यान केंद्रित करें। इन "सघन" टेक्स्टों की थोड़ी सी मात्रा भी आपको दोहराव वाले समाचारों के विशाल ढेर से कहीं अधिक सिखाएगी।
संक्षेप में: उन्होंने पश्तो के लिए एक विशाल, स्वच्छ लाइब्रेरी बनाई, यह साबित किया कि बहुत सारे "शोर वाले" टेक्स्ट से बेहतर थोड़ा सा "स्मार्ट" टेक्स्ट है, और उन्होंने सबको लाइब्रेरी की चाबियाँ दे दीं ताकि वे 6 करोड़ पश्तो भाषियों के लिए बेहतर उपकरण बना सकें।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।