← नवीनतम पेपर
💬 NLP

PashtoCorp: A 1.25-Billion-Word Corpus, Evaluation Suite, and Reproducible Pipeline for Low-Resource Language Development

यह शोधपत्र PashtoCorp को प्रस्तुत करता है, जो पश्तो के लिए 1.25 बिलियन शब्दों का एक कॉर्पस और पुनरुत्पादक पाइपलाइन है जो पिछले डेटासेट की तुलना में काफी बेहतर प्रदर्शन करता है, जिससे इस कम-संसाधन वाली भाषा के लिए लैंग्वेज मॉडल परप्लेक्सिटी, नेम्ड एंटिटी रिकग्निशन और रीडिंग कॉम्प्रिहेन्शन बेंचमार्क में पर्याप्त सुधार होता है।

मूल लेखक: Hanif Rahman

प्रकाशित 2026-03-18
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Hanif Rahman

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक रोबोट को पश्तो बोलना सिखाने की कोशिश कर रहे हैं, जो 6 करोड़ लोगों द्वारा बोली जाने वाली एक भाषा है। अब तक, रोबोट का पश्तो किताबों का "लाइब्रेरी" बहुत छोटा था—जैसे किसी पूरी भाषा को केवल एक पर्चे से सीखने की कोशिश करना। रोबोट शायद ही कुछ समझ पाता था और वह लगातार गलतियाँ करता था।

यह पेपर PashtoCorp नामक एक विशाल नए प्रोजेक्ट को पेश करता है जो खेल बदल देता है। यहाँ उन्होंने जो किया, उसका सरल विवरण दिया गया है:

1. समस्या: एक प्यासी लाइब्रेरी

पश्तो भाषा को एक विशाल, जीवंत शहर की तरह सोचें। लेकिन कंप्यूटरों (AI) के लिए, यह शहर ज्यादातर खाली था। पश्तो टेक्स्ट के मौजूदा सबसे बड़े संग्रह एक विशाल लाइब्रेरी में कुछ छोटी बुकशेल्फ़ की तरह थे। वे एक स्मार्ट रोबोट को कुछ भी उपयोगी सिखाने के लिए बहुत छोटे थे।

2. समाधान: एक "सुपर-लाइब्रेरी" बनाना

शोधकर्ताओं ने PashtoCorp बनाया, जो 1.25 बिलियन शब्दों वाली एक डिजिटल लाइब्रेरी है।

  • यह कितना बड़ा है? यह पिछले सबसे बड़े संग्रह से 40 गुना बड़ा और पुराने रिकॉर्ड-होल्डर से 83 गुना बड़ा है।
  • किताबें कहाँ से आईं? उन्होंने केवल एक चीज़ को कॉपी-पेस्ट नहीं किया। उन्होंने 32 कस्टम "रोबोट स्पाइडर" बनाए जो इंटरनेट पर रेंगकर निम्नलिखित से टेक्स्ट इकट्ठा करने के लिए बनाए गए थे:
    • समाचार साइटें (जैसे BBC पश्तो या स्थानीय अफगान समाचार)।
    • रेडियो ट्रांसक्रिप्ट (जो लोग वास्तव में हवा में बोलते हैं)।
    • किताबों और सरकारी रिपोर्टों की PDF ("गहन ज्ञान" वाली चीज़ें)।
    • विकिपीडिया (विश्वकोश)।
    • मौजूदा इंटरनेट डेटासेट।

3. सफाई की प्रक्रिया: "गोल्ड पन्नर" (सोना छानने वाला)

आप केवल मिट्टी का ढेर डालकर यह उम्मीद नहीं कर सकते कि आपको सोना मिल जाएगा; आपको उसे छानना होगा। शोधकर्ताओं ने डेटा को साफ करने के लिए एक पाइपलाइन बनाई:

  • भाषा की जाँच: उन्होंने उस किसी भी चीज़ को फेंक दिया जो वास्तव में पश्तो नहीं थी (जैसे मिला हुआ अंग्रेजी या उर्दू)।
  • डुप्लिकेट हटाना: यदि एक ही लेख पांच अलग-अलग वेबसाइटों पर दिखाई देता था, तो उन्होंने केवल एक प्रति रखी।
  • गुणवत्ता नियंत्रण: उन्होंने टेक्स्ट के उन छोटे, टूटे हुए टुकड़ों को बाहर कर दिया जो उपयोगी होने के लिए बहुत छोटे थे।
  • परिणाम: उन्होंने "सोना" (उच्च गुणवत्ता वाला टेक्स्ट) रखा और "मिट्टी" को फेंक दिया।

4. प्रयोग: रोबोट को सिखाना

उन्होंने एक मानक AI मॉडल (एक रोबोट जो कई भाषाएँ जानता है लेकिन पश्तो में खराब है) को इस नई लाइब्रेरी के साथ फीड किया।

  • परिणाम: रोबोट पश्तो व्याकरण और संरचना को समझने में 25% अधिक स्मार्ट हो गया।
  • "नाम" परीक्षण: उन्होंने रोबोट का परीक्षण "नेम्ड एंटिटी रिकग्निशन" (लोगों, स्थानों और संगठनों के नाम ढूंढना) नामक कार्य पर किया।
    • पहले: रोबोट बेतरतीब ढंग से अनुमान लगा रहा था और बहुत असंगत था (जैसे एक छात्र जिसे एक दिन 'A' ग्रेड मिलता है और अगले दिन 'F')।
    • बाद में: रोबोट बहुत अधिक सटीक और 7 गुना अधिक सुसंगत हो गया। उसने अनुमान लगाना बंद कर दिया और जानना शुरू कर दिया।

5. बड़ी हैरानी: यह कितना है, इसके बारे में नहीं, बल्कि क्या है, इसके बारे में है

यह इस पेपर का सबसे दिलचस्प हिस्सा है। शोधकर्ताओं ने एक "लीव-वन-आउट" टेस्ट किया। उन्होंने पूछा: "क्या होता है अगर हम एक विशिष्ट प्रकार के स्रोत को हटा दें?"

  • समाचार/रेडियो (मुख्य भाग): ये लाइब्रेरी का 35% हिस्सा थे। इन्हें हटाने से रोबोट को थोड़ा नुकसान हुआ, लेकिन वह फिर भी ठीक था।
  • विकिपीडिया (एक छोटा हिस्सा): विकिपीडिया कुल लाइब्रेरी का केवल 0.7% था (एक छोटा सा टुकड़ा)। लेकिन जब उन्होंने इसे हटाया, तो नामों को खोजने की रोबोट की क्षमता 47% तक गिर गई
  • PDF किताबें (एक छोटा हिस्सा): ये केवल 0.6% थे। लेकिन इनमें पूरे संग्रह के सभी अद्वितीय शब्दों में से 35% शामिल थे।

उपमा: कल्पना कीजिए कि आप एक भाषा सीखने की कोशिश कर रहे हैं। 1,000 समान समाचार हेडलाइंस पढ़ना आपको "द", "एंड", और "आज" जैसे सामान्य शब्द सीखने में मदद करता है। लेकिन एक एकल, सघन विश्वकोश प्रविष्टि (Wikipedia) या एक जटिल पुस्तक (PDFs) पढ़ना आपको कठिन शब्द, विशिष्ट नाम और गहरे विचार सिखाता है। उच्च-गुणवत्ता वाले, विविध टेक्स्ट का थोड़ा सा हिस्सा, दोहराव वाले टेक्स्ट के पहाड़ से अधिक मूल्यवान है।

6. जहाँ यह अभी भी संघर्ष करता है

रोबोट समाचार और औपचारिक लेखन को समझने में बहुत अच्छा हो गया। हालाँकि, जब उन्होंने सोशल मीडिया स्लैंग (जैसे संक्षिप्त अक्षरों या अनौपचारिक भाषण वाले ट्विटर या फेसबुक पोस्ट) पर इसका परीक्षण किया, तो रोबोट में कोई सुधार नहीं हुआ।

  • क्यों? क्योंकि लाइब्रेरी में "स्ट्रीट स्लैंग" की कमी थी। यह ज्यादातर औपचारिक समाचार था। यह हमें सिखाता है कि यदि आप चाहते हैं कि आपका AI आपके टेक्स्ट मैसेज को समझे, तो आपको उसे टेक्स्ट मैसेज खिलाने होंगे, न कि केवल समाचार लेख।

7. भविष्य के लिए सीख

लेखकों ने सब कुछ मुफ्त में जारी किया: लाइब्रेरी, प्रशिक्षित रोबोट मस्तिष्क और कोड।

  • सबक: यदि आप ऐसी भाषा के लिए AI बनाना चाहते है जिसके पास बहुत कम डेटा है, तो केवल पूरे इंटरनेट को खंगालना (scrape) काफी नहीं है। पहले विश्वकोश, किताबें और उच्च-गुणवत्ता वाले लेखों को खोजने पर ध्यान केंद्रित करें। इन "सघन" टेक्स्टों की थोड़ी सी मात्रा भी आपको दोहराव वाले समाचारों के विशाल ढेर से कहीं अधिक सिखाएगी।

संक्षेप में: उन्होंने पश्तो के लिए एक विशाल, स्वच्छ लाइब्रेरी बनाई, यह साबित किया कि बहुत सारे "शोर वाले" टेक्स्ट से बेहतर थोड़ा सा "स्मार्ट" टेक्स्ट है, और उन्होंने सबको लाइब्रेरी की चाबियाँ दे दीं ताकि वे 6 करोड़ पश्तो भाषियों के लिए बेहतर उपकरण बना सकें।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →