Wiki Dumps to Training Corpora: South Slavic Case
यह शोध पत्र सात दक्षिण स्लाव भाषाओं के लिए कई विकी परियोजनाओं से पाठ को व्यवस्थित रूप से निकालकर और निम्न-गुणवत्ता वाले, पुनरावृत्ति वाले लेखों को हटाने के लिए n-ग्राम-आधारित फ़िल्टरिंग का उपयोग करके, कच्चे विकिमीडिया डंप को उच्च-गुणवत्ता वाले, भाषाई रूप से समृद्ध प्रशिक्षण कॉर्पोरा में बदलने के लिए एक भाषा-अज्ञेय (language-agnostic) कार्यप्रणाली प्रस्तुत करता है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आप एक रोबोट को सात अलग-अलग दक्षिण स्लाव भाषाओं (जैसे सर्बियाई, क्रोएशियाई, बुल्गारियाई और अन्य) को बोलना और समझना सिखाने के लिए कहानियों, कविताओं और समाचार लेखों का एक विशाल पुस्तकालय बनाना चाहते हैं। आप विकिपीडिया और उसकी सहयोगी साइटों (जैसे विकिस्रोत या विकिन्यूज) को अपने स्रोत के रूप में उपयोग करने का निर्णय लेते हैं क्योंकि वे मुफ्त हैं और टेक्स्ट से भरी हुई हैं।
हालाँकि, यदि आप केवल इन वेबसाइटों से कच्ची फाइलें (raw files) उठा लेते हैं, तो आप कहानियों का पुस्तकालय नहीं प्राप्त कर रहे हैं। आप एक अराजक गोदाम प्राप्त कर रहे हैं जिसमें भरा है:
- निर्माण का मलबा: छिपे हुए कंप्यूटर कोड, फॉर्मेटिंग निर्देश, और "ब्लूप्रिंट्स" जो वेबसाइट को दिखने का तरीका बताते हैं लेकिन कहानी का हिस्सा नहीं हैं।
- टूटा हुआ कांच: टूटे हुए लिंक और खाली खंड।
- फैक्ट्री-निर्मित क्लोन: हजारों लेख जो लगभग एक जैसे दिखते हैं क्योंकि उन्हें मनुष्यों द्वारा लिखने के बजाय डेटाबेस से स्वचालित रूप से उत्पन्न किया गया था।
यह शोध पत्र उस बिखरे हुए गोदाम को साफ करने और उसे एक स्वच्छ पुस्तकालय में बदलने के तरीके पर एक मार्गदर्शिका है। लेखक, मिहाइलो शकोरिक (Mihailo Škorić), इस प्रक्रिया को दो मुख्य चरणों में विभाजित करते हैं: महान सफाई (The Great Cleanup) और गुणवत्ता फिल्टर (The Quality Filter)।
चरण 1: महान सफाई (टेक्स्ट एक्सट्रैक्शन)
कच्चे विकिपीडिया डेटा को एक ऐसे घर के रूप में सोचें जो अभी भी निर्माण के अधीन है। इसमें मचान (scaffolding), पेंट के डिब्बे और ब्लूप्रिंट्स हर जगह हैं। आप अभी इसमें रह नहीं सकते।
लेखक ने एक विशेष "निर्माण दल" (एक कंप्यूटर प्रोग्राम) बनाया है जो घर को उसके बुनियादी, रहने योग्य दीवारों तक उतार देता है।
- मचान को हटाना: प्रोग्राम एक टूल का उपयोग करता है जिसे
mwparserfromhellकहा जाता है (एक फैंसी नाम जो विकिपीडिया की गुप्त भाषा को समझता है) ताकि सभी कंप्यूटर कोड, टेम्पलेट्स और फॉर्मेटिंग टैग्स को बाहर निकाला जा सके। - शोर को हटाना: यह "कैटेगरी" सूचियों (जैसे फाइल कैबिनेट पर लगे टैग) को हटा देता है, इमेज विवरणों को निकाल देता है, और "संदर्भ" (References) अनुभागों को हटा देता है जो फुटनोट्स की तरह दिखते हैं लेकिन मुख्य कहानी का हिस्सा नहीं हैं।
- टेबल्स को समतल करना: विकिपीडिया अक्सर डेटा को व्यवस्थित करने के लिए तालिकाओं (tables) का उपयोग करता है। प्रोग्राम इन जटिल ग्रिडों को सरल, पठनीय वाक्यों में बदल देता है ताकि रोबोट ग्रिड लाइनों से भ्रमित न हो।
- परिणाम: इस चरण के बाद, आपके पास साफ, सादा टेक्स्ट का ढेर होता है। यह अब एक वेबसाइट नहीं है; यह केवल शब्द हैं।
चरण 2: गुणवत्ता फिल्टर (क्लोन को हटाना)
अब जब आपके पास साफ टेक्स्ट है, तो एक नई समस्या है। कुछ लेख "ज़ोंबी" टेक्स्ट हैं। ये वे लेख हैं जो ऐसे दिखते हैं जैसे उन्हें किसी इंसान ने लिखा हो, लेकिन वास्तव में उन्हें एक कंप्यूटर द्वारा ऑटो-जेनरेट किया गया था। वे दोहराव वाले, उबाऊ हैं और एक ही बात को थोड़े अलग तरीकों से बार-बार कहते हैं।
यदि आप इन "ज़ोंबी" लेखों को अपने रोबोट को खिलाते हैं, तो वह रोबोटिक और दोहराव वाले लूप में बोलना सीख जाएगा। इसे ठीक करने के लिए, लेखक एक जासूसी रणनीति (Detective Strategy) का उपयोग करते हैं:
- पड़ोस के आधार पर समूहीकरण: प्रोग्राम लेखों को उनके विषय (जैसे, सभी "इतिहास" वाले लेख एक कमरे में जाते हैं, सभी "खेल" दूसरे कमरे में) के आधार पर समूहित करता है। केवल 'सेब की तुलना सेब से' करना आसान है यदि आप डुप्लिकेट्स को खोजना चाहते हैं।
- "फिंगरप्रिंट" स्कैन: प्रोग्राम हर लेख को एक गणितीय "फिंगरप्रिंट" (वेक्टर) में बदल देता है। यह लेख के पहले कुछ शब्दों को देखता है कि क्या वे एक टेम्पलेट के पैटर्न से मेल खाते हैं।
- समानता परीक्षण: यह MinHashing नामक एक गणितीय ट्रिक का उपयोग करके इन फिंगरप्रिंट्स की आपस में तुलना करता है। कल्पना करें कि आपके पास दो किताबें हैं। यदि वे एक ही क्रम में बहुत सारे समान वाक्यों को साझा करती हैं, तो संभावना है कि वे क्लोन हैं।
- कटऑफ: प्रोग्राम एक "समानता स्कोर" (similarity score) की गणना करता है। यदि कोई लेख दूसरों के बहुत समान है (एक निश्चित सीमा से ऊपर), तो उसे पुस्तकालय से बाहर निकाल दिया जाता है। यह क्लब के एक बाउंसर की तरह है जो कहता है, "तुम बिल्कुल लाइन में खड़े बाकी लोगों जैसे दिखते हो; तुम्हें अंदर नहीं जाने दिया जाएगा।"
परिणाम
इस शोध पत्र ने सात दक्षिण स्लाव भाषाओं पर इस पद्धति का परीक्षण किया। परिणाम नाटकीय थे:
- सर्बियाई: इसे साफ करने के लिए सबसे बड़े कचरे की आवश्यकता थी। फ़िल्टरिंग से पहले, इसमें 500,000 से अधिक लेख थे। "बाउंसर" द्वारा अपना काम करने के बाद, डुप्लिकेट या ऑटो-जेनरेटेड होने के कारण लगभग आधे लेख हटा दिए गए। शब्द गणना लगभग 60% कम हो गई।
- बुल्गारियाई और स्लोवेनियाई: ये पहले से ही काफी साफ थे, इसलिए इन्होंने कम लेख खोए।
- प्रतिफल (The Payoff): अंतिम परिणाम एक छोटा, लेकिन बहुत उच्च-गुणवत्ता वाला पुस्तकालय है। इन नए पुस्तकालयों के शब्द वास्तव में इस तरह से मेल खाते हैं जैसे वास्तविक मनुष्य बोलते हैं, न कि उस तरह से जैसे एक डेटाबेस टेक्स्ट उत्पन्न करता है।
यह क्यों महत्वपूर्ण है
लेखक का तर्क है कि एक रोबोट को भाषा अच्छी तरह से सीखने के लिए, उसे वास्तविक मानवीय लेखन पढ़ने की आवश्यकता है, न कि कंप्यूटर-जनित फिलर की। यह दो-चरणीय प्रक्रिया (कोड की सफाई, फिर क्लोन को फ़िल्टर करना) करके, यह शोध पत्र दक्षिण स्लाव भाषाओं में AI मॉडल को प्रशिक्षित करने के लिए विश्वसनीय, उच्च-गुणवत्ता वाला पुस्तकों का सेट प्रदान करता है।
संक्षेप में: यह शोध पत्र हमें सिखाता है कि कैसे विकिपीडिया के एक बिखरे हुए, कोड-भरे ढेर को लिया जाए, उसे कंप्यूटर के कचरे से साफ किया जाए, और फिर "कॉपी-पेस्ट" लेखों को बाहर निकाला जाए, जिससे मानव भाषा का एक शुद्ध संग्रह पीछे बच जाए जो एक रोबोट के सीखने के लिए तैयार हो।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।