← नवीनतम पेपर
💬 NLP

Sri Lanka Document Datasets: A Large-Scale, Multilingual Resource for Law, News, and Policy

यह शोध पत्र एक बड़े पैमाने के, बहुभाषी खुले डेटासेट संग्रह को प्रस्तुत करता है जिसमें सिंहल, तमिल और अंग्रेजी में 278,000 से अधिक दस्तावेज़ शामिल हैं, जो कम्प्यूटेशनल भाषाविज्ञान और सामाजिक-राजनीतिक अध्ययन में अनुसंधान का समर्थन करने के लिए श्रीलंकाई कानून, समाचार और नीति को कवर करते हैं।

मूल लेखक: Nuwan I. Senaratna

प्रकाशित 2026-07-03
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Nuwan I. Senaratna

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि श्रीलंका के सार्वजनिक रिकॉर्ड—कानून, समाचार, अदालती निर्णय और सरकारी रिपोर्ट—सैकड़ों अलग-अलग इमारतों में बिखरी हुई एक विशाल, अराजक लाइब्रेरी की तरह हैं। कुछ किताबें कांच के बक्सों में बंद हैं (PDF), कुछ बस कागजों पर लिखे गए बिखरे हुए लेख हैं (वेबसाइटें), और कई तीन अलग-अलग भाषाओं में लिखी गई हैं: सिंहल, तमिल और अंग्रेजी। एक आम नागरिक, पत्रकार या शोधकर्ता के लिए, इस अव्यवस्था में किसी विशिष्ट तथ्य को खोजना घास के ढेर में सुई खोजने जैसा है जो लगातार अपनी जगह बदलता रहता है।

यह शोध पत्र "श्रीलंका डॉक्यूमेंट डेटासेट्स" (Sri Lanka Document Datasets) नामक एक प्रोजेक्ट का परिचय देता है, जो एक अत्यंत व्यवस्थित लाइब्रेरियन और एक डिजिटल मूविंग ट्रक के संयोजन की तरह कार्य करता है। उन्होंने यह बनाया है:

1. विशाल संग्रह (द "डिजिटल वेयरहाउस")

टीम ने 278,621 दस्तावेज़ों (लगभग 80.7 GB डेटा) को एक व्यवस्थित, मशीन-पठनीय पैकेज में एकत्र किया है। इसे एक ही विशाल गोदाम बनाने के रूप में समझें जहाँ श्रीलंका की हर महत्वपूर्ण जानकारी को छाँटा गया, लेबल किया गया और उपयोग के लिए तैयार किया गया है।

इस संग्रह में शामिल हैं:

  • "कानून लाइब्रेरी": संसदीय बहस (हंसार्ड्स), सर्वोच्च न्यायालय के निर्णय, और पुलिस प्रेस विज्ञप्तियाँ।
  • "नियम पुस्तिका": वास्तविक कानून (अधिनियम), मसौदा कानून (विधेयक), और तत्काल सरकारी नोटिस (राजपत्र/गज़ेट)।
  • "न्यूज़स्टैंड": हजारों समाचार लेख और सरकारी अपडेट।
  • "मौसम और अर्थव्यवस्था रिपोर्ट": पर्यटन आँकड़े, मछली की कीमतें, बाढ़ की चेतावनियाँ और बैंक रिपोर्ट।

यह सब तीन भाषाओं में उपलब्ध है, जो इसे एक वास्तविक बहुभाषी खजाना बनाता है।

2. जादुई मशीन (द "कलेक्शन पाइपलाइन")

यह सारा डेटा उन्हें कैसे मिला? उन्होंने इसे मैन्युअल रूप से कॉपी-पेस्ट करने के लिए लोगों की टीम नहीं रखी। इसके बजाय, उन्होंने एक स्वचालित रोबोट सिस्टम बनाया।

  • द स्काउट (खोजकर्ता): यह रोबट हर दिन आधिकारिक सरकारी वेबसाइटों पर जाता है। यह विनम्र है; यह "प्रवेश निषेध" (robots.txt) के संकेतों की जाँच करता है और अपनी बारी का इंतज़ार करता है ताकि वेबसाइट क्रैश न हो जाए।
  • द सॉर्टर (छँटनी करने वाला): जब रोबोट को कोई नया दस्तावेज़ मिलता है, तो वह केवल उसे उठाता नहीं है; वह जाँच करता है कि क्या वह पहले से ही वहाँ मौजूद है। यदि वह नया है, तो वह उसे डाउनलोड करता है, पढ़ता है और उसे साफ़ करता है।
  • द ट्रांसलेटर एंड क्लीनर (अनुवादक और सफाईकर्मी): सिस्टम अव्यवस्थित PDF (जो टेक्स्ट की तस्वीरों की तरह होते हैं) को लेकर उन्हें साफ, खोजने योग्य टेक्स्ट में बदल देता है। यह टूटी हुई लाइनों को ठीक करता है और डेटा को एक मानक प्रारूप (JSON) में व्यवस्थित करता है ताकि कंप्यूटर इसे आसानी से समझ सकें।
  • द डेली अपडेट (दैनिक अपडेट): यह रोबोट स्वचालित रूप से दिन में कई बार चलता है। यदि कोई नया कानून पारित होता है या कोई नई बाढ़ की चेतावनी जारी की जाती है, तो यह सिस्टम उसे तुरंत पकड़ लेता है और संग्रह में जोड़ देता है।

3. खुली द्वार नीति (लाइसेंसिंग और एक्सेस)

आमतौर पर, बड़े डेटा सेट पेवॉल (पैसे देकर एक्सेस करने की व्यवस्था) के पीछे बंद होते हैं या उन्हें उपयोग करने के लिए विशेष अनुमति की आवश्यकता होती है। यह प्रोजेक्ट अलग है। यह एक निजी क्लब के बजाय एक सार्वजनिक पार्क की तरह है।

  • प्रवेश निःशुल्क: कोई भी डेटा मुफ्त में डाउनलोड कर सकता है।
  • बदलाव के लिए स्वतंत्र: आप डेटा ले सकते हैं, गलतियों को सुधार सकते हैं, या इस पर अपने स्वयं के उपकरण बना सकते हैं, बशर्ते आप मूल रचनाकारों को श्रेय दें।
  • हमेशा उपलब्ध: डेटा को दो लोकप्रिय प्लेटफार्मों (GitHub और Hugging Face) पर मिरर किया गया है, जिससे यह सुनिश्चित होता है कि यदि एक साइट डाउन भी हो जाए, तो भी लाइब्रेरी खुली रहे।

4. आगे क्या? (भविष्य की योजनाएं)

यह शोध पत्र भविष्य के लिए तीन मुख्य लक्ष्यों को रेखांकित करता है:

  1. लाइब्रेरी का विस्तार करना: अन्य सरकारी विभागों और ऐतिहासिक अभिलेखों से और अधिक प्रकार के दस्तावेज़ जोड़ना।
  2. भाषा को निखारना: सिंहल और तमिल में जटिल वाक्यों को पढ़ने के तरीके में सुधार करना, यह सुनिश्चित करना कि "रोबोट" भाषाओं की बारीकियों को पूरी तरह से समझ सके।
  3. हस्तलिखित/स्कैन किए गए दस्तावेज़ों को पढ़ना: वर्तमान में, सिस्टम धुंधले या स्कैन किए गए दस्तावेज़ों के साथ संघर्ष करता है। वे रोबोट को कम गुणवत्ता वाली छवियों से टेक्स्ट पढ़ने के लिए "आंखें" (OCR तकनीक) का उपयोग करना सिखाने की योजना बना रहे हैं, जिससे सबसे अव्यवस्थित पुराने कागजात भी साफ डिजिटल टेक्स्ट में बदल सकें।

यह क्यों महत्वपूर्ण है?

यह शोध पत्र तर्क देता है कि खंडित और कठिन-से-पढ़ने योग्य रिकॉर्ड को एक साफ, खुले और खोजने योग्य डेटाबेस में बदलकर, वे शोधकर्ताओं, पत्रकारों और नागरिकों को एक महाशक्ति (सुपरपावर) दे रहे हैं। यह उन्हें यह ट्रैक करने की अनुमति देता है कि कानून कैसे बदलते हैं, सरकारी निर्णयों की निगरानी करने और कागजी कार्रवाई में खोए बिना देश के इतिहास का अध्ययन करने में सक्षम बनाता है। यह श्रीलंका के "डिजिटल रिकॉर्ड" को केवल उन लोगों के लिए नहीं, बल्कि उन सभी के लिए सुलभ बनाने के बारे में है जिनके पास अभिलेखों को खोजने के लिए समय या उपकरण हैं।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →