← नवीनतम पेपर
💻 computer science

The Saudi Legal Corpus for AI: An Auditable, Official-Source-Grounded, Article-Level Corpus of Saudi Arabian Legislation

यह शोध पत्र 'सॉदी लीगल कॉर्पस फॉर एआई' (Saudi Legal Corpus for AI) को प्रस्तुत करता है, जो 290 सऊदी विधायी उपकरणों का एक व्यापक, आधिकारिक रूप से स्रोतबद्ध और ऑडिट करने योग्य लेख-स्तरीय डेटासेट है, जिसमें अद्वितीय प्रोवेनेंस ट्रैकिंग, साइटेशन ग्राफ और परिभाषित-शब्द शब्दावली जैसे संरचित विश्लेषणात्मक स्तर शामिल हैं, तथा एक रिट्रीवल बेंचमार्क अरबी कानूनी एनएलपी (NLP) के लिए मानक बेसलाइन की तुलना में मेटाडेटा-उन्नत खोज के बेहतर प्रदर्शन को प्रदर्शित करता है।

मूल लेखक: Abdullah Almohammedi

प्रकाशित 2026-09-01
📖 7 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Abdullah Almohammedi

मूल पेपर CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

आधुनिक दुनिया में, कंप्यूटरों से कानून के बारे में सवाल पूछने के लिए तेजी से कहा जा रहा है। इसे सटीक रूप से करने के लिए, वे 'रिट्रीवल-ऑगमेंटेड जनरेशन' (retrieval-augmented generation) नामक एक तकनीक पर भरोसा करते हैं। यह प्रक्रिया एक लाइब्रेरियन की तरह काम करती है जो किसी प्रश्न का उत्तर देने से पहले, उत्तर रखने वाले सटीक अंश को खोजने के लिए विश्वसनीय दस्तावेजों के एक विशाल पुस्तकालय की खोज करता है। यदि कंप्यूटर सही पाठ ढूंढ लेता है, तो वह अपनी ओर से कुछ भी मनगढ़ंत बनाए बिना उपयोगकर्ता के लिए उसका सारांश प्रस्तुत कर सकता है। हालाँकि, यह प्रणाली तभी काम करती है जब पुस्तकालय ऐसे प्रारूप में मौजूद हो जिसे कंप्यूटर पढ़ और समझ सके। कई भाषाओं और कानूनी प्रणालियों के लिए, विशेष रूप से अरब जगत में, यह पुस्तकालय अनुपलब्ध रहा है। सऊदी अरब के कानून, जो एक प्रमुख वैश्विक अर्थव्यवस्था है, आधिकारिक राजपत्रों (gazettes) और सरकारी वेबसाइटों पर प्रकाशित होते हैं, लेकिन वे मानव-पठनीय पृष्ठों और दस्तावेजों के रूप में मौजूद हैं, न कि संरचित डेटा (structured data) के रूप में जिसे सॉफ्टवेयर आसानी से खोज सके। मशीन-पठनीय संस्करण के बिना, आर्टिफिशियल इंटेलिजेंस किंगडम (सऊदी अरब) में कानूनी प्रश्नों में विश्वसनीय रूप से सहायता नहीं कर सकता, जिससे तकनीक और न्याय तक पहुंच दोनों में एक महत्वपूर्ण अंतर पैदा होता है।

इस अंतर को पाटने के लिए, अब्दुल्ला अलमोहम्मदी नामक एक शोधकर्ता ने 'सऊदी लीगल कॉर्पस फॉर एआई' (Saudi Legal-Corpus for AI) का निर्माण किया है, जो किंगडम के कानूनों का एक विशाल, संरचित डिजिटल संग्रह है। यह केवल लिंक की एक साधारण सूची या स्कैन किए गए पीडीएफ का संग्रह नहीं है। इसके बजाय, यह 290 विशिष्ट विधायी उपकरणों (legislative instruments) वाला एक सावधानीपूर्वक व्यवस्थित डेटाबेस है, जिसमें प्रमुख वैधानिक कानूनों से लेकर विस्तृत कार्यान्वयन नियमों और प्रक्रियात्मक नियमों तक शामिल हैं। यह संग्रह कानून के बारह अलग-अलग क्षेत्रों को कवर करता है, जिसमें वाणिज्यिक व्यवसाय, आपराधिक न्याय, श्रम अधिकार और कराधान शामिल हैं। इस कार्य का मूल 290 कानूनों को 15,689 व्यक्तिगत अनुच्छेद-स्तरीय रिकॉर्ड्स में बदलना है। प्रत्येक रिकॉर्ड एक एकल, आत्मनिर्भर पाठ का हिस्सा है, जैसे कि किसी कानून का एक विशिष्ट अनुच्छेद, जो लगभग 1.2 मिलियन अरबी शब्दों के बराबर है। पूरा संग्रह ऑडिट करने योग्य (auditable) बनाया गया है, जिसका अर्थ है कि प्रत्येक पाठ को उसके सटीक आधिकारिक स्रोत से जोड़ा जा सकता है, जिससे यह सुनिश्चित होता है कि कंप्यूटर वास्तविक कानून पढ़ रहा है, न कि कोई सारांश या अनुमान।

इस कॉर्पस का निर्माण सटीकता और विश्वसनीयता सुनिश्चित करने के लिए नियमों के एक सख्त सेट का पालन करता है। सबसे महत्वपूर्ण नियम यह है कि आधिकारिक अरबी पाठ ही एकमात्र मान्य संस्करण है। जबकि संग्रह में अंग्रेजी और चीनी अनुवाद शामिल हैं, उन्हें गैर-प्रामाणिक संदर्भ के रूप में स्पष्ट रूप से चिह्नित किया गया है, जो समझने के लिए उपयोगी हैं लेकिन कानूनी रूप से बाध्यकारी नहीं हैं। डेटाबेस के प्रत्येक अनुच्छेद में एक लेबल लगा है जो बताता है कि वह वास्तव में कहाँ से आया है और उसे कैसे सत्यापित किया गया है। शोधकर्ता ने प्रत्येक स्रोत की विश्वसनीयता को ग्रेड देने के लिए चार-स्तरीय प्रणाली का उपयोग किया, जो उन कानूनों के बीच अंतर करता है जिन्हें कई आधिकारिक दस्तावेजों के विरुद्ध क्रॉस-चेक किया गया था और वे जो एक एकल स्रोत से आए थे। विवरण का यह स्तर उपयोगकर्ताओं को साक्ष्य की आवश्यकता के आधार पर डेटा को फ़िल्टर करने की अनुमति देता है। उदाहरण के लिए, उच्च-जोखिम वाली कानूनी सलाह के लिए डिज़ाइन किया गया सिस्टम केवल सबसे कठोरता से सत्यापित स्रोतों का उपयोग कर सकता है, जबकि एक शोध परियोजना व्यापक श्रेणी को स्वीकार कर सकती है। डेटाबेस में एक "फ्रेशनेस मैनिफेस्ट" (freshness manifest) भी शामिल है, जो उन 16 विशिष्ट ट्रैक्स की सूची देता है जहाँ आधिकारिक सरकारी पोर्टल में अभी भी नवीनतम संशोधन नहीं हो सकते हैं, जिससे उपयोगकर्ता गलत जानकारी से भ्रमित होने के बजाय संभावित पुराने डेटा के प्रति सचेत रहें।

केवल पाठ को संग्रहीत करने के अलावा, शोधकर्ता ने इसमें विश्लेषण के कई स्तर जोड़े हैं जो सऊदी कानून के लिए पहले कभी अस्तित्व में नहीं थे। इस कॉर्पस में कानूनों के एक-दूसरे को संदर्भित करने का एक मानचित्र शामिल है, जो दिखाता है कि कौन से अनुच्छेद अन्य अनुच्छेदों को उद्धृत करते हैं। यह साइटेशन ग्राफ (citation graph) 3,600 से अधिक संदर्भों को दर्शाता है, जो यह प्रकट करता है कि कौन से कानून कानूनी प्रणाली में केंद्रीय केंद्र के रूप में कार्य करते हैं, जैसे कि श्रम कानून और कंपनी कानून, जिन्हें अन्य नियमों द्वारा बार-बार उद्धृत किया जाता है। एक हस्त-वर्गीकृत मानचित्र भी है जो दिखाता है कि किन कानूनों ने पुराने कानूनों को प्रतिस्थापित या निरस्त किया है, जिससे कानूनी परिवर्तनों के इतिहास को ट्रैक करने में मदद मिलती है। इसके अतिरिक्त, इस परियोजना ने लगभग 2,000 शब्दों का एक शब्दावली (glossary) तैयार किया है जो विशेष रूप से कानूनों के भीतर परिभाषित हैं, साथ ही 3,300 से अधिक परिभाषाएँ भी शामिल हैं। यह स्पष्ट करने में मदद करता है कि कैसे एक ही शब्द विभिन्न संदर्भों में अलग-अलग अर्थ रख सकता है। आधुनिक एआई टूल के लिए डेटा को तैयार करने हेतु, पाठ को छोटे, प्रबंधनीय टुकड़ों (chunks) में भी विभाजित किया गया था, जिससे कंप्यूटर हजारों पृष्ठों के पाठ में खोए बिना कानून के विशिष्ट अनुभागों को प्रोसेस कर सकें।

यह परीक्षण करने के लिए कि यह नया संसाधन कितनी अच्छी तरह काम करता है, शोधकर्ता ने सऊदी कानून के बारे में 519 विशिष्ट प्रश्न बनाए, जिनमें से प्रत्येक को सही अनुच्छेद के साथ जोड़ा गया है जिसमें उत्तर मौजूद है। ये प्रश्न वास्तविक कानूनों को पढ़कर और फिर उन प्रश्नों को तैयार करके लिखे गए थे जो एक व्यक्ति पूछ सकता है। जब शोधकर्ताओं ने एक मानक खोज पद्धति का इस नए, मेटाडेटा-समृद्ध सिस्टम के विरुद्ध परीक्षण किया, तो परिणाम उल्लेखनीय थे। नए सिस्टम ने 93.3 प्रतिशत बार सही अनुच्छेद की पहचान की, जबकि मानक पद्धति के लिए यह 90.4 प्रतिशत था। अंतर तब सबसे अधिक स्पष्ट हुआ जब प्रश्नों में परिभाषाओं के बारे में पूछा गया, जैसे कि "बिक्री अनुबंध क्या है?" इन मामलों में, नया सिस्टम काफी अधिक सटीक था, जिसने सही परिभाषा को 90.9 प्रतिशत बार पाया, जबकि मानक पद्धति के लिए यह 74.5 प्रतिशत था। यह अंतर यह प्रदर्शित करता है कि डेटा को व्यवस्थित करने और विस्तृत लेबल जोड़ने में किया गया अतिरिक्त कार्य सार्थक है, जिससे कंप्यूटर के लिए सही जानकारी ढूँढना बहुत आसान हो जाता है, भले ही खोज शब्द पाठ से पूरी तरह मेल न खाते हों।

इस कॉर्पस का विमोचन क्षेत्र में कानूनी तकनीक के लिए एक महत्वपूर्ण कदम है, लेकिन यह स्पष्ट सीमाओं और सीमाओं के साथ आता है। यह संग्रह व्यापक नहीं है; यह मुख्य कानूनों को कवर करता है लेकिन इसमें प्रत्येक मंत्रिस्तरीय निर्णय या नगर पालिका नियम शामिल नहीं है। शोधकर्ता इस बारे में पारदर्शी है, संग्रह के दायरे और प्रत्येक डेटा से जुड़े विशिष्ट जोखिमों का दस्तावेजीकरण करता है। यह कार्य स्पष्ट रूप से कोई आधिकारिक सरकारी प्रकाशन नहीं है, और अंग्रेजी एवं चीनी परतें आधिकारिक अनुवाद नहीं हैं। केवल बाध्यकारी पाठ वही मूल अरबी है जैसा कि आधिकारिक राजपत्र में प्रकाशित है। इस संरचित, सत्यापित और ऑडिट करने योग्य संसाधन को प्रदान करके, यह परियोजना विश्वसनीय कानूनी सहायकों के निर्माण और सऊदी कानून की संरचना पर गहन अध्ययन करने के लिए एक आधार प्रदान करती है। यह एक टेम्पलेट प्रदान करता है कि कैसे अन्य देश जिनके पास मशीन-पठनीय आधिकारिक राजपत्र नहीं हैं, डिजिटल युग के लिए अपनी स्वयं की कानूनी प्रणालियों को व्यवस्थित कर सकते हैं, यह सुनिश्चित करते हुए कि कानून सुलभ, समझने योग्य और तथ्यों पर आधारित रहे।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →