← नवीनतम पेपर
💻 computer science

NormDef-FR: an annotated corpus of normative definitions for the automatic processing of French legal codes

यह शोध पत्र NormDef-FR को प्रस्तुत करता है, जो 693 फ्रांसीसी मानकीय परिभाषाओं का एक उच्च-गुणवत्ता वाला, ओपन-सोर्स एनोटेटेड कॉर्पस है जिसे ज्ञान निष्कर्षण (knowledge extraction), सूचना पुनर्प्राप्ति (information retrieval) और रिट्रीवल-ऑगमेंटेड जनरेशन (retrieval-augmented generation) जैसे स्वचालित कानूनी एनएलपी कार्यों को सक्षम करने और उनका बेंचमार्किंग करने के लिए डिज़ाइन किया गया है।

मूल लेखक: Aboudourazakou Tetereou, Tarik Boudaa, Dadi El Wardani

प्रकाशित 2026-08-18
📖 8 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Aboudourazakou Tetereou, Tarik Boudaa, Dadi El Wardani

मूल पेपर CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कानून को अक्सर नियमों के एक विशाल पुस्तकालय के रूप में कल्पित किया जाता है, लेकिन एक कंप्यूटर के लिए, यह पाठ का एक अराजक समुद्र है। फ्रांस में, कानूनी प्रणाली कोड पर आधारित है—कानूनों के विशाल संग्रह जहाँ प्रत्येक शब्द का एक विशिष्ट महत्व होता है। इन हजारों पृष्ठों के भीतर, कानून निर्माता अक्सर अपने स्वयं के शब्दों को परिभाषित करने के लिए रुकते हैं। वे लिख सकते हैं, "व्यक्तिगत डेटा से हमारा तात्पर्य किसी पहचाने गए व्यक्ति से संबंधित किसी भी जानकारी से है," या "इस अनुच्छेद के उद्देश्य के लिए, एक वाहन में साइकिल शामिल है।" ये केवल सहायक स्पष्टीकरण नहीं हैं; ये वह कानूनी इंजन हैं जो यह निर्धारित करते हैं कि अधिकार और दायित्व कैसे कार्य करते हैं। इन सटीक परिभाषाओं के बिना, शेष कानून सही ढंग से कार्य नहीं कर सकता। हालाँकि, इन परिभाषाओं को खोजना कठिन है क्योंकि वे स्वास्थ्य से लेकर कराधान तक विभिन्न कोडों में फैले 161,000 से अधिक सक्रिय अनुच्छेदों में दबे हुए हैं, और खोज के मार्गदर्शन के लिए कोई व्यवस्थित मानचित्र उपलब्ध नहीं है।

संरचना की यह कमी तकनीक के लिए एक महत्वपूर्ण समस्या पैदा करती है। यदि कोई वकील या डिजिटल प्रणाली यह जानना चाहती है कि कानून की दृष्टि में किसी विशिष्ट शब्द का सटीक अर्थ क्या है, तो उन्हें अक्सर बिना किसी गारंटी के, यह सुनिश्चित किए बिना कि उन्होंने हर उदाहरण पा लिया है, अनगिनत पृष्ठों को मैन्युअल रूप से पढ़ना पड़ता है। नेचुरल लैंग्वेज प्रोसेसिंग, कंप्यूटर विज्ञान का वह क्षेत्र जो मशीनों को मानव भाषा समझने में सिखाता है, ने कानूनी ग्रंथों का विश्लेषण करने में बड़ी प्रगति की है, लेकिन यह इस विशिष्ट कार्य के साथ संघर्ष करता रहा है। अधिकांश मौजूदा उपकरण अंग्रेजी के लिए या शब्दकोशों में पाई जाने वाली सामान्य परिभाषाओं के लिए डिज़ाइन किए गए हैं, न कि फ्रांसीसी विधान में पाई जाने वाली सख्त, बाध्यकारी परिभाषाओं के लिए। इस अंतर को पाटने के लिए, शोधकर्ताओं ने NormDef-FR नामक एक नया संसाधन बनाया है, जो इन कानूनी परिभाषाओं का एक सावधानीपूर्वक क्यूरेट किया गया संग्रह है जिसे कंप्यूटरों को उन्हें स्वचालित रूप से खोजने और समझने के लिए सिखाने हेतु डिज़ाइन किया गया है।

शोधकर्ताओं ने, जो मोरक्को में अब्देलमालेक एसादी विश्वविद्यालय में कार्यरत हैं, मानव विशेषज्ञता और मशीन स्वचालन के बीच एक सेतु बनाकर इस समस्या के प्रति दृष्टिकोण अपनाया। उन्होंने आधिकारिक फ्रांसीसी कानूनी डेटाबेस से वर्तमान, सक्रिय कानूनों को एकत्र करके शुरुआत की। पूरी लाइब्रेरी को एक साथ पढ़ने के लिए कंप्यूटर को सिखाने के बजाय, उन्होंने पहले संभावित उम्मीदवारों को पहचानने के लिए सरल, नियम-आधारित पैटर्न का उपयोग किया। उन्होंने उन विशिष्ट वाक्यांशों की तलाश की जिनका उपयोग फ्रांसीसी कानून परिभाषाओं को पेश करने के लिए करता है, जैसे कि "परिभाषित है" या "माना जाता है," या शब्द के अर्थ से अलग करने के लिए कोलन (colon) का उपयोग। इस प्रारंभिक छंटनी ने संभावित परिभाषाओं की एक सूची तैयार की, लेकिन यह पूर्ण नहीं थी। कई उम्मीदवार गलत संकेत थे, जो ऐसे वाक्यों को पकड़ रहे थे जो परिभाषा की तरह दिखते थे लेकिन वास्तव में कुछ और थे, जैसे कि जमा किए जाने वाले दस्तावेजों की सूची या किसी कानूनी प्रभाव का विवरण।

इस कच्ची सूची को एक विश्वसनीय प्रशिक्षण उपकरण में बदलने के लिए, टीम ने मानव विशेषज्ञों की मदद ली। उन्होंने हजारों इन उम्मीदवारों की मैन्युअल रूप से समीक्षा की, यह तय करते हुए कि कौन सी वास्तविक, उपयोगी कानूनी परिभाषाएं हैं और किन्हें छोड़ दिया जाना चाहिए। उन्होंने पाठ की सीमाओं को भी सुधारा, यह सुनिश्चित करते हुए कि परिभाषित किया गया "शब्द" और स्वयं "परिभाषा" को बिल्कुल सटीक रूप से काटा गया है। यह प्रक्रिया कठोर थी। शोधकर्ताओं ने डेटा के एक नमूने को लेबल करने के लिए दो स्वतंत्र विशेषज्ञों का उपयोग किया ताकि यह सुनिश्चित हो सके कि वे इस बात पर सहमत हैं कि क्या एक परिभाषा मानी जाए। परिणाम एक उच्च स्तर की सहमति थी, जिसने पुष्टि की कि इन परिभाषाओं की पहचान करने के नियम स्पष्ट और सुसंगत थे। अंतिम उत्पाद, NormDef-FR का संस्करण 1.0.0, 50 अलग-अलग कानूनी कोड के 363 विभिन्न अनुच्छेदों से निकाले गए 693 सत्यापित परिभाषाओं को समाहित करता है। प्रत्येक प्रविष्टि परिभाषित शब्द को उसके अर्थ से जोड़ती है, मेटाडेटा शामिल करती है कि वह कहाँ से आया है, और यह भी नोट करती है कि वह किस प्रकार की परिभाषा है।

इस गोल्ड-स्टैंडर्ड संग्रह के साथ, शोधकर्ताओं ने परीक्षण किया कि कंप्यूटर इससे कितनी अच्छी तरह सीख सकते हैं। उन्होंने तीन अलग-अलग चुनौतियों को स्थापित किया यह देखने के लिए कि मशीनें कहाँ सफल होती हैं और कहाँ वे लड़खड़ाती हैं। पहला कार्य सरल निष्कर्षण था: क्या एक प्रणाली परिभाषा को पहचान सकती है और शब्द तथा अर्थ को बाहर निकाल सकती है? दूसरा कार्य व्यापक था: क्या एक प्रणाली पूरे अनुच्छेद को देख सकती है और निर्णय ले सकती है कि क्या इसमें कोई परिभाषा मौजूद है? तीसरा कार्य सबसे कठिन था: क्या एक प्रणाली द्वारा उत्पन्न उम्मीदवार परिभाषा को एक सिस्टम यह तय कर सकता है कि क्या वह पर्याप्त अच्छी है, या वह एक गलती है जिसे फेंक दिया जाना चाहिए?

परिणामों ने कठिनाई के एक स्पष्ट पदानुक्रम का खुलासा किया। मशीनें दूसरे कार्य में आश्चर्यजनक रूप से अच्छी थीं। जब उन्हें यह पहचानने के लिए कहा गया कि किन अनुच्छेदों में परिभाषाएँ शामिल हैं, तो मॉडलों ने लगभग पूर्ण सटीकता के साथ प्रदर्शन किया, विशेष रूप से जब उन्हें "ट्रू नेगेटिव्स" के एक सेट पर प्रशिक्षित किया गया था—वे अनुच्छेद जिन्हें मैन्युअल रूप से जांचा गया था कि उनमें कोई परिभाषा नहीं है। यह निष्कर्ष महत्वपूर्ण था क्योंकि इसने दिखाया कि यह मान लेने की प्रारंभिक विधि कि कोई भी अनुच्छेद जो परिभाषा सूची में नहीं है वह एक "नेगेटिव" है, त्रुटिपूर्ण थी; उन अनुच्छेदों में वास्तव में छिपी हुई परिभाषाएँ थीं। एक बार जब शोधकर्ताओं ने नेगेटिव उदाहरणों को साफ कर दिया, तो कंप्यूटर आसानी से एक परिभाषा-युक्त अनुच्छेद और एक सामान्य अनुच्छेद के बीच अंतर कर सकते थे।

हालाँकि, तीसरा कार्य वास्तविक बाधा साबित हुआ। जब कंप्यूटरों को विशिष्ट शब्द-परिभाषा युग्मों को मान्य करना था, तो उनका प्रदर्शन काफी गिर गया। जबकि वे आसानी से उस सामान्य क्षेत्र को पहचान सकते थे जहाँ एक परिभाषा हो सकती है, वे यह निर्धारित करने में संघर्ष करते थे कि क्या उनके द्वारा निकाला गया विशिष्ट युग्म कानूनी रूप से वैध है। वे अक्सर आवश्यकताओं की सूची या प्रक्रियात्मक निर्देश को परिभाषा समझ लेते थे। सर्वश्रेष्ठ मॉडल इन कठिन निर्णयों में से लगभग 71 प्रतिशत सही निर्णय लेने में सक्षम थे, जो अनुच्छेद पहचान कार्य में देखे गए लगभग पूर्ण स्कोर से बहुत कम है। यह सुझाव देता है कि जबकि कंप्यूटर सही पड़ोस को ढूंढ सकते हैं, उन्हें सटीक घर को सत्यापित करने के लिए अभी भी मानवीय सहायता की आवश्यकता होती है।

अध्ययन ने इस विशिष्ट संदर्भ में उन्नत कृत्रिम बुद्धिमत्ता की एक आश्चर्यजनक सीमा को भी उजागर किया। शोधकर्ताओं ने सामान्य बातचीत के लिए उपयोग किए जाने वाले एक परिष्कृत भाषा मॉडल का परीक्षण, शब्द पैटर्न पर आधारित एक सरल, अधिक पारंपरिक पद्धति के विरुद्ध किया। कठिन कार्य के लिए उम्मीदवारों को मान्य करने के लिए, जटिल मॉडल ने सरल पद्धति से बेहतर प्रदर्शन नहीं किया। वास्तव में, सरल पद्धति अधिक स्थिर और विश्वसनीय थी। यह इंगित करता है कि अत्यधिक विशिष्ट कानूनी ग्रंथों के लिए, जहाँ नियम कठोर हैं और पैटर्न विशिष्ट हैं, एक सीधा दृष्टिकोण जो स्पष्ट भाषाई मार्करों पर निर्भर करता है, एक जटिल प्रणाली की तुलना में अधिक प्रभावी हो सकता है जो सामान्य अर्थ में पाठ को "समझने" की कोशिश करती है।

NormDef-FR का निर्माण केवल एक डेटासेट नहीं है; यह कानूनी तकनीक के लिए विश्वसनीय संसाधन बनाने का एक प्रदर्शन है। शोधकर्ताओं ने दिखाया कि केवल डेटा की अनुपस्थिति को मान लेना पर्याप्त नहीं है; आपको सक्रिय रूप से यह सत्यापित करना होगा कि वहां क्या नहीं है। नेगेटिव उदाहरणों की मैन्युअल रूप से जांच करके, उन्होंने यह सुनिश्चित किया कि सिस्टम गलत सबक न सीख ले। यह दृष्टिकोण सुनिश्चित करता है कि संसाधन भविष्य के डेवलपर्स के लिए मजबूत और विश्वसनीय है। यह डेटासेट अब सार्वजनिक रूप से उपलब्ध है, जो दस्तावेज़ीकरण और स्क्रिप्ट के साथ आता है जो दूसरों को इस कार्य को दोहराने की अनुमति देता है। यह बेहतर कानूनी अनुसंधान उपकरण बनाने के लिए एक आधार के रूप में कार्य करता है, जिससे परिभाषाओं को खोजने के उबाऊ काम को स्वचालित करने में मदद मिलती है ताकि वकील और सिस्टम कानून की व्याख्या करने पर ध्यान केंद्रित कर सकें, न कि उसके अर्थ की खोज करने पर। हालाँकि यह कार्य समाप्त नहीं हुआ है—भविष्य के संस्करणों को अधिक प्रकार के कानूनों को कवर करने और समय के साथ परिभाषाएँ कैसे बदलती हैं, इसे ट्रैक करने की आवश्यकता होगी—यह फ्रांसीसी कानूनी कोड की जटिल दुनिया में स्पष्टता लाने के लिए एक ठोस शुरुआती बिंदु प्रदान करता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →