← नवीनतम पेपर
💬 NLP

EURO-5K: When Does Domain Pretraining Matter? Benchmarking Transformers for EU Reporting Obligation Extraction

यह शोध पत्र EURO-5K प्रस्तुत करता है, जो यूरोपीय संघ (EU) के रिपोर्टिंग दायित्वों को निकालने के लिए एक विशेष डेटासेट है, और यह प्रदर्शित करता है कि जबकि लीगल प्रीट्रेनिंग (legal pretraining) पूरी तरह से फाइन-ट्यून किए गए मॉडलों के लिए मामूली लाभ प्रदान करती है, यह पैरामीटर-कुशल ट्यूनिंग (parameter-efficient tuning) के प्रदर्शन को महत्वपूर्ण रूप से बढ़ाती है और सीमित डेटा के साथ सीखने की गति को तेज करती है, जो अंततः नियामक अनुपालन स्वचालन (regulatory compliance automation) के लिए डिस्क्रिमिनेटिव (discriminative) और जेनेरेटिव (generative) दोनों दृष्टिकोणों को मान्य करती है।

मूल लेखक: Marios Koniaris, Vasileios Kotronis, Eugenia Giannini, Panayiotis Tsanakas

प्रकाशित 2026-06-03✓ Author reviewed
📖 8 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Marios Koniaris, Vasileios Kotronis, Eugenia Giannini, Panayiotis Tsanakas

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने नहीं लिखा है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि यूरोपीय संघ (EU) एक विशाल पुस्तकालय है जिसमें 180,000 अलग-अलग नियम पुस्तिकाएं (कानून और विनियम) हैं जो एक बहुत ही औपचारिक, जटिल भाषा में लिखी गई हैं। इन किताबों के अंदर, केवल दो नहीं, बल्कि तीन मुख्य प्रकार के निर्देश हैं:

  1. व्यवहार संबंधी नियम (Behavioral Rules): "आपको यह कार्य करना चाहिए" (जैसे, "पानी को सुरक्षित बनाने के लिए उसका उपचार करें")।
  2. प्रकटीकरण नियम (Disclosure Rules): "आपको यह जानकारी सार्वजनिक करनी चाहिए" (जैसे, "अपने कार्बन उत्सर्जन को एक सार्वजनिक वेबसाइट पर प्रकाशित करें")।
  3. रिपोर्टिंग नियम (Reporting Rules): "आपको इस कार्य के बारे में सरकार को एक रिपोर्ट भेजनी चाहिए" (जैसे, "कमीशन को बताएं कि आपने कितना पानी उपचारित किया")।

समस्या यह है कि ये तीनों प्रकार के नियम कागज पर बिल्कुल एक जैसे दिखते हैं। ये सभी "shall" और "must" जैसे शब्दों का उपयोग करते हैं। इन विशिष्ट "रिपोर्टिंग नियमों" को मैन्युअल रूप से खोजना एक पहाड़ के आकार के ढेर में एक विशिष्ट सुई खोजने जैसा है, लेकिन इसमें कठिनाई यह भी है कि "व्यवहार संबंधी" और "प्रकटीकरण" वाली सुइयां लगभग "रिपोर्टिंग" वाली सुइयों जैसी ही दिखती हैं। इसे हाथ से करने में बहुत समय लगता है, बहुत पैसा खर्च होता है, और सरकार को बताने, जनता को बताने या केवल काम करने के बीच अंतर करने के लिए एक वकील को हर एक वाक्य को पढ़ना पड़ता है।

यह शोध पत्र EURO-5K नामक एक प्रोजेक्ट पेश करता है ताकि एक "स्मार्ट रोबोट" बनाया जा सके जो स्वचालित रूप से इन रिपोर्टिंग सुइयों को खोज सके। उन्होंने इसे कैसे किया, यहाँ सरल भाषा में समझाया गया है:

1. प्रशिक्षण डेटा (Training Data): एक कठोर वैज्ञानिक पद्धति

शोधकर्ताओं ने केवल टेक्स्ट के एक बिखरे हुए ढेर को "साफ" नहीं किया; उन्होंने शून्य से एक नया, स्वर्ण-मानक (gold-standard) डेटासेट बनाया।

  • उपमा: कल्पना कीजिए कि आप जासूसों की एक टीम को प्रशिक्षित कर रहे हैं। उन्हें पुराने, भ्रमित करने वाले केस फाइलों का ढेर देने के बजाय, आप एक नया प्रशिक्षण मैनुअल बनाते हैं। आप पाँच सख्त मानदंडों का उपयोग करके यह परिभाषित करते हैं कि एक "रिपोर्टिंग दायित्व" कैसा दिखता है। फिर मनुष्य और AI मिलकर उदाहरणों को लेबल करते हैं, जिसके बाद एक दोहरी-अंध समीक्षा (dual-blind review) (जहाँ दो विशेषज्ञ एक-दूसरे के काम की जाँच करते हैं बिना यह जाने कि किसने क्या किया) की जाती है ताकि यह सुनिश्चित हो सके कि वे सहमत हैं।
  • परिणाम: इस कठोर प्रक्रिया ने 5,253 पूरी तरह से लेबल किए गए उदाहरणों वाला EURO-5K डेटासेट तैयार किया। टीम ने वैज्ञानिक रूप से अपने समझौते को मापा (एक स्कोर जिसे कप्पा 0.613 कहा जाता है), जिससे यह साबित हुआ कि यह केवल एक त्वरित सफाई नहीं थी, बल्कि एक उच्च-गुणवत्ता वाला, स्वतंत्र वैज्ञानिक योगदान था। उन्होंने रोबोट को व्यवहार संबंधी और प्रकटीकरण नियमों से रिपोर्टिंग नियमों को अलग करने के लिए प्रशिक्षित किया, जिसमें "चालाकी भरे" उदाहरणों का उपयोग किया गया ताकि रोबोट आसान कीवर्ड्स के साथ धोखाधड़ी न कर सकें।

2. दावेदार (The Contenders): दो प्रकार के रोबोट

उन्होंने यह देखने के लिए कि रिपोर्टिंग नियमों को खोजने में कौन बेहतर है, दो अलग-अलग प्रकार के AI "मस्तिष्क" का परीक्षण किया:

  • "हाइलाइटर" (Discriminative/BERT): यह रोबोट एक वाक्य पढ़ता है और उन विशिष्ट शब्दों को हाइलाइट करता है जो इसे एक रिपोर्टिंग नियम बनाते हैं। यह एक छात्र की तरह है जो पाठ्यपुस्तक में उत्तर को रेखांकित करता है।
  • "लेखक" (Generative/LLM): यह रोबोट वाक्य पढ़ता है और शून्य से उत्तर लिखता है। यदि इसे कोई रिपोर्टिंग नियम दिखता है, तो यह वाक्य की नकल करता है; यदि नहीं, तो यह "कोई नहीं" कहता है। यह एक छात्र की तरह है जो खाली कागज पर उत्तर लिखता है।

उन्होंने इन रोबोटों का दो तरीकों से परीक्षण किया:

  • पूर्ण प्रशिक्षण (Fine-tuning): रोबोट को नए कानूनी डेटा का उपयोग करके शुरू से सब कुछ सिखाना।
  • कुशल प्रशिक्षण (QLoRA/LoRA): एक "शॉर्टकट" विधि का उपयोग करके रोबोट को प्रशिक्षित करना जो उसके मस्तिष्क के एक बहुत छोटे हिस्से को अपडेट करती है (जैसे पूरी किताब को फिर से लिखने के बजाय एक किताब में एक नया परिशिष्ट जोड़ना)। यह कंप्यूटर की भारी मात्रा में शक्ति बचाता है।

3. बड़े प्रश्न और परिणाम

प्रश्न: क्या हमें एक ऐसे रोबोट की आवश्यकता है जिसे पहले से ही कानूनी किताबों पर प्रशिक्षित किया गया हो, या एक सामान्य रोबोट काम करेगा?

  • निष्कर्ष: आश्चर्यजनक रूप से, सामान्य टेक्स्ट पर प्रशिक्षित एक जेनेरिक रोबोट ने कानूनी टेक्स्ट पर विशेष रूप से प्रशिक्षित रोबोट के लगभग समान प्रदर्शन किया।
  • ट्विस्ट: यह केवल एक भाग्यशाली अनुमान नहीं है। शोधकर्ताओं ने उन्नत सांख्यिकीय परीक्षणों (Welch's t-tests और bootstrap resampling) का उपयोग करके यह साबित किया कि "कानूनी विशेषज्ञ" और "सामान्यज्ञ" के बीच का अंतर सांख्यिकीय रूप से महत्वपूर्ण नहीं (statistically non-significant) है।
  • उपमा: यह यह खोजने जैसा है कि एक सामान्य मैकेनिक एक विशिष्ट प्रकार के कार इंजन को ठीक करने में उतना ही अच्छा है जितना कि एक विशेषज्ञ मैकेनिक, यदि आप उन्हें सही मैनुअल और अभ्यास के लिए पर्याप्त समय देते हैं। "कानूनी प्री-ट्रेनिंग" ने कोई वास्तविक लाभ नहीं दिया; डेटा और प्रशिक्षण पद्धति अधिक मायने रखती है।

प्रश्न: कौन सा रोबोट प्रकार बेहतर है: हाइलाइटर या लेखक?

  • निष्कर्ष: वे अनिवार्य रूप से बराबरी पर हैं। दोनों "हाइलाइटर" और "लेखक" ने समान उच्च स्कोर (एक F1-score लगभग 0.891) प्राप्त किया। नोट: F1-score एक मीट्रिक है जो यह संतुलित करता है कि रोबोट ने कितने नियमों को सही ढंग से पाया बनाम उसने कितने छोड़े, जो कि ट्रिकी डेटा के लिए महत्वपूर्ण है।
  • असली "ट्विस्ट": "शॉर्टकट" प्रशिक्षण (कुशल विधियों) ने पूर्ण प्रशिक्षण को नहीं हराया। वास्तव में, दोनों प्रकार के रोबोटों के लिए, पूर्ण प्रशिक्षण (Full Training) ने कुशल प्रशिक्षण (Efficient Training) को काफी बेहतर प्रदर्शन किया (p<0.01)।
  • प्रतिस्पर्धात्मक बढ़त: हालाँकि, एक दिलचस्प क्रॉसओवर हुआ। "लेखक" (Generative) मॉडल जिसने कुशल शॉर्टकट प्रशिक्षण का उपयोग किया, वह सबसे अच्छे "हाइलाइटर" (Legal-BERT) से थोड़ा आगे निकल गया जिसने पूर्ण प्रशिक्षण का उपयोग किया था। हालांकि यह अंतर छोटा था और सांख्यिकीय रूप से महत्वपूर्ण नहीं था (p=0.082), यह दिखाता है कि एक स्मार्ट, कुशल जेनेरेटिव मॉडल, एक भारी, पूरी तरह से प्रशिक्षित डिस्क्रिमिनेटिव मॉडल के साथ प्रतिस्पर्धा कर सकता है।

प्रश्न: हमें कितने डेटा की आवश्यकता है?

  • निष्कर्ष: रोबोट बहुत तेज़ी से सीखे, लेकिन लगभग 3,000 उदाहरणों के बाद, उनमें बहुत अधिक सुधार होना बंद हो गया।
  • उपमा: यह साइकिल चलाना सीखने जैसा है। आप शुरुआत में बहुत डगमगाते हैं, लेकिन एक बार जब आप इसे पकड़ लेते हैं (लगभग 3,000 मील के अभ्यास के बाद), तो अधिक मील जोड़ने से आप बहुत बेहतर राइडर नहीं बनते हैं। यह साबित करता है कि उनका 5,000 उदाहरणों का डेटासेट "बिल्कुल सही" था—बहुत छोटा नहीं या व्यर्थ रूप से बड़ा नहीं।

प्रश्न: क्या रोबोट वास्तव में कानून को समझते हैं, या वे केवल अनुमान लगा रहे हैं?

  • निष्कर्ष: शोधकर्ताओं ने रोबोट का परीक्षण उन नए कानूनों पर किया जिन्हें उन्होंने पहले कभी नहीं देखा था (वित्तीय कानूनों सहित)।
  • परिणाम: वे उन नियमों को "ना" कहने में बहुत अच्छे थे जो रिपोर्टिंग नियम नहीं थे (जैसे सार्वजनिक सुरक्षा या व्यवहार के नियम)। वे भ्रमित नहीं हुए। वे सामान्य अंदाज़ा लगाने वालों के बजाय विशिष्ट जासूसों की तरह काम कर रहे थे।

4. यह क्यों महत्वपूर्ण है: वास्तविक दुनिया का प्रभाव

यह केवल बेहतर AI के बारे में नहीं है; यह व्यवसायों के लिए अरबों यूरो बचाने और रेड टेप (लालफीताशाही) को कम करने के बारे में है।

  • दांव पर क्या है: शोध पत्र में उद्धृत एक वास्तविक दुनिया का उदाहरण 2025 EU ओम्निबस सरलीकरण पैकेज है। तीन स्थिरता ढांचों (sustainability frameworks) में ओवरलैपिंग रिपोर्टिंग दायित्वों की पहचान करके, यूरोपीय संघ ने लगभग 80% कंपनियों को अनावश्यक रिपोर्टिंग दायरे से बाहर करने में सक्षम बनाया। इससे प्रति वर्ष लगभग 4.4 बिलियन यूरो बचाने का अनुमान है।
  • लक्ष्य: चूंकि यूरोपीय संघ के पास लगभग 180,000 कानूनी अधिनियम हैं, इसलिए मैन्युअल रूप से इन ओवरलैप्स को खोजना असंभव है। यह पेपर पहला ओपन डेटासेट, प्रशिक्षित मॉडल और एक डिप्लॉयमेंट-रेडी टूल प्रदान करता है ताकि इस विश्लेषण को स्वचालित किया जा सके। यह सीधे तौर पर यूरोपीय आयोग के नियामक बोझ को 25% कम करने के लक्ष्य का समर्थन करता है।

5. "जादुई" टूल

टीम केवल अनुसंधान तक ही सीमित नहीं रही। उन्होंने एक सार्वजनिक वेबसाइट बनाई जहाँ कोई भी यूरोपीय संघ के कानून का एक हिस्सा पेस्ट कर सकता है, और रोबोट:

  1. रिपोर्टिंग नियमों को खोजेगा।
  2. आपको दिखाएगा कि उसने उन्हें क्यों पाया (विशिष्ट शब्दों जैसे "notify" या "Commission" को हाइलाइट करके)।
  3. परिणामों को एक संरचित प्रारूप में निर्यात करेगा जिसका उपयोग कंप्यूटर डेटाबेस बनाने के लिए कर सकते हैं।

सारांश

शोध पत्र निष्कर्ष निकालता है कि इस समस्या को हल करने के लिए हमें महंगे, विशेष कानूनी AI की आवश्यकता नहीं है। एक मानक, अच्छी तरह से प्रशिक्षित AI, स्मार्ट और कठोर प्रशिक्षण विधियों का उपयोग करके, काम को उतनी ही अच्छी तरह से कर सकता है। उन्होंने साबित कर दिया है कि हम यूरोपीय कानूनों में "किसे क्या रिपोर्ट करना है" खोजने के उबाऊ कार्य को स्वचालित कर सकते हैं, जिससे समय और पैसा बचता है। डेटा, मॉडल और उपकरण प्रदान करके, उन्होंने नीति निर्माताओं और व्यवसायों को नियामक जटिलता से निपटने की शक्ति दी है, जो सीधे तौर पर बोझ कम करने और विकास को बढ़ावा देने के यूरोपीय संघ के मिशन का समर्थन करती है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →