HUKUKBERT: Domain-Specific Language Model for Turkish Law
यह शोध पत्र हुकुकबर्ट (HukukBERT) को प्रस्तुत करता है, जो एक हाइब्रिड मास्किंग रणनीति का उपयोग करके 18 GB डोमेन-विशिष्ट कॉर्पस पर प्रशिक्षित एक अत्याधुनिक तुर्की कानूनी भाषा मॉडल है, जो कानूनी शब्दावली भविष्यवाणी और अदालती निर्णय विभाजन कार्यों में मौजूदा मॉडलों से काफी बेहतर प्रदर्शन करता है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आप एक प्रतिभाशाली, सुशिक्षित छात्र को तुर्की में वकील बनने के लिए प्रशिक्षित करने की कोशिश कर रहे हैं। आपके पास दो विकल्प हैं:
- सामान्यज्ञ (The Generalist): आप उन्हें रोजमर्रा की जिंदगी, समाचार, विकिपीडिया और सामान्य बातचीत के बारे में 84 अरब किताबों का एक पुस्तकालय देते हैं। वे दुनिया के बारे में सामान्य रूप से अविश्वसनीय रूप से बुद्धिमान बन जाते हैं।
- विशेषज्ञ (The Specialist): आप उन्हें एक छोटा, लेकिन अत्यधिक क्यूरेटेड (curated) 21 बिलियन शब्दों का पुस्तकालय देते हैं, लेकिन इसमें मौजूद हर एक किताब सख्ती से तुर्की कानून, अदालती फैसलों और कानूनी संहिताओं (codes) के बारे में है।
यह पेपर HukukBERT को पेश करता है, जो कि वह विशेषज्ञ है। लेखक तर्क देते हैं कि तुर्की कानून की जटिल और पेचीदा दुनिया के लिए, 'सामान्यज्ञ' पर्याप्त नहीं है, चाहे उसने कितनी भी किताबें क्यों न पढ़ ली हों।
यहाँ इस कहानी का सरल विवरण दिया गया है कि उन्होंने HukukBERT को कैसे बनाया:
1. समस्या: "अनुवाद" की आपदा
तुर्की एक बहुत ही "चिपचिपी" (sticky) भाषा है (भाषाविज्ञानी इसे agglutinative कहते हैं)। आप एक लंबा शब्द बनाने के लिए कई छोटे टुकड़ों को आपस में जोड़ सकते हैं।
- सामान्य मॉडल्स की गलती: कल्पना कीजिए कि एक सामान्य AI एक कानूनी दस्तावेज़ को पढ़ने की कोशिश कर रहा है। वह "Decision on the Unification of Judgments" जैसे जटिल कानूनी वाक्यांश को देखता है और उसे "Decision," "on," "the," "Unif," "ication," "of," "Judg," "ments" जैसे छोटे, अर्थहीन टुकड़ों में तोड़ने की कोशिश करता है।
- परिणाम: AI अर्थ खो देता है। यह एक रेसिपी को समझने की कोशिश करने जैसा है जहाँ आप केवल "fl," "ou," और "r" अक्षरों को अलग-अलग पढ़ रहे हैं बजाय इसके कि आप पूरे शब्द "flour" को समझें।
- "सिमेंटिक शिफ्ट" (Semantic Shift) का जाल: कानून में, सामान्य शब्दों का अर्थ पूरी तरह से अलग होता है। रोजमर्रा की जिंदगी में, "estate" का अर्थ एक बड़ा घर हो सकता है। लेकिन तुर्की कानून में, एक विशिष्ट शब्द (tereke) का अर्थ "मृतक की कुल संपत्ति" होता है। सामान्य AI मॉडल सामान्य अर्थ ("घर" या "विरासत") का अनुमान लगाते हैं और कानूनी उत्तर गलत दे देते हैं।
2. समाधान: एक कस्टम टूलकिट बनाना
लेखकों ने केवल मौजूदा मॉडल में अधिक डेटा नहीं डाला। उन्होंने शुरुआत से एक कस्टम टूलकिट बनाया:
- "साफ" पुस्तकालय (डेटा): उन्होंने 27 GB कच्चा कानूनी टेक्स्ट (अदालती निर्णय, कानून, शैक्षणिक शोध पत्र) एकत्र किया। लेकिन कानूनी टेक्स्ट दोहराव वाले "बॉयलरप्लेट" (जैसे "यह आवश्यक माना जाता है..." जैसे मानक वाक्यांश) से भरा होता है। उन्होंने डुप्लिकेट को हटाने के लिए एक स्मार्ट फ़िल्टर का उपयोग किया और पुस्तकालय को संतुलित किया ताकि AI केवल अदालती फैसलों को रटे नहीं बल्कि कानूनों और शैक्षणिक सिद्धांतों से भी सीखे।
- कस्टम डिक्शनरी (Tokenizer): यह सबसे महत्वपूर्ण हिस्सा है। उन्होंने कानून के लिए विशेष रूप से डिज़ाइन किया गया 48,000 शब्दों का एक नया शब्दकोश बनाया।
- उपमा: "Unification" को "Uni-fic-ation" में तोड़ने वाले शब्दकोश के बजाय, उनका शब्दकोश पूरे कानूनी विचार को एक एकल ब्लॉक के रूप में मानता है। यह AI को तुर्की शब्दों के "चिपचिपे" हिस्सों से भ्रमित होने से रोकता है।
- "हार्ड मोड" ट्रेनिंग (Masking): ट्रेनिंग के दौरान, उन्होंने केवल यादृच्छिक (random) शब्द नहीं छिपाए। उन्होंने एक विशेष रणनीति का उपयोग किया जहाँ उन्होंने पूरे कानूनी विचारों या प्रमुख कानूनी शब्दों को छिपा दिया।
- उपमा: एक छात्र से, "वाक्य में [खाली स्थान] क्या है?" (जहाँ वे व्याकरण संबंधी शब्द का अनुमान लगा सकते हैं) पूछने के बजाय, उन्होंने पूछा, "एक विरासत के मामले में, मृतक की कुल संपत्ति के लिए विशिष्ट कानूनी शब्द क्या है?" इसने AI को केवल व्याकरण नहीं, बल्कि कानून के तर्क को सीखने के लिए मजबूर किया।
3. परिणाम: विशेषज्ञ की जीत
उन्होंने "सामान्यज्ञों" (जैसे TabiBERT, जिसने 84 बिलियन टोकन के सामान्य टेक्स्ट को पढ़ा) और "पुराने विशेषज्ञों" (पुराने तुर्की कानूनी मॉडल्स) के मुकाबले HukukBERT का परीक्षण किया।
- कानूनी क्लोज़ टेस्ट (Legal Cloze Test): उन्होंने 750 कठिन कानूनी प्रश्नों की एक क्विज़ बनाई।
- सामान्य मॉडल्स: लगभग 60-70% सही उत्तर दे पाए। वे कानूनी शब्दों के बजाय सामान्य शब्दों का अनुमान लगाते रहे।
- HukukBERT: 84.4% सही उत्तर दे पाया। वह जानता था कि कब सामान्य शब्द के बजाय सटीक कानूनी शब्द का उपयोग करना है।
- वास्तविक दुनिया का परीक्षण (Document Segmentation): उन्होंने AI को एक अव्यवस्थित, 50 पन्नों के अदालती निर्णय को स्वचालित रूप से विभिन्न खंडों (हेडर, दावा, बचाव, निर्णय, आदि) में काटने के लिए कहा।
- HukukBERT: 92.8% बार सफलतापूर्वक दस्तावेज़ को सही ढंग से विभाजित कर सका।
- अन्य: अक्सर विफल रहे, लंबे और जटिल वाक्यों में खो गए।
4. यह क्यों महत्वपूर्ण है
तुर्की कानून को एक बहुत ही घने, पुराने जंगल के रूप में सोचें।
- सामान्य AI पूरे देश के अच्छे मानचित्र वाले एक हाइकर (hiker) की तरह है लेकिन इस विशिष्ट जंगल के लिए उसके पास दिशा-सूचक यंत्र (compass) नहीं है। वे झाड़ियों में खो जाते हैं।
- HukukBERT उस गाइड की तरह है जिसने इस विशिष्ट जंगल में हजारों बार चक्कर लगाया है। वह जानता है कि छिपे हुए रास्ते कहाँ हैं और हर अजीब पौधे को क्या कहा जाता है।
मुख्य निष्कर्ष (The Bottom Line)
लेखकों ने HukukBERT, इसकी कस्टम डिक्शनरी और अपनी क्विज़ को सार्वजनिक रूप से जारी किया है। वे कह रहे हैं: "यदि आप तुर्की के लिए लीगल AI बनाना चाहते हैं, तो केवल एक जेनेरिक मॉडल पर अधिक सामान्य डेटा मत डालिए। आपको एक ऐसे मॉडल की आवश्यकता है जो तुर्की कानून की विशिष्ट, चिपचिपी और सटीक भाषा बोलता हो।"
यह तुर्की में "लीगलटेक" (LegalTech) के लिए एक बड़ा कदम है, जिससे ऐसे उपकरण बनाना संभव हो जाता है जो मानवीय त्रुटि के बिना अदालती फैसलों को समझ सकते हैं, परिणामों की भविष्यवाणी कर सकते हैं और कानूनी दस्तावेजों को व्यवस्थित कर सकते हैं।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।