← नवीनतम पेपर
💬 NLP

HUKUKBERT: Domain-Specific Language Model for Turkish Law

यह शोध पत्र हुकुकबर्ट (HukukBERT) को प्रस्तुत करता है, जो एक हाइब्रिड मास्किंग रणनीति का उपयोग करके 18 GB डोमेन-विशिष्ट कॉर्पस पर प्रशिक्षित एक अत्याधुनिक तुर्की कानूनी भाषा मॉडल है, जो कानूनी शब्दावली भविष्यवाणी और अदालती निर्णय विभाजन कार्यों में मौजूदा मॉडलों से काफी बेहतर प्रदर्शन करता है।

मूल लेखक: Mehmet Utku Öztürk, Tansu Türkoğlu, Buse Buz-Yalug

प्रकाशित 2026-04-07
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Mehmet Utku Öztürk, Tansu Türkoğlu, Buse Buz-Yalug

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक प्रतिभाशाली, सुशिक्षित छात्र को तुर्की में वकील बनने के लिए प्रशिक्षित करने की कोशिश कर रहे हैं। आपके पास दो विकल्प हैं:

  1. सामान्यज्ञ (The Generalist): आप उन्हें रोजमर्रा की जिंदगी, समाचार, विकिपीडिया और सामान्य बातचीत के बारे में 84 अरब किताबों का एक पुस्तकालय देते हैं। वे दुनिया के बारे में सामान्य रूप से अविश्वसनीय रूप से बुद्धिमान बन जाते हैं।
  2. विशेषज्ञ (The Specialist): आप उन्हें एक छोटा, लेकिन अत्यधिक क्यूरेटेड (curated) 21 बिलियन शब्दों का पुस्तकालय देते हैं, लेकिन इसमें मौजूद हर एक किताब सख्ती से तुर्की कानून, अदालती फैसलों और कानूनी संहिताओं (codes) के बारे में है।

यह पेपर HukukBERT को पेश करता है, जो कि वह विशेषज्ञ है। लेखक तर्क देते हैं कि तुर्की कानून की जटिल और पेचीदा दुनिया के लिए, 'सामान्यज्ञ' पर्याप्त नहीं है, चाहे उसने कितनी भी किताबें क्यों न पढ़ ली हों।

यहाँ इस कहानी का सरल विवरण दिया गया है कि उन्होंने HukukBERT को कैसे बनाया:

1. समस्या: "अनुवाद" की आपदा

तुर्की एक बहुत ही "चिपचिपी" (sticky) भाषा है (भाषाविज्ञानी इसे agglutinative कहते हैं)। आप एक लंबा शब्द बनाने के लिए कई छोटे टुकड़ों को आपस में जोड़ सकते हैं।

  • सामान्य मॉडल्स की गलती: कल्पना कीजिए कि एक सामान्य AI एक कानूनी दस्तावेज़ को पढ़ने की कोशिश कर रहा है। वह "Decision on the Unification of Judgments" जैसे जटिल कानूनी वाक्यांश को देखता है और उसे "Decision," "on," "the," "Unif," "ication," "of," "Judg," "ments" जैसे छोटे, अर्थहीन टुकड़ों में तोड़ने की कोशिश करता है।
  • परिणाम: AI अर्थ खो देता है। यह एक रेसिपी को समझने की कोशिश करने जैसा है जहाँ आप केवल "fl," "ou," और "r" अक्षरों को अलग-अलग पढ़ रहे हैं बजाय इसके कि आप पूरे शब्द "flour" को समझें।
  • "सिमेंटिक शिफ्ट" (Semantic Shift) का जाल: कानून में, सामान्य शब्दों का अर्थ पूरी तरह से अलग होता है। रोजमर्रा की जिंदगी में, "estate" का अर्थ एक बड़ा घर हो सकता है। लेकिन तुर्की कानून में, एक विशिष्ट शब्द (tereke) का अर्थ "मृतक की कुल संपत्ति" होता है। सामान्य AI मॉडल सामान्य अर्थ ("घर" या "विरासत") का अनुमान लगाते हैं और कानूनी उत्तर गलत दे देते हैं।

2. समाधान: एक कस्टम टूलकिट बनाना

लेखकों ने केवल मौजूदा मॉडल में अधिक डेटा नहीं डाला। उन्होंने शुरुआत से एक कस्टम टूलकिट बनाया:

  • "साफ" पुस्तकालय (डेटा): उन्होंने 27 GB कच्चा कानूनी टेक्स्ट (अदालती निर्णय, कानून, शैक्षणिक शोध पत्र) एकत्र किया। लेकिन कानूनी टेक्स्ट दोहराव वाले "बॉयलरप्लेट" (जैसे "यह आवश्यक माना जाता है..." जैसे मानक वाक्यांश) से भरा होता है। उन्होंने डुप्लिकेट को हटाने के लिए एक स्मार्ट फ़िल्टर का उपयोग किया और पुस्तकालय को संतुलित किया ताकि AI केवल अदालती फैसलों को रटे नहीं बल्कि कानूनों और शैक्षणिक सिद्धांतों से भी सीखे।
  • कस्टम डिक्शनरी (Tokenizer): यह सबसे महत्वपूर्ण हिस्सा है। उन्होंने कानून के लिए विशेष रूप से डिज़ाइन किया गया 48,000 शब्दों का एक नया शब्दकोश बनाया।
    • उपमा: "Unification" को "Uni-fic-ation" में तोड़ने वाले शब्दकोश के बजाय, उनका शब्दकोश पूरे कानूनी विचार को एक एकल ब्लॉक के रूप में मानता है। यह AI को तुर्की शब्दों के "चिपचिपे" हिस्सों से भ्रमित होने से रोकता है।
  • "हार्ड मोड" ट्रेनिंग (Masking): ट्रेनिंग के दौरान, उन्होंने केवल यादृच्छिक (random) शब्द नहीं छिपाए। उन्होंने एक विशेष रणनीति का उपयोग किया जहाँ उन्होंने पूरे कानूनी विचारों या प्रमुख कानूनी शब्दों को छिपा दिया।
    • उपमा: एक छात्र से, "वाक्य में [खाली स्थान] क्या है?" (जहाँ वे व्याकरण संबंधी शब्द का अनुमान लगा सकते हैं) पूछने के बजाय, उन्होंने पूछा, "एक विरासत के मामले में, मृतक की कुल संपत्ति के लिए विशिष्ट कानूनी शब्द क्या है?" इसने AI को केवल व्याकरण नहीं, बल्कि कानून के तर्क को सीखने के लिए मजबूर किया।

3. परिणाम: विशेषज्ञ की जीत

उन्होंने "सामान्यज्ञों" (जैसे TabiBERT, जिसने 84 बिलियन टोकन के सामान्य टेक्स्ट को पढ़ा) और "पुराने विशेषज्ञों" (पुराने तुर्की कानूनी मॉडल्स) के मुकाबले HukukBERT का परीक्षण किया।

  • कानूनी क्लोज़ टेस्ट (Legal Cloze Test): उन्होंने 750 कठिन कानूनी प्रश्नों की एक क्विज़ बनाई।
    • सामान्य मॉडल्स: लगभग 60-70% सही उत्तर दे पाए। वे कानूनी शब्दों के बजाय सामान्य शब्दों का अनुमान लगाते रहे।
    • HukukBERT: 84.4% सही उत्तर दे पाया। वह जानता था कि कब सामान्य शब्द के बजाय सटीक कानूनी शब्द का उपयोग करना है।
  • वास्तविक दुनिया का परीक्षण (Document Segmentation): उन्होंने AI को एक अव्यवस्थित, 50 पन्नों के अदालती निर्णय को स्वचालित रूप से विभिन्न खंडों (हेडर, दावा, बचाव, निर्णय, आदि) में काटने के लिए कहा।
    • HukukBERT: 92.8% बार सफलतापूर्वक दस्तावेज़ को सही ढंग से विभाजित कर सका।
    • अन्य: अक्सर विफल रहे, लंबे और जटिल वाक्यों में खो गए।

4. यह क्यों महत्वपूर्ण है

तुर्की कानून को एक बहुत ही घने, पुराने जंगल के रूप में सोचें।

  • सामान्य AI पूरे देश के अच्छे मानचित्र वाले एक हाइकर (hiker) की तरह है लेकिन इस विशिष्ट जंगल के लिए उसके पास दिशा-सूचक यंत्र (compass) नहीं है। वे झाड़ियों में खो जाते हैं।
  • HukukBERT उस गाइड की तरह है जिसने इस विशिष्ट जंगल में हजारों बार चक्कर लगाया है। वह जानता है कि छिपे हुए रास्ते कहाँ हैं और हर अजीब पौधे को क्या कहा जाता है।

मुख्य निष्कर्ष (The Bottom Line)

लेखकों ने HukukBERT, इसकी कस्टम डिक्शनरी और अपनी क्विज़ को सार्वजनिक रूप से जारी किया है। वे कह रहे हैं: "यदि आप तुर्की के लिए लीगल AI बनाना चाहते हैं, तो केवल एक जेनेरिक मॉडल पर अधिक सामान्य डेटा मत डालिए। आपको एक ऐसे मॉडल की आवश्यकता है जो तुर्की कानून की विशिष्ट, चिपचिपी और सटीक भाषा बोलता हो।"

यह तुर्की में "लीगलटेक" (LegalTech) के लिए एक बड़ा कदम है, जिससे ऐसे उपकरण बनाना संभव हो जाता है जो मानवीय त्रुटि के बिना अदालती फैसलों को समझ सकते हैं, परिणामों की भविष्यवाणी कर सकते हैं और कानूनी दस्तावेजों को व्यवस्थित कर सकते हैं।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →