← नवीनतम पेपर
💬 NLP

LEMUR: A Corpus for Robust Fine-Tuning of Multilingual Law Embedding Models for Retrieval

यह शोध पत्र LEMUR को प्रस्तुत करता है, जो यूरोपीय संघ के पर्यावरणीय कानून का एक बड़े पैमाने का बहुभाषी संग्रह है, और यह प्रदर्शित करता है कि इस उच्च-सटीकता वाले डेटा पर बहुभाषी एम्बेडिंग मॉडल को फाइन-ट्यून करने से कानूनी सूचना पुनर्प्राप्ति की सटीकता में महत्वपूर्ण सुधार होता है, विशेष रूप से कम-संसाधन और क्रॉस-लिंगुअल परिदृश्यों के लिए।

मूल लेखक: Narges Baba Ahmadi, Jan Strich, Martin Semmann, Chris Biemann

प्रकाशित 2026-02-11
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Narges Baba Ahmadi, Jan Strich, Martin Semmann, Chris Biemann

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

समस्या: "अनुवाद में खोई हुई" कानूनी लाइब्रेरी

कल्पना कीजिए कि आप लाखों कानून की किताबों से भरी एक विशाल, प्राचीन लाइब्रेरी में हैं। ये किताबें केवल साधारण टेक्स्ट में नहीं लिखी गई हैं; ये अक्सर जटिल तालिकाओं (tables), छोटे फुटनोट्स और अजीब लेआउट वाली पुरानी, धूल भरी PDF फाइलें हैं। इतना ही नहीं, यह लाइब्रेरी अंतरराष्ट्रीय है—किताबें 25 अलग-अलग भाषाओं में लिखी गई हैं।

अब, कल्पना कीजिए कि आपको पर्यावरण संरक्षण के बारे में एक विशिष्ट नियम ढूँढना है। आप एक रोबोट लाइब्रेरियन (AI) से इसे खोजने के लिए कहते हैं। लेकिन यहाँ दो बड़ी समस्याएँ हैं:

  1. रोबोट एक सामान्यज्ञ (Generalist) है: रोबोट को विकिपीडिया और समाचार लेख पढ़ने के लिए प्रशिक्षित किया गया था, न कि जटिल कानूनी शब्दावली के लिए। वह एक कानूनी शब्द देखता है और सोचता है कि इसका अर्थ कुछ सामान्य है, जैसे कि एक डॉक्टर किसी चिकित्सा शब्द को एक अनौपचारिक शब्द समझ लेने की गलती कर सकता है।
  2. "धुंधली दृष्टि" की समस्या: जब रोबोट उन पुरानी PDF किताबों को पढ़ने की कोशिश करता है, तो टेक्स्ट गड़बड़ होकर आता है। यह एक धुंधली खिड़की के माध्यम से दस्तावेज़ पढ़ने जैसा है।

इस कारण से, रोबोट अक्सर "भ्रम" (hallucinate) का शिकार हो जाता है—वह आत्मविश्वास के साथ आपको गलत उत्तर देता है या आपको ऐसी किताब की ओर संकेत करता है जिसका आपके प्रश्न से कोई लेना-देना नहीं है।


समाधान: प्रोजेक्ट LEMUR

शोधकर्ताओं ने इस समस्या को ठीक करने के लिए LEMUR बनाया। LEMUR को AI लाइब्रेरियन के लिए एक "लीगल बूटकैंप" (कानूनी प्रशिक्षण शिविर) के रूप में समझें। उन्होंने इसे इस प्रकार किया:

1. परम पाठ्यपुस्तक बनाना (द कॉर्पस)

AI को इंटरनेट के बिखरे हुए कचरे से सीखने देने के बजाय, शोधकर्ताओं ने सीधे स्रोत से जानकारी ली: आधिकारिक यूरोपीय संघ (EU) के पर्यावरणीय कानून। उन्होंने 25 अलग-अलग भाषाओं में लगभग 25,000 आधिकारिक दस्तावेज़ एकत्र किए। यह छात्र को रैंडम मैगजीन के ढेर के बजाय एक पूरी तरह से क्यूरेटेड (चुनिकीकृत) पाठ्यपुस्तकों का सेट देने जैसा है।

2. चश्मा साफ करना (LCS स्कोर)

"धुंधली दृष्टि" की समस्या को ठीक करने के लिए, उन्होंने लेक्सिकल कंटेंट स्कोर (LCS) नामक एक टूल बनाया। इसे एक गुणवत्ता-नियंत्रण निरीक्षक (quality-control inspector) के रूप में समझें। हर बार जब उन्होंने एक PDF को डिजिटल टेक्स्ट में बदला, तो निरीक्षक ने मूल दस्तावेज़ के साथ उसकी तुलना की ताकि यह सुनिश्चित हो सके कि कोई शब्द खोया या बिगड़ा नहीं है। उन्होंने यह सुनिश्चित करने के लिए कि AI "बड़बड़" (gibberish) न पढ़ रहा हो, एक उच्च-तकनीकी टूल (olmOCR) का उपयोग किया कि जटिल तालिकाएँ भी व्यवस्थित रहें।

3. विशेष प्रशिक्षण (फाइन-ट्यूनिंग)

शोधकर्ताओं ने तीन "स्मार्ट" AI मॉडल्स को गहन कानूनी प्रशिक्षण के लिए लिया।

  • एकभाषी ड्रिल (The Monolingual Drill): उन्होंने उन्हें एक समय में एक भाषा का विशेषज्ञ बनने के लिए सिखाया (जैसे एक अनुवादक को केवल फ्रांसीसी कानून का मास्टर बनने के लिए प्रशिक्षित करना)।
  • द्विभाषी बडी सिस्टम (The Bilingual Buddy System): उन्होंने उन्हें एक साथ दो भाषाएँ (जैसे अंग्रेजी और लातवियाई) सिखाने की कोशिश की, यह देखने के लिए कि क्या एक को जानने से दूसरे को समझने में मदद मिलती है।

परिणाम: एक स्मार्ट लाइब्रेरियन

परिणाम प्रभावशाली थे! यहाँ बताया गया है कि उन्होंने क्या पाया:

  • "विशेषज्ञ" का उछाल: एक बार जब AI "लीगल बूटकैंप" से गुजर गया, तो वह सही दस्तावेज़ खोजने में बहुत बेहतर हो गया। भले ही आपने उसे केवल एक छोटा सा संकेत (जैसे एक छोटा शीर्षक) दिया हो, वह उस विशाल, जटिल कानून को खोज सकता था जिससे वह संबंधित था।
  • "भाषा का सेतु" (The Language Bridge): यह सबसे शानदार हिस्सा था। उन्होंने पाया कि यदि आप AI को अंग्रेजी में कानून समझना सिखाते हैं, तो यह वास्तव में अन्य भाषाओं में कानून समझने में बेहतर हो जाता है, भले ही उसने उन विशिष्ट भाषाओं का गहराई से अध्ययन न किया हो।
    • उपमा: यह एक संगीतकार को अंग्रेजी में संगीत पढ़ने के तरीके सिखाने जैसा है। एक बार जब वे समझ जाते हैं कि संगीत का तर्क (logic) कैसे काम करता है, तो वे इतालवी या जर्मन में लिखे गए संगीत के टुकड़े को बहुत तेज़ी से पकड़ सकते हैं। AI ने कानून के "तर्क" को सीखा, जिसने इसे भाषा की बाधाओं को पार करने में मदद की।
  • अल्पसंख्यक भाषाओं की मदद करना: AI का सुधार "लो-रिसोर्स" भाषाओं (वे भाषाएँ जिनके पास इंटरनेट पर बहुत अधिक डेटा नहीं है) के लिए सबसे नाटकीय था। इस प्रशिक्षण ने इन भाषाओं को एक बड़ा बढ़ावा दिया, जिससे वे अंग्रेजी या जर्मन जैसी प्रमुख भाषाओं के स्तर तक पहुँच गईं।

सारांश

संक्षेप में, शोधकर्ताओं ने एक उच्च-गुणवत्ता वाली, बहुभाषी "कानूनी लाइब्रेरी" बनाई और इसका उपयोग सामान्य-उद्देश्य वाले AI को विशिष्ट कानूनी विशेषज्ञों में बदलने के लिए किया। यह इस बात की संभावना को बहुत अधिक बढ़ाता है कि जब कोई वकील या नागरिक प्रश्न पूछेगा, तो AI उसे सटीक कानून ढूँडेगा, न कि केवल अनुमान लगाएगा।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →