← नवीनतम पेपर
💻 computer science

Can LLMs Judge Legal Accuracy? Reliability of LLM Evaluators for High-Stakes Insurance QA in a Low-Resource Language

यह शोध पत्र यह प्रदर्शित करता है कि जबकि क्यूबेक फ्रेंच जैसी कम-संसाधन वाली भाषाओं में कानूनी सटीकता का मूल्यांकन करने के लिए LLMs का उपयोग किया जा सकता है, मानवीय देखरेख के बिना उच्च-जोखिम वाले परिनियोजन के लिए उनकी विश्वसनीयता अपर्याप्त है, क्योंकि सबसे मजबूत मॉडल भी मध्यम सहमति प्रदर्शित करते हैं, खतरनाक त्रुटियों को पकड़ने में लगातार विफल रहते हैं, और चरण-दर-चरण तर्क एवं एन्सेम्बल विधियों से महत्वपूर्ण रूप से लाभान्वित होते हैं।

मूल लेखक: David Beauchemin, Richard Khoury

प्रकाशित 2026-09-07
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: David Beauchemin, Richard Khoury

मूल पेपर CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

आर्टिफिशियल इंटेलिजेंस की दुनिया में, एक पुरानी समस्या को हल करने के लिए एक नया उपकरण उभरा है: हमें कैसे पता चलेगा कि कंप्यूटर सच बोल रहा है या नहीं? वर्षों से, डेवलपर्स इन स्मार्ट मशीनों द्वारा उत्पन्न उत्तरों को पढ़ने और ग्रेड देने के लिए मानव विशेषज्ञों पर भरोसा करते रहे हैं, लेकिन यह प्रक्रिया धीमी, महंगी और दोहराने में कठिन है। इसे तेज करने के लिए, शोधकर्ताओं ने अन्य मॉडलों के काम को ग्रेड देने के लिए स्वयं सबसे स्मार्ट आर्टिफिशियल इंटेलिजेंस मॉडलों का उपयोग करना शुरू कर दिया। इस दृष्टिकोण को, जिसे अक्सर "एआई जजिंग" कहा जाता है, लोकप्रिय बनाया गया क्योंकि यह तेज़ और सुसंगत है। हालाँकि, इन डिजिटल जजों के बारे में हम जो कुछ भी जानते हैं, वह अंग्रेजी में सामान्य विषयों जैसे कहानियाँ लिखने या सामान्य ज्ञान के प्रश्नों के उत्तर देने पर किए गए परीक्षणों से आता है। हम अभी तक यह नहीं जानते कि क्या इन जजों पर तब भरोसा किया जा सकता है जब दांव ऊंचे हों, विषय जटिल कानून हो, और भाषा एक विशिष्ट क्षेत्रीय बोली हो।

कनाडा के यूनिवर्सिटे लावल (Université Laval) के शोधकर्ताओं की एक टीम ने यह तय किया कि वे इन डिजिटल जजों का परीक्षण सबसे चुनौतीपूर्ण वातावरण में करें जिसकी वे कल्पना कर सकते हैं। उन्होंने क्यूबेक प्रांत में ऑटोमोबाइल बीमा पर ध्यान केंद्रित किया, जो एक ऐसी जगह है जहाँ नियम फ्रेंच के एक अनूठे रूप में लिखे गए हैं और एक विशिष्ट कानूनी प्रणाली द्वारा शासित होते हैं जो शेष कनाडा और यूरोप से भिन्न है। इस प्रणाली में, कार दुर्घटनाओं से होने वाली शारीरिक चोट को एक सार्वजनिक, 'नो-फॉल्ट' योजना द्वारा संभाला जाता है, जबकि संपत्ति के नुकसान को निजी बीमा कंपनियों द्वारा संभाला जाता है। इन नियमों को समझाने में एक एकल गलती भी नागरिक को उनके अधिकारों के बारे में गुमराह कर सकती है या किसी कंपनी को कानूनी रूप से असुरक्षित छोड़ सकती है। शोधकर्ताओं ने बीमा पेशेवरों को प्रमाणित करने के लिए उपयोग किए जाने वाले 807 वास्तविक परीक्षा प्रश्नों को, सही उत्तरों और विशेषज्ञ स्पष्टीकरणों के साथ एकत्र किया। फिर उन्होंने 52 अलग-अलग आर्टिफिशियल इंटेलिजेंस मॉडलों को जज के रूप में कार्य करने के लिए कहा, यह जाँचने के लिए कि इन प्रश्नों के विभिन्न उत्तर सही हैं या गलत।

परिणाम निराशाजनक थे। यहाँ तक कि सबसे शक्तिशाली और उन्नत आर्टिफिशियल इंटेलिजेंस मॉडल, जिन्हें दुनिया के सर्वश्रेष्ठ माना जाता है, अकेले इन कानूनी उत्तरों का निर्णय करने के लिए भरोसेमंद नहीं थे। सबसे अच्छा प्रदर्शन करने वाला मॉडल केवल मध्यम रूप से विश्वसनीय था, जिसका अर्थ है कि वे इतनी बार गलतियाँ करते थे कि कोई मनुष्य उन पर आँख मूंदकर भरोसा नहीं करना चाहेगा। इससे भी महत्वपूर्ण बात यह है कि शोधकर्ताओं ने पाया कि एक मॉडल की समग्र बुद्धिमत्ता इस बात का पूर्वानुमान नहीं लगा सकती थी कि उसका उपयोग करना कितना सुरक्षित है। कुछ बहुत ही स्मार्ट मॉडल आश्चर्यजनक रूप से लापरवाह थे, जो गलत उत्तरों को इस तरह से सही मान लेते थे जैसे कि वे सही हों। अन्य अत्यधिक सतर्क थे, जो सुरक्षित रहने के लिए सही उत्तरों को भी खारिज कर देते थे। उनकी सामान्य प्रतिष्ठा के आधार पर एक "अच्छा" जज चुनने का कोई सरल तरीका नहीं था; एक मॉडल जो समग्र गुणवत्ता पर उच्च स्कोर करता था, वह फिर भी खतरनाक हो सकता था क्योंकि वह विशिष्ट, महंगी गलतियों को पकड़ने में विफल रहा।

अध्ययन ने यह भी खुलासा किया कि ये डिजिटल जज इस बात पर अलग व्यवहार करते हैं कि उत्तर कौन लिख रहा है। कई अन्य अध्ययनों में, आर्टिफिशियल इंटेलिजेंस मॉडल अन्य मशीनों द्वारा लिखे गए उत्तरों के प्रति अधिक दयालु होते हैं, और अक्सर उन्हें मानव-लिखित पाठ की तुलना में उच्च अंक देते हैं। लेकिन इस सख्त कानूनी सेटिंग में, इसके विपरीत हुआ। जज आर्टिफिशियल इंटेलिजेंस द्वारा लिखे गए उत्तरों पर मानव-लिखित उत्तरों की तुलना में वास्तव में अधिक कठोर थे। वे मशीन-जनित उत्तर को सही मानने की कम संभावना रखते थे, भले ही मानव-लिखित विकल्प स्पष्ट रूप से गलत हों। यह सुझाव देता है कि इन मॉडलों का पूर्वाग्रह स्थिर नहीं है; यह कार्य और दिए गए निर्देशों के आधार पर बदल जाता है। जब कानून के बारे में सटीक होने के लिए कहा गया, तो मॉडल अधिक उदार होने के बजाय अधिक सख्त हो गए।

आगे बढ़ने का रास्ता खोजने के लिए, शोधकर्ताओं ने इस निर्णय प्रक्रिया को सुरक्षित बनाने के लिए विभिन्न रणनीतियों का परीक्षण किया। उन्होंने पाया कि जजों को तुलना करने के लिए एक संदर्भ पाठ (reference text) देने से मदद मिली, लेकिन केवल कमजोर मॉडलों के लिए। सबसे प्रभावी समाधान एक एकल जज के बजाय जजों का एक पैनल उपयोग करना था। जजों के एक छोटे समूह द्वारा उत्तर पर मतदान कराने और, उत्तर को सही मानने से पहले सभी की सहमति अनिवार्य करने से, शोधकर्ताओं ने खतरनाक गलतियों की संख्या में भारी कमी की। इस "रूढ़िवादी" दृष्टिकोण का अर्थ था कि यदि समूह के एक भी जज ने त्रुटि पकड़ी, तो उत्तर को खारिज कर दिया गया। इस पद्धति ने अकेले सबसे अच्छे मॉडल का उपयोग करने की तुलना में गलत स्वीकृतियों की दर को आधे से अधिक कम कर दिया।

शोधकर्ताओं ने निष्कर्ष निकाला कि उच्च-दांव वाले कानूनी प्रश्नों के लिए, एक एकल आर्टिफिशियल इंटेलिजेंस जज अकेले काम करने के लिए भरोसेमंद नहीं है। एक गलत कानूनी उत्तर को मशीन द्वारा अनुमोदित किए जाने का जोखिम अनदेखा करने के लिए बहुत बड़ा है। इसके बजाय, सबसे अच्छा दृष्टिकोण चुनिंदा स्मार्ट मॉडलों की एक छोटी टीम का उपयोग करना है जो प्रारंभिक स्क्रीनिंग करें, लेकिन कठिन या जोखिम भरे मामलों में अंतिम निर्णय लेने के लिए हमेशा एक मानव विशेषज्ञ तैयार रहे। यह एक ऐसा सिस्टम बनाता है जहाँ आर्टिफिशियल इंटेलिजेंस की गति को मानवीय निरीक्षण की सुरक्षा के साथ जोड़ा जाता है। यह अध्ययन एक चेतावनी के रूप में कार्य करता है कि हालांकि ये उपकरण शक्तिशाली हैं, वे मानव निर्णय के पूर्ण विकल्प नहीं हैं, विशेष रूप से जब नियम जटिल हों और गलती के परिणाम गंभीर हों।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →