← नवीनतम पेपर
💬 NLP

Validate Your Authority: Benchmarking LLMs on Multi-Label Precedent Treatment Classification

यह शोध पत्र मल्टी-लेबल कानूनी मिसाल उपचार वर्गीकरण पर लार्ज लैंग्वेज मॉडल्स को बेंचमार्क करने के लिए एक नया विशेषज्ञ-एनोटेटेड डेटासेट और एक नया एवरेज सेवेरिटी एरर मेट्रिक प्रस्तुत करता है, जो यह प्रकट करता है कि जहाँ जेमिनी 2.5 फ्लैश उच्च-स्तरीय कार्यों में उत्कृष्ट है, वहीं GPT-5-mini जटिल सूक्ष्म-स्तरीय स्कीमा पर बेहतर प्रदर्शन करता है।

मूल लेखक: M. Mikail Demir, M. Abdullah Canbaz

प्रकाशित 2026-05-19
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: M. Mikail Demir, M. Abdullah Canbaz

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कानूनी व्यवस्था की कल्पना कहानियों के एक विशाल, निरंतर बढ़ते पुस्तकालय के रूप में करें। इस पुस्तकालय में, हर नई कहानी (अदालती मामला) अक्सर यह समझाने के लिए कि कोई निर्णय क्यों लिया गया था, एक पुरानी कहानी (पूर्ववृत्त/precedent) का संदर्भ देती है। वकीलों के लिए बड़ा सवाल यह है: "क्या वह पुरानी कहानी अब भी एक अच्छा नियम है जिसे मानना चाहिए, या उसे किसी नई कहानी द्वारा रद्द, आलोचनात्मक या परिवर्तित कर दिया गया है?"

यदि एक वकील किसी ऐसी पुरानी कहानी पर अपना तर्क बनाता है जिसे "रद्द" (overruled) कर दिया गया है, तो यह एक ऐसी कार चलाने की कोशिश करने जैसा है जो वर्षों पहले असुरक्षित घोषित कर दी गई थी। यह एक खतरनाक गलती है।

समस्या: मानव पुस्तकालयाध्यक्ष थक गए हैं

द दशकों से, बड़ी कंपनियाँ इन नई कहानियों को पढ़ने और पुरानी कहानियों पर छोटे झंडे लगाने के लिए मानव "पुस्तकालयाध्यक्षों" (कानूनी संपादकों) की टीमें नियुक्त करती रही हैं। वे उस पर लाल झंडा लगा सकते हैं जिस पर "रद्द किया गया" लिखा हो या पीला झंडा जिस पर "आलोचना की गई" लिखा हो।

लेकिन इंसान गलतियाँ करते हैं। कभी-कभी वे झंडा लगाना भूल जाते हैं, या वे उस पर गलत रंग लगा देते हैं। इस शोध पत्र के लेखकों ने पूछा: "क्या एक सुपर-स्मार्ट कंप्यूटर (AI) इस फ्लैगिंग (झंडा लगाने) के काम को इंसानों से बेहतर और तेज़ी से कर सकता है?"

प्रयोग: AI के लिए एक नया परीक्षण

शोधकर्ताओं ने केवल AI से अनुमान लगाने के लिए नहीं कहा; उन्होंने एक कठोर परीक्षण बनाया।

  1. डेटासेट (परीक्षण पुस्तक): उन्होंने वास्तविक दुनिया की 239 कानूनी कहानियों का एक विशेष संग्रह बनाया। उन्होंने केवल कच्चे टेक्स्ट का उपयोग नहीं किया; उन्होंने इसे साफ किया और इसमें "सही" उत्तर (ग्राउंड ट्रुथ) जोड़े जो विशेषज्ञ मानव विश्लेषण पर आधारित थे। यह एक बहुत ही कठिन परीक्षा के लिए शिक्षक की उत्तर कुंजी की तरह है।
  2. चुनौती (दो स्तर):
    • स्तर 1 (बड़ी तस्वीर): क्या पुरानी कहानी खराब है? (जैसे, "क्या इसकी आलोचना की गई है या इसे सीमित किया गया है?")
    • स्तर 2 (बारीक विवरण): यह कैसे खराब है? (जैसे, "क्या इसे रद्द कर दिया गया था? क्या इसे अलग (distinguished) माना गया था? क्या इस पर सवाल उठाया गया था?")
    • उपमा: स्तर 1 यह पूछने जैसा है, "क्या यह भोजन खराब है?" स्तर 2 यह पूछने जैसा है, "क्या यह फफूंद लगा हुआ है, जला हुआ है, या बस एक्सपायर हो गया है?"
  3. प्रतिद्वंद्वी: उन्होंने कई शीर्ष-स्तरीय AI मॉडलों (जैसे Google का Gemini और OpenAI का GPT) को एक-दूसरे के खिलाफ खड़ा किया। उन्होंने AI को पहले उत्तर नहीं सिखाए (कोई "रट्टा मारना" नहीं); उन्होंने बस इसे प्रश्न दिए और इसे अपने मौजूदा ज्ञान का उपयोग करके उन्हें हल करने के लिए कहा।

परिणाम: कौन जीता?

परिणाम थोड़े विभाजित निर्णय की तरह थे, जैसे कि एक खेल का मैच जहाँ एक टीम रक्षा में जीतती है और दूसरी आक्रमण में:

  • "बड़ी तस्वीर" का चैंपियन: Gemini 2.5 Flash सामान्य प्रश्न के लिए सबसे अच्छा था। इसने लगभग 79% बड़ी श्रेणियों को सही बताया। यह यह कहने में बहुत अच्छा था कि, "हाँ, यह पुरानी कहानी अब अच्छा कानून नहीं है।"
  • "बारीक विवरण" का चैंपियन: GPT-5-mini जटिल, विशिष्ट विवरणों के लिए सबसे अच्छा था। इसने लगभग 68% विशिष्ट लेबल को सही बताया। यह "आलोचना किए गए" और "सवाल उठाए गए" के बीच अंतर करने में बेहतर था।

एक पेंच: विजेता भी गलतियाँ करते थे, विशेष रूप से दुर्लभ, अजीब मामलों में। AI सामान्य समस्याओं को पहचानने में बहुत अच्छा था लेकिन दुर्लभ, जटिल मामलों में संघर्ष करता था।

नया स्कोरकार्ड: क्यों "सटीकता" पर्याप्त नहीं है

लेखकों को एहसास हुआ कि कानून में केवल "सही" और "गलत" उत्तरों को गिनना उचित नहीं है।

  • उपमा: कल्पना करें कि एक डॉक्टर मरीज का निदान कर रहा है। यदि डॉक्टर सोचता है कि मरीज को सर्दी है जबकि वास्तव में उसे फ्लू है, तो यह एक गलती है। लेकिन अगर डॉक्टर सोचता है कि मरीज को सर्दी है जबकि वास्तव में उसकी हड्डी टूटी हुई है, तो यह एक तबाही है।

इस कानूनी परीक्षण में, एक "मामूली रूप से आलोचना किए गए" मामले को "पूरी तरह से रद्द किए गए" मामले के साथ भ्रमित करना एक बड़ी त्रुटि है। आलोचना के दो समान प्रकारों के बीच भ्रमित होना एक छोटी त्रुटि है।

इसलिए, शोधकर्ताओं ने एक नया स्कोर बनाया जिसे "औसत गंभीरता त्रुटि" (Average Severity Error) कहा जाता है। केवल गलतियों को गिनने के बजाय, उन्होंने मापा कि गलती कितनी गंभीर थी।

  • विजेता: इस नए, सख्त स्कोर का उपयोग करते हुए, Gemini 2.5 Flash अभी भी शीर्ष प्रदर्शन करने वाला रहा। इसने सबसे कम खतरनाक गलतियाँ कीं।

निष्कर्ष

शोध पत्र यह निष्कर्ष निकालता है कि हालांकि AI इस कानूनी "फ्लैगिंग" के काम में बहुत अच्छा हो रहा है, लेकिन यह अभी भी पूर्ण नहीं है।

  • अच्छी खबर: AI भारी काम संभाल सकता है और अधिकांश समस्याओं को पहचान सकता है।
  • बुरी खबर: कानूनी भाषा इतनी सूक्ष्म है कि सबसे स्मार्ट AI भी बारीक विवरणों में भ्रमित हो जाते हैं। इसके अलावा, टेस्ट डेटा असंतुलित था (वहाँ "अच्छी" कहानियों की तुलना में "खराब" कहानियाँ बहुत अधिक थीं), जिससे AI के लिए दुर्लभ मामलों को सीखना कठिन हो गया।

मुख्य बात: इस शोध पत्र ने केवल AI का परीक्षण नहीं किया; इसने कानूनी दुनिया को एक नया, बेहतर तरीका दिया कि कैसे AI के प्रदर्शन को मापा जाए, और इसने "अभ्यास परीक्षाओं" (डेटासेट) का एक नया सेट जारी किया ताकि अन्य शोधकर्ता इन मॉडलों को बेहतर बनाने के प्रयास जारी रख सकें। यह उच्च-दांव वाले कानूनी निर्णयों के लिए AI पर भरोसा करने की दिशा में एक महत्वपूर्ण पहला कदम है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →