Magis-Bench: Evaluating LLMs on Magistrate-Level Legal Tasks
यह शोध पत्र मैजिस-बेंच (Magis-Bench) प्रस्तुत करता है, जो ब्राज़ीलियाई न्यायिक परीक्षाओं से व्युत्पन्न एक नया बेंचमार्क है, जो मजिस्ट्रेट-स्तर के कानूनी तर्क और लेखन कार्यों पर 23 अत्याधुनिक एलएलएम (LLMs) का मूल्यांकन करता है, जिससे यह पता चलता है कि शीर्ष प्रदर्शन करने वाले मॉडल भी तर्कसंगत न्यायिक निर्णय उत्पन्न करने में उच्च अंक प्राप्त करने के लिए संघर्ष करते हैं।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
एक उच्च-दांव वाली कुकिंग प्रतियोगिता की कल्पना करें। आमतौर पर, जब हम AI का परीक्षण करते हैं, तो हम कंप्यूटर को कोई व्यंजन पकाने (एक कानूनी तर्क या अनुबंध लिखना) के लिए कहते हैं। लेकिन एक वास्तविक कानूनी प्रणाली में, सबसे महत्वपूर्ण काम केवल खाना पकाना नहीं है; बल्कि वह जज बनना है जो व्यंजन को चखता है, तय करता है कि वह अच्छा है या नहीं, और समझाता है कि वह क्यों पास या फेल हुआ।
यह शोध पत्र, Magis-Bench, AI को उस "जज" की भूमिका पर परखने के बारे में है।
समस्या: क्या AI एक जज बन सकता है?
कानून में अधिकांश AI परीक्षण कंप्यूटर को एक वकील बनने के लिए कहते हैं: "इस क्लाइंट के लिए बचाव पक्ष लिखें।" लेकिन एक वास्तविक जज को कुछ अधिक कठिन करना होता है: दोनों पक्षों को सुनना, अपनी भावनाओं को दरकिनार करना, सख्त नियमों को लागू करना और एक अंतिम निर्णय लिखना जो जांच के दायरे में खरा उतर सके।
लेखक यह जानना चाहते थे: क्या वर्तमान AI मॉडल एक वास्तविक जज की तरह कार्य कर सकते हैं?
परीक्षण: "मैजिस्ट्रेट" परीक्षा
इसकी परीक्षा लेने के लिए, शोधकर्ताओं ने काल्पनिक प्रश्न नहीं बनाए। उन्होंने 74 वास्तविक प्रश्न लिए जो 2023 और 2025 के बीच वास्तविक न्यायाधीशों को नियुक्त करने के लिए उपयोग की जाने वाली अत्यधिक प्रतिस्पर्धी ब्राज़ीलियाई परीक्षाओं से लिए गए थे।
इन परीक्षाओं को न्यायाधीशों के लिए "बार एग्जाम" की तरह समझें। इनमें शामिल हैं:
- निबंध प्रश्न: "यहाँ एक जटिल कानूनी स्थिति है; कानून की व्याख्या करें।"
- ड्राफ्टिंग कार्य: "यहाँ तथ्य दिए गए हैं; पूर्ण, आधिकारिक अदालती निर्णय (अंतिम फैसला) लिखें।"
महत्वपूर्ण बात यह है कि प्रत्येक प्रश्न के साथ एक आधिकारिक उत्तर कुंजी (रूब्रिक) भी थी। यह एक शिक्षक की ग्रेडिंग शीट की तरह है जो बताती है कि किसी विशिष्ट कानून का उल्लेख करने या एक विशिष्ट संरचना का पालन करने के लिए आपको कितने अंक मिलते हैं।
विधि: AI बनाम AI
चूंकि 23 अलग-अलग AI मॉडलों के लिए 74 निबंधों को ग्रेड करने के लिए 23 मानव न्यायाधीशों को काम पर रखना अविश्वसनीय रूप से महंगा और धीमा होगा, इसलिए शोधकर्ताओं ने एक चतुर तरकीब का उपयोग किया: उन्होंने AI को AI को ग्रेड करने दिया।
- प्रतिभागी: उन्होंने उपलब्ध 23 सबसे स्मार्ट AI मॉडल चुने (Google, OpenAI, Anthropic और अन्य कंपनियों से)।
- जज: उन्होंने ग्रेडर के रूप में चार अन्य, बहुत शक्तिशाली AI मॉडल का उपयोग किया।
- नियम: "जज AI" को यह नहीं पता था कि उत्तर किसने लिखे हैं। उन्होंने केवल प्रश्न, आधिकारिक उत्तर कुंजी और AI की प्रतिक्रिया को देखा, फिर उसे 0 से 10 तक का स्कोर दिया।
परिणाम: AI "जज" सहमत थे
यहाँ हुआ:
- जज आपस में सहमत थे: चारों AI जज लगभग पूरी तरह से एक-दूसरे से सहमत थे (98.4% सहमति)। यह चार खाद्य आलोचकों की तरह है जो सभी इस बात पर सहमत हैं कि कौन सा रेस्टोरेंट सबसे अच्छा है। इसने शोधकर्ताओं को विश्वास दिलाया कि स्कोर निष्पक्ष थे और केवल यादृच्छिक (random) नहीं थे।
- विजेता: शीर्ष प्रदर्शन करने वाले Google के Gemini-3-Pro-Preview (स्कोर: 6.97/10) थे, उसके बाद Gemini-3-Flash और Claude-4.5-Opus आए।
- वास्तविकता की जाँच: यहाँ तक कि "विजेता" को भी केवल 6.97/10 मिला। यह 70% से भी कम है।
इसका क्या अर्थ है
शोध पत्र निष्कर्ष निकालता है कि जबकि AI कानूनी कार्यों में बेहतर हो रहा है, जज की तरह कार्य करना अभी भी उनके लिए बहुत कठिन है।
- अंतराल: वर्तमान AI मॉडल उन छात्रों की तरह हैं जो पाठ्यपुस्तक को रट सकते हैं लेकिन एक मानव न्यायाधीश की सूक्ष्मता और अधिकार के साथ एक जटिल, वास्तविक जीवन की स्थिति में नियमों को लागू करने में संघर्ष करते हैं।
- बेंचमार्क: शोधकर्ताओं ने सभी प्रश्न, उत्तर और ग्रेडिंग कोड जारी कर दिया है ताकि अन्य वैज्ञानिक इन मॉडलों का परीक्षण और सुधार करना जारी रख सकें।
संक्षेप में: हमने AI को एक वास्तविक जज की परीक्षा देने के लिए कहा। सबसे स्मार्ट मॉडलों ने "C" या "B" के साथ पास किया, जो यह साबित करता है कि हालांकि वे स्मार्ट हो रहे हैं, वे अभी अदालत में मानव न्यायाधीशों की जगह लेने के लिए तैयार नहीं हैं।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।