PLawBench: A Rubric-Based Benchmark for Evaluating LLMs in Real-World Legal Practice
यह शोधपत्र PLawBench प्रस्तुत करता है, जो बड़े भाषा मॉडलों (large language models) की सूक्ष्म-स्तरीय तर्क क्षमताओं का मूल्यांकन करने के लिए 850 वास्तविक दुनिया के कानूनी परिदृश्यों और विशेषज्ञ-निर्मित रूब्रिक्स (rubrics) से युक्त एक व्यापक बेंचमार्क है, जो यह प्रकट करता है कि वर्तमान अत्याधुनिक मॉडल अभी भी व्यावहारिक कानूनी कार्यों की जटिलता के साथ संघर्ष कर रहे हैं।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आप एक बहुत ही बुद्धिमान, लेकिन अनुभवहीन रोबोट को वकील बनना सिखाने की कोशिश कर रहे हैं। आप यह जानना चाहते हैं कि क्या यह रोबोट वास्तव में वास्तविक जीवन की कानूनी समस्याओं को संभाल सकता है, न कि केवल एक बहुविकल्पीय परीक्षा (multiple-choice test) पास कर सकता है।
यह शोध पत्र PLAWBENCH पेश करता है, जो एक नया "फाइनल एग्जाम" है जिसे विशेष रूप से बड़े भाषा मॉडलों (LLMs) को वास्तविक कानूनी कार्य करने की उनकी क्षमता पर परखने के लिए डिज़ाइन किया गया है।
यहाँ उन्होंने क्या किया है, इसका सरल उपमाओं (analogies) का उपयोग करके विवरण दिया गया है:
1. समस्या: "पाठ्यपुस्तक" का जाल (The "Textbook" Trap)
AI वकीलों के लिए पिछले परीक्षण एक छात्र की पाठ्यपुस्तक क्विज़ देने जैसा था। प्रश्न साफ थे, तथ्य स्पष्ट थे, और केवल एक ही सही उत्तर था।
- वास्तविकता: वास्तविक कानूनी कार्य अव्यवस्थित होता है। क्लाइंट रोते हुए आते हैं, महत्वपूर्ण विवरण छोड़ देते हैं, या अपनी समस्याओं का वर्णन करने के लिए गलत शब्दों का उपयोग करते हैं। एक वास्तविक वकील को सच्चाई खोजने के लिए उस भ्रम के बीच से खुदाई करनी पड़ती है।
- खामी: पुराने परीक्षण यह नहीं जांचते थे कि क्या AI इस अव्यवस्था को संभाल सकता है। वे केवल यह देखते थे कि क्या AI कानूनों को याद रख सकता है या एक सरल तर्क पैटर्न (जैसे कि एक बुनियादी सिलोजिज्म) का पालन कर सकता है।
2. समाधान: एक "वास्तविक दुनिया का सिमुलेशन" (A "Real-World Simulation")
लेखकों ने वास्तविक कानूनी कार्यप्रवाह (workflow) को सिम्युलेट करने के लिए PLAWBENCH बनाया। एक क्विज़ के बजाय, उन्होंने तीन विशिष्ट परिदृश्य बनाए जिनका सामना वकील हर दिन करते हैं:
कार्य 1: "डिटेक्टिव" इंटरव्यू (सार्वजनिक कानूनी परामर्श)
- सेटअप: एक क्लाइंट एक भ्रमित करने वाली, भावनात्मक कहानी देता है जिसमें तथ्यों की कमी है।
- परीक्षण: क्या AI छिपे हुए विवरणों को उजागर करने के लिए सही फॉलो-अप प्रश्न पूछ सकता है? यह एक जासूस की तरह है जिसे एहसास होता है कि गवाह ने यह बताना भूल गया कि उसने लाल टोपी पहनी थी, जो पूरे मामले को बदल सकता है।
- लक्ष्य: यह देखने के लिए कि क्या AI यह पहचान सकता है कि क्या गायब है, न कि केवल पूछे गए प्रश्नों का उत्तर दे सकता है।
कार्य 2: "केस ब्रेकडाउन" (व्यावहारिक केस विश्लेषण)
- सेटअप: AI को एक अव्यवस्थित केस फाइल दी जाती है और उसका विश्लेषण करने के लिए कहा जाता है।
- परीक्षण: क्या AI तर्क की एक तार्किक श्रृंखला बना सकता है? केवल "दोषी" या "निर्दोष" कहना पर्याप्त नहीं है। AI को अपना काम दिखाना होगा: "यह तथ्य है, यह कानून है, और यह बताया गया है कि वे कैसे जुड़ते हैं।"
- लक्ष्य: यह सुनिश्चित करना कि AI केवल अनुमान नहीं लगा रहा है या संबंध बना रहा है, बल्कि वास्तव में चरण-दर-चरण तर्क दे रहा है।
कार्य 3: "ड्राफ्टिंग" (कानूनी दस्तावेज़ निर्माण)
- सेटअप: AI को क्लाइंट के भटके हुए नोट्स के आधार पर एक औपचारिक कानूनी दस्तावेज़ (जैसे कि मुकदमा या बचाव) लिखना होता है।
- परीक्षण: क्या AI भावनात्मक शोर को छान सकता है, क्लाइंट की कानूनी गलतियों को ठीक कर सकता है, और एक ऐसा दस्तावेज़ लिख सकता है जो सख्त पेशेवर नियमों का पालन करता हो?
- लक्ष्य: यह देखने के लिए कि क्या AI एक पेशेवर लेखक के रूप में कार्य कर सकता है जो खेल के नियमों को जानता है।
3. ग्रेडिंग सिस्टम: "रूब्रिक" (The "Rubric")
यह सबसे महत्वपूर्ण हिस्सा है। अतीत में, AI के कानूनी उत्तर को ग्रेड करना एक शिक्षक द्वारा कहने जैसा था, "अच्छा काम किया, आपको सही उत्तर मिला।"
- नया तरीका: लेखकों ने प्रत्येक प्रश्न के लिए एक विस्तृत चेकलिस्ट (रूबरिक) बनाई।
- उपमा: कल्पना कीजिए कि एक कुकिंग प्रतियोगिता को ग्रेड कर रहे हैं। केवल सूप चखकर यह कहने के बजाय कि "यह अच्छा है," जज एक सूची देखते हैं: "क्या उन्होंने नमक की सही मात्रा डाली? क्या उन्होंने प्याज को सही ढंग से काटा? क्या उन्होंने ताजी जड़ी-बूटियों का उपयोग किया?"
- PLAWBENCH में लगभग 12,500 ऐसे चेकलिस्ट आइटम हैं। यह उन्हें AI को केवल अंतिम परिणाम पर नहीं, बल्कि इस पर ग्रेड करने की अनुमति देता है कि उसने कैसे सोचा।
4. परिणाम: AI अभी भी एक "लॉ स्टूडेंट" है
शोधकर्ताओं ने उपलब्ध 10 सबसे स्मार्ट AI मॉडलों (GPT-5, Claude और अन्य सहित) का इस नए एग्जाम पर परीक्षण किया।
- परिणाम: किसी भी मॉडल ने पासिंग ग्रेड प्राप्त नहीं किया जो उन्हें अकेले कानून का अभ्यास करने के लिए तैयार कर सके।
- कमजोरियाँ:
- वे अक्सर क्लाइंट की बिखरी हुई कहानियों में महत्वपूर्ण विवरणों को मिस कर जाते हैं।
- वे कभी-कभी अपने तर्क के चरणों को छोड़ देते हैं (साक्ष्य के बिना निष्कर्ष पर पहुंच जाना)।
- वे कभी-कभी पुराने कानून उद्धृत करते हैं या मनगढ़ंत तथ्य बनाते हैं (Hallucinations)।
- वे जटिल मामलों में आवश्यक सख्त, चरण-दर-चरण क्रम का पालन करने में संघर्ष करते हैं।
सारांश
PLAWBENZ को एक लिखित ड्राइविंग थ्योरी टेस्ट के बजाय एक ड्राइविंग टेस्ट के रूप में समझें।
- पुराने परीक्षण पूछते थे: "स्टॉप साइन का क्या मतलब है?" (AI इसे सही बताता था)।
- PLAWBENCH AI को एक भ्रमित यात्री, खराब मौसम और खराब GPS के साथ कार में रखता है, और उसे सुरक्षित रूप से मंजिल तक पहुंचने के लिए चलाने को कहता है।
- फैसला: AI सिद्धांत पढ़ने में बहुत अच्छा है, लेकिन जब वह वास्तविक दुनिया में गाड़ी चलाने की कोशिश करता है, तो वह क्रैश हो जाता है। वास्तविक कानूनी अभ्यास की जटिलता और अस्पष्टता को संभालने के लिए इसे और अधिक प्रशिक्षण की आवश्यकता है।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।