← नवीनतम पेपर
💬 NLP

PLawBench: A Rubric-Based Benchmark for Evaluating LLMs in Real-World Legal Practice

यह शोधपत्र PLawBench प्रस्तुत करता है, जो बड़े भाषा मॉडलों (large language models) की सूक्ष्म-स्तरीय तर्क क्षमताओं का मूल्यांकन करने के लिए 850 वास्तविक दुनिया के कानूनी परिदृश्यों और विशेषज्ञ-निर्मित रूब्रिक्स (rubrics) से युक्त एक व्यापक बेंचमार्क है, जो यह प्रकट करता है कि वर्तमान अत्याधुनिक मॉडल अभी भी व्यावहारिक कानूनी कार्यों की जटिलता के साथ संघर्ष कर रहे हैं।

मूल लेखक: Yuzhen Shi, Huanghai Liu, Yiran Hu, Gaojie Song, Xinran Xu, Yubo Ma, Tianyi Tang, Li Zhang, Qingjing Chen, Di Feng, Wenbo Lv, Weiheng Wu, Kexin Yang, Sen Yang, Wei Wang, Rongyao Shi, Yuanyang Qiu, Yue
प्रकाशित 2026-01-29
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Yuzhen Shi, Huanghai Liu, Yiran Hu, Gaojie Song, Xinran Xu, Yubo Ma, Tianyi Tang, Li Zhang, Qingjing Chen, Di Feng, Wenbo Lv, Weiheng Wu, Kexin Yang, Sen Yang, Wei Wang, Rongyao Shi, Yuanyang Qiu, Yuemeng Qi, Jingwen Zhang, Xiaoyu Sui, Yifan Chen, Yi Zhang, An Yang, Bowen Yu, Dayiheng Liu, Junyang Lin, Weixing Shen, Bing Zhao, Charles L. A. Clarke, Hu Wei

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक बहुत ही बुद्धिमान, लेकिन अनुभवहीन रोबोट को वकील बनना सिखाने की कोशिश कर रहे हैं। आप यह जानना चाहते हैं कि क्या यह रोबोट वास्तव में वास्तविक जीवन की कानूनी समस्याओं को संभाल सकता है, न कि केवल एक बहुविकल्पीय परीक्षा (multiple-choice test) पास कर सकता है।

यह शोध पत्र PLAWBENCH पेश करता है, जो एक नया "फाइनल एग्जाम" है जिसे विशेष रूप से बड़े भाषा मॉडलों (LLMs) को वास्तविक कानूनी कार्य करने की उनकी क्षमता पर परखने के लिए डिज़ाइन किया गया है।

यहाँ उन्होंने क्या किया है, इसका सरल उपमाओं (analogies) का उपयोग करके विवरण दिया गया है:

1. समस्या: "पाठ्यपुस्तक" का जाल (The "Textbook" Trap)

AI वकीलों के लिए पिछले परीक्षण एक छात्र की पाठ्यपुस्तक क्विज़ देने जैसा था। प्रश्न साफ थे, तथ्य स्पष्ट थे, और केवल एक ही सही उत्तर था।

  • वास्तविकता: वास्तविक कानूनी कार्य अव्यवस्थित होता है। क्लाइंट रोते हुए आते हैं, महत्वपूर्ण विवरण छोड़ देते हैं, या अपनी समस्याओं का वर्णन करने के लिए गलत शब्दों का उपयोग करते हैं। एक वास्तविक वकील को सच्चाई खोजने के लिए उस भ्रम के बीच से खुदाई करनी पड़ती है।
  • खामी: पुराने परीक्षण यह नहीं जांचते थे कि क्या AI इस अव्यवस्था को संभाल सकता है। वे केवल यह देखते थे कि क्या AI कानूनों को याद रख सकता है या एक सरल तर्क पैटर्न (जैसे कि एक बुनियादी सिलोजिज्म) का पालन कर सकता है।

2. समाधान: एक "वास्तविक दुनिया का सिमुलेशन" (A "Real-World Simulation")

लेखकों ने वास्तविक कानूनी कार्यप्रवाह (workflow) को सिम्युलेट करने के लिए PLAWBENCH बनाया। एक क्विज़ के बजाय, उन्होंने तीन विशिष्ट परिदृश्य बनाए जिनका सामना वकील हर दिन करते हैं:

  • कार्य 1: "डिटेक्टिव" इंटरव्यू (सार्वजनिक कानूनी परामर्श)

    • सेटअप: एक क्लाइंट एक भ्रमित करने वाली, भावनात्मक कहानी देता है जिसमें तथ्यों की कमी है।
    • परीक्षण: क्या AI छिपे हुए विवरणों को उजागर करने के लिए सही फॉलो-अप प्रश्न पूछ सकता है? यह एक जासूस की तरह है जिसे एहसास होता है कि गवाह ने यह बताना भूल गया कि उसने लाल टोपी पहनी थी, जो पूरे मामले को बदल सकता है।
    • लक्ष्य: यह देखने के लिए कि क्या AI यह पहचान सकता है कि क्या गायब है, न कि केवल पूछे गए प्रश्नों का उत्तर दे सकता है।
  • कार्य 2: "केस ब्रेकडाउन" (व्यावहारिक केस विश्लेषण)

    • सेटअप: AI को एक अव्यवस्थित केस फाइल दी जाती है और उसका विश्लेषण करने के लिए कहा जाता है।
    • परीक्षण: क्या AI तर्क की एक तार्किक श्रृंखला बना सकता है? केवल "दोषी" या "निर्दोष" कहना पर्याप्त नहीं है। AI को अपना काम दिखाना होगा: "यह तथ्य है, यह कानून है, और यह बताया गया है कि वे कैसे जुड़ते हैं।"
    • लक्ष्य: यह सुनिश्चित करना कि AI केवल अनुमान नहीं लगा रहा है या संबंध बना रहा है, बल्कि वास्तव में चरण-दर-चरण तर्क दे रहा है।
  • कार्य 3: "ड्राफ्टिंग" (कानूनी दस्तावेज़ निर्माण)

    • सेटअप: AI को क्लाइंट के भटके हुए नोट्स के आधार पर एक औपचारिक कानूनी दस्तावेज़ (जैसे कि मुकदमा या बचाव) लिखना होता है।
    • परीक्षण: क्या AI भावनात्मक शोर को छान सकता है, क्लाइंट की कानूनी गलतियों को ठीक कर सकता है, और एक ऐसा दस्तावेज़ लिख सकता है जो सख्त पेशेवर नियमों का पालन करता हो?
    • लक्ष्य: यह देखने के लिए कि क्या AI एक पेशेवर लेखक के रूप में कार्य कर सकता है जो खेल के नियमों को जानता है।

3. ग्रेडिंग सिस्टम: "रूब्रिक" (The "Rubric")

यह सबसे महत्वपूर्ण हिस्सा है। अतीत में, AI के कानूनी उत्तर को ग्रेड करना एक शिक्षक द्वारा कहने जैसा था, "अच्छा काम किया, आपको सही उत्तर मिला।"

  • नया तरीका: लेखकों ने प्रत्येक प्रश्न के लिए एक विस्तृत चेकलिस्ट (रूबरिक) बनाई।
  • उपमा: कल्पना कीजिए कि एक कुकिंग प्रतियोगिता को ग्रेड कर रहे हैं। केवल सूप चखकर यह कहने के बजाय कि "यह अच्छा है," जज एक सूची देखते हैं: "क्या उन्होंने नमक की सही मात्रा डाली? क्या उन्होंने प्याज को सही ढंग से काटा? क्या उन्होंने ताजी जड़ी-बूटियों का उपयोग किया?"
  • PLAWBENCH में लगभग 12,500 ऐसे चेकलिस्ट आइटम हैं। यह उन्हें AI को केवल अंतिम परिणाम पर नहीं, बल्कि इस पर ग्रेड करने की अनुमति देता है कि उसने कैसे सोचा।

4. परिणाम: AI अभी भी एक "लॉ स्टूडेंट" है

शोधकर्ताओं ने उपलब्ध 10 सबसे स्मार्ट AI मॉडलों (GPT-5, Claude और अन्य सहित) का इस नए एग्जाम पर परीक्षण किया।

  • परिणाम: किसी भी मॉडल ने पासिंग ग्रेड प्राप्त नहीं किया जो उन्हें अकेले कानून का अभ्यास करने के लिए तैयार कर सके।
  • कमजोरियाँ:
    • वे अक्सर क्लाइंट की बिखरी हुई कहानियों में महत्वपूर्ण विवरणों को मिस कर जाते हैं।
    • वे कभी-कभी अपने तर्क के चरणों को छोड़ देते हैं (साक्ष्य के बिना निष्कर्ष पर पहुंच जाना)।
    • वे कभी-कभी पुराने कानून उद्धृत करते हैं या मनगढ़ंत तथ्य बनाते हैं (Hallucinations)।
    • वे जटिल मामलों में आवश्यक सख्त, चरण-दर-चरण क्रम का पालन करने में संघर्ष करते हैं।

सारांश

PLAWBENZ को एक लिखित ड्राइविंग थ्योरी टेस्ट के बजाय एक ड्राइविंग टेस्ट के रूप में समझें।

  • पुराने परीक्षण पूछते थे: "स्टॉप साइन का क्या मतलब है?" (AI इसे सही बताता था)।
  • PLAWBENCH AI को एक भ्रमित यात्री, खराब मौसम और खराब GPS के साथ कार में रखता है, और उसे सुरक्षित रूप से मंजिल तक पहुंचने के लिए चलाने को कहता है।
  • फैसला: AI सिद्धांत पढ़ने में बहुत अच्छा है, लेकिन जब वह वास्तविक दुनिया में गाड़ी चलाने की कोशिश करता है, तो वह क्रैश हो जाता है। वास्तविक कानूनी अभ्यास की जटिलता और अस्पष्टता को संभालने के लिए इसे और अधिक प्रशिक्षण की आवश्यकता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →