← नवीनतम पेपर
💻 computer science

TW-LegalBench: Measuring Taiwanese Legal Understanding

यह शोध पत्र TW-LegalBench प्रस्तुत करता है, जो बहुविकल्पीय प्रश्नों, निबंध लेखन और निर्णय पूर्वानुमान के माध्यम से लार्ज लैंग्वेज मॉडल्स का मूल्यांकन करने के लिए ताइवान के आधिकारिक कानूनी संग्रह का उपयोग करने वाला एक व्यापक बेंचमार्क है, जो यह प्रकट करता है कि जबकि शीर्ष मॉडल वकीलों के योग्यता स्तर के करीब पहुँचते हैं, वे अभी भी न्यायाधीशों और अभियोजकों से काफी पीछे हैं और सटीक कानूनी उद्धरण (साइटेशन) के साथ संघर्ष करते हैं।

मूल लेखक: Fei-Yueh Chen, Chun Huang Lin, Chan Wei Hsu, Kuan Hsuan Yeh, Zih-Ching Chen, Kuan-Ming Chen, Patrick Chung-Chia Huang

प्रकाशित 2026-06-19
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Fei-Yueh Chen, Chun Huang Lin, Chan Wei Hsu, Kuan Hsuan Yeh, Zih-Ching Chen, Kuan-Ming Chen, Patrick Chung-Chia Huang

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप यह परीक्षण करना चाहते हैं कि एआई (AI) की एक नई पीढ़ी के "लॉ स्टूडेंट्स" वास्तव में कितने बुद्धिमान हैं। आप केवल उन्हें वर्णमाला सुनाने के लिए नहीं कह सकते; आपको यह देखने की आवश्यकता है कि क्या वे वास्तव में वास्तविक परीक्षाओं को पास कर सकते हैं और ताइवान में उपयोग किए जाने वाले वास्तविक कानूनी पहेलियों को हल कर सकते हैं।

लेखकों ने बिल्कुल यही किया जो इस शोध पत्र के लेखकों ने किया है। उन्होंने TW-LegalBench नामक एक विशाल परीक्षण मैदान बनाया। इसे एक विशाल, विशिष्ट जिम के रूप में समझें, जिसे विशेष रूप से एआई मॉडलों की ताइवानी कानून (जो कि अमेरिका या यूके की तरह पिछले अदालती मामलों के बजाय, लिखित कोड या नियम पुस्तिका पर आधारित है) को समझने की क्षमता का परीक्षण करने के लिए डिज़ाइन किया गया है।

यहाँ उनके "जिम" और उनके निष्कर्षों का विवरण दिया गया, जिसे सरल उपमाओं का उपयोग करके समझाया गया है:

1. तीन "वर्कआउट स्टेशन"

शोधकर्ताओं ने एआई को केवल एक प्रकार का परीक्षण नहीं दिया। उन्होंने विभिन्न कौशलों को मापने के लिए तीन अलग-अलग स्टेशन स्थापित किए:

  • स्टेशन A: बहुविकल्पीय प्रश्नोत्तरी (द "ट्रिविया नाइट")

    • यह क्या है: पांच वर्षों में फैले वास्तविक सरकारी परीक्षाओं (जैसे बार परीक्षा या नागरिक सेवा परीक्षण) से 16,000 से अधिक प्रश्न।
    • चुनौती: एआई को चार विकल्पों में से एक सही उत्तर चुनना होता है।
    • ट्विस्ट: उन्होंने केवल यह नहीं पूछा कि "कानून क्या है?" उन्होंने प्रत्येक प्रश्न को उस विशिष्ट कानून के साथ टैग किया जिससे वह आता है (जैसे नियम पुस्तिका का एक विशिष्ट अध्याय)। इससे उन्हें यह देखने में मदद मिली कि क्या एआई विशिष्ट नियमों को याद रखने में अच्छा है या केवल अनुमान लगा रहा है।
  • स्टेशन B: निबंध परीक्षा (द "लॉ स्कूल फाइनल")

    • यह क्या है: 117 खुले प्रश्न जहाँ एआई को केवल एक अक्षर चुनने के बजाय एक पूर्ण कानूनी तर्क लिखना होता है।
    • चुनौती: वास्तविक जीवन में, न्यायाधीश और वकील केवल "A" या "B" पर गोला नहीं लगाते; उन्हें यह समझाना पड़ता है कि क्यों
    • ग्रेडिंग: चूंकि मनुष्य 117 निबंधों को तुरंत ग्रेड नहीं कर सकते, इसलिए शोधकर्ताओं ने एक "सुपर-ग्रेडर एआई" (एक अन्य एआई जो न्यायाधीश की भूमिका निभाता है) का उपयोग किया। सुपर-ग्रेडर ने निबंधों की जांच एक सख्त चेकलिस्ट (रूब्रिक) के विरुद्ध की ताकि यह देखा जा सके कि क्या एआई ने सभी आवश्यक कानूनी बिंदुओं को छुआ है, और अच्छे तर्कों के लिए आंशिक क्रेडिट दिया जो एक विवरण चूक गए थे।
  • स्टेशन C: क्रिस्टल बॉल (द "वर्डिक्ट प्रेडिक्टर")

    • यह क्या है: 14,000 से अधिक वास्तविक आपराधिक मामले।
    • चुनौती: एआई को अपराध के तथ्य दिए जाते हैं (जैसे, "किसी ने साइकिल चुराई") और उसे दो चीजों की भविष्यवाणी करनी होती है: अंतिम फैसला (दोषी/निर्दोष) और सटीक सजा (जैसे, "3 महीने की जेल" या "$500 का जुर्माना")।
    • लक्ष्य: यह देखना कि क्या एआई एक अव्यवस्थित वास्तविक दुनिया की स्थिति को देख सकता है और परिणाम का सही अनुमान लगाने के लिए कानून लागू कर सकता है।

2. परिणाम: किसने कक्षा पास की?

शोधकर्ताओं ने 13 विभिन्न एआई मॉडलों का परीक्षण किया, जो विशाल, शक्तिशाली मॉडलों से लेकर छोटे, विशिष्ट मॉडलों तक विस्तृत थे। यहाँ क्या हुआ:

  • "बार परीक्षा" पास करना: शीर्ष एआई मॉडल वकील की बार परीक्षा पास करने के लिए पर्याप्त स्मार्ट थे। यदि ये एआई इंसान होते, तो वे अपना कानूनी लाइसेंस प्राप्त कर लेते! उनका स्कोर इतना अधिक था कि वे शीर्ष 33% परीक्षार्थियों में शामिल थे।
  • "जज" का अंतर: हालाँकि, जब बात जज और अभियोजक परीक्षाओं (जो बहुत कठिन हैं और विशेषज्ञता के गहरे स्तर की आवश्यकता होती है) की आई, तो कोई भी एआई पास नहीं हुआ। वे मानव उम्मीदवारों के शीर्ष 1-2% से पीछे रह गए। यह ऐसा है जैसे एआई एक बेहतरीन जूनियर एसोसिएट हो सकता है, लेकिन वह अभी जज बनने के लिए तैयार नहीं है।
  • "मेमोरी" बनाम "रीज़निंग" की समस्या:
    • अनुमान लगाने में कुशल: एआई अपराध के प्रकार या सामान्य सजा (जैसे, "यह चोरी है, इसलिए यह संभवतः कम जेल की अवधि है") की भविष्यवाणी करने में आश्चर्यजनक रूप से अच्छा था।
    • नियमों को उद्धृत करने में कमजोर: जब उन्हें सटीक कानून अनुच्छेद (जैसे, "अनुच्छेद 320, पैराग्राफ 1") उद्धृत करने के लिए कहा गया, तो वे संघर्ष करते दिखे। उन्होंने अक्सर फर्जी कानून बनाए या गलत कानूनों का उल्लेख किया। यह एक ऐसे छात्र की तरह है जो जानता है कि उत्तर "42" है लेकिन वह यह नहीं बता सकता कि पाठ्यपुस्तक के किस पृष्ठ पर है।
  • "स्थानीय विशेषज्ञ" का लाभ: दिलचस्प बात यह है कि जो एआई मॉडल विशेष रूप से पारंपरिक चीनी और ताइवानी डेटा पर प्रशिक्षित थे, वे कुछ विशाल, सामान्य-उद्देश्य वाले मॉडलों की तुलना में कठिन निबंध प्रश्नों पर बेहतर प्रदर्शन करते थे। यह एक स्थानीय गाइड की तरह है जो एक विशाल, सामान्य मानचित्र वाले पर्यटक की तुलना में शहर के छिपे हुए रास्तों को बेहतर जानता है।

3. "हैलुसिनेशन" का जाल

सबसे बड़ी खोजों में से एक हैलुसिनेशन (चीजों को बनाना) के बारे में थी।

  • "क्रिस्टल बॉल" स्टेशन में, एआई बहुत आत्मविश्वासी थे लेकिन अक्सर उन विशिष्ट कानूनों के बारे में गलत थे जिनका वे उल्लेख करते थे।
  • कुछ मॉडलों ने ऐसे कानून बना दिए जो अस्तित्व में नहीं थे (टाइप I त्रुटि), जबकि अन्य ने वास्तविक कानूनों का उल्लेख किया जो उस मामले पर लागू नहीं होते थे (टाइप II त्रुटि)।
  • शोध पत्र नोट करता है कि कुछ छोटे मॉडल अपने प्रशिक्षण डेटा से सटीक उत्तरों को याद करके "चीटिंग" करते प्रतीत हुए, बजाय इसके कि वे समस्या के माध्यम से वास्तव में तर्क करें। यह उस छात्र की तरह है जिसने पिछले साल की परीक्षा के लिए उत्तर कुंजी रट ली है लेकिन गणित को समझता नहीं है।

4. मुख्य निष्कर्ष

शोध पत्र निष्कर्ष निकालता है कि हालांकि एआई कानूनी कार्यों में बहुत अच्छा हो रहा है—इतना अच्छा कि यह प्रवेश-स्तर की वकील परीक्षाओं को पास कर सकता है—फिर भी यह मानव न्यायाधीशों या अभियोजकों को बदलने के लिए तैयार नहीं है।

  • अच्छा: एआई "ट्रिविया" और सामान्य तर्क को अच्छी तरह से संभाल सकता है।
  • बुरा: यह सजा सुनाने और सटीक कानूनों को उद्धृत करने के लिए आवश्यक सटीकता के साथ संघर्ष करता है।
  • सबक: एआई को वास्तव में उपयोगी बनाने के लिए, हमें इसे केवल सामान्य ज्ञान पर नहीं, बल्कि विशिष्ट स्थानीय कानूनों और भाषाओं पर अधिक प्रशिक्षित करने की आवश्यकता है।

संक्षेप में, TW-LegalBench एक वास्तविकता की जाँच है। यह दिखाता है कि हालांकि एआई एक शानदार लॉ स्टूडेंट है, लेकिन यह अभी तक एक योग्य जज नहीं है। वह नियमों को जानता है, लेकिन उसे अभी भी एक मानव विशेषज्ञ की तरह सटीकता और देखभाल के साथ उन्हें लागू करना सीखना होगा।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →