TW-LegalBench: Measuring Taiwanese Legal Understanding
यह शोध पत्र TW-LegalBench प्रस्तुत करता है, जो बहुविकल्पीय प्रश्नों, निबंध लेखन और निर्णय पूर्वानुमान के माध्यम से लार्ज लैंग्वेज मॉडल्स का मूल्यांकन करने के लिए ताइवान के आधिकारिक कानूनी संग्रह का उपयोग करने वाला एक व्यापक बेंचमार्क है, जो यह प्रकट करता है कि जबकि शीर्ष मॉडल वकीलों के योग्यता स्तर के करीब पहुँचते हैं, वे अभी भी न्यायाधीशों और अभियोजकों से काफी पीछे हैं और सटीक कानूनी उद्धरण (साइटेशन) के साथ संघर्ष करते हैं।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आप यह परीक्षण करना चाहते हैं कि एआई (AI) की एक नई पीढ़ी के "लॉ स्टूडेंट्स" वास्तव में कितने बुद्धिमान हैं। आप केवल उन्हें वर्णमाला सुनाने के लिए नहीं कह सकते; आपको यह देखने की आवश्यकता है कि क्या वे वास्तव में वास्तविक परीक्षाओं को पास कर सकते हैं और ताइवान में उपयोग किए जाने वाले वास्तविक कानूनी पहेलियों को हल कर सकते हैं।
लेखकों ने बिल्कुल यही किया जो इस शोध पत्र के लेखकों ने किया है। उन्होंने TW-LegalBench नामक एक विशाल परीक्षण मैदान बनाया। इसे एक विशाल, विशिष्ट जिम के रूप में समझें, जिसे विशेष रूप से एआई मॉडलों की ताइवानी कानून (जो कि अमेरिका या यूके की तरह पिछले अदालती मामलों के बजाय, लिखित कोड या नियम पुस्तिका पर आधारित है) को समझने की क्षमता का परीक्षण करने के लिए डिज़ाइन किया गया है।
यहाँ उनके "जिम" और उनके निष्कर्षों का विवरण दिया गया, जिसे सरल उपमाओं का उपयोग करके समझाया गया है:
1. तीन "वर्कआउट स्टेशन"
शोधकर्ताओं ने एआई को केवल एक प्रकार का परीक्षण नहीं दिया। उन्होंने विभिन्न कौशलों को मापने के लिए तीन अलग-अलग स्टेशन स्थापित किए:
स्टेशन A: बहुविकल्पीय प्रश्नोत्तरी (द "ट्रिविया नाइट")
- यह क्या है: पांच वर्षों में फैले वास्तविक सरकारी परीक्षाओं (जैसे बार परीक्षा या नागरिक सेवा परीक्षण) से 16,000 से अधिक प्रश्न।
- चुनौती: एआई को चार विकल्पों में से एक सही उत्तर चुनना होता है।
- ट्विस्ट: उन्होंने केवल यह नहीं पूछा कि "कानून क्या है?" उन्होंने प्रत्येक प्रश्न को उस विशिष्ट कानून के साथ टैग किया जिससे वह आता है (जैसे नियम पुस्तिका का एक विशिष्ट अध्याय)। इससे उन्हें यह देखने में मदद मिली कि क्या एआई विशिष्ट नियमों को याद रखने में अच्छा है या केवल अनुमान लगा रहा है।
स्टेशन B: निबंध परीक्षा (द "लॉ स्कूल फाइनल")
- यह क्या है: 117 खुले प्रश्न जहाँ एआई को केवल एक अक्षर चुनने के बजाय एक पूर्ण कानूनी तर्क लिखना होता है।
- चुनौती: वास्तविक जीवन में, न्यायाधीश और वकील केवल "A" या "B" पर गोला नहीं लगाते; उन्हें यह समझाना पड़ता है कि क्यों।
- ग्रेडिंग: चूंकि मनुष्य 117 निबंधों को तुरंत ग्रेड नहीं कर सकते, इसलिए शोधकर्ताओं ने एक "सुपर-ग्रेडर एआई" (एक अन्य एआई जो न्यायाधीश की भूमिका निभाता है) का उपयोग किया। सुपर-ग्रेडर ने निबंधों की जांच एक सख्त चेकलिस्ट (रूब्रिक) के विरुद्ध की ताकि यह देखा जा सके कि क्या एआई ने सभी आवश्यक कानूनी बिंदुओं को छुआ है, और अच्छे तर्कों के लिए आंशिक क्रेडिट दिया जो एक विवरण चूक गए थे।
स्टेशन C: क्रिस्टल बॉल (द "वर्डिक्ट प्रेडिक्टर")
- यह क्या है: 14,000 से अधिक वास्तविक आपराधिक मामले।
- चुनौती: एआई को अपराध के तथ्य दिए जाते हैं (जैसे, "किसी ने साइकिल चुराई") और उसे दो चीजों की भविष्यवाणी करनी होती है: अंतिम फैसला (दोषी/निर्दोष) और सटीक सजा (जैसे, "3 महीने की जेल" या "$500 का जुर्माना")।
- लक्ष्य: यह देखना कि क्या एआई एक अव्यवस्थित वास्तविक दुनिया की स्थिति को देख सकता है और परिणाम का सही अनुमान लगाने के लिए कानून लागू कर सकता है।
2. परिणाम: किसने कक्षा पास की?
शोधकर्ताओं ने 13 विभिन्न एआई मॉडलों का परीक्षण किया, जो विशाल, शक्तिशाली मॉडलों से लेकर छोटे, विशिष्ट मॉडलों तक विस्तृत थे। यहाँ क्या हुआ:
- "बार परीक्षा" पास करना: शीर्ष एआई मॉडल वकील की बार परीक्षा पास करने के लिए पर्याप्त स्मार्ट थे। यदि ये एआई इंसान होते, तो वे अपना कानूनी लाइसेंस प्राप्त कर लेते! उनका स्कोर इतना अधिक था कि वे शीर्ष 33% परीक्षार्थियों में शामिल थे।
- "जज" का अंतर: हालाँकि, जब बात जज और अभियोजक परीक्षाओं (जो बहुत कठिन हैं और विशेषज्ञता के गहरे स्तर की आवश्यकता होती है) की आई, तो कोई भी एआई पास नहीं हुआ। वे मानव उम्मीदवारों के शीर्ष 1-2% से पीछे रह गए। यह ऐसा है जैसे एआई एक बेहतरीन जूनियर एसोसिएट हो सकता है, लेकिन वह अभी जज बनने के लिए तैयार नहीं है।
- "मेमोरी" बनाम "रीज़निंग" की समस्या:
- अनुमान लगाने में कुशल: एआई अपराध के प्रकार या सामान्य सजा (जैसे, "यह चोरी है, इसलिए यह संभवतः कम जेल की अवधि है") की भविष्यवाणी करने में आश्चर्यजनक रूप से अच्छा था।
- नियमों को उद्धृत करने में कमजोर: जब उन्हें सटीक कानून अनुच्छेद (जैसे, "अनुच्छेद 320, पैराग्राफ 1") उद्धृत करने के लिए कहा गया, तो वे संघर्ष करते दिखे। उन्होंने अक्सर फर्जी कानून बनाए या गलत कानूनों का उल्लेख किया। यह एक ऐसे छात्र की तरह है जो जानता है कि उत्तर "42" है लेकिन वह यह नहीं बता सकता कि पाठ्यपुस्तक के किस पृष्ठ पर है।
- "स्थानीय विशेषज्ञ" का लाभ: दिलचस्प बात यह है कि जो एआई मॉडल विशेष रूप से पारंपरिक चीनी और ताइवानी डेटा पर प्रशिक्षित थे, वे कुछ विशाल, सामान्य-उद्देश्य वाले मॉडलों की तुलना में कठिन निबंध प्रश्नों पर बेहतर प्रदर्शन करते थे। यह एक स्थानीय गाइड की तरह है जो एक विशाल, सामान्य मानचित्र वाले पर्यटक की तुलना में शहर के छिपे हुए रास्तों को बेहतर जानता है।
3. "हैलुसिनेशन" का जाल
सबसे बड़ी खोजों में से एक हैलुसिनेशन (चीजों को बनाना) के बारे में थी।
- "क्रिस्टल बॉल" स्टेशन में, एआई बहुत आत्मविश्वासी थे लेकिन अक्सर उन विशिष्ट कानूनों के बारे में गलत थे जिनका वे उल्लेख करते थे।
- कुछ मॉडलों ने ऐसे कानून बना दिए जो अस्तित्व में नहीं थे (टाइप I त्रुटि), जबकि अन्य ने वास्तविक कानूनों का उल्लेख किया जो उस मामले पर लागू नहीं होते थे (टाइप II त्रुटि)।
- शोध पत्र नोट करता है कि कुछ छोटे मॉडल अपने प्रशिक्षण डेटा से सटीक उत्तरों को याद करके "चीटिंग" करते प्रतीत हुए, बजाय इसके कि वे समस्या के माध्यम से वास्तव में तर्क करें। यह उस छात्र की तरह है जिसने पिछले साल की परीक्षा के लिए उत्तर कुंजी रट ली है लेकिन गणित को समझता नहीं है।
4. मुख्य निष्कर्ष
शोध पत्र निष्कर्ष निकालता है कि हालांकि एआई कानूनी कार्यों में बहुत अच्छा हो रहा है—इतना अच्छा कि यह प्रवेश-स्तर की वकील परीक्षाओं को पास कर सकता है—फिर भी यह मानव न्यायाधीशों या अभियोजकों को बदलने के लिए तैयार नहीं है।
- अच्छा: एआई "ट्रिविया" और सामान्य तर्क को अच्छी तरह से संभाल सकता है।
- बुरा: यह सजा सुनाने और सटीक कानूनों को उद्धृत करने के लिए आवश्यक सटीकता के साथ संघर्ष करता है।
- सबक: एआई को वास्तव में उपयोगी बनाने के लिए, हमें इसे केवल सामान्य ज्ञान पर नहीं, बल्कि विशिष्ट स्थानीय कानूनों और भाषाओं पर अधिक प्रशिक्षित करने की आवश्यकता है।
संक्षेप में, TW-LegalBench एक वास्तविकता की जाँच है। यह दिखाता है कि हालांकि एआई एक शानदार लॉ स्टूडेंट है, लेकिन यह अभी तक एक योग्य जज नहीं है। वह नियमों को जानता है, लेकिन उसे अभी भी एक मानव विशेषज्ञ की तरह सटीकता और देखभाल के साथ उन्हें लागू करना सीखना होगा।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।