Testing Frontier LLMs on Indian Statutory Interpretation: The Indian Construction Canon Benchmarking (ICCB) -Pilot Benchmark
यह शोध पत्र भारतीय वैधानिक व्याख्या (statutory interpretation) पर सीमांत (frontier) LLMs का मूल्यांकन करने के लिए ICCB-Pilot बेंचमार्क प्रस्तुत करता है, जो यह प्रकट करता है कि हालांकि मॉडल अक्सर सही कानूनी परिणामों की भविष्यवाणी कर सकते हैं, वे अंतर्निहित निर्माण के सिद्धांतों (canons of construction) को सही ढंग से पहचानने और लागू करने में विफल रहते हैं, जो यह सुझाव देता है कि उनका तर्क वास्तविक विधिशास्त्रीय समझ के बजाय सतही पैटर्न-मैचिंग पर निर्भर है।
मूल पेपर CC BY 4.0 (https://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कानून की दुनिया में, किसी कानून को पढ़ना शब्दकोश की परिभाषा पढ़ने जितना सरल नहीं होता है। जब कोई न्यायाधीश किसी अस्पष्ट या संदिग्ध कानून का सामना करता है, तो वे केवल उत्तर का अनुमान नहीं लगाते; बल्कि वे "निर्माण के सिद्धांतों" (canons of construction) के रूप में जाने जाने वाले विशिष्ट मानसिक उपकरणों का पालन करते हैं। ये स्थापित नियम या दिशा-निर्देश हैं जो यह मार्गदर्शन करते हैं कि किसी पाठ को कैसे समझा जाना चाहिए। उदाहरण के लिए, एक नियम यह हो सकता है कि यदि कोई कानून किसी को दंडित करने के लिए बनाया गया है, तो इसे बहुत सख्ती से, शब्द दर शब्द पढ़ा जाना चाहिए। दूसरा नियम यह हो सकता है कि यदि कोई कानून गरीबों की मदद के लिए बनाया गया है, तो इसे व्यापक रूप से पढ़ा जाना चाहिए ताकि इसमें अधिक से अधिक लोग शामिल हो सकें। ये उपकरण ही वह अंतर हैं जो एक न्यायाधीश द्वारा पिछले मामले को केवल याद करने और एक न्यायाधीश द्वारा एक नई समस्या पर तर्क करने के बीच का अंतर स्पष्ट करते हैं। जैसे-जैसे आर्टिफिशियल इंटेलिजेंस सिस्टम कोर्टरूम और कानूनी कार्यालयों में प्रवेश कर रहे हैं, एक महत्वपूर्ण प्रश्न उठता है: क्या ये मशीनें वास्तव में इन उपकरणों का उपयोग करना जानती हैं, या वे केवल उन पैटर्न के आधार पर सही उत्तर का अनुमान लगाने में बहुत अच्छी हैं जिन्हें उन्होंने पहले देखा है?
भारत के मणिपाल एकेडमी ऑफ हायर एजुकेशन के शोधकर्ताओं की एक टीम ने नवीनतम पीढ़ी के आर्टिफिशियल इंटेलिजेंस मॉडल का उपयोग करके इस प्रश्न का परीक्षण करने का निर्णय लिया। उन्होंने एक विशेष परीक्षण बनाया, जिसे वे एक बेंचमार्क कहते हैं, जो पूरी तरह से इस बात पर केंद्रित है कि ये मशीनें भारतीय कानूनों की व्याख्या कैसे करती हैं। कंप्यूटरों से केवल किसी मामले के परिणाम की भविष्यवाणी करने के बजाय, शोधकर्ताओं ने उनसे उनके सोचने की प्रक्रिया को समझाने के लिए कहा। परीक्षण में मॉडलों के सामने वास्तविक भारतीय अदालती निर्णयों से लिए गए चालीस अलग-अलग कानूनी परिदृश्य प्रस्तुत किए गए। प्रत्येक परिदृश्य में, मॉडल को यह पहचानना था कि किस विशिष्ट व्याख्या नियम का उपयोग किया जाना चाहिए, उस नियम को सही ढंग से समझाना था, और फिर निष्कर्ष तक पहुँचने के लिए उसे तथ्यों पर लागू करना था। शोधकर्ताओं ने मॉडलों का मूल्यांकन पांच अलग-अलग पहलुओं पर किया: क्या उन्होंने सही नियम चुना, क्या उन्होंने भारतीय परंपरा के अनुसार उस नियम का सटीक वर्णन किया, क्या उन्होंने तथ्यों पर उसे सही ढंग से लागू किया, क्या वे सही अंतिम उत्तर तक पहुँचे, और उनकी समग्र तर्क प्रक्रिया कितनी स्पष्ट थी।
परिणामों ने मशीनों द्वारा किए जा जाने वाले कार्यों और उनके काम करने के तरीके के बीच एक चौंकाने वाली खाई को प्रकट किया। परीक्षण किए गए सबसे शक्तिशाली आर्टिफिशियल इंटेलिजेंस मॉडल सही अंतिम उत्तर प्राप्त करने में आश्चर्यजनक रूप से अच्छे थे। कई मामलों में, वे उसी निष्कर्ष पर पहुँचे जो एक मानव न्यायाधीश तक पहुँचता। हालाँकि, जब शोधकर्ताओं ने यह देखा कि वे वहाँ कैसे पहुँचे, तो तस्वीर बदल गई। मॉडल अक्सर उस विशिष्ट कानूनी नियम को पहचानने में विफल रहे जिसका वे उपयोग कर रहे थे। वे अक्सर सही परिणाम तक पहुँच जाते थे बिना यह जाने कि उन्हें उपयोग करने के लिए सही उपकरण कौन सा है, जो यह सुझाव देता है कि वे किसी तार्किक पथ का पालन करने के बजाय किसी परिचित पैटर्न से स्थिति का मिलान कर रहे थे। यह वैसा ही है जैसे कोई छात्र एक जटिल गणित की समस्या को सही ढंग से हल कर सकता है लेकिन यह नहीं समझा सकता कि उसने किस सूत्र का उपयोग किया या वह क्यों काम करता है। अध्ययन में पाया गया कि जब शोधकर्ताओं ने मॉडलों को स्पष्ट रूप से बताया कि किस नियम का उपयोग करना है, तो मॉडल उस नियम का नाम बताने में बहुत बेहतर हो गए, लेकिन उनकी इसे समझाने या लागू करने की क्षमता में कोई महत्वपूर्ण सुधार नहीं हुआ। यह सुझाव देता है कि मॉडलों के पास इन कानूनी नियमों का ज्ञान है लेकिन वे बिना किसी प्रत्यक्ष संकेत के स्वयं उस तक पहुँचने में संघर्ष करते हैं।
शोधकर्ताओं ने यह भी देखा कि प्रश्न पूछने के तरीके के आधार पर मॉडल अलग-अलग व्यवहार करते हैं। जब उन्हें स्वतंत्र रूप से समस्या को सुलझाने के लिए छोड़ा गया, तो मॉडल अक्सर हिचकिचाते थे या उत्तर देने से मना कर देते थे, विशेष रूप से परीक्षण किए गए ओपन-सोर्स मॉडल। हालाँकि, जब शोधकर्ताओं ने उन्हें नियम के प्रकार के बारे में कोई संकेत दिया, तो मॉडल अधिक सक्रिय होने लगे। इस तत्परता में सुधार के बावजूद, मूल मुद्दा बना रहा: मॉडल सही तर्क बनाने के बजाय सही परिणाम का अनुमान लगाने में अधिक बेहतर थे। एक मॉडल ने, विशेष रूप रूप से, कानूनी सिद्धांत को सही ढंग से पहचानने की तुलना में सही परिणाम तक अधिक बार पहुँचा, फिर भी उसने अपने अंतिम निष्कर्षों में महत्वपूर्ण त्रुटियाँ कीं। एक सही उत्तर और एक सही तर्क प्रक्रिया के बीच यह अलगाव एक महत्वपूर्ण खोज है। यह संकेत देता है कि यदि इन प्रणालियों को केवल उनके परिणामों की भविष्यवाणी करने की क्षमता के आधार पर वास्तविक कानूनी सेटिंग्स में तैनात किया जाता है, तो वे गलत कारणों से सही उत्तर दे सकते हैं, जो एक ऐसी प्रणाली में खतरनाक हो सकता है जहाँ परिणाम के साथ-साथ तर्क स्वयं भी उतना ही महत्वपूर्ण है।
अध्ययन यह निष्कर्ष निकालता है कि हालांकि ये आर्टिफिशियल इंटेलिजेंस सिस्टम शक्तिशाली उपकरण हैं, लेकिन उन्होंने अभी तक कानूनी व्याख्या के लिए आवश्यक विशिष्ट प्रकार के तर्क में महारत हासिल नहीं की है। वे कानूनी नियमों के चरण-दर-चरण अनुप्रयोग के बजाय पैटर्न पहचान पर बहुत अधिक निर्भर दिखाई देते हैं, जैसा कि मानव न्यायाधीशों द्वारा किया जाता है। शोधकर्ता इस बात पर जोर देते हैं कि इसका मतलब यह नहीं है कि तकनीक बेकार है, बल्कि इसका मतलब यह है कि हम इन प्रणालियों पर केवल इसलिए भरोसा नहीं कर सकते क्योंकि वे सही उत्तर देती हैं क्योंकि वे तर्क करती हैं। यह अध्ययन एक पायलट के रूप में कार्य करता है, एक छोटा-सा परीक्षण जिसे यह सिद्ध करने के लिए डिज़ाइन किया गया है कि इस प्रकार का मूल्यांकन संभव और आवश्यक है। टीम भविष्य में अधिक मॉडलों और विभिन्न प्रकार के कानूनों का परीक्षण करने के लिए इस कार्य का विस्तार करने की योजना बना रही है ताकि यह देखा जा सके कि क्या ये पैटर्न सभी पर समान रूप से लागू होते हैं। फिलहाल, निष्कर्ष एक स्पष्ट चेतावनी देते हैं: कानून की जटिल दुनिया में, सही उत्तर प्राप्त करना पर्याप्त नहीं है; मशीन को अपना काम भी दिखाना होगा।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।