BenGER: Benchmarking LLM Systems on Subsumption-Based Legal Reasoning in German Law
यह शोध पत्र BenGER को प्रस्तुत करता है, जो जर्मन कानून में उपसमूह-आधारित (subsumption-based) कानूनी तर्क के मूल्यांकन के लिए LLMs हेतु एक व्यापक बेंचमार्क डेटासेट है, जो यह प्रदर्शित करता है कि क्लोज्ड-फ्लैगशिप मॉडल प्रदर्शन में अग्रणी हैं जबकि मानव-AI सह-सृजन (co-creation) बिना सहायता वाले मानव कार्य से काफी बेहतर प्रदर्शन करता है, और इन सभी की पुष्टि एक सुदृढ़ LLM-as-a-Judge ढांचे के माध्यम से की गई है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आप एक रोबोट को वकील बनना सिखाने की कोशिश कर रहे हैं। लेकिन सिर्फ कोई भी वकील नहीं—एक ऐसा जो जर्मनी की विशिष्ट, कठोर और अत्यधिक संरचित कानूनी प्रणाली में विशेषज्ञता रखता हो। इस प्रणाली में, कानूनी समस्या को हल करना केवल सही उत्तर का अनुमान लगाने के बारे में नहीं है; यह एक सख्त रेसिपी का पालन करने के बारे में है जिसे "सबसमप्शन" (subsumption) कहा जाता है।
इसे एक केक बनाने जैसा समझें जहाँ रेसिपी मांगती है कि आप हर एक सामग्री की सूची बनाएं, स्पष्ट करें कि वह रेसिपी में क्यों फिट बैठती है, और फिर यह साबित करें कि वे अन्य सामग्रियों के साथ कैसे मिलती हैं, इससे पहले कि आप कह सकें, "केक तैयार है।" यदि आप एक भी चरण छोड़ देते हैं या केवल यह कहते हैं कि "यह एक केक है," तो आप असफल हो जाते हैं, भले ही केक स्वादिष्ट हो।
यह शोध पत्र, BenGER, एक विशाल नया परीक्षण है यह देखने के लिए कि क्या आधुनिक AI (लार्ज लैंग्वेज मॉडेल्स) वास्तव में इस सख्त जर्मन कानूनी रेसिपी का पालन कर सकते हैं।
यहाँ बताया गया है कि उन्होंने क्या किया, सरल उपमाओं का उपयोग करते हुए:
1. टेस्ट किचन (डेटासेट)
शोधकर्ताओं ने एक विशाल "टेस्ट किचन" बनाया जिसे BenGER कहा जाता है। इसमें तीन प्रकार की चुनौतियाँ हैं:
- बड़ी परीक्षाएँ (The Big Exams): 596 लंबे, जटिल कानूनी मामले (जैसे कानून के छात्रों के लिए अंतिम परीक्षा) जहाँ AI को एक पूर्ण, संरचित समाधान लिखना होता है।
- त्वरित क्विज़ (The Quick Quizzes): कानूनी सिद्धांतों के बारे में 531 छोटे प्रश्न।
- "बेंचैथॉन" (The Benchathon - मानव बनाम AI लैब): 15 नए विशेष समस्याओं का एक सेट जहाँ उन्होंने केवल AI से उन्हें हल करने के लिए नहीं कहा। उन्होंने वास्तविक मनुष्यों को भी दो तरीकों से उन्हें हल करने के लिए कहा:
- सोलो (Solo): किताबें और इंटरनेट लेकर अकेले काम करने वाले मनुष्य।
- सह-निर्माण (Co-Creation): एक AI सहायक के साथ मिलकर समाधान लिखने के लिए काम करने वाले मनुष्य।
2. जज (उन्होंने उत्तरों को कैसे ग्रेड किया)
कानूनी निबंधों को ग्रेड करना बेहद कठिन काम है। यहाँ तक कि मानव विशेषज्ञ भी अक्सर एक-दूसरे से असहमत होते हैं। एक प्रोफेसर एक पेपर को "A" दे सकता है, जबकि दूसरा उसी काम के लिए उसे "C" दे सकता है।
इसे संभालने के लिए, शोधकर्ताओं ने केवल एक व्यक्ति को AI को ग्रेड करने के लिए नहीं कहा। उन्होंने एक "रोबोट जज" (एक LLM-एज़-ए-जज) बनाया जिसे एक बहुत ही विशिष्ट रूब्रिक (ग्रेडिंग चेकलिस्ट) पर प्रशिक्षित किया गया था।
- रूब्रिक: एक स्कोरकार्ड की कल्पना करें जिसमें 10 श्रेणियाँ हैं, जैसे "क्या आपने सही कानून ढूँढा?", "क्या आपने तथ्यों को कानून से जोड़ा?", और "क्या आपका लेखन व्यवस्थित है?"
- वैलिडेशन (सत्यापन): यह सुनिश्चित करने के लिए कि उनका रोबोट जज पक्षपाती या पागल न हो, उन्होंने अपने स्कोर की तुलना तीन वास्तविक मानव विशेषज्ञों के पैनल से की, जिन्होंने अंधे होकर (blindly) उन्हीं उत्तरों को ग्रेड किया था।
- परिणाम: रोबोट जज आश्चर्यजनक रूप से निष्पक्ष था। जब उन्होंने एक मानव ग्रेडर को हटाकर रोबोट जज को उसकी जगह रखा, तो अंतिम समूह का स्कोर बहुत अधिक नहीं बदला। रोबोट जज एक मानव विशेषज्ञ की तरह ही विश्वसनीय था।
3. परिणाम (कौन जीता?)
उन्होंने 12 अलग-अलग AI सिस्टम का परीक्षण किया, जिनमें सबसे शक्तिशाली "फ्लैगशिप" मॉडल (AI की दुनिया के सुपर-कंप्यूटर) से लेकर छोटे, तेज़ "एफिशिएंसी" मॉडल तक शामिल थे।
- चैंपियंस: बड़े, क्लोज्ड-सोर्स "फ्लैगशिप" मॉडल (जैसे OpenAI, Anthropic और Google के मॉडल) शीर्ष पर रहे। उन्होंने उच्चतम स्कोर प्राप्त किया, और अक्सर शीर्ष कानून के छात्रों के बराबर "पासिंग ग्रेड" प्राप्त किया।
- अंडरडॉग्स: ओपन-सोर्स मॉडल (मुफ्त में डाउनलोड करने योग्य) ठीक-ठाक थे, लेकिन वे आम तौर पर बड़े व्यावसायिक मॉडलों से पीछे रहे।
- जादुई संयोजन (The Magic Combo): सबसे आश्चर्यजनक खोज मानव-AI सह-निर्माण के बारे में थी। जब मनुष्यों को अपने उत्तर लिखने में मदद करने के लिए AI का उपयोग करने की अनुमति दी गई, तो उनके स्कोर आसमान छू गए। उन्होंने न केवल AI के स्तर के प्रदर्शन किया; वे अकेले काम करने वाले मनुष्यों से भी बेहतर प्रदर्शन कर गए, और उन्होंने अकेले काम करने वाले AI को भी पछाड़ दिया। यह एक हाई-टेक मिक्सर का उपयोग करने वाले शेफ की तरह था जो एक ऐसा केक बनाने में सक्षम था जो अकेले शेफ या अकेले मशीन द्वारा बनाए गए केक से बेहतर था।
4. "गॉटचाज़" (क्या पेपर चेतावनी देता है)
लेखक अपनी सीमाओं के बारे में बहुत ईमानदार हैं:
- ब्लैक बॉक्स: उन्होंने AI का परीक्षण उसी रूप में किया है जैसा कि उसे जनता को बेचा जाता है (API के माध्यम से)। वे इसके "इंजन" को देख नहीं सके, इसलिए वे यह नहीं जानते कि एक मॉडल दूसरे से बेहतर क्यों है, बस इतना जानते हैं कि वह बेहतर है।
- रेसिपी विशिष्ट है: यह परीक्षण विशेष रूप से जर्मन कानून के लिए है। जर्मन वकील जिस तरह से सोचते हैं (वह "सबसमप्शन" रेसिपी), वह अमेरिका या यूके के वकीलों के सोचने के तरीके (जो पिछले मामलों पर अधिक निर्भर करते हैं) से अलग है। आप इन परिणामों को लेकर यह नहीं कह सकते कि "यह AI न्यूयॉर्क में एक महान वकील होगा।"
- मेमोराइजेशन (रटने) का जोखिम: कुछ परीक्षण प्रश्न सार्वजनिक जर्नल्स से आए थे। यह संभव है कि AI ने वास्तव में समस्या को "सोचकर" हल करने के बजाय इंटरनेट से उत्तर रट लिए हों। हालाँकि, नए "बेंचैथॉन" प्रश्नों (जिन्हें AI ने पहले नहीं देखा था) ने समान परिणाम दिखाए, जिससे पता चलता है कि AI वास्तव में तर्क सीख रहा है, न कि केवल नकल कर रहा है।
निचोड़ (The Bottom Line)
यह पेपर कहता है: "हमने जर्मन कानूनी तर्क के लिए एक सख्त, निष्पक्ष परीक्षण बनाया है। सर्वश्रेष्ठ AI मॉडल अब नियमों का पालन करने में बहुत अच्छे हैं, लेकिन वे अभी भी पूर्ण नहीं हैं। हालाँकि, जब मनुष्य AI के साथ टीम बनाते हैं, तो वे 'सुपर-लॉयर' बन जाते हैं, जो अकेले मनुष्य और अकेले AI दोनों से बेहतर प्रदर्शन करते हैं।"
उन्होंने यह भी सिद्ध किया कि एक स्मार्ट रोबोट जज इन निबंधों को मानव प्रोफेसरों के एक कमरे के बराबर विश्वसनीयता के साथ ग्रेड कर सकता है, जो भविष्य में कानूनी शिक्षा और परीक्षण को बड़े पैमाने पर बढ़ाने में मदद कर सकता है।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।