← नवीनतम पेपर
💬 NLP

A Two-Phase Stability Study of LLM Judges and Bar Council Examiners on Thai Bar-Exam Free-Form Essays

यह अध्ययन प्रकट करता है कि जहाँ स्पष्ट रूब्रिक्स वाले थाई बार-परीक्षा निबंधों पर एलएलएम (LLM) निर्णायक और मानव परीक्षक अभिसरित होते हैं, वहीं एलएलएम अस्पष्ट मामलों में अल्पसंख्यक मानव व्याख्या को पुनरुत्पादित करने में व्यवस्थित रूप से विफल रहते हैं, बल्कि इसके बजाय वे समान रूप से बहुमत मानव दृष्टिकोण के साथ संरेखित हो जाते हैं और इस प्रकार विशेषज्ञ असहमति के पूर्ण स्पेक्ट्रम को पकड़ने की अपनी अक्षमता को छिपा देते हैं।

मूल लेखक: Pawitsapak Akarajaradwong, Wuttikrai Lertprasertphakorn, Chompakorn Chaksangchaichot, Sarana Nutanong

प्रकाशित 2026-05-26
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Pawitsapak Akarajaradwong, Wuttikrai Lertprasertphakorn, Chompakorn Chaksangchaichot, Sarana Nutanong

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप कानूनी निबंधों की गुणवत्ता को परखने के लिए एक उच्च-दांव वाला प्रतियोगिता चला रहे हैं। आपके पास एक बहुत ही विशिष्ट नियम पुस्तिका (रूब्रिक) है जो ग्रेडर को उत्तरों को स्कोर करने के लिए बताती है। आमतौर पर, नियम पुस्तिका स्पष्ट होती है: यदि उत्तर सही है, तो उच्च स्कोर दें; यदि तर्क खराब है, तो कम स्कोर दें।

लेकिन कभी-कभी, नियम पुस्तिका एक "ग्रे ज़ोन" (धुंधले क्षेत्र) में फंस जाती है। यह यह नहीं बताता कि क्या करना है जब एक छात्र सही अंतिम उत्तर तो प्राप्त कर लेता है लेकिन एक विशिष्ट, महत्वपूर्ण कानून उद्धरण (citation) का उल्लेख करना भूल जाता है। यह "विनियम-मौन" (regulation-silent) क्षेत्र है।

यह शोधपत्र एक दो-भाग वाला प्रयोग है यह देखने के लिए कि मनुष्य और आर्टिफिशियल इंटेलिजेंस (AI) इस ग्रे ज़ोन को कैसे संभालते हैं।

भाग 1: "परीक्षा" (चरण 1)

सबसे पहले, शोधकर्ताओं ने 8 अलग-अलग AI मॉडल को "छात्र की सीट" पर बैठाया। उन्हें 42 वास्तविक थाई कानून के छात्रों की तरह कानूनी निबंध लिखने थे। इन AI मॉडल को मानव विशेषज्ञों द्वारा नेत्रहीन (blindly) रूप से ग्रेड किया गया।

  • परिणाम: AI मॉडल औसत मानव छात्र के बराबर प्रदर्शन करते थे। कुछ बेहतरीन थे, कुछ औसत थे, और कुछ संघर्ष कर रहे थे। वे सभी "खेल में शामिल" थे।

भाग 2: "ग्रेडिंग" (चरण 2)

इसके बाद, शोधकर्ताओं ने उन्हीं निबंधों को लिया और दो समूहों से उन्हें ग्रेड करने के लिए कहा:

  1. मानव पैनल: तीन वास्तविक, प्रमाणित कानूनी परीक्षक।
  2. AI पैनल: 26 विभिन्न AI मॉडल का एक विशाल समूह (जिनमें वे मॉडल भी शामिल थे जिन्होंने पहले परीक्षा दी थी, साथ ही कई अन्य)।

उन्होंने सभी को देखने के लिए ठीक वही चार चीजें दीं: प्रश्न, नियम पुस्तिका, "आदर्श" उत्तर कुंजी, और छात्र का निबंध।

बड़ी खोज: "एकतरफा रास्ता" (The One-Way Street)

शोधकर्ताओं ने एक दिलचस्प विभाजन पाया, लेकिन केवल उन कठिन प्रश्नों पर जहाँ नियम पुस्तिका मौन थी।

मानव विभाजन:
तीनों मानव विशेषज्ञों में सहमति नहीं थी।

  • दो विशेषज्ञों (B और C) ने कहा: "छात्र ने मुख्य बात सही पकड़ी है और तर्क पर्याप्त रूप से अच्छा है। उन्हें उच्च स्कोर (6-8) दें।"
  • एक विशेषज्ञ (A) ने कहा: "छात्र एक महत्वपूर्ण उद्धरण भूल गया है। यह तर्क को 'अनुपयोगी' बनाता है। उन्हें बहुत कम स्कोर (1-2) दें।"
  • इसे एक स्पोर्ट्स रेफरी की तरह समझें: दो रेफरी कहते हैं कि खिलाड़ी "इन बाउंड्स" है, और एक कहता है कि खिलाड़ी "आउट ऑफ बाउंड्स" है। दोनों एक ही नियम पुस्तिका का उपयोग कर रहे हैं, लेकिन वे ग्रे ज़ोन की व्याख्या अलग-अलग तरीके से करते हैं।

AI विभाजन (असममितता/Asymmetry):
यहाँ मामला अजीब हो गया। शोधकर्ता उम्मीद कर रहे थे कि 26 AI मॉडल विभाजित होंगे, शायद कुछ सख्त मानव (A) का पक्ष लेंगे और कुछ उदार मनुष्यों (B और C) का।

  • वे ऐसा नहीं हुआ।
  • 26 में से 22 AI मॉडल उदार मनुष्यों (B और C) के पक्ष में थे। उन्होंने उच्च स्कोर दिए।
  • 3 AI मॉडल भ्रमित थे और उन्होंने मध्यम स्कोर दिए।
  • शून्य AI मॉडल सख्त मानव (A) के पक्ष में थे। यहाँ तक कि जिस एक AI ने सख्त होने की कोशिश की (GPT-5.4 Nano), वह भी सख्त मानव की शैली से मेल खाने के लिए पर्याप्त सुसंगत नहीं था।

रूपक (Metaphor):
कल्पना कीजिए कि 26 अलग-अलग कैमरे एक पेंटिंग की फोटो ले रहे हैं।

  • तीन मानव कला समीक्षक पेंटिंग को देखते हैं और असहमत होते हैं: दो कहते हैं कि यह एक उत्कृष्ट कृति है, एक कहता है कि यह एक विफलता है।
  • आप 26 कैमरों से पेंटिंग का वर्णन करने के लिए कहते हैं।
  • परिणाम: सभी 26 कैमरे उन दो आलोचकों के पक्ष में सहमत होते हैं जिन्होंने इसे उत्कृष्ट कृति कहा। कोई भी कैमरा उस आलोचक के पक्ष में नहीं था जिसने इसे विफलता बताया। भले ही कैमरे अलग-अलग ब्रांड, आकार और कीमत के हों, वे सभी पेंटिंग को एक ही तरह से "देखते" हैं, और वे सख्त आलोचक के दृष्टिकोण को पूरी तरह से अनदेखा कर देते हैं।

यह क्यों मायने रखता है?

शोधपत्र तर्क देता है कि जब हम निबंधों को ग्रेड करने के लिए AI सिस्टम बनाते हैं, तो हम आमतौर पर उस AI को चुनते हैं जो "औसत" मानव ग्रेडर के साथ सबसे अधिक सहमत होता है।

  • क्योंकि इस अध्ययन में अधिकांश मनुष्य (3 में से 2) उदार थे, इसलिए AI ने भी उदार होना सीख लिया।
  • AI ने संतुलित तरीके से "निष्पक्ष" होना नहीं सीखा; इसने असममित (asymmetric) होना सीखा। यह बहुमत के विचार पर केंद्रित हो गया और बहुमत के विचार को पूरी तरह से अनदेखा कर दिया, भले ही वह अल्पसंख्यक विचार एक वैध, कानूनी व्याख्या थी।

"दोहरी भूमिका" का आश्चर्य

शोधकर्ताओं ने AI के व्यक्तित्व के बारे में भी कुछ अजीब देखा।

  • वे AI मॉडल जो चरण 1 में खराब छात्र थे (उनके अपने निबंधों पर कम स्कोर मिले), वे चरण 2 में सबसे सुसंगत उदार जज बने।
  • जो AI मॉडल चरण 1 में बेहतरीन छात्र थे, वे केवल "ठीक-ठाक" जज बने।
  • सबक: उत्तर लिखने में अच्छा होना आपको उत्तर ग्रेड करने में अच्छा नहीं बनाता। ये कौशल पूरी तरह से अलग हैं।

निष्कर्ष

अध्ययन दिखाता है कि AI जज बहुत स्थिर और एक-दूसरे के साथ सुसंगत हैं, लेकिन उनमें एक ब्लाइंड स्पॉट (अंध बिंदु) है। जब मानव विशेषज्ञ एक ग्रे-एरिया नियम पर असहमत होते हैं, तो AI बीच का रास्ता नहीं निकालता या सभी वैध विचारों का पता नहीं लगाता। इसके बजाय, यह भारी रूप से "बहुमत" के मानव विचार को चुनता है और अल्पसंख्यक विचार को पूरी तरह से अनदेखा कर देता है।

यदि आप निबंधों को ग्रेड करने के लिए AI का उपयोग करते हैं, तो आप केवल एक दूसरी राय नहीं प्राप्त कर रहे हैं; आप एक ऐसा दर्पण प्राप्त कर रहे हैं जो बहुमत के विचार को इतनी मजबूती से दर्शाता है कि वह अल्पसंख्यक विचार को पूरी तरह से गायब कर देता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →