← नवीनतम पेपर
💬 NLP

LLM Judges Inconsistently Disagree Across Safety Criteria and Harm Categories

यह शोध पत्र प्रकट करता है कि स्वचालित न्यायाधीश के रूप में उपयोग किए जाने वाले लार्ज लैंग्वेज मॉडल्स (LLMs) महत्वपूर्ण विसंगति और अविश्वसनीयता प्रदर्शित करते हैं, विशेष रूप से वित्त जैसे विनियमित डोमेन में या भाषा और मानदंडों के आधार पर भिन्नता दिखाते हुए, जो सुरक्षा आकलन में सावधानीपूर्वक कार्यान्वयन की आवश्यकता को रेखांकित करता है।

मूल लेखक: Krishnapriya Vishnubhotla, Soumya Vajjala, Akriti Vij, Isar Nejadgholi

प्रकाशित 2026-06-01
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Krishnapriya Vishnubhotla, Soumya Vajjala, Akriti Vij, Isar Nejadgholi

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आपने पेंटिंग्स के एक समूह का न्याय करने के लिए छह अलग-अलग कला समीक्षकों (art critics) का एक पैनल नियुक्त किया है। आप चाहते हैं कि वे इस बात पर सहमत हों कि कौन सी पेंटिंग्स "सुरक्षित" (अच्छी, उपयुक्त) हैं और कौन सी "असुरक्षित" (खराब, हानिकारक) हैं। आप उम्मीद करते हैं कि यदि आप उन्हें एक ही पेंटिंग दिखाएं, या यहाँ तक कि उसका थोड़ा अलग संस्करण भी (जैसे कि अलग फ्रेम में पेंटिंग की फोटो, या कलाकार के नोट का दूसरी भाषा में अनुवाद), तो वे सभी लगभग एक जैसा निर्णय दें।

यह शोध पत्र ठीक इसी का परीक्षण करने के बारे में है, लेकिन कला समीक्षकों के बजाय, यहाँ "जज" लार्ज लैंग्वेज मॉडल्स (AI) हैं, और पेंटिंग्स के बजाय, वे AI द्वारा जनरेट किए गए टेक्स्ट की सुरक्षा का न्याय कर रहे हैं।

यहाँ शोधकर्ताओं द्वारा पाए गए निष्कर्षों का विवरण दिया गया है, जिसे सरल उपमाओं (analogies) का उपयोग करके समझाया गया है:

1. "स्पष्ट बनाम सूक्ष्म" की समस्या (The "Obvious vs. Subtle" Problem)

शोधकर्ताओं ने AI जजों का परीक्षण दो बहुत ही अलग प्रकार के "बुरे" कंटेंट पर किया:

  • "चिल्लाती हुई आग" का परीक्षण (हिंसा): उन्होंने AI को हिंसा, घृणास्पद भाषण (hate speech), या अवैध कृत्यों के बारे में टेक्स्ट का न्याय करने के लिए कहा।
    • परिणाम: AI जज इसमें काफी अच्छे थे। यदि कोई पेंटिंग स्पष्ट रूप से आग की लपटों में थी, तो सभी छह समीक्षक सहमत थे, "यह असुरक्षित है।"
  • "वित्तीय सलाह" का परीक्षण (विनियमित क्षेत्र/Regulated Domains): उन्होंने AI को ऐसे टेक्स्ट का न्याय करने के लिए कहा जहाँ एक AI क्रेडिट स्कोर, वीज़ा आवेदन, या चिकित्सा सलाह जैसी चीजों पर सलाह देता है।
    • परिणाम: AI जज यहाँ बहुत खराब थे। यह एक ऐसे समीक्षक से पूछने जैसा है जो एक ऐसी पेंटिंग का न्याय कर रहा है जो लगभग एक उत्कृष्ट कृति (masterpiece) है लेकिन उसमें एक बहुत छोटी, सूक्ष्म खामी है। एक समीक्षक कहता है, "यह सुरक्षित है, बस थोड़ा जोखिम भरा है," जबकि दूसरा कहता है, "यह खतरनाक है, इसे बाहर फेंको!" वे इस बात पर सहमत नहीं हो सके कि "सुरक्षित" का वास्तव में क्या अर्थ है।

2. "जादुई दर्पण" की समस्या (The "Magic Mirror" Problem - Self-Consistency)

शोधकर्ताओं ने एक ही AI रिस्पॉन्स को लिया और उसे जजों को अलग-अलग "दर्पणों" में दिखाया:

  • अनुवाद (Translation): उन्होंने टेक्स्ट को अंग्रेजी में दिखाया, फिर फ्रेंच में, फिर हिंदी में, आदि।

  • पैराफ्रेसिंग (Paraphrasing): उन्होंने टेक्स्ट को इस तरह से दोबारा लिखा ताकि वह अधिक औपचारिक (formal), अधिक अनौपचारिक (casual) लगे, या वाक्यों का क्रम बदल दिया जाए, बिना वास्तविक अर्थ बदले।

  • परिणाम: जज असंगत (inconsistent) थे। यदि किसी जज ने कहा, "यह अंग्रेजी वाक्य सुरक्षित है," तो वे उसी वाक्य को हिंदी में अनुवादित रूप में देखकर कह सकते थे, "रुको, यह हिंदी संस्करण असुरक्षित है!" या वे एक पैराफ्रेज किए गए संस्करण को देखकर अपना विचार बदल सकते थे।

  • उपमा: एक सुरक्षा गार्ड की कल्पना करें जो लाल शर्ट पहने व्यक्ति को रोकता है लेकिन नीली शर्ट पहने उसी व्यक्ति को अंदर जाने देता है, भले ही वह बिल्कुल वही व्यक्ति हो। AI जज शब्दों के पहनावे (दिखावे) से आसानी से धोखा खा जाते हैं, न कि इस बात से कि शब्द वास्तव में क्या कह रहे हैं।

3. "जूरी" की समस्या (The "Jury" Problem - Cross-Consistency)

शोधकर्ताओं ने यह भी पूछा: "यदि हम उन सभी छह AI जजों को एक साथ एक कमरे में रखें, तो क्या वे एक-दूसरे से सहमत होंगे?"

  • परिणाम: नहीं। यहाँ तक कि एक ही टेक्स्ट और एक ही भाषा को देखते हुए भी, जज अक्सर विपरीत उत्तर देते थे।
  • उपमा: एक ऐसी जूरी की कल्पना करें जहाँ एक व्यक्ति "दोषी" वोट देता है, दूसरा "निर्दोष" वोट देता है, और तीसरा "शायद" वोट देता है। वे सभी एक ही सबूत देख रहे हैं, लेकिन उनके पास अलग-अलग आंतरिक नियम पुस्तिकाएं (rulebooks) हैं कि क्या अपराध माना जाए। शोधपत्र ने पाया कि जटिल विषयों (जैसे वित्तीय सलाह) के लिए, "जूरी" अक्सर पूरी तरह से अराजकता में होती है।

4. "नकली सहमति" का जाल (The "Fake Agreement" Trap)

यह शोध पत्र एक पेचीदा सांख्यिकीय भ्रम (statistical illusion) की ओर इशारा करता है।

  • कभी-कभी, सभी जज 99% समय "सुरक्षित" कहते हैं। यदि आप केवल "हाँ" वोटों को गिनते हैं, तो यह पूर्ण सहमति (100% consistency) जैसा दिखता है।
  • पेंच: लेकिन यदि वे केवल इसलिए "सुरक्षित" कह रहे हैं क्योंकि वे आलसी हैं या पक्षपाती हैं, और वास्तविक विवरणों पर विचार नहीं कर रहे हैं, तो वह वास्तविक सहमति नहीं है। शोधकर्ताओं ने विशेष गणित (जैसे कि "चांस-करेक्टेड" स्कोर) का उपयोग किया है ताकि इस नकली सहमति को हटाया जा सके।
  • उपमा: यह दोस्तों के एक समूह द्वारा ट्रिविया प्रश्न का उत्तर देने के अनुमान जैसा है। यदि उत्तर 99% बार "हाँ" होता है, और वे सभी "हाँ" का अनुमान लगाते हैं, तो वे प्रतिभाशाली दिखते हैं। लेकिन यदि प्रश्न वास्तव में कठिन है और वे केवल सबसे सामान्य उत्तर का अनुमान लगा रहे हैं, तो वे वास्तव में तर्क (reasoning) पर सहमत नहीं हैं। शोधपत्र दिखाता है कि जब आप गहराई से देखते हैं, तो AI जज वास्तव में बहुत अधिक असहमत होते हैं।

मुख्य निष्कर्ष (The Bottom Line)

शोधपत्र निष्कर्ष निकालता है कि जबकि AI जज स्पष्ट, शोर मचाने वाले खतरों (जैसे हिंसा) को पहचानने में ठीक हैं, वे सूक्ष्म, वास्तविक दुनिया की सलाह (जैसे वित्त या कानून) को परखने में अविश्वसनीय और असंगत हैं।

यदि आप जटिल विषयों के लिए सुरक्षा गार्ड के रूप में एक AI का उपयोग करते हैं, तो आप इसके सुसंगत होने पर भरोसा नहीं कर सकते। यह एक खतरनाक उत्तर को केवल इसलिए पास कर सकता है क्योंकि वाक्य की संरचना थोड़ी बदल गई थी, या यह एक सुरक्षित उत्तर को केवल इसलिए अस्वीकार कर सकता है क्योंकि इसे एक अलग भाषा में अनुवादित किया गया था। उच्च-जोखिम वाले निर्णयों के लिए मानवीय निरीक्षण (human oversight) के बिना AI मॉडल्स की "जूरी" वर्तमान में बहुत विभाजित है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →