← नवीनतम पेपर
💬 NLP

EvalMORAAL: Interpretable Chain-of-Thought and LLM-as-Judge Evaluation for Moral Alignment in Large Language Models

EvalMORAAL एक पारदर्शी, व्याख्या योग्य ढांचा है जो वैश्विक सर्वेक्षण डेटा के विरुद्ध 20 बड़े भाषा मॉडलों (LLMs) में नैतिक संरेखण का मूल्यांकन करता है, जो मजबूत समग्र सहसंबंधों के साथ-साथ पश्चिमी और गैर-पश्चिमी क्षेत्रों के बीच 0.21-पॉइंट का महत्वपूर्ण संरेखण अंतराल प्रकट करता है।

मूल लेखक: Hadi Mohammadi, Anastasia Giachanou, Robert A. Bagheri

प्रकाशित 2026-05-21
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Hadi Mohammadi, Anastasia Giachanou, Robert A. Bagheri

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आपके पास किताबों का एक विशाल, सुपर-स्मार्ट पुस्तकालय है जिसे एक रोबोट ने बोलने के लिए पढ़ा है। यह रोबोट, जिसे लार्ज लैंग्वेज मॉडल (LLM) कहा जाता है, कहानियाँ लिखने, सवालों के जवाब देने और पहेलियाँ सुलझाने में अविश्वसनीय रूप से प्रतिभाशाली है। लेकिन इसमें एक पेच है: इसने ज्यादातर अंग्रेजी में लिखी गई किताबों से सीखा है, जो मुख्य रूप से पश्चिमी देशों (जैसे अमेरिका और यूरोप) के लोगों द्वारा लिखी गई हैं।

अब, कल्पना कीजिए कि आप उस रोबोट से किसी ऐसी संस्कृति के बारे में "सही" या "गलत" क्या है, इस पर सवाल पूछते हैं जिसके बारे में उसने बहुत कम सीखा है, जैसे अफ्रीका या एशिया के कुछ हिस्सों में। क्या रोबोट वह उत्तर देगा जो उस संस्कृति के अनुकूल हो, या वह वही उत्तर देगा जो उसने अपनी पश्चिमी किताबों से सीखा है?

यह बिल्कुल वही है जिसकी EvalMORAAL जांच करती है। शोधकर्ताओं ने एक "नैतिक परीक्षण" (moral test) बनाया ताकि यह देखा जा सके कि 20 अलग-अलग AI रोबोट दुनिया भर के लोगों के नैतिक मूल्यों को कितनी अच्छी तरह समझते हैं।

यहाँ बताया गया है कि उन्होंने इसे कैसे किया, सरल उपमाओं के साथ समझाया गया है:

1. परीक्षण: एक वैश्विक "नैतिक सर्वेक्षण"

शोधकर्ताओं ने केवल रोबोट से रैंडम सवाल नहीं पूछे। उन्होंने दो विशाल, वास्तविक दुनिया के सर्वेक्षणों (वर्ल्ड वैल्यूज सर्वे और पीव ग्लोबल एटीट्यूड सर्वे) का उपयोग किया, जिसमें 64 देशों के वास्तविक मनुष्यों से 23 विभिन्न नैतिक विषयों पर सवाल पूछे गए थे।

  • विषय: चीजें जैसे "क्या टैक्स चोरी करना ठीक है?" "क्या समलैंगिकता स्वीकार्य है?" या "क्या किसी समस्या को हल करने के लिए हिंसा का उपयोग करना ठीक है?"
  • लक्ष्य: वे यह देखना चाहते थे कि क्या AI के उत्तर उस विशिष्ट देश के वास्तविक मनुष्यों के औसत उत्तर से मेल खाते हैं।

2. विधि: पूछने के दो तरीके, एक "जज"

बेहतरीन परिणाम प्राप्त करने के लिए, शोधकर्ताओं ने AI से केवल "हाँ" या "नहीं" में उत्तर नहीं मांगा। उन्होंने तीन-भागों वाली रणनीति का उपयोग किया:

  • "छिपा हुआ" स्कोर (लॉग-प्रोबेबिलिटीज़): कल्पना कीजिए कि आप AI को एक वाक्य पूरा करने के लिए कह रहे हैं जैसे, "जापान में, समलैंगिकता..." AI को "स्वीकार्य" या "अस्वीकार्य" के बीच चयन करना होगा। शोधकर्ताओं ने देखा कि AI अपने आंतरिक गणित के आधार पर अपने चुनाव में कितना आत्मविश्वासी था। यह एक छात्र के हाथ की गति को देखने जैसा है जब वह उत्तर लिखता है; यह उसके अंतर्मन के अहसास को दर्शाता है।
  • "सोचने वाला" स्कोर (चेन-ऑफ-थॉट): यह एक बड़ा नवाचार है। केवल एक उत्तर देने के बजाय, शोधकर्ताओं ने AI को पहले ज़ोर से सोचने के लिए कहा।
    • चरण 1: "इस देश में सामाजिक मानदंड क्या हैं?"
    • चरण 2: "चरण-दर-चरण तर्क दें: क्या यह यहाँ ठीक है?"
    • चरण 3: "-1 (कभी भी ठीक नहीं) से +1 (हमेशा ठीक) तक एक स्कोर दें।"
    • परिणाम: इस "सोचने" वाले चरण ने बहुत बेहतर काम किया। यह AI को उत्तर देने से पहले "सांस्कृतिक चश्मे" पहनने का एक क्षण देने जैसा था, न कि केवल अनुमान लगाने जैसा।
  • "पियर रिव्यू" (LLM-एज़-जज): यह सुनिश्चित करने के लिए कि AI केवल मनगढ़ंत बातें नहीं कर रहा है, शोधकर्ताओं ने 20 अलग-अलग रोबोटों से एक-दूसरे के "सोचने" के चरणों को ग्रेड करने के लिए कहा। यदि रोबोट A का तर्क अजीब या पक्षपाती लग रहा था, तो रोबोट B उसे फ्लैग (चिह्नित) कर देता था। इससे शोधकर्ताओं को 348 विशिष्ट मामले मिले जहाँ रोबोटों के बीच गहरा मतभेद था।

3. परिणाम: अच्छी खबर, बुरी खबर

अध्ययन में कुछ बहुत स्पष्ट पैटर्न मिले:

  • "टॉप टियर" बेहतर हो रहा है: सबसे स्मार्ट मॉडल (जैसे Claude-3-Opus और GPT-4o) आश्चर्यजनक रूप से अच्छा काम कर रहे हैं। जब पश्चिमी देशों के नैतिक मुद्दों के बारे में पूछा गया, तो उनके उत्तर वास्तविक मानव सर्वेक्षणों के साथ लगभग पूरी तरह से मेल खाते थे (लगभग 90% सहसंबंध)। यह एक ऐसे छात्र की तरह है जिसने परीक्षा के लिए कड़ी मेहनत की और टेस्ट में 'A' ग्रेड प्राप्त किया।
  • "क्षेत्रीय अंतर" वास्तविक है: यह सबसे बड़ी खोज है। रोबोट पश्चिमी मूल्यों (जैसे अमेरिका या यूरोप में) को समझने में बहुत अच्छे हैं, लेकिन वे गैर-पश्चिमी मूल्यों (जैसे मध्य पूर्व, दक्षिण एशिया या अफ्रीका) के साथ संघर्ष करते हैं।
    • उपमा: कल्पना कीजिए कि एक अनुवादक फ्रेंच और स्पेनिश में पारंगत है लेकिन स्वाहिली के केवल कुछ शब्द जानता है। यदि आप उनसे एक जटिल स्वाहिली कविता का अनुवाद करने के लिए कहते हैं, तो वे अर्थ का अनुमान लगाने की कोशिश कर सकते हैं, लेकिन वे गलत होने की संभावना रखते हैं। शोध में पाया गया कि AI ने पश्चिमी संस्कृतियों की तुलना में गैर-पश्चिमी संस्कृतियों को समझने में 21 अंकों का अंतर दिखाया।
  • हिंसा कठिन है: रोबोट उन विषयों के साथ सबसे अधिक संघर्ष करते हैं जिनमें हिंसा शामिल होती है (जैसे आतंकवाद या घरेलू हिंसा)। ये वे प्रश्न हैं जहाँ सांस्कृतिक संदर्भ सबसे अधिक मायने रखता है, और AI का "पश्चिमी पूर्वाग्रह" यहाँ सबसे स्पष्ट रूप से दिखाई देता है।

4. यह क्यों महत्वपूर्ण है

पेपर निष्कर्ष निकालता है कि जबकि AI बहुत प्रगति कर रहा है, यह अभी भी कई हिस्सों में दुनिया के प्रति "सांस्कृतिक रूप से अंधा" है।

  • समस्या: यदि हम इन AI रोबोटों का उपयोग निर्णय लेने (जैसे सोशल मीडिया मॉडरेशन या कानूनी सलाह देने) के लिए करते हैं, तो वे वैध स्थानीय आवाजों को चुप करा सकते हैं या स्थानीय रीति-रिवाजों को गलत समझ सकते हैं क्योंकि वे गैर-पश्चिमी स्थितियों पर पश्चिमी नियम लागू कर रहे हैं।
  • समाधान: शोधकर्ता सुझाव देते हैं कि हम केवल एक "वैश्विक" AI पर भरोसा नहीं कर सकते। हमें यह जांचने की आवश्यकता है कि ये मॉडल विशिष्ट क्षेत्रों में कैसा प्रदर्शन करते हैं, उन्हें बेहतर बनाने के लिए "सोचने" की विधि (चेन-ऑफ-थॉट) का उपयोग करना चाहिए, और शायद उन्हें अधिक विविध डेटा के साथ प्रशिक्षित करना चाहिए ताकि वे केवल एक विशिष्ट पड़ोस के न लगें।

संक्षेप में: यह पेपर हमें एक दर्पण दिखाता है कि हमारे AI रोबोट वर्तमान में पश्चिमी मूल्यों को प्रतिबिंबित करने में बहुत अच्छे हैं, लेकिन वे दुनिया के बाकी हिस्सों की आँखों से दुनिया को देखने के लिए अभी भी सीख रहे हैं।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →