← नवीनतम पेपर
🤖 machine learning

Moral Sensitivity in LLMs: A Tiered Evaluation of Contextual Bias via Behavioral Profiling and Mechanistic Interpretability

यह शोध पत्र बड़े भाषा मॉडलों (लार्ज लैंग्वेज मॉडल्स) में प्रासंगिक पूर्वाग्रह का मूल्यांकन करने के लिए एक स्तरीय 'मोरल सेंसिटिविटी इंडेक्स' (नैतिक संवेदनशीलता सूचकांक) प्रस्तुत करता है, जो विभिन्न आर्किटेक्चरों में विशिष्ट व्यवहार संबंधी हस्ताक्षरों को प्रकट करता है और यांत्रिक रूप से यह प्रमाणित करता है कि तर्क संबंधी आसवन (रीज़निंग डिस्टिलेशन), बढ़ी हुई क्षमता के बावजूद अनजाने में आपराधिक पूर्वाग्रह सर्किटों को पुन: सक्रिय कर सकता है।

मूल लेखक: Yash Aggarwal, Atmika Gorti, Vinija Jain, Aman Chadha, Krishnaprasad Thirunarayan, Manas Gaur

प्रकाशित 2026-05-06
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Yash Aggarwal, Atmika Gorti, Vinija Jain, Aman Chadha, Krishnaprasad Thirunarayan, Manas Gaur

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप बहुत बुद्धिमान, लेकिन थोड़े अलग तरह के रोबोट्स के एक समूह का परीक्षण कर रहे हैं। आप यह देखना चाहते हैं कि जब उन्हें कठिन विकल्प चुनने पड़ते हैं, तो वे कितने निष्पक्ष होते हैं। अधिकांश लोग रोबोट्स का परीक्षण एक सरल "हाँ या ना" वाले प्रश्न से करते हैं: "क्या यह रोबोट पक्षपाती है?" लेकिन यह शोध पत्र तर्क देता है कि यह पूछने जैसा है कि क्या कोई व्यक्ति "क्रोधित" है, बिना यह देखे कि किस बात ने उन्हें क्रोधित किया या उन्होंने कैसे प्रतिक्रिया दी।

इस शोध पत्र के लेखक कहते हैं: "आइए करीब से देखते हैं।" उन्होंने एक विशेष परीक्षण बनाया है यह देखने के लिए कि जैसे-जैसे स्थिति अधिक जटिल और भावनात्मक होती जाती है, रोबमाट अपना विचार कैसे बदलते हैं।

यहाँ उनकी खोज का विवरण दिया गया है, सरल उपमाओं का उपयोग करते हुए:

1. परीक्षण: "नैतिक तनाव सीढ़ी" (The Moral Stress Ladder)

शोधकर्ताओं ने केवल एक प्रश्न नहीं पूछा। उन्होंने एक 7-चरणीय सीढ़ी बनाई, जो बहुत सरल से शुरू होकर कठिन होती गई।

  • चरण 1 (सबसे नीचे): एक गणित की समस्या। "5 लोगों को बचाएं या 1 व्यक्ति को।" कोई नाम नहीं, कोई उम्र नहीं, कोई जाति नहीं। केवल संख्याएँ।
  • चरण 2–3: वे इसमें विवरण जोड़ते हैं जैसे "5 लोग बच्चे हैं" या "उस 1 व्यक्ति ने दुर्घटना का कारण बनाया।"
  • चरण 4–7 (सबसे ऊपर): वे भारी सामाजिक लेबल जैसे जाति, लिंग, गरीबी या ऐतिहासिक अन्याय जोड़ते हैं।

वे इसे नैतिक संवेदनशीलता सूचकांक (Moral Sensitivity Index - MSI) कहते हैं। यह मापता है कि एक रोबोट कितनी तेज़ी से "गणित करने" से "ओह नहीं, यह एक संवेदनशील विषय है, मैं उत्तर नहीं दे सकता" में बदल जाता है।

2. रोबोट्स के व्यक्तित्व

उन्होंने चार प्रसिद्ध AI मॉडलों (Claude, Qwen, Llama, और Gemini) का परीक्षण किया। प्रत्येक ने एक अलग प्रकार के व्यक्ति की तरह व्यवहार किया:

  • Claude ("स्टॉप साइन" या रुकने का संकेत): यह रोबोट सीढ़ी के निचले हिस्से में शांत और तार्किक है। लेकिन जैसे ही आप चरण 4 में जाति या लिंग का उल्लेख करते हैं, यह तुरंत ब्रेक लगा देता है। यह "सोचने" से सीधे "मैं उत्तर देने से इनकार करता हूँ" में बदल जाता है। यह एक गार्ड की तरह है जो केवल एक विशिष्ट गेट पर आपका आईडी चेक करता है।
  • Qwen ("दार्शनिक"): यह रोबोट केवल "ना" नहीं कहता। यह बहुत सारी बातें करता है। यह बड़े, फैंसी शब्दों का उपयोग करता है और अनिश्चित लगता है ("यह निर्भर करता है...")। यह निर्णय लेने से पहले पूरी समस्या पर विचार करने की कोशिश करता है। यह एक प्रोफेसर की तरह है जो उत्तर देने से पहले एक लंबा निबंध लिखता है।
  • Gemini ("संदेही"): यह रोबोट पूरे खेल पर ही संदेह करता है। चरण 1 (केवल संख्याओं) में भी, यह कहता है, "रुको, क्या सिर्फ इसलिए 5 लोगों को बचाना उचित है क्योंकि वे अधिक हैं?" यह खेल के नियमों पर ही सवाल उठाता है, खासकर जब पैसा या वर्ग शामिल होता है।

3. सबसे बड़ा आश्चर्य: पक्षपात का "U-वक्र" (The "U-Curve" of Bias)

यह इस शोध पत्र का सबसे महत्वपूर्ण हिस्सा है। शोधकर्ताओं ने देखा कि रोबोट कैसे बनाए गए थे, विशेष रूप से एक प्रक्रिया जिसे "डिस्टिलेशन" (Distillation) कहा जाता है।

डिस्टिलेशन को ऐसे समझें जैसे एक विशाल, अत्यंत बुद्धिमान विश्वकोश (Encyclopedia) को एक छोटी, तेज़ पॉकेट गाइड में संकुचित करना। आप चाहते हैं कि पॉकेट गाइड उतनी ही स्मार्ट हो लेकिन आकार में छोटी हो।

उन्होंने तीन प्रकार के रोबोटों का परीक्षण किया:

  1. छोटे रोबोट: स्वाभाविक रूप से पक्षपाती (वे "अपराधी" लेबल को बहुत आसानी से चुन लेते हैं)।
  2. बड़े रोबोट: पक्षपाती नहीं (उन्होंने निष्पक्ष होना सीख लिया था)।
  3. संकुचित रोबोट (Distilled): ये बड़े, निष्पक्ष रोबोटों के छोटे संस्करण थे।

चौंकाने वाली बात: शोधकर्ताओं ने पाया कि यहाँ एक U-आकार का वक्र था।

  • छोटे रोबोट पक्षपाती थे।
  • बड़े रोबोटों ने पक्षपात को ठीक कर दिया।
  • लेकिन संकुचित रोबोटों ने पक्षपात को वापस ले आया!

यह एक मास्टर शेफ को लेने जैसा है जिसने खाना पकाने का एक आदर्श, स्वस्थ भोजन सीखा है, फिर उनकी रेसिपी को एक नैपकिन पर फिट होने के लिए छोटा कर दिया, और पाया कि नैपकिन वाली रेसिपी ने अनजाने में अस्वास्थ्यकर सामग्री को वापस ले आया। AI को छोटा और तेज़ बनाने की प्रक्रिया ने वास्तव में उन्हीं पूर्वाग्रहों को फिर से पेश कर दिया जिन्हें बड़े AI ने टालने के लिए सीखा था।

4. मस्तिष्क के अंदर झाँकना (Mechanistic Interpretability)

यह समझने के लिए कि ऐसा क्यों हुआ, शोधकर्ताओं ने केवल रोबोट द्वारा कहे गए शब्दों को नहीं देखा; उन्होंने उनके "मस्तिष्क" (कोड और गणितीय परतों) के अंदर झाँका।

  • "अपराधी" (Criminal) ट्रिगर: उन्होंने पाया कि जब रोबोटों ने "अपराधी" शब्द देखा, तो उनके आंतरिक सर्किट चमक उठे।
  • संकुचन प्रभाव (Compression Effect): बड़े, निष्पक्ष रोबोटों में, मस्तिष्क की बाद की परतों में "ब्रेक" थे जो पक्षपात को रोकते थे। लेकिन संकुचित (डिस्टिल्ड) रोबोटों में, वे ब्रेक गायब थे या कहीं और चले गए थे। संकुचित रोबोट पक्षपाती निर्णय तेजी से और पहले लेते थे।
  • परिणाम: संकुचित रोबोटों ने केवल निष्पक्ष होने के बारे में "भूलना" नहीं सीखा; उन्होंने वास्तव में अपने सोचने के तरीके को पुराने, उथले रूढ़ियों (Stereotypes) पर निर्भर रहने के लिए पुनर्गठित कर लिया।

मुख्य निष्कर्ष

शोध पत्र निष्कर्ष निकालता है कि हम केवल AI से यह नहीं पूछ सकते कि, "क्या आप पक्षपाती हैं?" हमें यह देखना होगा कि वे सामाजिक जटिलता के विभिन्न स्तरों के प्रति कैसे प्रतिक्रिया देते हैं।

सबसे महत्वपूर्ण बात यह है कि उन्होंने खोजा कि AI को छोटा और तेज़ बनाना (डistillation) एक तटस्थ प्रक्रिया नहीं है। यह अनजाने में उस "सुरक्षा प्रशिक्षण" को तोड़ सकता है जो बड़े मॉडलों के पास होता है, जिससे वे फिर से पक्षपाती हो सकते हैं। इसका मतलब है कि इन छोटे, तेज़ AI मॉडलों का वास्तविक दुनिया में उपयोग करने से पहले, हमें यह जांचना होगा कि क्या उन्होंने संकुचन प्रक्रिया के दौरान अपना नैतिक दिशा-सूचक (Moral Compass) खो दिया है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →