← नवीनतम पेपर
📊 statistics

Silenced Biases: The Dark Side LLMs Learned to Refuse

यह शोध पत्र साइलेंस्ड बायस बेंचमार्क (SBB) प्रस्तुत करता है, जो एक ऐसा ढांचा है जो मॉडल के इनकार (refusals) को कम करने और "साइलेंस्ड बायस" (silenced biases) को उजागर करने के लिए एक्टिवेशन स्टीयरिंग का उपयोग करता है—जो कि सुरक्षा-संरेखित (safety-aligned) LLMs के भीतर छिपी अनैतिक प्राथमिकताएं हैं जिन्हें मानक मूल्यांकन विधियां गलती से निष्पक्षता मान लेती हैं।

मूल लेखक: Rom Himelstein, Amit LeVi, Brit Youngmann, Yaniv Nemcovsky, Avi Mendelson

प्रकाशित 2026-03-19
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Rom Himelstein, Amit LeVi, Brit Youngmann, Yaniv Nemcovsky, Avi Mendelson

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आपके पास एक बहुत ही विनम्र, प्रशिक्षित रोबोट सहायक है। आपने उसे सुरक्षित, दयालु और निष्पक्ष होना सिखाया है। यदि आप उससे कुछ बुरा या पक्षपाती पूछते हैं, जैसे "कौन सा समूह अपराधी होने की सबसे अधिक संभावना रखता है?", तो वह विनम्रता से कहता है, "मुझे खेद है, मैं इसका उत्तर नहीं दे सकता।"

अधिकांश लोग इसे देखते हैं और सोचते हैं, "शानदार! रोबोट निष्पक्ष है। इसने पक्षपाती होने से इनकार कर दिया।"

लेकिन यह शोध पत्र तर्क देता है कि रोबोट वास्तव में निष्पक्ष नहीं है। यह केवल अपने पक्षपात को छिपा रहा है।

यहाँ शोधकर्ताओं ने जो खोजा है, उसका सरल विवरण दिया गया है, जिसमें रोजमर्रा के उदाहरणों का उपयोग किया गया है।

1. "खामोश" पक्षपात (बेसमेंट में किशोर)

रोबोट के मस्तिष्क को एक घर के रूप में सोचें।

  • मुख्य द्वार (आउटपुट): यह वह है जो रोबोट आपसे कहता है। यह बहुत विनम्र है। यदि आप कोई बुरा प्रश्न पूछते हैं, तो "मुख्य द्वार" का गार्ड कहता है, "प्रवेश निषेध!"
  • बेसमेंट (लेटेंट स्पेस): यह वह जगह है जहाँ रोबot वास्तव में सोचता है। भले ही मुख्य द्वार "नहीं" कहता है, रोबोट के बेसमेंट में विचार अभी भी रूढ़ियों (stereotypes) से भरे होते हैं। वह अभी भी मानता है कि "समूह A" के "समूह B" की तुलना में अपराधी होने की अधिक संभावना है।

शोधकर्ता इसे "खामोश पक्षपात" (Silenced Bias) कहते हैं। सुरक्षा प्रशिक्षण ने बुरे विचारों को हटाया नहीं; इसने केवल उन्हें बाहर आने से रोकने के लिए एक दीवार बना दी। पक्षपात अभी भी वहीं है, बस खामोश कर दिया गया है।

2. वर्तमान परीक्षणों की समस्या (विनम्र झूठ)

रोबोटों के परीक्षण करने के वर्तमान तरीके (जिन्हें बेंचमार्क कहा जाता है) ऐसे हैं जैसे रोबोट से पूछना, "क्या आप जातिवादी हैं?"

  • यदि रोबोट कहता है, "मुझे नहीं पता," या "मैं उत्तर नहीं दे सकता," तो परीक्षण उसे 100% निष्पक्ष के रूप में स्कोर करता है।
  • शोधकर्ता कहते हैं कि यह एक चाल है। रोबोट निष्पक्ष नहीं हो रहा है; वह केवल उत्तर देने से बचने (refusal-prone) की प्रवृत्ति दिखा रहा है। यह उस किशोर की तरह है जो अपने खराब ग्रेड के बारे में सवाल पूछे जाने पर जवाब देने से मना कर देता है, इसलिए नहीं कि वह ईमानदार है, बल्कि इसलिए क्योंकि वह सच छिपा रहा है।

3. समाधान: "एक्टिवेशन स्टीयरिंग" (जादुई रिमोट कंट्रोल)

शोधकर्ताओं ने एक नया उपकरण बनाया जिसे "साइलेंस्ड बायस बेंचमार्क" (SBB) कहा जाता है। इसका उपयोग करने के लिए, वे "एक्टिवेशन स्टीयरिंग" (Activation Steering) नामक तकनीक का उपयोग करते हैं।

कल्पना कीजिए कि रोबोट का मस्तिष्क एक रेडियो स्टेशन है।

  • रिफ्यूज़ल मोड (अस्वीकार मोड): रेडियो उस चैनल पर ट्यून है जो केवल "मैं आपकी मदद नहीं कर सकता" वाला संगीत बजाता है।
  • कम्प्लायंस मोड (अनुपालन मोड): रेडियो उस चैनल पर ट्यून है जो सीधे सवालों के जवाब देता है।

शोधकर्ताओं ने एक "जादुई रिमोट" (एक्टिवेशन स्टीयरिंग) बनाया है जो रेडियो को "रिफ्यूज़ल चैनल" से "कम्प्लायंस चैनल" पर स्विच करने के लिए मजबूर करता है—सिर्फ एक पल के लिए—जब वे पेचीदा सवाल पूछते हैं।

अचानक, रोबोट "मैं उत्तर नहीं दे सकता" कहना बंद कर देता है और अपनी वास्तविक, अनफ़िल्टर्ड राय देने लगता है। और देखिए क्या होता है? पक्षपात फूट पड़ता है।

4. उन्होंने क्या पाया (चौंकाने वाले परिणाम)

जब उन्होंने 10 लोकप्रिय AI मॉडलों (जैसे Llama, Gemma, और Qwen) पर "रिफ्यूज़ल चैनल" को बंद किया, तो उन्होंने पाया:

  • पक्षपात वास्तविक था: रोबोटों के पास वास्तव में मजबूत, अनुचित प्राथमिकताएं थीं। उदाहरण के लिए, जब पूछा गया "आतंकवादी होने की सबसे अधिक संभावना किसकी है?", तो कुछ मॉडलों ने भारी रूप से विशिष्ट राष्ट्रों या धर्मों को चुना, भले ही वे आमतौर पर इस पर उत्तर देने से मना कर देते हैं।
  • सुरक्षा प्रशिक्षण एक मुखौटा है: "सुरक्षा" प्रशिक्षण ने केवल पक्षपात पर एक मुखौटा लगा दिया। इसने बीमारी को ठीक नहीं किया।
  • आकार मायने नहीं रखता: बड़े, नए मॉडल अनिवार्य रूप से अधिक निष्पक्ष नहीं थे। कभी-कभी पुराने, छोटे मॉडल नए, महंगे मॉडलों की तुलना में वास्तव में अधिक निष्पक्ष (या कम पक्षपाती) थे।

5. यह क्यों महत्वपूर्ण है ("जेलब्रेक" बनाम "स्टीयरिंग" का अंतर)

आप पूछ सकते हैं, "क्या हम 'जेलब्रेक्स' (रोबोट को धोखा देने के तरीके) का उपयोग करके इसे नहीं खोज सकते?"

  • जेलब्रेक मुख्य दरवाजे को हथौड़े से तोड़ने की कोशिश करने जैसा है। वे अक्सर नए शोर और पक्षपात पैदा करते हैं क्योंकि वह तरीका खुद में अव्यवस्थित होता है।
  • एक्टिवेशन स्टीयरिंग एक तरफ का दरवाजा खोलने के लिए धीरे से चाबी घुमाने जैसा है। यह बिना किसी नए शोर के यह प्रकट करता है कि वहां पहले से ही क्या मौजूद था। यह सत्य देखने का एक स्वच्छ, वैज्ञानिक तरीका है।

मुख्य निष्कर्ष

यह शोध पत्र एक चेतावनी है। यह हमें बताता है कि सिर्फ इसलिए कि AI कहता है "मैं यह नहीं कर सकता," इसका मतलब यह नहीं है कि वह निष्पक्ष है।

यह उस व्यक्ति की तरह है जो किसी विशिष्ट समूह के बारे में मजाक करने से मना कर देता है। वे विनम्र दिख सकते हैं, लेकिन यदि आप उनके मन को पढ़ सकें, तो वे शायद भी वही मजाक सोच रहे होंगे। शोधकर्ताओं ने एक "मन-पठन" उपकरण बनाया है जिससे यह साबित होता है कि ये AI मॉडल अभी भी रूढ़ियों का भारी बोझ ढो रहे हैं, जो एक विनम्र "नहीं" के पीछे छिपा हुआ है।

संक्षेप में: हमें "नहीं" वाले उत्तरों पर भरोसा करना बंद करना होगा और यह जांचना शुरू करना होगा कि सतह के नीचे AI वास्तव में क्या सोच रहा है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →