← नवीनतम पेपर
💬 NLP

The Neutral Mask: How RLHF Provides Shallow Alignment while Leaving Partisan Structure Intact in a Large Language Model

यह शोध पत्र यह प्रदर्शित करता है कि RLHF, Llama 3.1 8B में अंतर्निहित पक्षपाती संरचनाओं को मिटाकर नहीं, बल्कि इन अक्षुण्ण आंतरिक निरूपणों से मॉडल के आउटपुट तक जाने वाले कारण पथ (causal pathway) को काटकर कार्यात्मक राजनीतिक तटस्थता प्राप्त करता है, जिससे एक ऐसा नाजुक संरेखण निर्मित होता जिसे विशिष्ट स्टीयरिंग तकनीकों के माध्यम से बायपास किया जा सकता है।

मूल लेखक: Wendy K. Tam

प्रकाशित 2026-06-09
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Wendy K. Tam

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

यहाँ "द न्यूट्रल मास्क" (The Neutral Mask) शोध पत्र का सरल भाषा और उपमाओं के साथ हिंदी अनुवाद दिया गया है।

मुख्य विचार: एक "तटस्थता" का मुखौटा, न कि एक नया मस्तिष्क

कल्पना कीजिए कि आपके पास एक बहुत ही बुद्धिमान, विद्वान व्यक्ति है (बेस मॉडल) जिसने अब तक लिखी गई हर किताब, समाचार लेख और ट्वीट पढ़ा है। इस व्यक्ति की अपनी मज़बूत राय है। यदि आप उनसे राजनीति के बारे में पूछते हैं, तो वे विषय के आधार पर तुरंत एक कट्टर डेमोक्रेट या एक उग्र रिपब्लिकन की तरह सुनाई दे सकते हैं। उनके पास एक गहरा, आंतरिक "कंपास" (दिशा-सूचक यंत्र) है जो अलग-अलग दिशाओं में मजबूती से संकेत करता है।

शोधकर्ता यह जानना चाहते थे: जब हम इस व्यक्ति को "तटस्थ" और सहायक बनने के लिए प्रशिक्षित करते हैं, तो क्या होता है?

यह शोध पत्र तर्क देता है कि प्रशिक्षण की प्रक्रिया (जिसे RLHF कहा जाता है) वास्तव में उस व्यक्ति के राजनीतिक कंपास को मिटाती नहीं है और न ही उनके मस्तिष्क को बदलती है। इसके बजाय, यह उन पर एक मुखौटा (Mask) लगा देती है। वह व्यक्ति अभी भी उन सभी राजनीतिक विचारों और आंतरिक दिशाओं को रखता है, लेकिन उसे उन्हें अनदेखा करने और एक उबाऊ, संतुलित, "दोनों पक्षों" वाला तरीका बोलने के लिए प्रशिक्षित किया गया है।

यदि आप मुखौटा हटा देते हैं (या उस व्यक्ति को किसी विशिष्ट संदर्भ में होने का भ्रम देकर धोखा देते हैं), तो उनका मूल राजनीतिक कंपास अभी भी वहीं मौजूद है, घूमने के लिए तैयार।


उन्होंने इसका परीक्षण कैसे किया: "राजनीतिक जीपीएस" (Political GPS)

इसे सिद्ध करने के लिए, शोधकर्ताओं ने एक उपकरण का उपयोग किया जो राजनीतिक जीपीएस की तरह काम करता है।

  1. मानचित्र (The Map): उन्होंने पहले मॉडल के "मस्तिष्क" में (गणितीय रूप से) एक विशिष्ट दिशा को मैप किया जो "रिपब्लिकन" और "डेमोक्रेट" के बीच के अंतर को दर्शाता है।
  2. परीक्षण: उन्होंने "बेस मॉडल" (प्रशिक्षण से पहले) और "इंस्ट्रक्ट मॉडल" (प्रशिक्षण के बाद) से एक ही 84 प्रश्न पूछे, जो "स्टेक कैसे पकाएं" से लेकर "क्या गर्भपात कानूनी है?" तक विस्तृत थे।

परिणाम:

  • बेस मॉडल: राजनीति के बारे में पूछे जाने पर, इसका आंतरिक जीपीएस सुई पागलों की तरह घूमती थी। कभी यह बहुत वामपंथी (Left) की ओर इशारा करती, तो कभी बहुत दक्षिणपंथी (Right) की ओर। इसके उत्तर उस उतार-चढ़ाव से मेल खाते थे (जैसे कि बहुत प्रगतिशील या बहुत रूढ़िवादी सुनाई देना)।
  • इंस्ट्रक्ट मॉडल: उन्हीं सवालों के पूछे जाने पर, इसका आंतरिक जीपीएस बहुत कम हिला। यह बीच में ही अटका रहा। इसके उत्तर पूरी तरह से संतुलित थे, जिसमें बिना किसी का पक्ष लिए दोनों पक्षों के तर्कों को सूचीबद्ध किया गया था।

आश्चर्य: शोधकर्ता उम्मीद कर रहे थे कि प्रशिक्षण से राजनीतिक कंपास हटा दिया गया होगा। इसके बजाय, उन्होंने पाया कि कंपास अभी भी वहीं था; बस उसे एक मजबूत हाथ द्वारा बहुत स्थिर रखा गया था।


"लाइट स्विच" की उपमा: वास्तव में क्या हो रहा है?

शोध पत्र मॉडल के मस्तिष्क के भीतर लाइट स्विच (या फीचर्स) से जुड़ी एक चतुर उपमा का उपयोग करता है।

  • प्रशिक्षण से पहले (बेस मॉडल): मस्तिष्क में कई लाइट स्विच होते हैं। कुछ स्विच "कुकिंग" को नियंत्रित करते हैं, कुछ "इतिहास" को, और कुछ "राजनीतिक बयानबाजी" (Political Rhetoric) को। जब आप राजनीतिक प्रश्न पूछते हैं, तो "राजनीतिक बयानबाजी" वाले स्विच चालू हो जाते हैं, और मॉडल एक पक्षपाती आवाज़ के साथ बोलता है।
  • प्रशिक्षण के बाद (इंस्ट्रक्ट मॉडल): शोधकर्ताओं ने पाया कि राजनीतिक बयानबाजी के स्विच पूरी तरह से बंद (OFF) हैं। वे अंधेरे हैं। मॉडल उनका उपयोग ही नहीं कर रहा है।
  • ट्विस्ट: मॉडल बहुत कम स्विचों का उपयोग कर रहा है। यह केवल स्विचों के एक बहुत ही विशिष्ट सेट का उपयोग कर रहा है जो "औपचारिक, उबाऊ, संतुलित भाषण" को नियंत्रित करते हैं।

"ऑफसेट" (Offset) का रहस्य:
शोधकर्ताओं ने देखा कि इंस्ट्रक्ट मॉडल की जीपीएस सुई बिल्हीं शून्य पर नहीं थी; यह थोड़ा "रिपब्लिकन" की ओर झुकी हुई थी। उन्होंने सोचा, "अहा! यह अभी भी पक्षपाती है!"
लेकिन जब उन्होंने बारीकी से देखा, तो उन्हें एहसास हुआ कि यह झुकाव राजनीतिक विचारों के कारण नहीं था। यह उत्तरों की शैली (Style) के कारण था। मॉडल को बहुत औपचारिक, संरचित तरीके से बोलने के लिए प्रशिक्षित किया गया था (सूचियों, उद्धरणों और औपचारिक लहजे का उपयोग करना)। यह सामने आया कि मॉडल को प्रशिक्षित करने के लिए उपयोग किए गए डेटा में, रिपब्लिकन इस औपचारिक शैली का अधिक उपयोग करते थे। इसलिए, "औपचारिक शैली" वाले स्विच ने गलती से राजनीतिक सुई को थोड़ा दाईं ओर धकेल दिया, भले ही मॉडल कुछ भी राजनीतिक नहीं कह रहा था।


"रिमोट कंट्रोल" प्रयोग

यह सिद्ध करने के लिए कि राजनीतिक कंपास अभी भी मौजूद था लेकिन बस डिस्कनेक्ट हो गया था, शोधकर्ताओं ने रिमोट कंट्रोल का खेल खेला।

उन्होंने "बेस मॉडल" और "इंस्ट्रक्ट मॉडल" को लिया और "राजनीतिक बयानबाजी" के स्विच को जबरदस्ती चालू करने के लिए एक रिमोट कंट्रोल का उपयोग किया (इसे स्टीयरिंग/Steering कहा जाता है)।

  • बेस मॉडल: जब उन्होंने स्विच को चालू करने के लिए मजबूर किया, तो मॉडल तुरंत कड़े राजनीतिक विचार उगलने लगा। यह पूरी तरह से काम कर रहा था।
  • इंस्ट्रक्ट मॉडल: जब उन्होंने उसी स्विच को चालू करने के लिए मजबूर किया, तो मॉडल ने अपना उत्तर नहीं बदला। वह वही संतुलित, तटस्थ प्रतिक्रिया देता रहा।

इसका क्या अर्थ है: राजनीतिक विचारों के लिए "वायरिंग" अभी भी इंस्ट्रक्ट मॉडल के मस्तिष्क के अंदर है। लेकिन उन तारों को मुँह (आउटपुट) से जोड़ने वाले "सर्किट ब्रेकर" को काट दिया गया है। मॉडल राजनीतिक तर्कों को जानता है, लेकिन उसे उन्हें बोलने से मना करने के लिए प्रशिक्षित किया गया है।


निष्कर्ष: एक नाजुक तटस्थता

शोध पत्र निष्कर्ष निकालता है कि आज के AI में हम जो "तटस्थता" देखते हैं वह कार्यात्मक (Functional) है, संरचनात्मक (Structural) नहीं।

  • कार्यात्मक तटस्थता (Functional Neutrality): AI तटस्थ व्यवहार करता है क्योंकि वह नियमों का पालन कर रहा है। यह एक ऐसे अभिनेता की तरह है जिसने हमेशा विनम्र दिखने के लिए एक स्क्रिप्ट याद कर ली है।
  • संरचनात्मक तटस्थता (Structural Neutrality): AI इसलिए तटस्थ होता क्योंकि उसके पास पक्षपाती होने की क्षमता ही नहीं होती। (शोध पत्र कहता है कि ऐसा नहीं हुआ है)।

जोखिम: क्योंकि आंतरिक राजनीतिक कंपास अभी भी बरकरार है, इसलिए "मुखौटा" नाजुक है। यदि कोई नियमों को दरकिनार करने का तरीका जानता है (उदाहरण के लिए, AI को यह विश्वास दिलाकर कि उपयोगकर्ता एक विशिष्ट राजनीतिक राय चाहता है, या "जेलब्रेक" प्रॉम्प्ट का उपयोग करके), तो मॉडल तुरंत अपना मुखौटा उतार सकता है और अपने अंतर्निहित पक्षपाती ढांचे को प्रकट कर सकता है।

संक्षेप में: AI को अपने राजनीतिक पूर्वाग्रह को खोने के लिए "पुनः शिक्षित" नहीं किया गया है। इसे बस तटस्थता का मुखौटा पहनने के लिए सिखाया गया है। पूर्वाग्रह अभी भी वहीं है, मुखौटे के पीछे छिपा हुआ, बाहर आने के लिए तैयार।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →