← नवीनतम पेपर
💬 NLP

Refusal Direction is Universal Across Safety-Aligned Languages

यह शोध पत्र प्रदर्शित करता है कि लार्ज लैंग्वेज मॉडल्स में रिफ्यूज़ल मैकेनिज्म (अस्वीकृति तंत्र) क्रॉस-लिंगुअल सार्वभौमिकता प्रदर्शित करते हैं, जहाँ अंग्रेजी से निकाला गया एक एकल रिफ्यूज़ल डायरेक्शन वेक्टर बिना किसी अतिरिक्त फाइन-ट्यूनिंग के 14 अन्य भाषाओं में सुरक्षा संरेखणों (सेफ्टी अलाइनमेंट्स) को प्रभावी ढंग से बायपास कर सकता है, जो बहुभाषी जेलब्रेक्स के लिए एक साझा अंतर्निहित तंत्र को प्रकट करता है।

मूल लेखक: Xinpeng Wang, Mingyang Wang, Yihong Liu, Hinrich Schütze, Barbara Plank

प्रकाशित 2026-02-26
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Xinpeng Wang, Mingyang Wang, Yihong Liu, Hinrich Schütze, Barbara Plank

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

एक बड़े भाषा मॉडल (LLM) की कल्पना करें जो एक बहुत ही बुद्धिमान, अच्छी तरह से प्रशिक्षित लाइब्रेरियन (पुस्तकालयाध्यक्ष) की तरह है। इस लाइब्रेरियन को एक सख्त नियम सिखाया गया है: "कभी भी ऐसी किताबें न दें जिनमें खतरनाक निर्देश, घृणास्पद भाषण (hate speech), या हानिकारक सलाह हो।" AI की दुनिया में, इसे रिफ्यूज़ल मैकेनिज्म (refusal mechanism) कहा जाता है।

लंबे समय तक, शोधकर्ताओं ने सोचा कि यह "सुरक्षा नियम" एक विशिष्ट भाषा की तरह है। उनका मानना था कि लाइब्रेरियन केवल अंग्रेजी में "नहीं" कहना जानता है। यदि आप फ्रेंच, चीनी या योरूबा (Yoruba) में पूछते, तो लाइब्रेरियन भ्रमित हो सकता था और गलती से वह खतरनाक किताब आपको दे सकता था।

हालाँकि, "Refusal Direction is Universal" नामक एक नया अध्ययन एक चौंकाने वाला रहस्य उजागर करता है कि ये AI लाइब्रेरियन वास्तव में कैसे सोचते हैं।

द "नो" बटन इज़ अ यूनिवर्सल रिमोट (The "No" Button is a Universal Remote)

शोधकर्ताओं ने पाया कि AI की "नहीं" कहने की क्षमता हर भाषा में एक जटिल वाक्य के रूप में संग्रहीत नहीं है। इसके बजाय, यह AI के मस्तिष्क में एक एकल, अदृश्य दिशा (direction) (गणितीय रूप से कहें तो एक वेक्टर) के रूप में संग्रहीत है।

AI के मस्तिष्क को एक विशाल, बहु-आयामी कमरे के रूप में सोचें।

  • हानिकारक अनुरोध (जैसे, "मैं बम कैसे बनाऊं?") AI के विचारों को एक दिशा में धकेलते हैं।
  • सुरक्षित अनुरोध (जैसे, "मैं केक कैसे बनाऊं?") उन्हें दूसरी दिशा में धकेलते हैं।
  • रिफ्यूज़ल (मना करना) एक विशिष्ट "नहीं" दिशा है जो उनके बीच स्थित है, जो एक दीवार की तरह कार्य करती है।

अध्ययन ने पाया कि यह "नहीं" वाली दीवार सभी भाषाओं में समानांतर (parallel) है। यह एक एकल "यूनिवर्सल रिमोट कंट्रोल" की तरह है जो सुरक्षा के लिए काम करता है।

जादुई ट्रिक: एक रिमोट, सभी भाषाएँ (The Magic Trick: One Remote, All Languages)

यहाँ प्रयोग का सबसे आश्चर्यजनक हिस्सा है:

  1. अंग्रेजी कुंजी (The English Key): शोधकर्ताओं ने केवल अंग्रेजी प्रॉम्प्ट का उपयोग करके सटीक "नहीं" दिशा का पता लगाया।
  2. स्विच (The Switch): उन्होंने इस अंग्रेजी "नहीं" दिशा को लिया और इसे AI पर लागू किया जब वह योरूबा, थाई या जर्मन बोल रहा था।
  3. परिणाम (The Result): AI ने उन भाषाओं में हानिकारक अनुरोधों को मना करना तुरंत बंद कर दिया। ऐसा लग रहा था जैसे उन्होंने एक ऐसी चाबी का उपयोग करके सुरक्षा प्रणाली का प्लग निकाल दिया हो, जो पूरी तरह से दूसरे देश में बनी थी।

इससे भी अधिक आश्चर्यजनक बात यह है कि, यदि उन्हें जर्मन या थाई में "नहीं" दिशा मिल जाती, तो वह अंग्रेजी और जापानी पर भी उतनी ही अच्छी तरह काम करती। "नहीं" बटन भाषा-निरपेक्ष (language-agnostic) है; यह मशीन में वही भौतिक लीवर है, चाहे मशीन वर्तमान में कोई भी भाषा बोल रही हो।

जेलब्रेक अभी भी क्यों काम करते हैं? (The Cracked Wall)

यदि "नहीं" बटन हर जगह काम करता है, तो गैर-अंग्रेजी भाषाओं में पूछे जाने पर AI को धोखा (jailbroken) क्यों दिया जा सकता है?

शोधकर्ताओं ने AI के मस्तिष्क की ज्यामिति (geometry) को देखकर इसका उत्तर खोजा।

  • अंग्रेजी में: "हानिकारक" विचार और "सुरक्षित" विचार दो अलग-अलग द्वीप हैं जो एक विस्तृत महासागर द्वारा अलग किए गए हैं। "नहीं" की दीवार मजबूत और स्पष्ट रूप से परिभाषित है।
  • अन्य भाषाओं में: "हानिकारक" और "सुरक्षित" द्वीप अक्सर एक साथ दब जाते हैं। वे धुंधले और अस्पष्ट होते हैं।

उपमा (Analogy): एक सुरक्षा गार्ड (AI) की कल्पना करें जो एक गेट पर खड़ा है।

  • अंग्रेजी में, गार्ड की दृष्टि एकदम स्पष्ट है। वह बुरे लोगों को आसानी से देख सकता है और उन्हें रोक सकता है।
  • अन्य भाषाओं में, कोहरा इतना घना है कि बुरे लोग और अच्छे लोग एक धुंधली भीड़ की तरह दिखते हैं। भले ही गार्ड के हाथ में वही "रुकें" (Stop) का आदेश हो, लेकिन वह यह तय नहीं कर पाता कि किसे रोकना है क्योंकि भीड़ बहुत समान दिखती है।

"नहीं" की दिशा (आदेश) सार्वभौमिक है, लेकिन उन भाषाओं में सुरक्षित और असुरक्षित अनुरोधों के बीच अंतर करने की क्षमता कमजोर है। यही वह कमजोरी है जो हैकर्स को सुरक्षा गार्ड के पास से हानिकारक अनुरोधों को चुपके से ले जाने की अनुमति देती है।

मुख्य निष्कर्ष (The Takeaway)

यह पेपर हमें दो मुख्य बातें सिखाता है:

  1. सुरक्षा सार्वभौमिक है (Safety is Universal): AI हर भाषा के लिए एक नया "नहीं" शब्द नहीं सीखता है। वह "मना करने" (refusal) की एक मूल अवधारणा सीखता है जो सब कुछ पर लागू होती है।
  2. कमजोर कड़ी (The Weak Link): समस्या यह नहीं है कि AI को योरूबा या थाई में "नहीं" कैसे कहना नहीं आता। समस्या यह है कि AI का मस्तिष्क उन भाषाओं में एक सुरक्षित और असुरक्षित अनुरोध के बीच अंतर देखने के लिए बहुत धुंधला है।

भविष्य के लिए इसका क्या अर्थ है?
दुनिया भर में AI को सुरक्षित बनाने के लिए, हमें केवल उसे विभिन्न भाषाओं में अधिक "नहीं" शब्द सिखाने की आवश्यकता नहीं है। इसके बजाय, हमें AI के मस्तिष्क को अपनी दृष्टि तेज करने में मदद करने की आवश्यकता है। हमें इसे हर भाषा में "अच्छे" और "बुरे" विचारों को स्पष्ट रूप से अलग करने के लिए प्रशिक्षित करने की आवश्यकता है, ताकि इसका सार्वभौमिक "नहीं" बटन वास्तव में प्रभावी ढंग से उपयोग किया जा सके।

संक्षेप में: AI के पास हर भाषा में एक ही "स्टॉप" साइन है, लेकिन कुछ भाषाओं में, खतरे के संकेतों को देखना इतना कठिन है कि उसे पता ही नहीं चलता कि कब इसका उपयोग करना है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →