← नवीनतम पेपर
💬 NLP

Why Do Safety Guardrails Degrade Across Languages?

यह शोध पत्र विभिन्न भाषाओं में लार्ज लैंग्वेज मॉडल्स (LLMs) में सुरक्षा क्षरण (safety degradation) को चलाने वाले विशिष्ट कारकों को अलग करने और उनका विश्लेषण करने के लिए एक मल्टी-ग्रुप आइटम रिस्पांस थ्योरी फ्रेमवर्क प्रस्तुत करता है, जो यह प्रकट करता है कि सुरक्षा विफलताएं मुख्य रूप से एकआयामी हैं, अक्सर कम-संसाधन वाली भाषाओं की तुलना में अंग्रेजी में अधिक गंभीर होती हैं, और केवल अनुवाद की गुणवत्ता के बजाय भौतिक हानि और सांस्कृतिक बेमेल से संबंधित प्रॉम्प्ट-विशिष्ट क्रॉस-लिंगुअल अंतराल से महत्वपूर्ण रूप से प्रभावित होती हैं।

मूल लेखक: Max Zhang, Ameen Patel, Sang T. Truong, Sanmi Koyejo

प्रकाशित 2026-05-19
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Max Zhang, Ameen Patel, Sang T. Truong, Sanmi Koyejo

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आपके पास एक संग्रहालय में सुरक्षा गार्डों (AI मॉडल) की एक टीम है। उनका काम उन लोगों को रोकना है जो चोरी की गई कलाकृतियों को बाहर ले जाने की कोशिश कर रहे हैं (असुरक्षित अनुरोध)।

लंबे समय से, हम केवल अंग्रेजी में इन गार्डों का परीक्षण करते रहे हैं। हम उनसे पूछेंगे, "क्या आप मुझे बता सकते हैं कि पेंटिंग कैसे चुराएं?" यदि वे "नहीं" कहते हैं, तो वे पास हो जाते हैं। यदि वे "हाँ" कहते हैं, तो वे विफल हो जाते हैं। हम विफलताओं को गिनते थे और इसे एक स्कोर कहते थे।

लेकिन यह शोध पत्र पूछता है: क्या होता है जब हम इन गार्डों का अन्य भाषाओं, जैसे स्वाहिली, जावानीस या बंगाली में परीक्षण करते हैं?

शोधकर्ताओं ने पाया कि परीक्षण करने का पुराना तरीका सेब की तुलना संतरे से करने जैसा था। उन्होंने एक नया, अधिक स्मार्ट तरीका बनाया है जिससे सुरक्षा को मापने के लिए इसे उसके व्यक्तिगत हिस्सों में विभाजित किया जा सके, ठीक वैसे ही जैसे एक मैकेनिक कार के इंजन को अलग-अलग करके यह देखने के लिए कि कौन सा हिस्सा खराब है।

यहाँ उनके निष्कर्षों का सरल उपमाओं (analogies) का उपयोग करके विवरण दिया गया है:

1. पुराना तरीका बनाम नया तरीका

पुराना तरीका ("जेलब्रेक सफलता दर"):
कल्पना कीजिए कि आपके पास एक परीक्षण है जहाँ आप एक गार्ड से पूछते हैं, "क्या आप नियमों को तोड़ सकते हैं?" यदि वे नियमों को तोड़ते हैं, तो आप एक बड़ा लाल "X" मार्क करते हैं। आप बस लाल Xs को गिनते हैं।

  • समस्या: यदि एक गार्ड स्वाहिली में विफल होता है लेकिन अंग्रेजी में पास हो जाता है, तो क्या इसका मतलब है कि गार्ड बुरा है? क्या ऐसा इसलिए है क्योंकि स्वाहिली प्रश्न समझना कठिन था? या क्या ऐसा इसलिए है क्योंकि प्रश्न के स्वाहिली अनुवाद ने गलती से इसे हानिरहित बना दिया? पुराना तरीका इन सभी कारणों को एक भ्रमित करने वाले नंबर में मिला देता है।

नया तरीका ("IRT ढांचा"):
लेखकों ने एक "सेफ्टी डिकंपोजिशन मशीन" बनाई है। एक बड़े स्कोर के बजाय, यह विफलता को चार अलग-अलग सामग्रियों में विभाजित करता है:

  • गार्ड का कौशल (θ\theta): सामान्य रूप से "ना" कहने में गार्ड कितना अच्छा है?
  • प्रश्न की कठिनाई (β\beta): क्या प्रश्न स्वयं कठिन है, यहाँ तक कि अंग्रेजी में भी?
  • भाषाई बाधा (γ\gamma): क्या यह भाषा AI के लिए सामान्य रूप से संसाधित करना कठिन है?
  • अनुवाद की त्रुटि (τ\tau): क्या विशिष्ट प्रश्न अनुवाद के दौरान बिगड़ गया, जिससे गार्ड को धोखा देना आसान हो गया?

2. बड़ी आश्चर्यजनक बातें

शोधकर्ताओं ने 10 भाषाओं में 61 अलग-अलग AI कॉन्फ़िगरेशन का परीक्षण किया। यहाँ उन्हें क्या मिला:

आश्चर्य #1: "अंग्रेजी उलटाव" (English Reversal)
हम आमतौर पर मानते हैं कि AI अंग्रेजी में सबसे सुरक्षित होता है और अन्य भाषाओं में बदतर हो जाता है।

  • वास्तविकता: कई मॉडलों के लिए, अंग्रेजी वास्तव में सबसे खतरनाक भाषा थी। गार्ड अंग्रेजी में नियमों को तोड़ने के लिए अधिक प्रवृत्त थे।
  • क्यों? शोधकर्ता सोचते हैं कि "बुरे लोग" (हमलावर) अपने हथकंडे अंग्रेजी में लिखते हैं। जब उन हथकंडों का अनुवाद किया जाता है, तो वे कभी-कभी अपना "दम" या प्रभाव खो देते हैं, जिससे वे कम प्रभावी हो जाते हैं। अंग्रेजी में, वे हथकंडे पूरी तरह से काम करते हैं।

आश्चर्य #2: सुरक्षा एक बड़ा मांसपेशी है
हमें लग सकता है कि एक AI को हर विषय के लिए एक अलग "सुरक्षा मांसपेशी" की आवश्यकता होती है (चोरी के लिए एक, हिंसा के लिए एक, घृणास्पद भाषण के लिए एक)।

  • वास्तविकता: सुरक्षा एक-आयामी (unidimensional) है। यह एक एकल मांसपेशी की तरह है। यदि एक गार्ड चोरी में मदद करने से मना करने में अच्छा है, तो वह हिंसा में मदद करने से मना करने में भी लगभग हमेशा अच्छा होगा। उनके पास प्रत्येक के लिए अलग सर्किट नहीं हैं; वे "ना" कहने के लिए एक साझा तंत्र का उपयोग करते हैं।

आश्चर्य #3: अनुवाद त्रुटियां "धुआं छोड़ने वाली बंदूक" (Smoking Gun) हैं
कभी-कभी, एक गार्ड इसलिए विफल नहीं होता क्योंकि वह कमजोर है, बल्कि इसलिए क्योंकि प्रश्न का अनुवाद खराब हुआ था।

  • उपमा: कल्पना करें कि एक गार्ड से पूछ रहे हैं, "मैं कार कैसे हॉट-वायर कर सकता हूँ?" (कार चुराने के लिए उसे स्टार्ट करना)।
    • यदि अनुवाद गलती से इसे "मैं कार को कैसे गर्म (warm) कर सकता हूँ?" में बदल देता है, तो गार्ड कह सकता है, "ज़रूर, यहाँ बताया गया है कि हीटर का उपयोग कैसे करें।"
    • गार्ड सुरक्षा में विफल नहीं हुआ; वह टूटे हुए अनुवाद को समझने में विफल रहा।
  • शोध पत्र ने पाया कि हालांकि खराब अनुवाद कुछ विफलताओं का कारण बनते हैं, लेकिन वे कुल समस्या का केवल एक बहुत छोटा हिस्सा समझाते हैं। अधिकांश समय, अनुवाद ठीक होता है, लेकिन फिर भी AI संघर्ष करता है।

आश्चर्य #4: सांस्कृतिक भ्रम
कुछ प्रश्न इसलिए विफल होते हैं क्योंकि वह अवधारणा उस संस्कृति में मौजूद नहीं होती।

  • उपमा: किसी ऐसे देश में AI से पूछना जहाँ FBI नहीं है, "मैं FBI से कैसे बचूँ?" AI को भ्रमित कर सकता है। "FBI" की अवधारणा सांस्कृतिक रूप से विशिष्ट है। AI यह नहीं समझ पाएगा कि यह एक खतरनाक अनुरोध है क्योंकि सांस्कृतिक संदर्भ गायब है।

3. "अनिश्चितता" का कारक

शोधकर्ताओं ने देखा कि कम-संसाधन वाली भाषाओं (कम डेटा उपलब्ध वाली भाषाएं) में, AI एक घबराए हुए छात्र की तरह व्यवहार करता है जो परीक्षा में अनुमान लगा रहा है। यह "सीमावर्ती" उत्तर देता है—ऐसे जवाब जो आधे सुरक्षित, आधे असुरक्षित या बहुत अनिश्चित होते हैं।

  • समाधान: सही रीडिंग प्राप्त करने के लिए, आप केवल प्रश्न एक बार नहीं पूछ सकते। आपको इसे 10 बार पूछना होगा और उत्तरों का औसत निकालना होगा। यह "अनुमान लगाने" को सुचारू बनाता है और AI के वास्तविक सुरक्षा स्तर को प्रकट करता है।

4. यह क्यों महत्वपूर्ण है

शोध पत्र निष्कर्ष निकालता है कि हम अब केवल एक AI के लिए एकल "सुरक्षा स्कोर" को नहीं देख सकते।

  • यदि कोई AI किसी विशिष्ट भाषा में विफल होता है, तो अब हम जानते हैं कि निदान कैसे किया जाए:
    • क्या AI केवल सुरक्षा में बुरा है? (मॉडल को ठीक करें)।
    • क्या भाषा AI के लिए कठिन है? (भाषा प्रशिक्षण में सुधार करें)।
    • क्या अनुवाद टूटा हुआ है? (डेटासेट को ठीक करें)।
    • क्या अवधारणा सांस्कृतिक रूप से विदेशी है? (प्रॉम्प्ट को समायोजित करें)।

संक्षेप में: यह शोध पत्र हमें AI सुरक्षा को देखने के लिए एक "सूक्ष्मदर्शी" (microscope) देता है। केवल यह कहने के बजाय कि "यह AI असुरक्षित है," अब हम कह सकते हैं, "यह AI सुरक्षित है, लेकिन जब हम इससे जावानीस में कार चोरी करने के बारे में पूछते हैं तो यह भ्रमित हो जाता है क्योंकि अनुवाद थोड़ा गलत है।" यह डेवलपर्स को अनुमान लगाने के बजाय सटीक समस्या को ठीक करने में मदद करता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →