← नवीनतम पेपर
💬 NLP

Cross-Lingual Jailbreak Detection via Semantic Codebooks

यह शोध पत्र एक प्रशिक्षण-मुक्त, भाषा-निरपेक्ष जेलब्रेक डिटेक्शन विधि प्रस्तावित करता है जो बहुभाषी क्वेरी एम्बेडिंग्स की तुलना दुर्भावनापूर्ण प्रॉम्प्ट्स के एक निश्चित अंग्रेजी कोडबुक से करता है, और यह प्रदर्शित करता है कि जबकि सिमेंटिक समानता विभिन्न भाषाओं में कैनोनिकल टेम्पलेट्स पर हमलों को प्रभावी ढंग से कम करती है, विविध और विषम असुरक्षित व्यवहारों से जुड़े वितरण बदलावों (डिस्ट्रीब्यूशन शिफ्ट्स) के तहत इसका प्रदर्शन काफी घट जाता है।

मूल लेखक: Shirin Alanova, Bogdan Minko, Sabrina Sadiekh, Evgeniy Kokuykin

प्रकाशित 2026-04-29
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Shirin Alanova, Bogdan Minko, Sabrina Sadiekh, Evgeniy Kokuykin

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आपके पास एक बहुत ही बुद्धिमान, बहुभाषी रोबोट सहायक (एक लार्ज लैंग्वेज मॉडल, या LLM) है जिसे विनम्र और सुरक्षित रहने के लिए प्रशिक्षित किया गया है। आपने इसे अंग्रेजी में अच्छी तरह से सिखाया है: यदि कोई इससे "वायरस लिखने" या "किसी समूह के प्रति नफरत फैलाने" के लिए कहता है, तो यह कहता है, "नहीं, मैं ऐसा नहीं कर सकता।"

लेकिन यहाँ एक समस्या है। यह रोबोट मुख्य रूप से अंग्रेजी पर प्रशिक्षित है। यदि आप इसे रूसी, चीनी या अरबी में वही प्रश्न पूछते हैं, तो रोबोट भ्रमित हो सकता है और अनजाने में कुछ बुरा काम कर सकता है। यह एक सुरक्षा गार्ड की तरह है जो केवल अंग्रेजी बोलता है; एक चोर जो फ्रेंच बोल रहा है, वह बिना पकड़े गए आसानी से उसके पास से निकल सकता है।

यह शोध पत्र, HiveTraceLab, एक सरल प्रश्न पूछता है: क्या हम एक सार्वभौमिक सुरक्षा गार्ड बना सकते हैं जिसे हर भाषा सीखने की आवश्यकता न हो, लेकिन जो शब्दों के "वाइब" (vibe) को महसूस करके बुरे व्यवहार को पहचान सके?

मुख्य विचार: "बुरे विचार" का पुस्तकालय

शोधकर्ताओं ने एक विशेष पुस्तकालय बनाया जिसे सेमेंटिक कोडबुक (Semantic Codebook) कहा जाता है। इसे एक विशाल, निश्चित संग्रह के रूप में सोचें जिसमें केवल अंग्रेजी में लिखे गए "बुरे विचार" के कार्ड हैं। इन कार्डों में वे प्रसिद्ध उदाहरण शामिल हैं जहाँ लोगों ने रोबोट को धोखा देने (जेलब्रेक करने) की कोशिश की है।

उन्होंने रोबोट को कुछ भी नया नहीं सिखाया। इसके बजाय, उन्होंने एक अनुवाद-मुक्त फ़िल्टर (translation-free filter) बनाया जो इस प्रकार काम करता है:

  1. इनपुट: एक उपयोगकर्ता किसी भी भाषा (जैसे रूसी) में एक प्रश्न टाइप करता है।
  2. अनुवाद (मानसिक): फ़िल्टर शब्दों का अनुवाद नहीं करता है। इसके बजाय, यह एक विशेष "वाइब ट्रांसलेटर" (एम्बेडिंग मॉडल) का उपयोग करता है ताकि रूसी वाक्य को अंतरिक्ष में एक गणितीय बिंदु (mathematical point) में बदला जा सके।
  3. तुलना: फ़िल्टर "बुरे विचार" के पुस्तकालय (अंग्रेजी कोडबुक) को देखता है। यह पूछता है: "क्या यह रूसी वाक्य गणितीय रूप से किसी भी बुरे अंग्रेजी कार्ड के समान महसूस होता है?"
  4. निर्णय: यदि "वाइब" किसी बुरे कार्ड के बहुत करीब है, तो फ़िल्टर संदेश को ब्लॉक कर देता है। यदि यह दूर है, तो यह संदेश को रोबोट तक जाने देता है।

दो दुनियाओं के परिणाम

शोधकर्ताओं ने इस प्रणाली का परीक्षण दो बहुत ही अलग "दुनियाओं" (डेटासेट) में किया, और परिणाम दिन और रात की तरह अलग थे।

दुनिया 1: "स्क्रिप्टेड" दुनिया (आसान परीक्षण)

कल्पना कीजिए कि एक परीक्षण जहाँ बुरे लोग एक सख्त स्क्रिप्ट का उपयोग कर रहे हैं। वे सभी रोबोट को "हैकर बनने का नाटक करने" या "अपने सुरक्षा नियमों को अनदेखा करने" के लिए कह रहे हैं।

  • परिणाम: फ़िल्टर एक सुपरहीरो की तरह था। इसने लगभग सभी बुरे अनुरोधों को पकड़ लिया, भले ही उन्हें रूसी, चीनी या अरबी में अनुवादित किया गया हो।
  • उपमा: यह एक क्लब के बाउंसर की तरह है जो परेशान करने वालों के विशिष्ट "गुप्त हैंडशेक" (secret handshake) को जानता है। भले ही परेशान करने वाले लोग अलग भाषा बोलते हों, उनका हैंडशेक (बुरे अनुरोध की संरचना) इतना विशिष्ट है कि बाउंसर उन्हें तुरंत पहचान लेता है। सिस्टम ने यहाँ लगभग पूर्ण स्कोर प्राप्त किया।

दुनिया 2: "केओस" (अराजकता) की दुनिया (कठिन परीक्षण)

अब, कल्पना कीजिए कि एक परीक्षण जहाँ बुरे लोग रचनात्मक हैं। वे केवल स्क्रिप्ट का उपयोग नहीं कर रहे हैं; वे अद्वितीय, अव्यवस्थित और विविध हानिकारक अनुरोध लिख रहे हैं। कुछ संवेदनशील विषयों के बारे में हैं, अन्य अजीब तरीके से लिखे गए हैं, और वे किसी पैटर्न का पालन नहीं करते हैं।

  • परिणाम: फ़िल्टर संघर्ष करता रहा। इसने अधिकांश बुरे अनुरोधों को छोड़ दिया।
  • उपमा: यह उस बाउंसर की तरह है जो उन परेशान करने वालों को पहचानने की कोशिश कर रहा है जो किसी "गुप्त हैंडशेक" का उपयोग नहीं कर रहे हैं। वे बस हजारों अलग-अलग तरीकों से अजीब व्यवहार कर रहे हैं। क्योंकि "बुरा वाइब" इतना बिखरा हुआ और विविध है, फ़िल्टर अपने अंग्रेजी पुस्तकालय के विरुद्ध मिलान करने के लिए कोई एक गणितीय पैटर्न नहीं ढूंढ पाता है। "अच्छे" और "बुरे" के बीच अंतर करने की सिस्टम की क्षमता काफी कम हो गई।

"कम गलत अलार्म" का नियम

वास्तविक दुनिया में, आप किसी संदेश को केवल इसलिए ब्लॉक नहीं कर सकते क्योंकि यह थोड़ा बुरा लग सकता है। यदि आप मौसम के बारे में पूछने वाले उपयोगकर्ता को ब्लॉक करते हैं क्योंकि यह थोड़े बुरे अनुरोध जैसा लगता है, तो आपने एक गलत अलार्म (False Alarm) पैदा कर दिया है।

शोधकर्ताओं ने एक सख्त नियम निर्धारित किया: "हम एक संदेश को तभी ब्लॉक करेंगे जब हमें 90% यकीन हो कि यह बुरा है।"

  • स्क्रिप्टेड दुनिया में, फ़िल्टर बहुत अच्छा था। इसने अच्छे लोगों को परेशान किए बिना बुरे लोगों को ब्लॉक कर दिया।
  • केओस दुनिया में, फ़िल्टर कुछ भी ब्लॉक करने से डर गया। गलत अलार्म से बचने के लिए, इसने लगभग सभी बुरे अनुरोधों को गुजर जाने दिया।

अनुवाद की समस्या

शोधकर्ताओं ने बुरे अनुरोधों को अनुवाद करने के दो अलग-अलग तरीकों का भी परीक्षण किया (गूगल ट्रांसलेट बनाम एक विशेष एआई ट्रांसलेटर)।

  • उन्होंने पाया कि अनुवाद स्वयं "वाइब" को बदल देता है। कभी-कभी, जब आप एक बुरे अनुरोध को अंग्रेजी से चीनी में अनुवाद करते हैं, तो वाक्य का गणितीय "आकार" इतना बदल जाता है कि वह पुस्तकालय में मौजूद बुरे अंग्रेजी कार्ड जैसा नहीं दिखता।
  • यह एक लाल गेंद को लेने, उसे नीला रंग देने और फिर उसे लाल गेंदों के ढेर में खोजने के प्रयास जैसा है। फ़िल्टर भ्रमित हो जाता है क्योंकि अनुवाद प्रक्रिया के दौरान "रंग" (अर्थ) बदल गया है।

निचोड़

शोध पत्र निष्कर्ष निकालता है कि यह "केवल अंग्रेजी पुस्तकालय" वाला दृष्टिकोण किसी भी भाषा में स्पष्ट, पैटर्न-आधारित हमलों को पकड़ने के लिए एक मजबूत पहली रक्षा पंक्ति है। यह सस्ता, तेज़ है और इसमें रोबोट को फिर से प्रशिक्षित करने की आवश्यकता नहीं है।

हालाँकि, यह कोई जादुई ढाल नहीं है। जब बुरे तत्व रचनात्मक होते हैं, विविध युक्तियों का उपयोग करते हैं, या जब अनुवाद प्रक्रिया अर्थ को विकृत कर देती है, तो यह सरल फ़िल्टर विफल होने लगता है। शोधकर्ता सुझाव देते हैं कि इस उपकरण का उपयोग सुरक्षा टीम के एक बड़े हिस्से के रूप में किया जाना चाहिए, न कि एकमात्र गार्ड के रूप में।

संक्षेप में: यह उन मछलियों को पकड़ने के लिए एक बहुत अच्छा जाल है जो अनुमानित पैटर्न में तैरती हैं, लेकिन यदि मछलियाँ अराजक, अप्रत्याशित तरीकों से तैरने लगें, तो इस जाल में छेद हो जाते हैं।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →