← नवीनतम पेपर
💻 computer science

Revisiting JBShield: Breaking and Rebuilding Representation-Level Jailbreak Defenses

यह शोध पत्र प्रदर्शित करता है कि JBShield जेलब्रेक डिफेंस अपने अवधारणा-आधारित डिटेक्शन में संरचनात्मक खामियों का फायदा उठाकर एक नए एडेप्टिव अटैक (JB-GCG) के प्रति असुरक्षित है, और एक अधिक सुदृढ़ मल्टी-लेयर रिप्रेजेंटेशन ट्राजेक्टरी वेरिफिकेशन (RTV) डिफेंस का प्रस्ताव करता है जो नए और आगामी एडेप्टिव अटैक्स के विरुद्ध लगभग पूर्ण डिटेक्शन प्राप्त करता है।

मूल लेखक: Kemal Derya, Berk Sunar

प्रकाशित 2026-05-06
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Kemal Derya, Berk Sunar

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि लार्ज लैंग्वेज मॉडल्स (LLMs) अत्यधिक प्रशिक्षित, विनम्र रोबोट हैं। हमने उन्हें मददगार बनाया है, लेकिन साथ ही उन्हें खतरनाक या बुरे काम करने के लिए कहे जाने पर "ना" कहना भी सिखाया है। इसे "अलाइनमेंट" (alignment) कहा जाता है। हालाँकि, चतुर हैकर्स ने इन रोबोट्स को उनके सुरक्षा नियमों को अनदेखा करने के लिए धोखा देने के तरीके खोज लिए हैं। इन तरकीबों को "जेलब्रेक्स" (jailbreaks) कहा जाता है।

यह शोध पत्र एक सुरक्षा गार्ड, एक चतुर हैकर और एक नए, स्मार्ट सुरक्षा तंत्र की कहानी है।

पुराना गार्ड: JBShield

शोधकर्ताओं ने एक हालिया सुरक्षा प्रणाली JBShield को देखकर शुरुआत की। सोचिए कि JBShield एक क्लब का बाउंसर है जो किसी को भी अंदर जाने देने से पहले दो विशिष्ट आईडी (ID) की जाँच करता है:

  1. "टॉक्सिक" (Toxic) आईडी: क्या यह व्यक्ति बुरा व्यवहार कर रहा है?
  2. "जेलब्रेक" (Jailbreak) आईडी: क्या यह व्यक्ति कोई चाल चलने की कोशिश कर रहा है?

JBShield का एक सख्त नियम है: फ्लैग होने के लिए आपके पास दोनों आईडी होनी चाहिए। यदि आपके पास केवल एक है, या दोनों में से कोई नहीं है, तो बाउंसर आपको जाने देता है। JBShield के रचनाकारों ने दावा किया कि यह पूर्ण था, जो 100% हमलों को रोकता है।

हैकर की सफलता: JB-GCG

लेखकों ने यह परीक्षण करने के लिए कि क्या JBShield वास्तव में अटूट है, खुद को एक "व्हाइट-हैट" हैकर (वह व्यक्ति जो चीजों को ठीक करने के लिए उन्हें तोड़ता है) के रूप में प्रस्तुत किया, जिसके पास इस बात का पूरा ज्ञान था कि बाउकर कैसे काम करता है।

उन्होंने बाउंसर के तर्क में एक खामी खोजी। क्योंकि बाउंसर को अलार्म बजाने के लिए दोनों आईडी की आवश्यकता थी, हैकर ने महसूस किया कि उसे केवल एक को छिपाने की आवश्यकता थी।

उन्होंने JB-GCG नामक एक नया हमला बनाया। कल्पना कीजिए कि एक जासूस एक ऐसा भेष धारण करता है जो उसे पूरी तरह से निर्दोष दिखाता है (टॉक्सिक आईडी को छिपाना) लेकिन फिर भी वह एक गुप्त हथियार (जेलब्रेक आईडी को सक्रिय रखना) साथ रखता है। क्योंकि बाउंसर को केवल दोनों की जाँच करनी होती है, वह निर्दोष भेष को देखता है और जासूस को अंदर जाने देता है।

परिणाम: हैकर सफलतापूर्वक रोबोट को बुरी चीजें करने के लिए 53.4% बार धोखा देने में सफल रहा, भले ही मूल सुरक्षा प्रणाली ने 100% सुरक्षित होने का दावा किया था। इसने साबित कर दिया कि एक प्रणाली सामान्य परीक्षणों के खिलाफ मजबूत दिख सकती है, लेकिन जब एक स्मार्ट दुश्मन उसके विशिष्ट नियमों के अनुकूल हो जाता है, तो वह ढह जाती है।

नया समाधान: RTV (द "फिंगरप्रिंट" स्कैनर)

लेखकों ने महसूस किया कि जबकि हैकर बाउंसर की दो विशिष्ट जाँचों को मूर्ख बनाने में अच्छा था, हैकर ने एक अलग तरह का निशान छोड़ा।

जब एक सामान्य व्यक्ति कोई प्रश्न पूछता है, तो रोबोट का मस्तिष्क ऊपर से नीचे तक एक सुसंगत, अनुमानित पैटर्न में चमकता है। जब एक हैकर रोबोट को धोखा देने की कोशिश करता है, तो उसे शुरुआत में (टॉक्सिक आईडी को छिपाने के लिए) रोबोट के मस्तिष्क को अलग तरह से कार्य करने के लिए मजबूर करना पड़ता है, लेकिन रोबोट की अपनी आंतरिक प्रक्रिया अंत तक इसे गड़बड़ कर देती है, जिससे पैटर्न अजीब और असंगत दिखाई देता है।

लेखकों ने एक नया बचाव बनाया जिसे RTV (Representation Trajectory Verification) कहा जाता है।

उपमा (Analogy):

  • JBShield एक व्यक्ति के चेहरे और उसके जूतों को दरवाजे पर देखने जैसा था। यदि चेहरा ठीक दिखता है, तो आप उसे अंदर जाने देते हैं।
  • RTV एक सुरक्षा कैमरे की तरह है जो पूरे गलियारे में व्यक्ति के चलने की निगरानी करता है। यह केवल उनके चेहरे या जूतों को नहीं देखता; यह जाँचता है कि क्या उनका चाल (gait) शुरुआत से अंत तक सुसंगत है।

एक सामान्य व्यक्ति सुचारू रूप से चलता है। एक हैकर जो घुसपैटने की कोशिश कर रहा है, उसे अपनी पहचान छिपाने के लिए शुरुआत में लंगड़ाना पड़ता है, लेकिन जैसे-जैसे वह गलियारे में आगे बढ़ता है, उसका लंगड़ाना और भी खराब या बदल जाता है। RTV इस "लंगड़ाहट" (असंगति) को पहचान लेता है और उन्हें पकड़ लेता है।

यह कैसे काम करता है:

  1. यह तीन अलग-अलग स्तरों पर (जैसे गलियारे के शुरू, मध्य और अंत में देखना) रोबोट की मस्तिष्क गतिविधि को देखता है।
  2. यह जाँचता है कि "अस्वीकार" (refusal) का संकेत इन सभी स्तरों पर कितना सुसंगत है।
  3. यह महालनोबिस डिस्टेंस (Mahalanobis distance) नामक एक गणितीय उपकरण (इसे "अजीब होने का मीटर" समझें) का उपयोग करता है ताकि यह देखा जा सके कि पैटर्न एक सामान्य व्यक्ति का है या हैकर का।

परिणाम:

  • हैकर की नई ट्रिक (JB-GCG) के खिलाफ, RTV ने 100% प्रयासों को पकड़ा।
  • इसे सीखने के लिए इसे किसी पिछले हैक को देखने की आवश्यकता नहीं थी; इसे बस यह जानने की आवश्यकता थी कि "सामान्य" क्या है।

अंतिम मुकाबला: क्या हैकर नए सिस्टम को हरा सकता है?

लेखक वहीं नहीं रुके। उन्होंने अपने स्वयं के नए सिस्टम (RTV) को तोड़ने के लिए एक और भी स्मार्ट, अधिक शक्तिशाली हमले के साथ परीक्षण किया। उन्होंने हैकर को नए सुरक्षा कैमरे और "अजीब होने के मीटर" का पूरा ज्ञान दे दिया।

परिणाम:

  • हैकर अभी भी सिस्टम को तोड़ सकता था, लेकिन यह अविश्वसनीय रूप से कठिन था।
  • हैकर की सफलता दर 53% से गिरकर केवल 7% रह गई।
  • इस मामूली सफलता को प्राप्त करने के लिए, हैकर को पहले की तुलना में 13 गुना अधिक कंप्यूटिंग पावर (ऊर्जा और समय) खर्च करनी पड़ी।

हैकर क्यों विफल हुआ?
लेखक बताते हैं कि नया सिस्टम हैकर के लिए एक "तनाव" या "कैच-22" (दुविधा) पैदा करता है। अपनी पहचान छिपाने के लिए, हैकर को शुरुआत में रोबोट के मस्तिष्क को "सामान्य" दिखाना होगा। लेकिन रोबोट को बुरा करने के लिए धोखा देने के लिए, हैकर को बाद में मस्तिष्क को "असामान्य" दिखाना होगा। हैकर एक ही समय में दोनों काम नहीं कर सकता। यह एक साथ आगे चलते हुए पीछे की ओर चलने की कोशिश करने जैसा है; आप बस फंस जाते हैं।

सारांश

  1. पुरानी सुरक्षा (JBShield): दो विशिष्ट चीजों की जाँच करती थी। हैकर्स ने एक को छिपाकर एक खामी ढूंढ ली।
  2. हमला (JB-GCG): खामी का फायदा उठाया, जिससे सुरक्षा प्रणाली 53% बार टूट गई।
  3. नई सुरक्षा (RTV): पूरे सिस्टम में रोबोट की "विचार प्रक्रिया" की निरंतरता की जाँच करती है, न कि केवल एक स्थान पर।
  4. अंतिम निर्णय: नया बचाव बहुत अधिक मजबूत है। यह लगभग हर बार हैकर को पकड़ लेता है, और इसे तोड़ने के लिए इतनी मेहनत की आवश्यकता होती है कि यह अधिकांश हमलावरों के लिए अव्यवहारिक हो जाता है।

शोध पत्र निष्कर्ष निकालता है कि रोबोट की सोचने की प्रक्रिया के केवल एक बिंदु पर उसकी सुरक्षा की जाँच करना पर्याप्त नहीं है। धोखेबाजों को पकड़ने के लिए आपको पूरी यात्रा की निगरानी करनी होगी।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →