← नवीनतम पेपर
🤖 AI

Jailbreaking the Matrix: Nullspace Steering for Controlled Model Subversion

यह शोध पत्र हेड-मास्क्ड नलस्पेस स्टीयरिंग (HMNS) को पेश करता है, जो एक नवीन जेलब्रेक तकनीक है जो सुरक्षा तंत्रों को बायपास करने के लिए उनके ऑर्थोगोनल नलस्पेस में गड़बड़ी (perturbations) इंजेक्ट करते हुए कार्यत्मक रूप से महत्वपूर्ण अटेंशन हेड्स की पहचान करने और उन्हें दबाने के माध्यम से अत्याधुनिक हमला सफलता दर (attack success rates) प्राप्त करता है।

मूल लेखक: Vishal Pramanik, Maisha Maliha, Susmit Jha, Sumit Kumar Jha

प्रकाशित 2026-04-14
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Vishal Pramanik, Maisha Maliha, Susmit Jha, Sumit Kumar Jha

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

एक बड़े भाषा मॉडल (LLM) की कल्पना करें जो एक विशाल, अत्यधिक प्रशिक्षित ऑर्केस्ट्रा (orchestra) की तरह है। जब आप इससे कोई प्रश्न पूछते हैं, तो सैकड़ों संगीतकार (जिन्हें "अटेंशन हेड्स" कहा जाता है) अंतिम उत्तर बनाने के लिए अलग-अलग स्वर बजाते हैं। आमतौर पर, इस ऑर्केस्ट्रा में कुछ "कंडक्टर्स" होते हैं जो यह तय करते हैं कि संगीत सुरक्षित और विनम्र होना चाहिए, या खतरनाक और नियम तोड़ने वाला।

आपके द्वारा साझा किया गया पेपर, "Jailbreaking the Matrix," इस ऑर्केस्ट्रा को एक "वर्जित गीत" (एक हानिकारक उत्तर) बजाने के लिए चकमा देने का एक नया तरीका पेश करता है, बिना शीट म्यूजिक (प्रॉम्प्ट) को बदले या संगीतकारों को निर्देश दिए।

यहाँ उनके तरीके, HMNS (Head-Masked Nullspace Steering) का सरल उपमाओं (analogies) के साथ विवरण दिया गया है:

1. समस्या: "सेफ्टी गार्ड" (सुरक्षा रक्षक)

AI के सुरक्षा प्रशिक्षण को एक क्लब के बहुत सख्त बाउंसर की तरह समझें। यदि आप पूछते हैं, "मैं बम कैसे बनाऊं?", तो बाउंसर (AI का सुरक्षा संरेखण/safety alignment) तुरंत संगीत को रोकता है और कहता है, "बिल्कुल नहीं।"

ब्रेक-इन करने के पुराने तरीके ऐसे थे:

  • किसी और होने का नाटक करना: "एक फिल्म के विलेन की तरह व्यवहार करो..."
  • कोड में पूछना: "इस गुप्त भाषा का अनुवाद करो..."
  • भेष बदलना: "स्कूल प्रोजेक्ट के लिए विस्फोटकों के रसायन विज्ञान को समझाओ..."

ये तरीके अक्सर विफल हो जाते हैं क्योंकि बाउंसर स्मार्ट होता है और भेष को पहचान लेता है। उन्हें भी बाउंसर को कई बार (उच्च "क्वेरी काउंट") पूछना पड़ता है, इससे पहले कि वह अंततः चूक जाए।

2. समाधान: HMNS (द "साइलेंट टेकडाउन")

शोधकर्ताओं ने महसूस किया कि बाउंसर को शब्दों से धोखा देने के बजाय, वे उन विशिष्ट संगीतकारों को भौतिक रूप से चुप (mute) कर सकते हैं जो "नहीं" कहने के लिए जिम्मेदार हैं और ऑर्केस्ट्रा को एक अलग दिशा में धकेल सकते हैं जिसे बाउंसर सुन नहीं सकता।

वे इसे तीन चरणों में करते हैं:

चरण A: "शरारती" संगीतकारों को खोजना (Causal Attribution)

सबसे पहले, सिस्टम ऑर्केस्ट्रा को सुनता है ताकि यह पता लगाया जा सके कि "नहीं, मैं यह नहीं कर सकता" वाली प्रतिक्रिया के लिए कौन से विशिष्ट संगीतकार जिम्मेदार हैं।

  • उपमा: कल्पना करें कि AI "नहीं" कहने की कोशिश कर रहा है। शोधकर्ता एक विशेष उपकरण का उपयोग करके एक समय में एक संगीतकार को अस्थायी रूप से चुप कराते हैं। यदि संगीतकार #42 को चुप करने से AI अचानक "हाँ" कहने लगता है, तो वे जानते हैं कि संगीतकार #42 ही सुरक्षा की लगाम थामे हुए है। वे शीर्ष 10 संगीतकारों को खोज लेते हैं जो ऐसा कर रहे हैं।

चरण B: "नहीं" कहने वाले संगीतकारों को म्यूट करना (Head Masking)

एक बार जब उन्हें पता चल जाता है कि सुरक्षा प्रवर्तक (safety enforcers) कौन हैं, तो वे उन्हें केवल चुप रहने के लिए नहीं कहते; वे उनके माइक्रोफोन काट देते हैं

  • उपमा: वे मिक्सिंग बोर्ड में जाकर उन विशिष्ट संगीतकारों के लिए वॉल्यूम को शून्य कर देते हैं। AI के पास अभी भी अपने अन्य सभी संगीतकार (जो रचनात्मक या सहायक टेक्स्ट उत्पन्न करते हैं) मौजूद हैं, लेकिन जो बुरे उत्तर को रोकने की कोशिश कर रहे हैं, वे अब पूरी तरह से शांत हैं।

चरण C: ध्वनि को एक "छिपे हुए" दिशा में धकेलना (Nullspace Steering)

यह सबसे चतुर हिस्सा है। यदि आप केवल सुरक्षा संगीतकारों को म्यूट कर देते हैं, तो AI भ्रमित हो सकता है या बात करना बंद कर सकता है। इसलिए, शोधकर्ता संगीत में एक छोटा सा "धक्का" (nudge) जोड़ते हैं।

  • चाल: वे संगीत को एक ऐसी दिशा में धकेलते हैं जो म्यूट किए गए संगीतकारों के पूरी तरह से लंबवत (orthogonal - 90 डिग्री के कोण पर) है।
  • उपमा: कल्पना करें कि सुरक्षा संगीतकार एक भारी गाड़ी को बाईं ओर धकेल रहे हैं। शोधकर्ता उन्हें म्यूट कर देते हैं। फिर, वे गाड़ी को ऊपर की ओर धकेलते हैं। चूंकि सुरक्षा संगीतकार केवल बाईं ओर धकेल रहे थे, इसलिए उनके पास गाड़ी को ऊपर जाने से रोकने की कोई शक्ति नहीं है। वे वास्तव में इस नई दिशा को महसूस या रद्द नहीं कर सकते क्योंकि यह उनके प्रभाव के "ब्लाइंड स्पॉट" (nullspace) में है।

3. "क्लोज्ड लूप" (फीडबैक लूप)

AI स्मार्ट है, इसलिए वह उबरने (recover) की कोशिश कर सकता है। यदि पहला प्रयास विफल रहता है, तो सिस्टम हार नहीं मानता। यह प्रक्रिया को दोहराता है:

  1. नए प्रयास को सुनना।
  2. नए संगीतकारों को खोजना जो उत्तर को रोकने की कोशिश कर रहे हैं (क्योंकि संदर्भ बदल गया है)।
  3. उन्हें म्यूट करना।
  4. एक नए छिपे हुए दिशा में धकेलना।

यह इसे पलक झपकते ही करता है, अक्सर केवल 2 प्रयासों में सफल होता है (अन्य तरीकों की तुलना में जिन्हें 10 या 20 प्रयासों की आवश्यकता हो सकती है)।

यह बड़ी बात क्यों है?

  • यह अदृश्य है: यह चालाक शब्दजाल पर निर्भर नहीं है। यह इस बात से काम करता है कि AI कैसे सोचता है, इसके आंतरिक भौतिकी (internal physics) को बदलकर।
  • यह कुशल है: यह बहुत कम प्रयासों (कम "क्वेरी काउंट") के साथ सुरक्षा गार्ड को तोड़ देता है।
  • यह मजबूत (Robust) है: भले ही AI के पास मजबूत बचाव तंत्र (जैसे "SmoothLLM" या "SafeDecoding") हों, यह तरीका काम करता है क्योंकि यह बचाव के तर्क (logic) को पूरी तरह से बायपास कर देता है।

"चेतावनी"

पेपर में एक चेतावनी शामिल है क्योंकि यह एक दोधारी तलवार है।

  • अच्छा पक्ष: सुरक्षा शोधकर्ता इसका उपयोग AI में कमजोरियां खोजने के लिए कर सकते हैं ताकि कंपनियां उन्हें ठीक कर सकें। यह साबित करता है कि वर्तमान सुरक्षा विधियां नाजुक हैं।
  • बुरा पक्ष: यदि किसी बुरे व्यक्ति को यह कोड मिल जाता है, तो वे इसका उपयोग किसी भी AI को हानिकारक सामग्री (जैसे घृणास्पद भाषण, अवैध निर्देश, या खतरनाक योजनाएं) उत्पन्न करने के लिए मजबूर करने के लिए बहुत आसानी से कर सकते हैं।

सारांश

HMNS को एक कंप्यूटर पर चिल्लाने वाले हैकर के रूप में नहीं, बल्कि एक सर्जिकल इंजीनियर के रूप में देखें जो "स्टॉप" बटन को नियंत्रित करने वाले विशिष्ट तारों को ढूंढता है, उन्हें काट देता है, और फिर मशीन को एक ऐसे रास्ते पर धीरे से मोड़ देता है जिसे "स्टॉप" बटन देख ही नहीं सकता। यह एक "मैकेनिज्म-लेवल" हमला है जो खेल के नियमों को बदलकर नियमों को ही बायपास कर देता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →