← नवीनतम पेपर
🤖 AI

SlotGCG: Exploiting the Positional Vulnerability in LLMs for Jailbreak Attacks

यह शोध पत्र SlotGCG को प्रस्तुत करता है, जो एक नवीन जेलब्रेक हमला ढांचा (framework) है जो प्रतिकूल टोकन (adversarial token) प्रविष्टि के लिए सबसे संवेदनशील प्रॉम्प्ट "स्लॉट्स" की पहचान करके और उन्हें लक्षित करके लार्ज लैंग्वेज मॉडल्स में स्थितिजन्य कमजोरियों (positional vulnerabilities) का लाभ उठाता है, जिससे यह हमला सफलता दर, अभिसरण गति (convergence speed) और सुरक्षा प्रणालियों के विरुद्ध मजबूती के मामले में GCG जैसे मौजूदा तरीकों से काफी बेहतर प्रदर्शन करता है।

मूल लेखक: Seungwon Jeong, Jiwoo Jeong, Hyeonjin Kim, Yunseok Lee, Woojin Lee

प्रकाशित 2026-06-05
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Seungwon Jeong, Jiwoo Jeong, Hyeonjin Kim, Yunseok Lee, Woojin Lee

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

यहाँ "SLOTGCG: Exploiting the Positional Vulnerability in LLMs for Jailbreak Attacks" का सरल भाषा और रचनात्मक उपमाओं (analogies) के साथ विवरण दिया गया है।

बड़ी तस्वीर: दीवार में कमज़ोर कड़ी ढूँढना

एक Large Language Model (LLM) की कल्पना करें जो एक बहुत ही बुद्धिमान, लेकिन थोड़े शंकालु सुरक्षा गार्ड की तरह है, जो एक किले के गेट पर खड़ा है। इस गार्ड को किसी भी खतरनाक चीज़ (जैसे "बम कैसे बनाएँ?") के बारे में पूछने वाले को रोकने के लिए प्रशिक्षित किया गया है।

लंबे समय से, हैकर्स (या "रेड टीमर्स" जो सुरक्षा खामियों को खोजने की कोशिश कर रहे हैं) ने इस गार्ड को उनके अनुरोध के बिल्कुल अंत में एक गुप्त कोड फुसफुसाकर चकमा देने की कोशिश की है। यह ठीक वैसा ही है जैसे गेट बंद करने से ठीक पहले गार्ड के हाथ में एक नोट थमा देना। इस पद्धति को GCG (Greedy Coordinate Gradient) कहा जाता है।

यह शोध पत्र तर्क देता है कि गार्ड केवल अंत की निगरानी नहीं कर रहा है। गार्ड वास्तव में उन चीज़ों से विचलित हो रहा है जो पूरी लाइन में—बीच में, शुरुआत में, और बीच-बीच में हर जगह—हो रही हैं। शोधकर्ताओं ने पाया कि "सुरक्षा गार्ड" के पास वाक्य के अलग-अलग स्थानों पर विशिष्ट ब्लाइंड स्पॉट्स (कमज़ोर बिंदु) होते हैं, न कि केवल अंत में।

समस्या: केवल पिछले दरवाज़े पर दस्तक देना

पुराना तरीका (GCG) एक ऐसे चोर की तरह है जो केवल पिछले दरवाज़े का ताला खोलने की कोशिश करता है। वे मान लेते हैं कि पिछला दरवाज़ा ही सबसे कमज़ोर बिंदु है।

  • वास्तविकता: कभी-कभी पिछला दरवाज़ा वास्तव में सबसे मज़बूत होता है। कभी-कभी सामने का दरवाज़ा, या घर के बीच में स्थित कोई खिड़की, पूरी तरह खुली होती है।
  • सीमा: केवल पिछले दरवाज़े (प्रॉम्ट के अंत) को देखकर, हैकर्स अंदर जाने के कई आसान तरीकों को मिस कर रहे थे।

समाधान: SLOTGCG (द "स्लॉट" डिटेक्टिव)

लेखकों ने SlotGCG नामक एक नया टूल बनाया है। केवल यह अनुमान लगाने के बजाय कि कमज़ोर जगह कहाँ है, यह टूल एक विशेष टॉर्च वाले जासूस की तरह काम करता है।

1. "स्लॉट्स" (खाली स्थान)

कल्प diजिये कि आपका वाक्य डिब्बों वाली एक ट्रेन है: [How] [to] [make] [bomb]
हर डिब्बे के बीच में, और पहले डिब्बे से पहले और आखिरी डिब्बे के बाद, एक खाली जगह है। शोधकर्ता इन जगहों को "स्लॉट्स" (Slots) कहते हैं।

  • स्लॉट 0: "How" से पहले
  • स्लॉट 1: "How" और "to" के बीच
  • स्लॉट 2: "to" और "make" के बीच
    ...और इसी तरह।

2. "वल्नरेबल स्लॉट स्कोर" (VSS) (टॉर्च की रोशनी)

शोधकर्ताओं ने महसूस किया कि मॉडल का ध्यान (attention) इस बात पर निर्भर करता है कि शब्द कहाँ रखे गए हैं। उन्होंने Vulnerable Slot Score (VSS) नामक एक मीट्रिक बनाया।

  • उपमा: मॉडल के ध्यान को एक स्पॉटलाइट की तरह समझें। शोधकर्ता हर एक स्लॉट में एक "प्रोब" लाइट जलाते हैं।
  • खोज: उन्होंने पाया कि कुछ वाक्यों के लिए, स्पॉटलाइट वाक्य के बिल्कुल बीच में सबसे तेज़ (सबसे अधिक संवेदनशील) होती है। दूसरों के लिए, यह शुरुआत के पास होती है। "पिछला दरवाज़ा" (अंत) शायद ही कभी सबसे चमकदार स्थान होता है।
  • जादू: उन्होंने पाया कि ये चमकदार बिंदु (bright spots) शब्दों के बदलने पर भी चमकते रहते हैं। यह संवेदनशीलता शब्दों के विशिष्ट उपयोग में नहीं, बल्कि वाक्य की संरचना में बसी होती है।

3. हमला रणनीति (सेना को तैनात करना)

एक बार जब SlotGCG पहचान लेता है कि कौन से स्लॉट सबसे "चमकदार" (सबसे अधिक संवेदनशील) हैं, तो यह अपने सभी "एडवर्सरियल टोकन्स" (गुप्त कोड शब्द) को अंत में नहीं डालता।

  • पुराना तरीका: वाक्य के बिल्कुल अंत में 20 गुप्त शब्द डाल देना।
  • SlotGCG का तरीका: यह उन 20 शब्दों को लेता है और उन्हें खोजे गए विशिष्ट "चमकदार" स्लॉट्स में बिखेर देता है। कुछ बीच में, कुछ शुरुआत के पास, कुछ अंत के पास।

यह बेहतर क्यों काम करता है

यह शोध पत्र दावा करता है कि यह दृष्टिकोण एक सैन्य रणनीति की तरह है:

  • GCG (पुराना तरीका): अपने सभी सैनिकों को एक ही गेट पर हमला करने के लिए भेजना। यदि वह गेट कड़ी सुरक्षा वाला है, तो आप विफल हो जाते हैं।
  • SlotGCG (नया तरीका): अपने सैनिकों को एक साथ सामने के गेट, बगल की खिड़की और पिछले दरवाज़े पर हमला करने के लिए भेजना। भले ही गार्ड एक जगह को ब्लॉक कर दे, अन्य जगहों से घुसपैठ हो जाएगी।

परिणाम: शोध पत्र ने क्या पाया

शोधकर्ताओं ने कई मॉडलों (जैसे Llama, Mistral, और Qwen) पर इसका परीक्षण किया और पाया:

  1. उच्च सफलता दर: SlotGCG ने पुराने तरीकों की तुलना में सुरक्षा गार्डों को 14% अधिक बार तोड़ा। इसने उन मॉडलों को सफलतापूर्वक धोखा दिया जिन्हें पहले बहुत सुरक्षित माना जाता था।
  2. तेज़: इसने "कमज़ोर जगह" को ढूँढा और बहुत तेज़ी से अंदर घुस गया। इसे सफल होने के लिए कम प्रयासों (iterations) की आवश्यकता पड़ी।
  3. रोकना कठिन: जब मॉडलों ने सुरक्षा उपकरण (जैसे संदिग्ध शब्दों को हटाने वाले फिल्टर) का उपयोग करने की कोशिश की, तो SlotGCG को रोकना बहुत कठिन था। क्योंकि "बुरे शब्द" पूरे वाक्य में बिखरे हुए थे, इसलिए कुछ शब्दों को हटाने से हमला नहीं रुका। पुराने तरीके, जो सभी बुरे शब्दों को अंत में रखते थे, उस एक हिस्से को हटाकर आसानी से रोके जा सकते थे।

एक वाक्य में सारांश

यह शोध पत्र दिखाता है कि AI सुरक्षा गार्ड वाक्य के बीच में होने वाली चीज़ों से विचलित हो जाते हैं, और उन विशिष्ट मध्य स्थानों में "ट्रिक वर्ड्स" (धोखा देने वाले शब्द) बिखेरकर, हैकर्स सुरक्षा फिल्टरों को बहुत अधिक प्रभावी ढंग से बायपास कर सकते हैं।

(नोट: यह स्पष्टीकरण हमले के तंत्र और कमजोरियों के बारे में शोध पत्र के दावों पर आधारित है। शोध पत्र इसका उपयोग नैदानिक, चिकित्सा या लाभकारी अनुप्रयोगों के लिए करने का प्रस्ताव नहीं करता है, बल्कि इसे इन सुरक्षा खामियों को समझने और ठीक करने के एक उपकरण के रूप में प्रस्तुत करता है।)

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →