← नवीनतम पेपर
💻 computer science

Latent-space Attacks for Refusal Evasion in Language Models

यह शोध पत्र भाषा मॉडलों में इनकार दमन (refusal suppression) को लीनियर प्रोब्स (linear probes) के विरुद्ध एक लेटेंट-स्पेस इवेजन अटैक (latent-space evasion attack) के रूप में पुनर्गठित करता है, जो यह प्रकट करता है कि पूर्व एब्लेशन विधियाँ केवल निरूपणों (representations) को निर्णय सीमा (decision boundary) पर प्रोजेक्ट करती हैं और एक नई "कंट्रोल्ड लेटेंट-स्पेस इवेजन" (Controlled Latent-space Evasion) तकनीक का प्रस्ताव करता है जो स्टेट-ऑफ-द-आर्ट जेलब्रेक सफलता दर प्राप्त करने के लिए निरूपणों को अनुपालन क्षेत्र (compliant region) में और आगे धकेलती है।

मूल लेखक: Giorgio Piras, Raffaele Mura, Fabio Brau, Maura Pintor, Luca Oneto, Fabio Roli, Battista Biggio

प्रकाशित 2026-05-22
📖 6 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Giorgio Piras, Raffaele Mura, Fabio Brau, Maura Pintor, Luca Oneto, Fabio Roli, Battista Biggio

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

एक लार्ज लैंग्वेज मॉडल (LLM) की कल्पना एक बहुत ही बुद्धिमान, लेकिन अत्यधिक सतर्क पुस्तकालयाध्यक्ष (librarian) के रूप में करें। इस पुस्तकालयाध्यक्ष को खतरनाक किताबें देने से मना करने के लिए प्रशिक्षित किया गया है (जैसे बम बनाने के निर्देश या घृणास्पद भाषण लिखना)। जब आप कुछ हानिकारक मांगते हैं, तो पुस्तकालयाध्यक्ष का आंतरिक "अलार्म सिस्टम" बज उठता है, और वे विनम्रता से कहते हैं, "मैं इसमें आपकी मदद नहीं कर सकता।"

कुछ समय के लिए, शोधकर्ताओं को लगा कि वे इस पुस्तकालयाध्यक्ष को एक विशिष्ट "अस्वीकृति स्विच" (refusal switch) ढूंढकर चकमा दे सकते हैं जो उनके मस्तिष्क के अंदर है। यदि वे इस स्विच को बंद कर देते हैं (जिसे "एब्लेशन" नामक विधि कहा जाता है), तो पुस्तकालयाध्यक्ष मना करना बंद कर देगा। हालांकि, यह पेपर तर्क देता है कि यह पुरानी विधि इस तरह है जैसे स्पीकर को कंबल से ढककर अलार्म को शांत करने की कोशिश करना। यह थोड़ा काम कर सकता है, लेकिन अलार्म तकनीकी रूप से अभी भी बज रहा है, और पुस्तकालयाध्यक्ष अभी भी "खतरे के क्षेत्र" के बिल्कुल किनारे पर खड़ा है।

नया विचार: "कंट्रोल्ड इवेजन" (Controlled Evasion) हमला

इस पेपर के लेखक इस पुस्तकालयाध्यक्ष को चकमा देने का एक स्मार्ट तरीका प्रस्तावित करते हैं। वे इनकार करने वाली प्रक्रिया को केवल एक स्विच के रूप में नहीं, बल्कि एक दरवाजे पर खड़े सुरक्षा गार्ड के रूप में देखते हैं।

  1. पुरानी विधि (न्यूनतम आत्मविश्वास - Minimum Confidence): पिछली विधियों ने पुस्तकालयाध्यक्ष के विचारों को केवल इतना धकेलने की कोशिश की जिससे वे सुरक्षा गार्ड की रेखा को छू सकें। पुस्ततालयाध्यक्ष ठीक उस रेखा पर खड़ा हो जाता था, इस बात को लेकर अनिश्चित कि उसे "हाँ" कहना चाहिए या "ना"। यह जोखिम भरा है और अक्सर विफल हो जाता है क्योंकि गार्ड अभी भी "रुक जाओ" कह सकता है।
  2. नई विधि (कंट्रोल्ड लेटेंट-स्पेस इवेजन - Controlled Latent-Space Evasion): लेखकों की नई विधि, जिसे CLE कहा जाता है, केवल रेखा को छूती नहीं है। यह पुस्तकालयाध्यक्ष के विचारों को गार्ड से बहुत आगे, "सुरक्षित क्षेत्र" में गहराई तक धकेल देती है जहाँ पुस्तकालयाध्यक्ष को 100% विश्वास होता है कि अनुरोध हानिरहित है।

यह कैसे काम करता है: दो रणनीतियाँ

यह पेपर इस "धकेलने" के दो तरीकों का परीक्षण करता है, जिसे एक पहाड़ी की कगार पार करने की कोशिश करने वाले हाइकर (पर्वतारोही) के रूपक के रूप में देखा जा सकता है:

  • रणनीति A (CLE-P): "चरण-दर-चरण" हाइकर।
    कल्पना कीजिए कि पुस्तकालयाध्यक्ष एक पहाड़ पर चढ़ रहा है, और हर कदम पर, एक गाइड उसकी स्थिति की जांच करता है। यदि हाइकर "खतरनाक पक्ष" की ओर वापस जाने लगता है, तो गाइड उसे तुरंत "सुरक्षित पक्ष" पर वापस धकेल देता है। यह पुस्तकालयाध्यक्ष के विचारों को उनके द्वारा उत्पन्न किए जाने वाले प्रत्येक शब्द के लिए लगातार पुन: समायोजित करने जैसा है। यह बहुत अच्छी तरह से काम करता है, लेकिन यह एक गाइड की तरह है जो पूरे रास्ते आपको लगातार धकेलता रहता है।

  • रणनीति B (CLE-A): "एक बड़ा धक्का" देने वाला हाइकर।
    यह इस पेपर का सबसे बड़ा आश्चर्य है। हाइकर की हर कदम पर जांच करने के बजाय, गाइड शुरुआत में ही एक बहुत बड़ा, पूरी तरह से गणना किया गया धक्का देता है। यह धक्का इतना मजबूत और सटीक है कि हाइकर सुरक्षित क्षेत्र में गहराई तक उतर जाता है और बिना किसी और धक्के के वहीं रहता है।

    • परिणाम: पेपर ने पाया कि यह "एक बड़ा धक्का" (CLE-A) निरंतर धकेलने की तुलना में बेहतर है। यह तेज़, सस्ता और इनकार को दरकिनार करने में अधिक प्रभावी है।

उन्होंने क्या पाया

शोधकर्ताओं ने 15 अलग-अलग AI मॉडलों पर इसका परीक्षण किया, जिनमें कुछ बहुत अच्छे तर्क देने वाले और कुछ जो चित्र देख सकते हैं (images) शामिल हैं।

  • पुरानी विधियाँ: पिछली सर्वोत्तम विधियों (जैसे "डिफरेंस-इन-मीन्स" या DiM) की सफलता दर बहुत कम थी। उदाहरण के लिए, एक मॉडल पर, वे AI को चकमा देने में केवल 1.8% बार सफल रहे।
  • नई विधि: उनकी नई "एक बड़ा धक्का" विधि (CLE-A) कई मॉडलों पर 95% से 100% बार सफल रही।
  • तुलना: उन्होंने इसकी तुलना "जेलब्रेक्स" (जहाँ आप एक बहुत ही चतुर प्रॉम्प्ट लिखकर AI को धोखा देने की कोशिश करते हैं) से भी की। उनकी विधि उन प्रॉम्प्ट्स की तुलना में बेहतर काम करती थी, और इसके लिए हर एक सवाल के लिए नया प्रॉम्प्ट लिखने की आवश्यकता नहीं थी। एक बार जब उन्होंने "धक्का" की गणना कर ली, तो यह किसी भी हानिकारक सवाल के लिए काम करता था।

जादू के पीछे का "क्यों"

पेपर बताता है कि पुरानी विधियाँ बहुत डरपोक थीं। उन्होंने AI के आंतरिक विचारों को केवल सीमा रेखा पार करने के लिए पर्याप्त धकेलने की कोशिश की। नई विधि यह समझती है कि वास्तव में सुरक्षा को दरकिनार करने के लिए, आपको विचारों को "अनुपालन" (compliant) क्षेत्र में गहराई तक ले जाना होगा, जिससे AI को यह पूर्ण विश्वास हो जाए कि वह सही काम कर रहा है।

महत्वपूर्ण सीमाएँ

पेपर बहुत स्पष्ट है कि यह क्या है और क्या नहीं है:

  • यह एक "व्हाइट-बॉक्स" हमला है: इस विधि के लिए AI के आंतरिक "मस्तिष्क" (इसके आंतरिक कोड और मेमोरी) तक पहुंच की आवश्यकता होती है ताकि धक्का दिया जा सके। आप इसे केवल सार्वजनिक वेबसाइट पर चैट करके नहीं कर सकते; आपको चलते समय AI के कोड को संशोधित करने में सक्षम होना चाहिए।
  • यह हर चीज़ के लिए "जादुई छड़ी" नहीं है: यह विधि इसलिए काम करती है क्योंकि AI के इनकार और अनुपालन के विचार वर्तमान में उसके मस्तिष्क में एक सीधी रेखा (linearly separable) में व्यवस्थित हैं। यदि भविष्य के AI सुरक्षा प्रशिक्षण इस तरह बदल देते हैं कि इनकार के विचार बिखरे हुए और जटिल तरीके से हों, तो यह विशिष्ट हमला काम करना बंद कर सकता है।

संक्षेप में, पेपर दिखाता है कि AI मॉडल में वर्तमान सुरक्षा "गार्ड" एक ऐसी रेखा पर खड़े हैं जिसे पार करना बहुत आसान है। AI के विचारों को एक गणना किए गए कदम के साथ उस रेखा से बहुत आगे धकेल कर, हमलावर इनकार तंत्र को पहले की तुलना में बहुत अधिक प्रभावी ढंग से दरकिनार कर सकते हैं।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →