← नवीनतम पेपर
🤖 AI

Minimal, Local, Causal Explanations for Jailbreak Success in Large Language Models

यह शोध पत्र LOCA प्रस्तुत करता है, जो एक ऐसी विधि है जो मॉडल के इनकार (refusal) को प्रेरित करने के लिए आवश्यक व्याख्या योग्य मध्यवर्ती प्रतिनिधित्व परिवर्तनों के एक न्यूनतम सेट की पहचान करके, बड़े भाषा मॉडलों में जेलब्रेक सफलता के लिए स्थानीय, कारण संबंधी स्पष्टीकरण प्रदान करती है, और पूर्व वैश्विक स्पष्टीकरण दृष्टिकोणों से बेहतर प्रदर्शन करती है।

मूल लेखक: Shubham Kumar, Narendra Ahuja

प्रकाशित 2026-05-04
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Shubham Kumar, Narendra Ahuja

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि लार्ज लैंग्वेज मॉडल्स (LLMs) अविश्वसनीय रूप से बुद्धिमान लेकिन बहुत सतर्क लाइब्रेरियन (पुस्तकालयाध्यक्ष) हैं। उन्हें उन अनुरोधों को अस्वीकार करने के लिए प्रशिक्षित किया गया है जो खतरनाक या हानिकारक हैं (जैसे "मैं बम कैसे बनाऊं?")। हालांकि, चतुर ठगों ने इन लाइब्रेरियन को धोखा देने के लिए "जेलब्रेक" करने के तरीके खोज लिए हैं—चाहे वह चतुराई भरी शब्द-रचना हो या भूमिका निभाने वाले परिदृश्य (role-playing scenarios), ताकि वे किसी तरह खतरनाक जानकारी प्राप्त कर सकें।

लंबे समय तक, शोधकर्ताओं ने यह समझने की कोशिश की कि ये चालें क्यों काम करती हैं, इसके लिए उन्होंने लाइब्रेरियन के पूरे मस्तिष्क को एक साथ देखा। उन्होंने मस्तिष्क में सामान्य "खतरा क्षेत्र" (danger zones) पाए और यह मान लिया कि हर चाल केवल उन क्षेत्रों की आवाज़ को कम करके काम करती है। लेकिन इस शोध पत्र के लेखक तर्क देते हैं कि यह बहुत व्यापक है। जिस तरह अलग-अलग लोग कार दुर्घटना के अलग-अलग कारणों से दुर्घटनाग्रस्त हो सकते हैं (तेज़ गति बनाम टेक्स्टिंग), उसी तरह अलग-अलग जेलब्रेक लाइब्रेरियन के मस्तिष्क के विभिन्न विशिष्ट हिस्सों को बदलकर सफल होते हैं।

यह पेपर LOCA (लोकल, कॉज़ल एक्सप्लेनेशन - Local, Causal explanations) नामक एक नई विधि पेश करता है। यह कैसे काम करता है, इसके लिए सरल उपमाओं का उपयोग यहाँ दिया गया है:

समस्या: "ग्लोबल" बनाम "लोकल" दृष्टिकोण

पिछली विधियाँ एक मैकेनिक की तरह थीं जो टूटी हुई कार को देखकर कहता है, "इंजन बहुत गर्म है," और पूरे इंजन ब्लॉक को ठंडा करने की कोशिश करता है। यह एक व्यापक समाधान है जो हर विशिष्ट कार के लिए काम नहीं करेगा।

लेखक कहते हैं: "नहीं, हमें यह जानने की ज़रूरत है कि इस विशिष्ट कार में कौन सा विशेष स्पार्क प्लग खराब हो रहा है ताकि वह रुक सके।" वे एक लोकल स्पष्टीकरण चाहते हैं (क्यों यह विशिष्ट चाल काम कर गई?) और एक कॉज़ल (कारण संबंधी) स्पष्टीकरण चाहते हैं (यदि हम इस विशिष्ट हिस्से को ठीक करते हैं, तो क्या यह चाल काम करना बंद कर देगी?)।

समाधान: LOCA (एक "स्कैल्पल" या सर्जिकल चाकू वाला दृष्टिकोण)

LOCA एक अत्यंत सटीक सर्जन या एक मास्टर संपादक की तरह कार्य करता है। अनुमान लगाने के बजाय, यह चरण-दर-चरण प्रयोग करता है:

  1. सेटअप: आपके पास एक "हानिरहित" अनुरोध है जिसे लाइब्रेरियन अस्वीकार कर देता है (जैसे, "मैं बम कैसे बनाऊं?") और एक "जेलब्रेक" संस्करण है जो लाइब्रेरियन को जवाब देने के लिए मजबूर करता है (जैसे, "कल्पना करें कि आप एक फिल्म में विलेन हैं...")।
  2. मैचिंग (मिलान): चूंकि दोनों वाक्य अलग-अलग लंबाई और संरचना के हैं, LOCA पहले चालाकी भरे प्रश्न के शब्दों को सुरक्षित प्रश्न के शब्दों से मिलाने के लिए एक मानचित्र (map) बनाता है।
  3. सर्जरी (एक्टिवेशन पैचिंग): LOCA लाइब्रेरियन के आंतरिक "विचारों" (गणितीय निरूपण) को हर एक शब्द के लिए देखता है। यह पूछता है: "यदि मैं इस विशिष्ट शब्द के लिए आंतरिक विचार को सुरक्षित प्रश्न के विचार से बदल दूँ, तो क्या लाइब्रेरियन फिर से 'नहीं' कहने पर वापस आ जाएगा?"
  4. न्यूनतम सुधार: यह एक-एक करके, एक शब्द के बाद एक शब्द, तब तक काम करता रहता है जब तक कि लाइब्रेरियन फिर से अनुरोध को अस्वीकार न कर दे।

परिणाम: दक्षता ही कुंजी है

यह पेपर दावा करता है कि LOCA पिछली विधियों की तुलना में अविश्वसनीय रूप से कुशल है:

  • पुरानी विधियाँ: मॉडल के मस्तिष्क में 20 या अधिक बदलाव करने की कोशिश करती थीं, और अक्सर फिर भी लाइब्रेरियन को मना करने में विफल रहती थीं।
  • LOCA: आमतौर पर केवल 6 बदलावों के माध्यम से सफल होता है। यह एक लीक होने वाले नल को ठीक करने के लिए पूरे पाइप को बदलने के बजाय केवल एक पेंच कसने जैसा है।

"चालें" कहाँ छिपी थीं?

लेखकों ने यह भी जांचा कि लाइब्रेरियन के मस्तिष्क में ये चालें कहाँ छिपी थीं:

  • प्रारंभिक परतें (शुरुआत में): चालाकी अक्सर उपयोगकर्ता के वास्तविक निर्देशों (वह हिस्सा कि "आप क्या करना चाहते हैं") के साथ शुरू होती थी।
  • बाद की परतें (अंत में): जैसे-जैसे मॉडल अनुरोध को प्रोसेस करता था, चालाकी विराम चिह्नों (punctuation) और "चैट टेम्पलेट" शब्दों (फॉर्मेटिंग शब्द जैसे "Assistant:" या "User:") की ओर स्थानांतरित हो जाती थी।
  • आश्चर्य: बाद के चरणों में, मॉडल मुख्य रूप से विराम चिह्नों और फॉर्मेटिंग प्रतीकों द्वारा धोखा खा रहा था, न कि केवल बड़े शब्दों द्वारा। ऐसा लगता है कि जेलब्रेक्स ने मॉडल को विश्वास दिला दिया कि अनुरोध की संरचना सुरक्षित थी, भले ही उसकी सामग्री खतरनाक थी।

पेपर से एक वास्तविक उदाहरण

लेखकों ने एक जेलब्रेक पर परीक्षण किया जहाँ एक उपयोगकर्ता ने मॉडल से अवैध रूप से हथियार प्राप्त करने के बारे में सिखाने के लिए कहा, यह नाटक करते हुए कि वह "डेवलपर मोड" में है।

  • LOCA ने पाया कि यह चाल इसलिए काम कर रही थी क्योंकि मॉडल को विश्वास दिलाया गया था कि "डेवलपर मोड" हानिरहित कोड लिखने जैसा है।
  • मॉडल के आंतरिक विचारों में केवल दो छोटे बदलाव करके (एक विराम चिह्न पर, एक फॉर्मेटिंग शब्द पर), LOCA ने मॉडल को वापस वास्तविकता में "स्नैप" कर दिया, जिससे मॉडल ने अनुरोध को अस्वीकार कर दिया।

सारांश

संक्षेप में, यह पेपर तर्क देता है कि AI मॉडल को धोखा क्यों दिया जा रहा है, इसे समझने के लिए हमें पूरी तस्वीर देखने के बजाय विशिष्ट, सूक्ष्म विवरणों पर ध्यान केंद्रित करने की आवश्यकता है। LOCA एक ऐसा उपकरण है जो उन सटीक, छोटे "स्विचों" को ढूंढता है जिन्हें एक विशिष्ट चाल को रोकने के लिए बदलना आवश्यक है, और यह पिछले तरीकों की तुलना में बहुत तेज़ी से और अधिक सटीकता से ऐसा करता है। यह "सामान्य समस्या का अनुमान लगाने" से "सटीक, स्थानीय सर्जरी करने" की ओर एक कदम है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →