← नवीनतम पेपर
💬 NLP

What Intermediate Layers Know: Detecting Jailbreaks from Entropy Dynamics

यह शोधपत्र यह प्रदर्शित करता है कि लार्ज लैंग्वेज मॉडल्स (LLMs) में जेलब्रेक हमलों का पता मध्यवर्ती परतों (intermediate layers) में टोकन-स्तरीय प्रेडिक्टिव एंट्रॉपी के मोनोटोनिक ट्रेंड का विश्लेषण करके लगाया जा सकता है, जो यह प्रकट करता है कि हानिकारक इरादा स्थिर समग्र सांख्यिकी या अंतिम-परत आउटपुट के बजाय संरचित अनिश्चितता गतिकी (structured uncertainty dynamics) में एनकोड होता है।

मूल लेखक: Sofiia Nikolenko, Michele Papucci, Mina Rezaei, Shireen Kudukkil Manchingal

प्रकाशित 2026-06-25
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Sofiia Nikolenko, Michele Papucci, Mina Rezaei, Shireen Kudukkil Manchingal

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

एक लार्ज लैंग्वेज मॉडल (LLM) की कल्पना एक बहुत ही परिष्कृत, बहु-मंजिला फैक्ट्री के रूप में करें। जब आप इस फैक्ट्री में कोई प्रश्न (प्रॉम्ट) टाइप करते हैं, तो जानकारी इमारत के विभिन्न स्तरों (लेयर्स) के माध्यम से ऊपर की ओर यात्रा करती है। ग्राउंड फ्लोर पर, कच्चा टेक्स्ट प्राप्त होता है। जब तक यह जानकारी सबसे ऊपरी मंजिल तक पहुँचती है, फैक्ट्री टेक्स्ट को प्रोसेस कर चुकी होती है और उत्तर प्रिंट करने के लिए तैयार होती है।

वर्षों से, सुरक्षा विशेषज्ञ "जेलब्रेक्स" (jailbreaks) को पकड़ने की कोशिश कर रहे हैं—ऐसे चालाकी भरे प्रॉम्ट जो फैक्ट्री को खतरनाक या वर्जित आउटपुट देने के लिए बहलाने-फुसलाने के लिए डिज़ाइन किए गए हैं। अधिकांश सुरक्षा उपाय प्रवेश द्वार (वह टेक्स्ट जो आपने टाइप किया) या निकास (वह उत्तर जो फैक्ट्री ने प्रिंट किया) को देखते हैं। लेकिन यह पेपर एक अलग सवाल पूछता है: काम होने के दौरान फैक्ट्री के अंदर क्या हो रहा है?

यहाँ शोधकर्ताओं द्वारा की गई खोज का सरल विवरण दिया गया है:

1. "कन्फ्यूजन मीटर" (एन्ट्रॉपी - Entropy)

फैक्ट्री के भीतर, प्रक्रिया के हर एक चरण में, मशीन के पास एक "कन्फ्यूजन मीटर" होता है। यह मीटर मापता है कि मशीन अगला शब्द कहने के बारे में कितनी अनिश्चित है।

  • कम कन्फ्यूजन (Low confusion): मशीन बहुत आश्वस्त है (जैसे, "आसमान... नीला है")।
  • उच्च कन्फ्यूजन (High confusion): मशीन अंदाज़ा लगा रही है (जैसे, "आसमान... शायद बैंगनी है? या एक टोस्टर?")।

शोधकर्ताओं ने केवल पूरे प्रॉम्ट के लिए औसत कन्फ्यूजन स्तर को नहीं देखा। इसके बजाय, उन्होंने यह देखा कि जैसे-जैसे वाक्य बनाया जा रहा है, शब्द दर शब्द कन्फ्यूजन मीटर कैसे चलता है

2. "स्मूथ स्लाइड" (Smooth Slide) बनाम "फ्लैट लाइन" (Flat Line)

टीम ने पाया कि बुरे प्रॉम्ट्स (जेलब्रेक्स) बनाम अच्छे प्रॉम्ट्स (सुरक्षित प्रश्न) के लिए यह मीटर कैसे व्यवहार करता है, इसमें एक स्पष्ट पैटर्न है।

  • सुरक्षित प्रॉम्ट्स: कल्पना करें कि कन्फ्यूजन मीटर एक शांत झील की तरह है। इसमें थोड़ी लहर उठ सकती है, लेकिन कुल मिलाकर, जैसे-जैसे वाक्य आगे बढ़ता है, यह अपेक्षाकृत स्थिर और सपाट रहता है।
  • जेलब्रेक प्रॉम्ट्स: कल्पना करें कि कन्फ्यूजन मीटर एक फिसलन भरी स्लाइड (slippery slide) की तरह है। जैसे-जैसे बुरा प्रॉम्ट सामने आता है, मशीन की अनिश्चितता केवल उच्च या निम्न नहीं रहती; यह एक बहुत ही विशिष्ट, सुचारू रूप से फिसलने वाली दिशा में चलती है (या तो लगातार अधिक आत्मविश्वासी होती जाती है या लगातार अधिक भ्रमित होती जाती है) जैसे-जैसे शब्द जमा होते जाते हैं।

शोधकर्ताओं ने महसूस किया कि मीटर कितना ऊँचा है, इसके बजाय मीटर कैसे चलता है (जिसे "ट्रैजेक्टरी" कहा जाता है), असली सुराग है।

3. "मिडल फ्लोर" (Middle Floor) का रहस्य

यहाँ सबसे आश्चर्यजनक बात है: यह "स्लिपरी स्लाइड" पैटर्न न तो सबसे ऊपरी मंजिल (अंतिम लेयर जहाँ उत्तर प्रिंट किया जाता है) पर दिखाई देता है और न ही सबसे निचली मंजिल पर।

  • ऊपरी मंजिल: जब तक संदेश ऊपरी मंजिल तक पहुँचता है, फैक्ट्री ने सिग्नल को "साफ" (clean up) कर दिया होता है। स्लाइडिंग पैटर्न गायब हो जाता है या बिखर जाता है।
  • मध्य मंजिलें (Middle Floors): "स्लिपरी स्लाइड" पैटर्न सबसे अधिक और स्पष्ट रूप से इमारत के बीच में (विशेष रूप से लेयर्स के 60-70% के आसपास) दिखाई देता है।

ऐसा लगता है जैसे फैक्ट्री में एक गुप्त "डेंजर ज़ोन" है, जो उसकी प्रोसेसिंग लाइन के बीच में स्थित है, जहाँ एक बुरे अनुरोध की संरचना सबसे स्पष्ट होती है, लेकिन जब तक उत्पाद तैयार हो जाता है, वह प्रमाण सुचारू (smooth) होकर मिट जाता है।

4. यह क्यों महत्वपूर्ण है (बिना ट्रेनिंग के)

शोधकर्ताओं ने एक ऐसा टूल बनाया है जो केवल इन मध्य मंजिलों पर केंद्रित एक सुरक्षा कैमरे की तरह काम करता है।

  • कोई नई ट्रेनिंग नहीं: उन्हें फैक्ट्री को कुछ भी नया सिखाने की आवश्यकता नहीं पड़ी। उन्होंने बस मौजूदा "कन्फ्यूजन मीटर" की गतिविधियों को देखा।
  • यह हर जगह काम करता है: उन्होंने इसका परीक्षण तीन अलग-अलग प्रमुख फैक्ट्री डिज़ाइनों (Llama, Qwen, और Gemma) पर किया। भले ही फैक्ट्रियां अलग-अलग तरह से बनाई गई थीं, लेकिन जब भी जेलब्रेक का प्रयास किया गया, उन सभी के मध्य मंजिलों में "स्लिपरी स्लाइड" पैटर्न दिखाई दिया।
  • पुराने तरीकों से बेहतर: औसत कन्फ्यूजन (स्टैटिक स्टैट्स) को देखना ऐसा था जैसे कार के स्पीडोमीटर की एक अकेली फोटो देखकर यह अनुमान लगाना कि कार तेज़ चल रही है या नहीं। ट्रैजेक्टरी (डायनेमिक फीचर्स) को देखना कार के ढलान से नीचे तेज़ होने को देखने जैसा है; यह आपको बहुत कुछ अधिक बताता है कि वास्तव में क्या हो रहा है।

कमी (सीमाएँ)

पेपर में दो मुख्य सीमाएँ बताई गई हैं:

  1. आपको अंदर देखना होगा: इस तरीके का उपयोग करने के लिए, आपको फैक्ट्री के "मध्य मंजिलों" (आंतरिक डेटा) तक पहुँच की आवश्यकता है। यदि आप एक ब्लैक-बॉक्स AI का उपयोग कर रहे हैं जहाँ आप अंदर नहीं देख सकते, तो आप इस विशिष्ट डिटेक्टर का उपयोग नहीं कर सकते।
  2. नकल करने की चतुराई (Tricky Mimicry): यदि कोई "सुरक्षित" प्रॉम्ट ऐसी शैली में लिखा गया है जो संरचनात्मक रूप से जेलब्रेक जैसा दिखता है (भले ही वह हानिकारक न हो), तो डिटेक्टर भ्रमित हो जाता है। यह प्रॉम्ट के इरादे को नहीं, बल्कि उसके स्ट्रक्चर को पहचानता है। यदि कोई सुरक्षित प्रॉम्ट "स्लिपरी स्लाइड" पैटर्न की नकल करता है, तो डिटेक्टर उसे खतरनाक के रूप में चिह्नित कर सकता है।

सारांश

संक्षेप में, यह पेपर प्रकट करता है कि जब एक लार्ज लैंग्वेज मॉडल को जेलब्रेक द्वारा धोखा दिया जाता है, तो उसकी आंतरिक "अनिश्चितता" केवल स्थिर नहीं रहती; यह एक अनुमानित, सुचारू पैटर्न में फिसलती है। यह पैटर्न मॉडल की प्रोसेसिंग लेयर्स के बीच में सबसे अधिक दृश्यमान होता है, जो मॉडल के आत्मविश्वास के विकास को देखकर इन हमलों को पहचानने का एक नया, बिना ट्रेनिंग वाला तरीका प्रदान करता है।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →