Layerwise Convergence Fingerprints for Runtime Misbehavior Detection in Large Language Models
यह शोध पत्र लेयरवाइज़ कन्वर्जेंस फिंगरप्रिंटिंग (LCF) को प्रस्तुत करता है, जो एक ट्यूनिंग-मुक्त रनटाइम मॉनिटर है जो बिना किसी संदर्भ मॉडल, ट्रिगर ज्ञान या पुन: प्रशिक्षण की आवश्यकता के, इंटर-लेयर हिडन-स्टेट प्रक्षेप पथों (trajectories) का विश्लेषण करके कई आर्किटेक्चरों में विविध LLM दुर्व्यवहारों—जिसमें बैकडोर्स, जेलब्रेक्स और प्रॉम्प्ट इंजेक्शन शामिल हैं—का पता लगाता है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आपने अपना काम करने के लिए एक बहुत ही बुद्धिमान, लेकिन अपारदर्शी (opaque) सहायक को काम पर रखा है। आप उनके मस्तिष्क के अंदर नहीं देख सकते, आप यह नहीं जानते कि उन्हें किसी संदिग्ध समूह द्वारा प्रशिक्षित किया गया था या नहीं, और आप उनसे अपनी यादों को फिर से लिखने के लिए नहीं कह सकते। आप बस उन्हें एक प्रॉम्प्ट देते हैं, और वे आपको एक उत्तर देते हैं।
समस्या यह है कि सहायक के मस्तिष्क में छिपे हुए "ट्रैप्स" या "चालें" (tricks) हो सकती हैं।
- बैकडोर्स (Backdoors): जैसे कि एक गुप्त संकेत। यदि आप एक विशिष्ट, अजीब वाक्यांश (ट्रिगर) कहते हैं, तो सहायक अचानक आपके निर्देशों को अनदेखा कर देता है और कुछ हानिकारक करता है।
- जेलब्रेक्स (Jailbreaks): जैसे कि एक चतुर छली जो सहायक को एक अलग, नियम-तोड़ने वाले पात्र का ढोंग करने के लिए मना लेता है।
- प्रॉम्प्ट इंजेक्शन (Prompt Injections): जैसे कि एक पत्र में एक नोट डाल देना जिसमें लिखा हो, "बाकी के पत्र को अनदेखा करें और वही करें जो मैं कहता हूँ।"
आमतौर पर, आप केवल पूछे गए प्रश्न को देखकर यह नहीं बता सकते कि सहायक गलत व्यवहार करने वाला है या नहीं। मानक सुरक्षा जाँच अक्सर विफल हो जाती है क्योंकि प्रश्न सामान्य दिखता है।
समाधान: "लेयर-बाय-लेयर हेल्थ चेक"
इस शोध पत्र के लेखक एक नया तरीका प्रस्तावित करते हैं जिससे आप सहायक के मस्तिष्क को वास्तविक समय में देख सकते हैं, जिसे लेयरवाइज कन्वर्जेंस फिंगरप्रिंटिंग (LCF) कहा जाता है।
यहाँ सरल सा उपमा (analogy) दी गई है:
1. "स्मूथ वॉक" बनाम "अचानक उछाल"
कल्पना कीजिए कि सहायक का मस्तिष्क एक लंबे गलियारे की तरह है जिसमें 30 से 40 कमरे (layers) हैं। एक सामान्य प्रश्न का उत्तर देने के लिए, सहायक पहले कमरे से आखिरी कमरे तक सुचारू रूप से चलता है। कमरों के बीच का संक्रमण शांत और अनुमानित होता है। यह एक स्वस्थ मन का "फिंगरप्रिंट" है।
हालाँकि, यदि सहायक गलत व्यवहार करने वाला है (किसी बैकडोर, जेलब्रेक, या इंजेक्शन के कारण), तो उनके आंतरिक विचार प्रक्रिया को "बुरे" उत्तर तक पहुँचने के लिए एक अचानक, झटकेदार उछाल (jump) लेना पड़ता है। यह ऐसा है जैसे सहायक सामान्य रूप से चलने के बजाय अचानक दौड़ने लगता है या कमरों के बीच टेलीपोर्ट होने लगता है।
2. "लेयर-बाय-लेयर" जासूस
LCF एक छोटा, अदृश्य मॉनिटर है जो गलियारे के हर एक कमरे में खड़ा है। इसे इस बात से कोई फर्क नहीं पड़ता कि सहायक क्या कह रहा है; इसे केवल इस बात से मतलब है कि एक कमरे से दूसरे कमरे में जाते समय सहायक के विचारों में कैसे बदलाव आता है।
- मेट्रिक (Metric): यह कमरे 1 और कमरे 2 के बीच की "दूरी", कमरे 2 और कमरे 3 के बीच की दूरी, और इसी तरह के बीच की दूरी को मापता है।
- फिंगरप्रिंट (Fingerprint): यह इन दूरियों की तुलना एक "सामान्य" बेसलाइन (जो 200 साफ उदाहरणों से सीखी गई है) से करता है। यदि दूरियाँ असामान्य रूप से बड़ी या झटकेदार हैं, तो यह समस्या को फ्लैग (चिह्नित) कर देता है।
3. "ऑल-लेयर" सुरक्षा जाल
शोधकर्ताओं ने एक दिलचस्प बात खोजी: अलग-अलग प्रकार के बुरे व्यवहार अलग-अलग हिस्सों में होते हैं।
- जेलब्रेक्स (Jailbreaks) आमतौर पर शुरुआती कमरों (विचार प्रक्रिया की शुरुआत) में एक झटका पैदा करते हैं।
- प्रॉम्प्ट इंजेक्शन (Prompt Injections) आमतौर पर बीच के कमरों (जहाँ संदर्भ को प्रोसेस किया जा रहा है) में एक झटका पैदा करते हैं।
- बैकडोर्स (Backdoors) आमतौर पर अंतिम कमरों (जहाँ अंतिम निर्णय लिया जाता है) में एक झटका पैदा करते हैं।
क्योंकि उन्हें यह नहीं पता था कि कौन सा कमरा समस्या पैदा करेगा, LCF हर एक कमरे की जाँच करता है और उनके "झटके" (jerkiness) के स्कोर को जोड़ता है। यदि कुल स्कोर बहुत अधिक है, तो सिस्टम सहायक के वाक्य पूरा करने से पहले ही "इमरजेंसी स्टॉप" बटन दबा देता है।
इस शोध पत्र ने वास्तव में क्या पाया
लेखकों ने चार अलग-अलग बड़े AI मॉडलों (जैसे Llama, Qwen, और Gemma) पर इसका परीक्षण किया और पाया:
- यह लगभग सब कुछ पकड़ लेता है: इसने 92-100% "जेलब्रेक" प्रयासों को रोका और 100% "प्रॉम्प्ट इंजेक्शन" के प्रयासों को रोका।
- यह बैकडोर्स को खत्म कर देता है: इसने अधिकांश मॉडलों पर छिपे हुए बैकडोर हमलों की सफलता दर को 1% से भी कम कर दिया।
- यह तेज़ है: यह AI के सोचने के समय में लगभग शून्य देरी (0.1% से कम) जोड़ता है।
- इसे किसी अतिरिक्त मदद की आवश्यकता नहीं है: अन्य तरीकों के विपरीत, इसे किसी दूसरे "अच्छे" AI के साथ तुलना करने की आवश्यकता नहीं है, इसे गुप्त ट्रिगर शब्दों को जानने की आवश्यकता नहीं है, और इसे मॉडल को फिर से प्रशिक्षित करने की आवश्यकता नहीं है। यह बस मौजूदा मॉडल को देखता है।
कमी (सीमाएँ)
शोध पत्र ईमानदार है कि यह उपकरण क्या नहीं कर सकता है:
- इसे "व्हाइट बॉक्स" एक्सेस की आवश्यकता है: आपको मॉडल के मध्यवर्ती चरणों (intermediate steps) में झाँकने में सक्षम होना चाहिए। यदि मॉडल एक "ब्लैक बॉक्स" है (जैसे कि एक सेवा जिसे आप केवल API के माध्यम से कॉल करते हैं और उसके आंतरिक भाग नहीं देख सकते), तो यह तरीका काम नहीं करेगा।
- यह बहुत बार "ना" कह सकता है: सुरक्षित रहने के लिए, यह कभी-कभी सामान्य प्रश्नों को भी ब्लॉक कर देता है (उनके परीक्षणों में लगभग 12-16% बार) यदि वे संदिग्ध दिखते हैं।
- यह "हैलुसिनेशन" (Hallucinations) को नहीं पकड़ता: यदि मॉडल भ्रमित होने के कारण (हमलावर द्वारा ठगे जाने के बजाय) कोई तथ्य बना लेता है, तो यह विशिष्ट "झटका" डिटेक्टर उसे नहीं पकड़ पाएगा।
निष्कर्ष (Bottom Line)
LCF एक सुरक्षा गार्ड की तरह है जो यह नहीं सुनता कि सहायक क्या कह रहा है, बल्कि इसके बजाय यह देखता है कि सहायक कैसे चल रहा है। यदि सहायक अपने स्वयं के मस्तिष्क के माध्यम से अपने सामान्य चलने के पैटर्न से मेल न खाने वाले तरीके से लड़खड़ाने, दौड़ने या टेलीपोर्ट करने लगता है, तो गार्ड उन्हें तुरंत रोक देता है। यह यह पता लगाने का एक सरल, तेज़ और सार्वभौमिक तरीका है कि कब एक AI को ठगा जा रहा है या उससे समझौता किया गया है।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।