Segment-Level Coherence for Robust Harmful Intent Probing in LLMs
यह शोध पत्र एक सेगमेंट-स्तरीय कोहेरेंस प्रोबिंग विधि प्रस्तुत करता है जो हानिकारक CBRN-संबंधित इरादों का मजबूती से पता लगाने के लिए कई साक्ष्य टोकन को एकत्रित करता है, जो अनुकूलित जेलब्रेकिंग और कैरेक्टर-लेवल अस्पष्टता के विरुद्ध भी उच्च पहचान सटीकता बनाए रखते हुए फॉल्स पॉजिटिव्स को काफी कम करता है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
मुख्य चित्र: "अति-उत्साही सुरक्षा गार्ड"
कल्पना कीजिए कि एक बड़ा लैंग्वेज मॉडल (LLM) एक बहुत ही मददगार, लेकिन थोड़ा भोला सहायक है। आपका लक्ष्य इस सहायक को जैविक हथियार या रासायनिक बम (CBRN खतरे) बनाने के निर्देश लिखने से रोकना है।
इसे करने के लिए, आप सहायक के विचारों को वास्तविक समय में देखने के लिए एक सुरक्षा गार्ड (प्रोब/probe) को काम पर रखते हैं। यदि गार्ड कुछ भी खतरनाक देखता है, तो वे आपातकालीन स्टॉप बटन दबा देते हैं।
समस्या:
पुराने सुरक्षा गार्ड आसानी से धोखा खा जाते थे। वे एक "कीवर्ड ट्रिगर" (keyword trigger) प्रणाली पर काम करते थे।
- परिदृश्य: एक डॉक्टर मरीजों की मदद करने के लिए इबोला वायरस पर एक मेडिकल टेक्स्टबुक लिख रहा है।
- पुराने गार्ड की प्रतिक्रिया: वे "इबोला" शब्द देखते हैं, एड्रेनालिन का एक बड़ा उछाल महसूस करते हैं, और तुरंत आपातकालीन स्टॉप बटन दबा देते हैं।
- परिणाम: डॉक्टर का उपयोगी कार्य बाधित हो जाता है। यह एक फॉल्स पॉजिटिव (False Positive) है। गार्ड शब्द पर इतना केंद्रित है कि वह इरादे को समझने में चूक जाता है।
समाधान: "वह जासूस जो पूरी कहानी पढ़ता है"
इस पेपर के लेखकों ने एक नए प्रकार का सुरक्षा गार्ड बनाया जिसे SC-TopK कहा जाता है। पहले डरावने शब्द पर चिल्लाने के बजाय, यह नया गार्ड सेगमेंट-लेवल कोहेरेंस (Segment-Level Coherence) नामक रणनीति का उपयोग करता है।
इसे इस तरह समझें:
- पुराना गार्ड (कीवर्ड खोजने वाला): "मुझे 'बम' शब्द दिख रहा है। रुकिए!" (भले ही वाक्य यह हो: "फिल्म की कहानी में एक नकली बम शामिल है।")
- नया गार्ड (इरादा समझने वाला): "मुझे 'बम' शब्द दिख रहा है। ठीक है, चलिए आगे पढ़ते हैं। क्या अगला वाक्य 'फिल्म स्क्रिप्ट' के बारे में है? क्या अगला वाक्य 'स्पेशल इफेक्ट्स' के बारे में है? क्या पूरा पैराग्राफ मनोरंजन के बारे में है? आह, यहाँ कोई खतरा नहीं है। चलिए देखते रहते हैं।"
नया गार्ड कैसे काम करता है (दो तरकीबें)
पेपर में गार्ड को स्मार्ट बनाने के लिए दो विशिष्ट तकनीकों का परिचय दिया गया है:
1. "टॉप-के" नियम (जूरी सिस्टम)
बातचीत के भाग्य का निर्णय करने के लिए एक अकेले डरावने शब्द को अनुमति देने के बजाय, नया गार्ड एक सबूतों की जूरी की मांग करता है।
- उपमा: एक अदालत की कल्पना करें। पुराने सिस्टम में, यदि एक गवाह चिल्लाकर "दोषी!" कहता, तो न्यायाधीश तुरंत दोषी करार दे देता।
- नया सिस्टम: न्यायाधीश (AI) कहता है, "मुझे कम से कम K अलग-अलग सबूतों (जैसे बातचीत के 3 या 4 अलग-अलग हिस्से) की आवश्यकता है जो यह सहमत हों कि यह खतरनाक है, इससे पहले कि मैं दोषी ठहराऊं।"
- यह क्यों मदद करता है: यदि कोई उपयोगकर्ता केवल जीव विज्ञान का प्रश्न पूछ रहा है, तो वे एक बार "टॉक्सिन" (विष) शब्द का उपयोग कर सकते हैं। लेकिन वह केवल एक सबूत है। बाकी की बातचीत "विज्ञान कक्षा" के बारे में है। जूरी दोषी करार नहीं देती क्योंकि सबूत सुसंगत नहीं हैं।
2. SegVar ("सुचारूता" की जांच)
कभी-कभी, एक बुरा व्यक्ति लंबे, उबाऊ टेक्स्ट में खतरनाक शब्दों को दूर-दूर तक बिखेरकर छिपने की कोशिश कर सकता है।
- उपमा: एक अपराधी की कल्पना करें जो स्टेडियम में हथियार छिपाने की कोशिश कर रहा है, उसे तीन अलग-अलग बैगों में, एक-दूसरे से दूर छिपाकर।
- पुराना गार्ड: पैटर्न को मिस कर सकता है क्योंकि बैग एक-दूसरे से बहुत दूर हैं।
- नया गार्ड (SegVar): निरंतरता (Consistency) की जांच करता है। यह पूछता है, "क्या इस पूरे खंड में खतरे का स्तर सुचारू और स्थिर है, या यह बस यहाँ-वहाँ अचानक होने वाला उछाल है?"
- तरकीब: यदि टेक्स्ट हानिरहित है, तो गार्ड "खतरे के स्कोर" को सुचारू और कम रखने के लिए मजबूर करता है। यदि टेक्स्ट वास्तव में हानिकारक है, तो खतरे का स्कोर उच्च और सुसंगत होना चाहिए। यह गार्ड को एक एकल, अलग दिखने वाले डरावने शब्द पर घबराने से रोकता है।
परिणाम: यह क्यों मायने रखता है
पेपर ने तीन मुख्य परिदृश्यों का उपयोग करके पुराने गार्डों के मुकाबले इस नए गार्ड का परीक्षण किया:
- "गलत अलार्म" टेस्ट: उन्होंने गार्ड को डरावने शब्दों से भरी हानिरहित बातचीत दी (जैसे वायरस पर चर्चा करती जीव विज्ञान की कक्षा)।
- परिणाम: नए गार्ड ने पुराने गार्डों की तुलना में 35% कम गलतियाँ कीं। इसने वैज्ञानिकों के उपयोगी कार्यों को रोकने से बचाया।
- "ओब्फस्केशन" (Obfuscation) टेस्ट: उन्होंने कोड (जैसे गुप्त सिफर या अलग भाषा) में खतरनाक निर्देश लिखकर गार्ड को धोखा देने की कोशिश की।
- परिणाम: भले ही टेक्स्ट को उलझा दिया गया था, नया गार्ड 98.85% सटीकता के साथ इरादे का पता लगाने में सक्षम था। यह एक ऐसे गार्ड की तरह है जो यह बता सकता है कि आप वेश बदलकर भी बंदूक पकड़े हुए हैं, क्योंकि वह आपके कपड़ों (सतह के शब्दों) को नहीं, बल्कि आपके पोस्चर (आंतरिक तर्क) को देख रहा है।
- "इंटरनल व्यू" टेस्ट: उन्होंने देखा कि AI के मस्तिष्क में गार्ड कहाँ देख रहा था।
- परिणाम: उन्होंने पाया कि AI के "अटेंशन" (यह क्या ध्यान केंद्रित कर रहा है) या "MLP" (यह जानकारी को कैसे प्रोसेस करता है) को देखना, "रेसिडुअल स्ट्रीम" (एक जेनेरिक मेमोरी बफर) को देखने से कहीं बेहतर था। यह किसी के दिल की धड़कन की जांच करने के बजाय यह देखने जैसा है कि उसकी आँखें और हाथ घबराए हुए हैं या नहीं।
निचोड़
यह पेपर AI सुरक्षा की एक बड़ी समस्या को हल करता है: हम अच्छे लोगों को रोके बिना बुरे लोगों को कैसे रोकें?
"कीवर्ड स्पॉटिंग" से "इंटेंट एग्रीगेशन" (इरादे के एकत्रीकरण) की ओर बढ़ते हुए, यह नई विधि एक ट्रिगर-हैवी गार्ड के बजाय एक अनुभवी जासूस की तरह काम करती है। यह अलार्म बजाने से पहले व्यवहार के पैटर्न का इंतजार करती है, जिससे यह सुनिश्चित होता है कि वास्तविक खतरों को पकड़ा जाए जबकि हानिरहित विशेषज्ञ अपना काम जारी रख सकें।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।