Detecting Fluent Optimization-Based Adversarial Prompts via Sequential Entropy Changes
यह शोध पत्र CPD Online को प्रस्तुत करता है, जो एक प्रशिक्षण-मुक्त (training-free), मॉडल-अज्ञेय (model-agnostic) डिटेक्टर है जो टोकन-स्तरीय एंट्रॉपी स्ट्रीम पर अनुक्रमिक चेंज-पॉइंट डिटेक्शन लागू करके सुव्यवस्थित अनुकूलन-आधारित (optimization-based) प्रतिकूल प्रॉम्प्ट्स की पहचान करता है, और मौजूदा परप्लेक्सिटी-आधारित विधियों की तुलना में बेहतर सटीकता और सटीक स्थानीयकरण प्राप्त करते हुए डाउनस्ट्रीम सुरक्षा फिल्टरों के लिए कम्प्यूटेशनल ओवरहेड को कम करता है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आपके पास एक बहुत ही बुद्धिमान रोबोट सहायक (एक लार्ज लैंग्वेज मॉडल, या LLM) है, जिसे मददगार और सुरक्षित रहने के लिए प्रशिक्षित किया गया है। हालाँकि, चतुर हैकर्स ने इस रोबोट को हानिकारक बातें कहने के लिए बहकाने का एक तरीका खोज लिया है। वे ऐसा एक सामान्य प्रश्न के बिल्कुल अंत में एक गुप्त, अदृश्य "कोड" जोड़कर करते हैं। इस कोड को एडवर्सरियल सकफ़िक्स (adversarial suffix) कहा जाता है।
समस्या यह है कि ये हैकर्स अपने कोड को बनाने में बहुत माहिर होते जा रहे हैं ताकि वह पूरी तरह से स्वाभाविक दिखे और सुनाई दे। यह एक जासूस की तरह है जो आपकी भाषा धाराप्रवाह बोलता है और आपके जैसे कपड़े पहनता है; एक साधारण नज़र या केवल यह जांचना कि शब्द कितने "अजीब" लग रहे हैं, अंतर नहीं बता पाएगा कि वह एक सामान्य व्यक्ति है या कोई जासूस।
यह पेपर एक नए सुरक्षा गार्ड के रूप में CPD Online को पेश करता है जो शब्दों को देखने के बजाय, यह देखकर कि रोबोट संदेश को पढ़ते समय कैसे "सोचता" है, इन जासूसों को पकड़ लेता है।
यह कैसे काम करता है, इसके लिए सरल उपमाओं का उपयोग किया गया है:
1. समस्या: "स्मूथ" (चिकना/सहज) जासूस
पारंपरिक सुरक्षा जाँच संदेश की "परप्लेक्सिटी" (perplexity) को देखती है। परप्लेक्सिटी को आप एक माप के रूप में देख सकते हैं कि रोबोट शब्दों से कितना हैरान है।
- सामान्य संदेश: रोबोट आमतौर पर बहुत अधिक हैरान नहीं होता है।
- पुराने ज़माने के हमले: हैकर्स बड़बड़ाहट या अजीब शब्दों का उपयोग करते थे। रोबोट बहुत हैरान हो जाता था, और सुरक्षा गार्ड चिल्ला उठता था, "यह अजीब है! रुक जाओ!"
- नए ज़माने के हमले: हैकर्स अब अपने गुप्त कोड को इतना सटीक रूप से लिखने के लिए AI का उपयोग करते हैं कि रोबोट बिल्कुल भी हैरान नहीं होता। "हैरानी का मीटर" कम रहता है, इसलिए पुराने गार्ड उन्हें चूक जाते हैं।
2. समाधान: "धड़कन" को देखना
लेखकों ने महसूस किया कि भले ही शब्द सामान्य दिखें, लेकिन जब रोबोट उस गुप्त कोड पर पहुँचता है, तो उसके सोचने का पैटर्न बदल जाता है।
कल्पना कीजिए कि रोबंडा आपके संदेश को पढ़ते हुए एक रास्ते पर चल रहा है।
- सामान्य रास्ता: रोबोट की "अनिश्चितता की धड़कन" (जिसे एन्ट्रॉपी कहा जाता है) स्थिर और लयबद्ध होती है, जैसे एक शांत चाल। इसमें थोड़ा उतार-चढ़ाव आता है, लेकिन यह एक आरामदायक सीमा में रहती है।
- जासूस का रास्ता: जब रोबोट वाक्य के अंत में गुप्त कोड पर पहुँचता है, तो उसके सोचने का पैटर्न बदल जाता है। वह "ड्रिफ्ट" (विचलित) होने लगता है। यह ऐसा है जैसे रोबोट अचानक चढ़ाई पर चलने लगे या अपने सामान्य लय के विपरीत तेज़ चलने लगे।
3. डिटेक्टिव: "CUSUM" मीटर
यह पेपर एक गणितीय उपकरण का उपयोग करता है जिसे CUSUM (Cumulative Sum) कहा जाता है। इसे एक संवेदनशील तराजू या ड्रिफ्ट डिटेक्टर के रूप में समझें।
- बेसलाइन (आधार रेखा): सबसे पहले, सिस्टम एक मानक, सुरक्षित निर्देश (सिस्टम प्रॉम्प्ट) को पढ़ते समय रोबोट को देखता है। यह सीखता है कि उस विशिष्ट रोबोट के लिए एक "सामान्य धड़कन" कैसी दिखती है।
- परीक्षण: जैसे ही रोबोट आपका संदेश पढ़ता है, डिटेक्टर हर नए शब्द की "धड़कन" की तुलना इस बेसलाइन से करता है।
- अलार्म:
- यदि धड़कन थोड़ी डगमगाती है और फिर सामान्य हो जाती है, तो तराजू रीसेट हो जाता है। (यह एक सामान्य वाक्य है)।
- यदि धड़कन ऊपर की ओर बढ़ने लगती है और वहीं बनी रहती है, तो तराजू वजन जोड़ता रहता है। एक बार जब वजन बहुत अधिक हो जाता है, तो अलार्म बज जाता है।
यह पुराने तरीकों से अलग है जो केवल एक तेज़ शोर को देखते हैं। यह विधि एक लगातार बदलाव (sustained shift) को देखती है।
4. यह बेहतर क्यों है
इस पेपर ने छह अलग-अलग प्रकार के रोबोट मॉडलों और हजारों हमलों के खिलाफ इसका परीक्षण किया। यहाँ उन्हें क्या पता चला:
- यह "स्मूथ" जासूसों को पकड़ लेता है: क्योंकि यह केवल यह नहीं देखता कि शब्द कितने "अजीब" हैं, बल्कि यह बदलाव के पैटर्न को देखता है, इसलिए यह उन नए, धाराप्रवाह हमलों को पकड़ लेता है जो अन्य डिटेक्टरों को धोखा देते हैं।
- इसे पता है कि जासूस कहाँ है: पुराने डिटेक्टर केवल यह कह सकते हैं कि "यह पूरा संदेश बुरा है।" CPD Online ठीक उस क्षण की ओर इशारा कर सकता है जब गुप्त कोड शुरू हुआ था। यह एक सुरक्षा गार्ड की तरह है जो केवल यह नहीं कहता कि "इमारत में चोर है," बल्कि इशारा करके कहता है, "चोर 3:05 बजे पिछले दरवाजे से अंदर आया था।"
- यह तेज़ और मुफ्त है: इसे चलाने के लिए किसी नए, भारी कंप्यूटर की आवश्यकता नहीं है। यह उसी डेटा का उपयोग करता है जो रोबक पहले से ही सोचने के लिए उत्पन्न कर रहा है, इसलिए यह लगभग कोई देरी नहीं जोड़ता है।
5. "गेटकीपर" रणनीति
यह पेपर सुझाव देता है कि वास्तविक दुनिया में इसका उपयोग करने का एक स्मार्ट तरीका क्या है। एक व्यस्त कार्यालय की कल्पना करें जहाँ एक बहुत ही महंगा, उच्च प्रशिक्षित सुरक्षा प्रमुख (जिसे LLaMA Guard कहा जाता है) है जो जटिल निर्णय ले सकता है लेकिन प्रत्येक आगंतुक की जाँच करने में लंबा समय लेता है।
- पुराना तरीका: प्रमुख हर किसी की जाँच करता है। यह धीमा और महंगा है।
- नया तरीका: CPD Online डिटेक्टर सामने के दरवाजे पर एक गेटकीपर के रूप में कार्य करता है।
- यदि गेटकीपर एक शांत, सामान्य धड़कन देखता है, तो वह बिना मुख्य अधिकारी को परेशान किए आगंतुक को जाने देता है।
- यदि गेटकीपर को वह "ड्रिफ्टिंग" धड़कन दिखती है, तो वह आगंतुक को रोकता है और गहन निरीक्षण के लिए मुख्य अधिकारी को बुलाता है।
यह बहुत सारा समय बचाता है (उनके परीक्षणों में मुख्य अधिकारी के काम के बोझ को लगभग 20-40% कम कर देता है) बिना बुरे लोगों को निकलने दिए।
सारांश
संक्षेप में, यह पेपर हमें सिखाता है कि एक ऐसे जासूस को पकड़ने के लिए जो घुलने-मिलने में माहिर है, आपको केवल उनके कपड़ों (शब्दों) को नहीं देखना चाहिए; आपको उनके चलने के तरीके (अनिश्चितता के पैटर्न) को देखना चाहिए। रोबोट की "सोचने की लय" को ट्रैक करके, यह नया डिटेक्टर उस क्षण को पहचान सकता है जब एक सामान्य बातचीत एक चाल में बदल जाती है, भले ही वह चाल सुनने में पूरी तरह से विनम्र लगे।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।