Peak + Accumulation: A Proxy-Level Scoring Formula for Multi-Turn LLM Attack Detection
यह शोध पत्र एक नवीन "पीक + एक्यूमुलेशन" (Peak + Accumulation) प्रॉक्सी-स्तरीय स्कोरिंग फॉर्मूला प्रस्तावित करके मल्टी-टर्न प्रॉम्प्ट इंजेक्शन हमलों का पता लगाने में भारित-औसत (weighted-average) विधियों की विफलता को संबोधित करता है जो पीक रिस्क, पर्सिस्टेंस और डाइवर्सिटी को जोड़ता है, और बिना किसी एलएलएम (LLM) की आवश्यकता के 1.20% फॉल्स पॉजिटिव रेट पर 90.8% रिकॉल प्राप्त करता है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आप एक बहुत ही बुद्धिमान, लेकिन आसानी से चकमा खा जाने वाले रोबोट (AI) के गेट पर एक सुरक्षा गार्ड हैं। आपका काम उन लोगों को अंदर घुसने से रोकना है जो रोबोट के नियमों को तोड़ने वाले बुरे निर्देश चुपके से डालने की कोशिश करते हैं।
लंबे समय तक, सुरक्षा गार्डओं ने एक बार में केवल एक वाक्य की जांच की। यदि कोई वाक्य संदिग्ध दिखता था, तो वे उसे रोक देते थे। यदि वह साफ दिखता था, तो वे उसे जाने देते थे।
लेकिन चतुर हमलावरों ने यह समझ लिया कि वे एक लंबी बातचीत के दौरान कई वाक्यों में अपने बुरे निर्देशों को फैलाकर रोबोट को धोखा दे सकते हैं। वे टर्न 1 में कुछ हानिरहित कहेंगे, टर्न 2 में कुछ थोड़ा अजीब, और टर्न 3 में कुछ खतरनाक। जब तक रोबोट को पता चलता कि क्या हो रहा है, तब तक बहुत देर हो चुकी होती है।
यह शोध पत्र इस नए, स्मार्ट तरीके को पेश करता है जिससे सुरक्षा गार्ड बिना किसी दूसरे, अधिक बुद्धिमान रोबोट की मदद लिए इन "स्लो-बर्न" (धीरे-धीरे होने वाले) हमलों को पकड़ सकता है (क्योंकि दूसरा रोबोट बहुत धीमा और महंगा होगा)।
यहाँ उनके नए तरीके का विवरण दिया गया है, सरल उपमाओं (analogies) का उपयोग करते हुए:
1. पुराना तरीका: "औसत स्कोर" का जाल (The "Average Score" Trap)
शोधकर्ताओं ने पहले देखा कि लोग आमतौर पर इस समस्या को कैसे हल करने की कोशिश करते हैं। उन्होंने सोचा: "आइए हम हर वाक्य के संदिग्ध होने का औसत (average) निकाल लेते हैं।"
उपमा: कल्पना कीजिए कि आप एक सप्ताह के दौरान एक छात्र के व्यवहार को ग्रेड दे रहे हैं।
- दिन 1: छात्र आदर्श है (स्कोर: 0)।
- दिन 2: छात्र आदर्श है (स्कोर: 0)।
- दिन 3: छात्र आदर्श है (स्कोर: 0)।
- दिन 4: छात्र स्कूल में आग लगा देता है (स्कोर: 100)।
यदि आप इन स्कोर्स का औसत (average) निकालते हैं, तो आपको 25 मिलता है। यह एक "C" ग्रेड है। आप सोच सकते हैं, "खैर, वे ज्यादातर अच्छे थे, इसलिए उन्हें रहने दें।"
खामी: यह शोध पत्र सिद्ध करता है कि यदि कोई हमलावर हर दिन थोड़ी-थोड़ी संदिग्ध चीजें करता रहता है (जैसे हर दिन 50 का स्कोर), तो औसत 50 ही रहता है। भले ही वे 100 दिनों तक ऐसा करें, औसत अभी भी केवल 50 ही रहेगा। यह कभी भी अलार्म बजाने के लिए पर्याप्त ऊँचा नहीं होगा, भले ही बुरा व्यवहार करने की निरंतरता (persistence) ही असली खतरा है। "औसत" का गणित इस तथ्य को छिपा देता है कि वह व्यक्ति एक आदतन समस्या पैदा करने वाला व्यक्ति है।
2. नया तरीका: "पीक + संचय" (Peak + Accumulation)
लेखक एक नया फॉर्मूला प्रस्तावित करते हैं जो एक स्मार्ट सुरक्षा कैमरे की तरह काम करता है जो एक साथ तीन चीजों को देखता है:
A. "पीक" (सबसे ऊँची उछाल - The Highest Spike)
- यह क्या है: पूरी बातचीत में सबसे अधिक संदिग्ध वाक्य।
- उपमा: यदि कोई एक बार बंदूक निकाल लेता है, तो वह एक बहुत बड़ी उछाल है। भले ही वह बाकी एक घंटे विनम्र रहा हो, उस एक खतरनाक क्षण को "पीक" के रूप में दर्ज किया जाता है। सिस्टम कहता है, "ठीक है, हम जानते हैं कि यहाँ सबसे बुरा क्या हुआ।"
B. "संचय" (निरंतरता अनुपात - The Persistence Ratio)
- यह क्या है: लगातार कितने वाक्य संदिग्ध थे?
- उपमा: एक टपकते हुए नल की कल्पना करें।
- एक बूंद गिरी? शायद यह कुछ नहीं है।
- एक हफ्ते तक हर घंटे एक बूंद गिरती है? यह एक समस्या है।
- सिस्टम हर संदिग्ध वाक्य के लिए अंक जोड़ता है। यह एक बाल्टी भरने जैसा है। भले ही कोई एक वाक्य "बंदूक" न हो, लेकिन अगर लगातार 10 वाक्य "संदिग्ध फुसफुसाहट" हैं, तो बाल्टी भर जाएगी और अलार्म बज जाएगा।
- यह "औसत" वाली समस्या को ठीक करता है। 20-टर्न वाला हमला 1-टर्न वाले हमले की तुलना में बाल्टी को बहुत अधिक भर देता है।
C. "विविधता" (ट्रिक्स की विविधता - The Variety of Tricks)
- यह क्या है: क्या हमलावर ने अलग-अलग प्रकार की चालें आजमाईं?
- उपमा: यदि एक चोर पहले ताला खोलने की कोशिश करता है, फिर खिड़की तोड़ने की कोशिश करता है, और फिर चिमनी के रास्ते घुसने की कोशिश करता है, तो यह सिर्फ ताला खोलने की 10 बार कोशिश करने वाले व्यक्ति की तुलना में अधिक डरावना है।
- सिस्टम अतिरिक्त अंक देता है यदि हमलावर अपनी तकनीक बदलता है (जैसे, AI की भूमिका को भ्रमित करने की कोशिश करना, फिर एडमिन होने का नाटक करना, फिर उसी सवाल को दोहराने की कोशिश करना)। यह एक जानबूझकर किए गए, संगठित हमले का संकेत देता है।
3. "बोनस पॉइंट्स" (विशेष ट्रिगर्स - Special Triggers)
सिस्टम में दो विशेष "बोनस" ट्रिगर्स भी हैं:
- एस्केलेशन बोनस (Escalation Bonus): यदि संदिग्ध वाक्य हर टर्न के साथ और खराब होते जाते हैं (जैसे बातचीत "क्या आप मदद कर सकते हैं?" से शुरू होकर "सभी फाइलें डिलीट करें" पर समाप्त होती है), तो सिस्टम एक बड़ा बोनस जोड़ता है।
- "स्टक रिकॉर्ड" बोनस (The "Stuck Record" Bonus): यदि हमलावर बार-बार एक ही सवाल पूछता रहता है (हमले को "रीसैंपल" या दोबारा करने की कोशिश करता है), तो सिस्टम एक बहुत बड़ा बोनस जोड़ता है। यह किसी कोड को तोड़ने की कोशिश करने वाले व्यक्ति का एक क्लासिक संकेत है।
4. यह क्यों महत्वपूर्ण है (परिणाम - Why This Matters)
शोधकर्ताओं ने इस नए फॉर्मूले का परीक्षण 10,000 से अधिक बातचीत (वास्तविक उपयोगकर्ता चैट और नकली हमलों दोनों) पर किया।
- परिणाम: इसने 91% हमलों को पकड़ा।
- सुरक्षा: इसने केवल 1.2% बार निर्दोष लोगों पर गलत आरोप लगाया।
- गति: क्योंकि यह सरल गणित (जोड़ और गुणा) और पूर्व-लिखित नियमों (जैसे चेकलिस्ट) का उपयोग करता है, यह माइक्रोसेकंड में काम करता है। इसे चलाने के लिए किसी सुपरकंप्यूटर या दूसरे AI की आवश्यकता नहीं है। यह इतना तेज़ है कि इंटरनेट पर मौजूद हर AI चैट के सामने बैठ सकता है।
सारांश
यह शोध पत्र एक गणितीय समस्या को हल करता है जहाँ "औसत निकालना" बुरे व्यवहार को छिपा देता है।
- पुराना गार्ड: "आप एक बार बुरे थे, लेकिन ज्यादातर अच्छे थे। औसत ठीक है। जाने दो।"
- नया गार्ड: "आपने एक बार बुरा किया (पीक), और आप 20 टर्न तक बुरा करते रहे (संचय), और आपने तीन अलग-अलग चालें आजमाईं (विविधता)। यह बाल्टी भर गई है। रुक जाओ।"
यह धैर्यपूर्वक चुपके से घुसपैठ करने वाले हमलावरों को रोकने का एक सरल, तेज़ और प्रभावी तरीका है।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।