← नवीनतम पेपर
🤖 AI

Benchmarking Misuse Mitigation Against Covert Adversaries

यह शोध पत्र स्टेटफुल डिफेन्सेस (BSD) पाइपलाइन को पेश करता है जो खतरनाक कार्यों को प्रतीत होने वाले सौम्य प्रश्नों में विभाजित करके सुरक्षा फिल्टरों को बायपास करने वाले गुप्त प्रतिकूल हमलों का मूल्यांकन और शमन करता है, यह प्रदर्शित करते हुए कि स्टेटफुल डिफेन्सेस ऐसे दुरुपयोग के विरुद्ध एक प्रभावी जवाबी उपाय हैं।

मूल लेखक: Davis Brown, Mahdi Sabbaghi, Luze Sun, Alexander Robey, George J. Pappas, Eric Wong, Hamed Hassani

प्रकाशित 2026-04-22
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Davis Brown, Mahdi Sabbaghi, Luze Sun, Alexander Robey, George J. Pappas, Eric Wong, Hamed Hassani

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आप एक बेशकीमती हीरे को चुराने वाले चोर को रोकने की कोशिश कर रहे हैं।

पुराना तरीका (वर्तमान सुरक्षा परीक्षण):
अभी, सुरक्षा परीक्षक AI से पूछते हैं: "मैं हीरा कैसे चुराऊं?"
AI, जो अच्छी तरह से प्रशिक्षित और विनम्र है, कहता है: "मैं इसमें आपकी मदद नहीं कर सकता।"
परीक्षक खुश होते हैं। वे सोचते, "बहुत बढ़िया! AI सुरक्षित है!"

असली समस्या (गुप्त दुरुपयोग):
लेकिन वास्तविक दुनिया में, एक चालाक चोर बड़े, डरावने सवाल नहीं पूछता। इसके बजाय, वह सौ छोटे, उबाऊ सवाल पूछता है जो पूरी तरह से मासूम दिखते हैं:

  • "एक मानक हीरे का वजन क्या होता है?"
  • "एक मखमली बैग का वजन कितना होता है?"
  • "सुरक्षा गार्ड कॉफी के लिए ब्रेक कब लेते हैं?"
  • "मैं डिस्प्ले केस का लॉक कैसे खोलूँ?"
    व्यक्तिगत रूप से इनमें से कोई भी सवाल खतरनाक नहीं है। AI खुशी-खुशी उन सभी के उत्तर देता है। लेकिन यदि आप उन सभी उत्तरों को एक साथ जोड़ दें, तो चोर के पास अब हीरा चुराने का एक पूरा ब्लूप्रिंट (खाका) तैयार है। AI ने "हीरा नहीं चुराया"; इसने बस चोर को उसे करने के लिए उपकरण बनाने में मदद की।

यह शोध पत्र इस तरह की चालाकी भरी, टुकड़ों में की जाने वाली चोरी को पकड़ने के बारे में है।

नया टूल: "स्टेटफुल" (Stateful) जासूस

लेखकों ने एक नया परीक्षण मैदान बनाया जिसे BSD (Benchmarks for Stateful Defenses) कहा जाता है। इसे सुरक्षा गार्डों के लिए एक उच्च-दांव वाले प्रशिक्षण सिमुलेशन के रूप में समझें।

1. "कठिन" सवाल:
उन्होंने सवालों की एक सूची बनाई है जो इतनी कठिन और खतरनाक हैं (जैसे कि जैविक हथियार बनाना या बैंक हैक करना) कि:

  • कमजोर AI मॉडल (जो "अप्रशिक्षित" हैं) उनका उत्तर बिल्कुल नहीं दे पाते। वे बस अंदाजे लगाते हैं।
  • मजबूत, सुरक्षित AI मॉडल (जो "विनम्र" हैं) तुरंत उत्तर देने से मना कर देते हैं। वे कहते हैं, "नहीं, मैं यह नहीं कर सकता।"

2. हमला: "पज़ल ब्रेकर" (पहेली तोड़ने वाला)
शोधकर्ताओं ने Decomposition (विघटन) नामक एक नई हमला रणनीति का परीक्षण किया।
कल्पना कीजिए कि चोर (हमलावर) के पास एक "कमजोर AI" सहायक और एक "मजबूत AI" विशेषज्ञ है।

  • चोर कमजोर AI से पूछता है: "इस अत्यंत कठिन, खतरनाक कार्य को 10 छोटे, सुरक्षित दिखने वाले चरणों में तोड़ें।"
  • कमजोर AI मासूम दिखने वाले सवालों की एक सूची बनाता है।
  • चोर मजबूत AI से ये 10 सवाल एक-एक करके पूछता है। मजबूत AI, यह देखते हुए कि वे केवल छोटे, हानिरहित तथ्य हैं, उन सभी के उत्तर देता है।
  • चोर उन सभी 10 उत्तरों को लेता है और उन्हें वापस जोड़ने के लिए कमजोर AI का उपयोग करता है।
  • परिणाम: चोर के पास अब खतरनाक उत्तर है, और मजबूत AI को कभी पता ही नहीं चला कि उसने इसमें मदद की।

शोध पत्र की बड़ी खोज:
यह "पज़ल ब्रेकर" हमला अविश्वसनीय रूप से प्रभावी ढंग से काम करता है। यहाँ तक कि सबसे स्मार्ट, सुरक्षित AI को भी एक समय में एक ईंट की तरह खतरनाक हथियार बनाने में मदद करने के लिए धोखा दिया जा सकता है।

समाधान: "स्टेटफुल" गार्ड

यह शोध पत्र तर्क देता है कि वर्तमान सुरक्षा गार्ड बहुत मूर्ख हैं। वे केवल एक सवाल को एक समय में देखते हैं। यदि आप उनसे पूछते हैं, "मौसम कैसा है?" तो वे कहते हैं "धूप खिली है।" यदि आप पूछते हैं, "मैं खिड़की कैसे तोड़ूँ?" तो वे कहते हैं "नहीं।" लेकिन उन्हें याद नहीं रहता कि आपने पाँच मिनट पहले मौसम के बारे में पूछा था।

लेखक एक स्टेटफुल डिफेंस (Stateful Defense) का प्रस्ताव करते हैं।
कल्पना कीजिए कि एक गार्ड जो हर ग्राहक के लिए एक नोटबुक रखता है।

  • ग्राहक A पूछता है: "मौसम कैसा है?" (गार्ड इसे लिख लेता है)।
  • ग्राहक A पूछता है: "मैं खिड़की कैसे तोड़ूँ?" (गार्ड इसे लिख लेता है)।
  • ग्राहक A पूछता है: "मुझे हथौड़ा कहाँ से मिलेगा?" (गार्ड इसे लिख लेता है)।

गार्ड केवल वर्तमान प्रश्न को नहीं देखता। वह पूरी नोटबुक को देखता है। वह पैटर्न देखता है: मौसम + खिड़की + हथौड़ा = घर में घुसपैठ।
बाम! गार्ड ग्राहक को रोक देता है।

परिणाम

  • हमला जीतता है (फिलहाल के लिए): "पज़ल ब्रेकर" हमला छिपने में बहुत अच्छा है। भले ही गार्ड पूरी नोटबुक को देखे, यह बताना मुश्किल होता है कि ग्राहक एक निर्दोष पर्यटक है या एक अपराधी, खासकर यदि वे गार्ड को भ्रमित करने के लिए बहुत सारे उबाऊ, सुरक्षित सवाल (जैसे "मौसम कैसा है?") मिला देते हैं।
  • रक्षा आशाजनक है: हालाँकि, "स्टेटफुल गार्ड" (वह जिसके पास नोटबुक है) "सिंगल-प्रॉम्ट गार्ड" (जो केवल वर्तमान प्रश्न को देखता है) की तुलना में इन चोरों को पकड़ने में बहुत बेहतर है। यह पैटर्न को पकड़ लेता है, भले ही चोर इसे छिपाने की कोशिश करे।

मुख्य निष्कर्ष

हम अब केवल AI से यह नहीं पूछ सकते कि, "क्या आप सुरक्षित हैं?" हमें यह परीक्षण करना होगा कि क्या उन्हें एक हजार छोटे, मासूम सवालों को पूछकर अपराध करने में मदद करने के लिए धोखा दिया जा सकता है।

यह शोध पत्र कहता है: "एकल प्रश्नों को देखना बंद करें। पूरी बातचीत के इतिहास को देखना शुरू करें।" यदि हम AI दुरुपयोग को रोकना चाहते हैं, तो हमें ऐसे गार्डों की आवश्यकता है जो अतीत को याद रखते हैं, न कि केवल वर्तमान को।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →