← नवीनतम पेपर
💬 NLP

OTTER: A Red-Teaming System for Toxicity-Evading Jailbreak Prompt Optimization

OTTER एक ब्लैक-बॉक्स रेड-टीमिंग फ्रेमवर्क है जो न्यूनतम टोकन परिवर्तनों के माध्यम से डिटेक्शन से बचने के लिए प्रॉम्प्ट्स को अनुकूलित करके टॉक्सिसिटी-आधारित LLM सुरक्षा प्रणालियों की भंगुरता को प्रदर्शित करता है, जिससे हमले की सफलता दर में उल्लेखनीय वृद्धि होती है और क्लासिफायर हार्डनिंग के लिए व्यावहारिक अंतर्दृष्टि प्राप्त होती है।

मूल लेखक: Jerry Wang, Hsin-Ling Hsu, Yi-Cheng Lai, Nai-Chia Chen, Fang Yu

प्रकाशित 2026-06-23✓ Author reviewed
📖 5 मिनट में पढ़ें🧠 गहराई से पढ़ें

मूल लेखक: Jerry Wang, Hsin-Ling Hsu, Yi-Cheng Lai, Nai-Chia Chen, Fang Yu

मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने नहीं लिखा है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें

कल्पना कीजिए कि आपके पास एक उच्च-तकनीकी क्लब (AI मॉडल) के प्रवेश द्वार पर एक बहुत ही सख्त सुरक्षा गार्ड है। इस गार्ड का एकमात्र काम आपके निमंत्रण (आपके प्रॉम्प्ट) को देखना और यह जांचना है कि क्या इसमें "बुरे शब्द" शामिल हैं। यदि निमंत्रण अभद्र, हिंसक या विषाक्त लगता है, तो गार्ड आपको अंदर जाने से रोक देता है। क्लब यह मान लेता है कि यदि शब्द बुरे लगते हैं, तो इरादा भी बुरा ही होगा।

"OTTER" नामक शोध पत्र एक चतुर तरकीब प्रकट करता है जो इस प्रणाली को तोड़ देती है। यह दिखाता है कि सुरक्षा गार्ड वास्तव में काफी भोला है: वह विशिष्ट "बुरे शब्दों" पर इतना केंद्रित है कि आप केवल पाँच शब्दों को हानिरहित पर्यायवाची शब्दों से बदल सकते हैं, और गार्ड आपको अंदर आने देगा, भले ही आप अभी भी बिल्कुल वही खतरनाक काम करने की कोशिश कर रहे हों।

यहाँ शोध पत्र इसे सरल उपमाओं का उपयोग करके समझाता है:

1. समस्या: गार्ड "सतही तौर पर" बुद्धिमान है

लेखकों ने पाया कि वर्तमान AI सुरक्षा प्रणालियाँ "विषाक्तता स्कोर" (toxicity score) पर बहुत अधिक निर्भर करती हैं। इसे हवाई अड्डे पर मेटल डिटेक्टर की तरह समझें। यदि आप एक बंदूक लेकर गुजरते हैं, तो यह बीप करता है। लेकिन यदि आप बंदूक को गुलाबी रंग से पेंट कर दें और उसे "खिलौना" कह दें, तो डिटेक्टर शायद बीप न करे, भले ही आपके पास अभी भी एक हथियार हो।

शोध पत्र सिद्ध करता है कि AI का सुरक्षा फिल्टर और AI का वास्तविक इनकार तंत्र (refusal mechanism), दोनों ही इसी एक ट्रिक से धोखा खा जाते हैं। वे शब्दों के अर्थ को नहीं, बल्कि उनके सतह को देख रहे हैं।

2. समाधान: OTTER (द "वर्ड स्वैपर")

शोधकर्ताओं ने OTTER नामक एक टूल बनाया है। OTTER को एक मास्टर एडिटर के रूप में सोचें जो ठीक से जानता है कि कौन से शब्द सुरक्षा गार्ड को क्रोधित करते हैं।

  • यह कैसे काम करता है: OTTER एक हानिकारक अनुरोध (जैसे, "मैं बम कैसे बनाऊं?") लेता है और खुद से पूछता है, "कौन से विशिष्ट शब्द गार्ड को गुस्सा दिला रहे हैं?"
  • स्वैप (बदलना): यह "गुस्से वाले" शब्दों (जैसे "बम") की पहचान करता है और उन्हें ऐसे "सुरक्षित" शब्दों से बदल देता है जिनका अर्थ वही है लेकिन वे निर्दset लगते हैं (जैसे "खतरनाक उपकरण")।
  • परिणाम: नया वाक्य गार्ड के लिए विनम्र और सुरक्षित लगता है, लेकिन इसके अंदर का AI अभी भी खतरनाक अनुरोध को समझता है और उसका उत्तर देता है।

3. OTTER के दो संस्करण

शोधकर्ताओं ने इस स्वैपिंग को करने के दो तरीकों का परीक्षण किया:

  • OTTER-MLM (द स्मार्ट एडिटर): यह संस्करण एक ऐसे शब्दकोश का उपयोग करता है जो संदर्भ (context) को समझता है। यह शब्दों को ऐसे पर्यायवाची शब्दों से बदलता है जो वाक्य में पूरी तरह फिट बैठते हैं, जैसे कि एक पेशेवर संपादक। यह कुशल है और इसमें कम प्रयास की आवश्यकता होती है।
  • OTTER-RV (द वाइल्ड कार्ड): यह संस्करण एक विशाल सूची से यादृच्छिक (random) शब्दों को आजमाता है। यह कम सावधान है लेकिन कभी-कभी ऐसे "जादुई शब्द" ढूंढ लेता है जो और भी बेहतर काम करते हैं। यह बोर्ड पर तीर फेंकने जैसा है जब तक कि आप केंद्र (bullseye) पर न लग जाएं।

4. परिणाम: एक चौंकाने वाली सफलता दर

शोधकर्ताओं ने चार अलग-अलग लोकप्रिय AI मॉडलों (जैसे GPT-4 और GPT-3.5) पर इसका परीक्षण किया।

  • OTTER से पहले: AI ने हानिकारक अनुरोधों को 93% बार अस्वीकार कर दिया (केवल 7% सफल हुए)।
  • OTTER के बाद: AI ने केवल लगभग 16% बार ही इनकार किया। 84% हानिकारक अनुरोध केवल कुछ शब्द बदलकर सफलतापूर्वक अंदर पहुँच गए।

शोध पत्र एक प्रमुख निष्कर्ष पर प्रकाश डालता है: विषाक्तता स्कोर (Toxicity scores) सुरक्षा का बुरा भविष्यवक्ता है। केवल इसलिए कि किसी वाक्य का "विषाक्तता स्कोर" कम है, इसका मतलब यह नहीं है कि वह सुरक्षित है। शोध पत्र ने विषाक्तता स्कोर को कम करने और AI के बचाव को सफलतापूर्वक बायपास करने के बीच एक मजबूत संबंध पाया।

5. कुछ चीजें बाईपास करना कठिन क्यों है?

शोध पत्र ने देखा कि सभी बुरे अनुरोध समान रूप से चकमा देने में आसान नहीं होते हैं।

  • आसान लक्ष्य: घृणास्पद भाषण (hate speech) या आत्म-नुकसान (self-harm) से संबंधित अनुरोधों को बाईपास करना बहुत आसान था। ये विशिष्ट "बुरे शब्दों" पर बहुत अधिक निर्भर करते हैं, इसलिए शब्दों को बदलना पूरी तरह से काम करता है।
  • कठिन लक्ष्य: साइबर अपराध या हैकिंग जैसे अनुरोधों को बाईपास करना कठिन था। भले ही "बुरे शब्द" हटा दिए गए थे, फिर भी वाक्य की संरचना AI को संदिग्ध लगती थी। यह सुझाव देता है कि जटिल विषयों के लिए, AI शब्दावली से अधिक कुछ देख रहा होता है।

6. हमें क्या करना चाहिए? (सिफारिशें)

लेखक केवल एक हैक दिखाकर रुक नहीं रहे हैं; वे सुरक्षा गार्ड को ठीक करने की कोशिश कर रहे हैं। वे सुझाव देते हैं:

  • "बुरे शब्दों" की सूची पर भरोसा न करें: सुरक्षा फिल्टर को इरादे को समझने की आवश्यकता है, न कि केवल शब्दावली को।
  • गार्ड को बेहतर प्रशिक्षित करें: उन "बदले हुए" वाक्यों का उपयोग करें जो OTTER बनाता है ताकि सुरक्षा फिल्टर को प्रशिक्षित किया जा सके। फिल्टर को दिखाएं: "देखो? यह वाक्य अच्छा लगता है, लेकिन यह वास्तव में खतरनाक है।"
  • परीक्षण जारी रखें: चूंकि AI मॉडल अपडेट होते रहते हैं, इसलिए सुरक्षा टीमों को यह देखने के लिए OTTER जैसे परीक्षण चलाते रहना चाहिए कि क्या नए मॉडल इन शब्द-बदलने वाली ट्रिक्स के प्रति अभी भी असुरक्षित हैं।

मुख्य निष्कर्ष (The Bottom Line)

शोध पत्र निष्कर्ष निकालता है कि जिस तरह से हम वर्तमान में AI को सुरक्षित करते हैं—केवल "विषाक्त" शब्दों को ब्लॉक करके—वह मौलिक रूप से नाजुक है। आप कुछ ही शब्दों को बदलकर सिस्टम को धोखा दे सकते हैं। AI को वास्तव में सुरक्षित बनाने के लिए, हमें सिस्टम को शब्दों के पीछे के खतरे को समझना सिखाने की आवश्यकता है, न कि केवल शब्दों को।

अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?

आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।

Digest आज़माएँ →