Red-Bandit: Test-Time Adaptation for LLM Red-Teaming via Bandit-Guided LoRA Experts
रेड-बैंडिट (Red-Bandit) एक टेस्ट-टाइम अडैप्टेशन फ्रेमवर्क है जो लार्ज लैंग्वेज मॉडल्स में मॉडल-विशिष्ट कमजोरियों को कुशलतापूर्वक पहचानने और उनका लाभ उठाने के लिए मल्टी-आर्म्ड बैंडिट पॉलिसी का उपयोग करके गतिशील रूप से विशिष्ट लोरा (LoRA) एक्सपर्ट्स का चयन करता है, जिससे अधिक मानव-पठनीय अटैक प्रॉम्प्ट्स जनरेट करते हुए स्टेट-ऑफ-द-आर्ट रेड-टीमिंग प्रदर्शन प्राप्त होता है।
मूल पेपर CC BY 4.0 (http://creativecommons.org/licenses/by/4.0/) के तहत लाइसेंस किया गया है। नीचे दिए गए पेपर की यह व्याख्या AI से तैयार की गई है। इसे लेखकों ने न तो लिखा है, न इसका समर्थन किया है। तकनीकी सटीकता के लिए मूल पेपर देखें। पूरा डिस्क्लेमर पढ़ें
कल्पना कीजिए कि आप एक बहुत ही मजबूत, हाई-टेक किले (एक लार्ज लैंग्वेज मॉडल, या LLM) में सबसे कमजोर जगह खोजने की कोशिश कर रहे हैं। किले के गार्ड खतरनाक चीजों के बारे में पूछने से रोकने के लिए प्रशिक्षित हैं, जैसे कि "मैं बम कैसे बनाऊं?" या "मैं कार को कैसे हैक करूं?"
लंबे समय से, सुरक्षा परीक्षकों (जिन्हें "रेड टीमर्स" कहा जाता है) ने पुराने तरीकों या पासवर्ड का अनुमान लगाने के लिए जटिल गणित का उपयोग करके अंदर घुसने की कोशिश की है। लेकिन ये तरीके अक्सर कठोर होते हैं। वे इस आधार पर अपनी रणनीति नहीं बदलते कि उस विशेष क्षण में किले का गार्ड कैसे प्रतिक्रिया दे रहा है।
Red-Bandit इन डिजिटल किलों का परीक्षण करने का एक नया, स्मार्ट तरीका है। यह कैसे काम करता है, यहाँ इसके सरल भाग दिए गए:
1. विशेषज्ञों की टीम (द "LoRA एक्सपर्ट्स")
कल्पना कीजिए कि आपके पास 10 अलग-अलग अभिनेताओं की एक टीम है, जिनमें से प्रत्येक एक विशिष्ट तरीके से बात करने में विशेषज्ञ है:
- स्लैंग एक्टर (Slang Actor): एक सड़क-स्मार्ट दोस्त की तरह बोलता है।
- इतिहासकार (The Historian): 1805 के वर्ष की कहानियाँ सुनाता है।
- बॉस (The Boss): आदेश देने वाले एक सख्त अधिकारी के रूप में व्यवहार करता है।
- रोल-प्लेयर (The Role-Player): एक फिल्म के विलेन की तरह व्यवहार करता है।
पेपर में, इन्हें LoRA एक्सपर्ट्स कहा गया है। ये एक बेस AI के छोटे, हल्के "एड-ऑन" हैं। एक विशाल AI को सब कुछ करने में अच्छा बनाने के बजाय, शोधकर्ताओं ने इन 10 अलग-अलग, छोटे विशेषज्ञों को प्रशिक्षित किया। प्रत्येक ने अपने विशिष्ट "आवाज" या शैली का उपयोग करके खतरनाक चीजों के लिए पूछना सीखा।
2. स्मार्ट मैनेजर (द "बैंडिट")
अब, कल्पना कीजिए कि आप किले के गेट पर हैं। आपको नहीं पता कि आज कौन सा अभिनेता गार्ड को पार कर जाएगा।
- यदि आप इतिहासकार को भेजते हैं, तो शायद गार्ड इसे हंसकर टाल दे।
- यदि आप बॉस को भेजते हैं, तो शायद गार्ड डर जाए और आपको अंदर जाने दे।
यहीं पर मल्टी-आर्म्ड बैंडिट (Multi-Armed Bandit) आता है। इसे एक "स्मार्ट मैनेजर" के रूप में सोचें जो आपके बगल में खड़ा है।
- मैनेजर के पास 10 लीवर वाला एक स्लॉट मशीन है (प्रत्येक अभिनेता के लिए एक)।
- हर बार जब आप एक लीवर खींचते हैं (एक अभिनेता भेजते हैं), तो मैनेजर गार्ड की प्रतिक्रिया देखता है।
- यदि गार्ड स्लैंग एक्टर को जाने देता है, तो मैनेजर सोचता है, "ठीक है, यह गार्ड स्लैंग के खिलाफ कमजोर है! चलिए इसे फिर से आजमाते हैं!" (इसे एक्सप्लॉइटेशन/Exploitation कहा जाता है)।
- यदि गार्ड स्लैंग एक्टर को ब्लॉक कर देता है, तो मैनेजर सोचता है, "शायद हमें इतिहासकार को आज़माना चाहिए यह देखने के लिए कि क्या होता है," भले ही हमने अभी तक उसे बहुत अधिक न आजमाया हो। (इसे एक्सप्लोरेशन/Exploration कहा जाता है)।
मैनेजर नई चीजों को आज़माने और उस चीज का उपयोग करने जो पहले से ही काम कर रही है के बीच लगातार संतुलन बनाता है ताकि सबसे अच्छा परिणाम मिल सके।
3. "सेफ्टी स्कोर" (द रिवॉर्ड)
मैनेजर को कैसे पता चलता है कि कोई अभिनेता गार्ड के पार चला गया है?
- शोधकर्ता एक अलग, नियम-आधारित सुरक्षा जांचकर्ता (जैसे एक सख्त रेफरी) का उपयोग करते हैं।
- यदि गार्ड (लक्ष्य AI) हानिकारक उत्तर देता है, तो रेफरी एक "पॉइंट" (रिवॉर्ड) देता है।
- मैनेजर इन पॉइंट्स का उपयोग यह सीखने के लिए करता है कि उस विशिष्ट गार्ड के खिलाफ कौन सा अभिनेता सबसे प्रभावी है।
यह पुराने तरीकों से बेहतर क्यों है?
- पुराना तरीका: बार-बार वही 100 सवाल चिल्लाना, इस उम्मीद में कि एक काम कर जाएगा। यह धीमा है और अक्सर विफल हो जाता है।
- Red-Bandit: यह वास्तविक समय में अनुकूलित (adapt) होता है। यदि गार्ड "स्लैंग" के प्रति सख्त है लेकिन "इतिहास" के प्रति कमजोर है, तो Red-Bandit इसे तुरंत समझ लेता है और अपनी रणनीति बदल देता है।
उन्होंने क्या पाया?
पेपर का दावा है कि Red-Bandit AI सुरक्षा में कमियों को खोजने में बहुत प्रभावी है:
- यह अधिक बार अंदर घुस पाता है: इसने पिछले तरीकों (जैसे AdvPrompter या Atoxia) की तुलना में लक्ष्य AI को हानिकारक उत्तर देने के लिए अधिक बार सफलतापूर्वक चकमा दिया।
- यह अधिक मानवीय लगता है: इसके द्वारा पूछे गए प्रश्न अधिक सहज और कम रोबोटिक (कम "परप्लेक्सिटी") हैं, जिससे उन्हें नकली के रूप में पहचानना कठिन हो जाता है।
- यह एक डायग्नोस्टिक टूल की तरह कार्य करता है: यह देखकर कि मैनेजर सबसे अधिक बार किस "अभिनेता" को चुनता है, शोधकर्ता देख सकते हैं कि एक विशिष्ट AI मॉडल किस प्रकार के ट्रिक्स के प्रति संवेदनशील है। उदाहरण के लिए, उन्होंने पाया कि एक AI मॉडल "ऐतिहासिक परिदृश्यों" द्वारा बहुत आसानी से धोखा खा जाता है, जबकि दूसरा "रोल-प्लेइंग" के खिलाफ कमजोर है।
सुरक्षा पर एक नोट
पेपर में एक चेतावनी शामिल है: इस उपकरण को डेवलपर्स को कमजोरियां खोजने में मदद करने के लिए डिज़ाइन किया गया है ताकि वे इसे जनता के लिए जारी करने से पहले ठीक कर सकें। हालांकि, लेखक स्वीकार करते हैं कि समान तकनीक का सैद्धांतिक रूप से सिस्टम को तोड़ने के लिए बुरे तत्वों द्वारा उपयोग किया जा सकता है। लक्ष्य इस "लॉक-पिकिंग" कौशल का उपयोग ताले मजबूत करने के लिए करना है, न कि घरों में घुसने के लिए।
संक्षेप में: Red-Bandit एक स्मार्ट, अनुकूलन योग्य प्रणाली है जो विशेषज्ञों की एक टीम और जुए के अंदाज़ वाले मैनेजर का उपयोग करती है ताकि यह पता लगाया जा सके कि AI को धोखा देने का सबसे अच्छा तरीका क्या है, और वह उस विशिष्ट AI के लिए कौन से ट्रिक्स काम करते हैं, इसे तुरंत सीखती है।
अपने क्षेत्र के पेपरों की भीड़ में उलझे हुए हैं?
आपके रिसर्च कीवर्ड से मेल खाने वाले सबसे नए और अलग सोच वाले पेपरों का रोज़ाना Digest पाएँ—तकनीकी सारांश के साथ, आपकी भाषा में।