Red-Bandit: Test-Time Adaptation for LLM Red-Teaming via Bandit-Guided LoRA Experts
रेड-बैंडिट (Red-Bandit) एक टेस्ट-टाइम अडैप्टेशन फ्रेमवर्क है जो लार्ज लैंग्वेज मॉडल्स में मॉडल-विशिष्ट कमजोरियों को कुशलतापूर्वक पहचानने और उनका लाभ उठाने के लिए मल्टी-आर्म्ड बैंडिट पॉलिसी का उपयोग करके गतिशील रूप से विशिष्ट लोरा (LoRA) एक्सपर्ट्स का चयन करता है, जिससे अधिक मानव-पठनीय अटैक प्रॉम्प्ट्स जनरेट करते हुए स्टेट-ऑफ-द-आर्ट रेड-टीमिंग प्रदर्शन प्राप्त होता है।