Learning-Based Automated Adversarial Red-Teaming for Robustness Evaluation of Large Language Models
यह शोध पत्र एक लर्निंग-ड्रिवन ऑटोमेटेड रेड-टीमिंग फ्रेमवर्क पेश करता है जो सुरक्षा मूल्यांकन को एक कंस्ट्रेंड एडवर्सरियल सर्च समस्या के रूप में मानता है, जो इवोल्यूशनरी प्रॉम्प्ट जनरेशन और हायरार्किकल डिटेक्शन को जोड़कर मैनुअल एक्सपर्ट विधियों की तुलना में काफी उच्च भेद्यता खोज दर और व्यापक श्रेणी कवरेज प्रदर्शित करता है।