How Reliable Is Your Jailbreak Judge? Calibration and Adversarial Robustness of Automated ASR Scoring
यह शोध पत्र प्रकट करता है कि LLM जेलब्रेक सफलता दर को मापने के लिए उपयोग किए जाने वाले स्वचालित जज अत्यधिक अविश्वसनीय हैं, जिसमें समर्पित क्लासिफायर ओवर-फ्लैगिंग के प्रति प्रवृत्त होते हैं और LLM-एज़-जज अस्थिर रिकॉल तथा प्रतिकूल फ्रेमिंग (adversarial framing) के प्रति अत्यधिक संवेदनशील होते हैं, जिससे जज प्रदर्शन मेट्रिक्स और प्रतिकूल मजबूती (adversarial robustness) जांच के मानकीकृत रिपोर्टिंग की आवश्यकता उत्पन्न होती है।