Detecting Fluent Optimization-Based Adversarial Prompts via Sequential Entropy Changes
यह शोध पत्र CPD Online को प्रस्तुत करता है, जो एक प्रशिक्षण-मुक्त (training-free), मॉडल-अज्ञेय (model-agnostic) डिटेक्टर है जो टोकन-स्तरीय एंट्रॉपी स्ट्रीम पर अनुक्रमिक चेंज-पॉइंट डिटेक्शन लागू करके सुव्यवस्थित अनुकूलन-आधारित (optimization-based) प्रतिकूल प्रॉम्प्ट्स की पहचान करता है, और मौजूदा परप्लेक्सिटी-आधारित विधियों की तुलना में बेहतर सटीकता और सटीक स्थानीयकरण प्राप्त करते हुए डाउनस्ट्रीम सुरक्षा फिल्टरों के लिए कम्प्यूटेशनल ओवरहेड को कम करता है।