When Benchmarks Lie: Evaluating Malicious Prompt Classifiers Under True Distribution Shift
यह शोध पत्र प्रकट करता है कि मानक क्रॉस-वैलिडेशन (cross-validation), एक कठोर लीव-वन-डेटासेट-आउट (Leave-One-Dataset-Out) मूल्यांकन की तुलना में मैलिशियस प्रॉम्प्ट क्लासिफायर के सामान्यीकरण (generalization) को 8–16.5 AUC अंकों से काफी अधिक बढ़ाकर दिखाता है, जो मॉडल फीचर्स में व्यापक डेटासेट-निर्भर शॉर्टकट्स को उजागर करता है जिन्हें वर्तमान डोमेन-जनरलाइजेशन तकनीकें कम करने में विफल रहती हैं।