White-Box Sensitivity Auditing with Steering Vectors
यह शोध पत्र लार्ज लैंग्वेज मॉडल्स के लिए एक व्हाइट-बॉक्स संवेदनशीलता ऑडिटिंग फ्रेमवर्क का प्रस्ताव करता है जो आंतरिक अवधारणाओं (इंटरनल कॉन्सेप्ट्स) को हेरफेर करने के लिए एक्टिवेशन स्टीयरिंग का लाभ उठाता है, जिससे उच्च-जोखिम वाले निर्णय कार्यों में संरक्षित विशेषताओं (प्रोटेक्टेड एट्रिब्यूट्स) पर पर्याप्त निर्भरता का पता चलता है जिसे मानक ब्लैक-बॉक्स मूल्यांकन अक्सर पकड़ने में विफल रहते हैं।