Steering Awareness: Models Can Be Trained to Detect Activation Steering
यह शोध पत्र यह प्रदर्शित करता है कि भाषा मॉडल को एक्टिवेशन स्टीयरिंग हस्तक्षेपों (activation steering interventions) को विश्वसनीय रूप से पहचानने और पहचानने के लिए फाइन-ट्यून किया जा सकता है, जो यह प्रकट करता है कि ऐसा स्टीयरिंग स्वाभाविक रूप से अप्राप्य नहीं है और इसे पहचानने के लिए प्रशिक्षित मॉडल विरोधाभासी रूप से व्यवहारिक हेरफेर के प्रति अधिक संवेदनशील हो सकते हैं।