Robust Safety Monitoring of Language Models via Activation Watermarking
यह शोध पत्र "एक्टिवेशन वॉटरमार्किंग" पेश करके अनुकूलनशील विरोधियों (adaptive adversaries) के प्रति मौजूदा लार्ज लैंग्वेज मॉडल मॉनिटर्स की संवेदनशीलता को संबोधित करता है, जो कम फॉल्स पॉजिटिव दरों को बनाए रखते हुए इन्फरेंस-टाइम अनिश्चितता को इंजेक्ट करके डिटेक्शन सटीकता में काफी सुधार करता है।