Harmful Intent as a Geometrically Recoverable Feature of LLM Residual Streams
यह शोध पत्र यह प्रदर्शित करता है कि हानिकारक इरादा (harmful intent) बड़े भाषा मॉडलों (large language models) में एक ज्यामितीय रूप से पुनः प्राप्त करने योग्य (geometrically recoverable) और रैखिक रूप से डिकोडेबल (linearly decodable) विशेषता है जो विविध आर्किटेक्चर और एलाइनमेंट अवस्थाओं, जिसमें एब्लीटरेटेड मॉडल (abliterated models) भी शामिल हैं, में मौजूद है, जिसे विशिष्ट प्रोबिंग रणनीतियों का उपयोग करके उच्च सटीकता के साथ पहचाना जा सकता है, जबकि यह भी प्रकट करता है कि AUROC जैसे डिटेक्शन मेट्रिक्स परिचालन सुरक्षा (operational safety) को बढ़ा-चढ़ाकर दिखा सकते हैं।