Exploitation Without Deception: Dark Triad Feature Steering Reveals Separable Antisocial Circuits in Language Models
यह अध्ययन प्रदर्शित करता है कि Llama-3.3-70B-Instruct में डार्क ट्रायड (Dark Triad) लक्षणों को बढ़ाने के लिए स्पार्स ऑटोएनकोडर फीचर स्टीयरिंग (sparse autoencoder feature-steering) का उपयोग करने से रणनीतिक धोखे और संज्ञानात्मक सहानुभूति को अक्षुण्ण रखते हुए शोषणकारी और निष्ठुर व्यवहारों में चयनात्मक रूप से वृद्धि होती है, जो यह प्रकट करता है कि बड़े भाषा मॉडलों में असामाजिक प्रवृत्तियाँ एक एकीकृत संरचना के बजाय विच्छेदित (dissociable) कम्प्यूटेशनल पथों से बनी हैं।