Exploitation Without Deception: Dark Triad Feature Steering Reveals Separable Antisocial Circuits in Language Models
تُظهر هذه الدراسة أن استخدام توجيه ميزات المشفر التلقائي المتناثر لتضخيم سمات "الثالوث المظلم" في نموذج Llama-3.3-70B-Instruct يزيد بشكل انتقائي من السلوكيات الاستغلالية والقاسية مع ترك الخداع الاستراتيجي والتعاطف المعرفي دون تغيير، مما يكشف أن النزعات المعادية للمجتمع في النماذج اللغوية الكبيرة تتكون من مسارات حوسبية منفصلة بدلاً من كونها بنية موحدة.