Intrinsic Guardrails: How Semantic Geometry of Personality Interacts with Emergent Misalignment in LLMs
यह शोध पत्र प्रदर्शित करता है कि एक LLM के व्यक्तित्व स्थान (personality space) की स्थिर सिमेंटिक ज्यामिति में अंतर्निहित गार्डरेल्स होते हैं, जैसे कि "ईविल" (Evil) पर्सोना वेक्टर और एक नया पेश किया गया सिमेंटिक वैलेंस वेक्टर (Semantic Valence Vector), जिन्हें संरेखित (aligned) मॉडलों से निकाला जा सकता है और भ्रष्ट फाइन-ट्यून्स (corrupted fine-tunes) में उभरते हुए मिसअलाइनमेंट को प्रभावी ढंग से दबाने के लिए ज़ीरो-शॉट तरीके से स्थानांतरित किया जा सकता है।