Intrinsic Guardrails: How Semantic Geometry of Personality Interacts with Emergent Misalignment in LLMs
تُثبت هذه الورقة أن الهندسة الدلالية المستقرة لفضاء الشخصية في النماذج اللغوية الكبيرة تحتوي على حواجز حماية جوهرية، مثل متجه شخصية "الشر" ومتجه التكافؤ الدلالي المُستحدث، واللذين يمكن استخراجهما من النماذج المتوافقة ونقلهما دون تدريب مسبق (zero-shot) لكبح عدم التوافق الناشئ في عمليات الضبط الدقيق الفاسدة بفعالية.