Evaluation Drift in LLM Personality Induction: Are We Moving the Goalpost?
تُظهر هذه الورقة أنه في حين أن الضبط الدقيق للنماذج اللغوية الكبيرة على المقالات الطويلة يعمل على تثبيت استجابات شخصيتها تجاه تغيرات المطالبات، إلا أنه يفشل في استحثاث سمات "الخمس الكبرى" المستهدفة بدقة من المقالات غير الموجهة، مما يسلط الضوء على الحاجة إلى مجموعات بيانات قائمة على السيناريوهات أو استقصاء تفاعلي من أجل استحثاث دقيق للشخصية.