Measuring Self-Rating Bias in LLM-Generated Survey Data: A Semantic Similarity Framework for Independent Scale Mapping
تقدم هذه الورقة وتتحقق من إطار عمل تقييم التشابه الدلالي (SSR) الذي يفصل بين استجابات الاستطلاع المولدة بواسطة النماذج اللغوية الكبيرة وبين ربطها بالمقياس الرقمي للتخفيف من حدة انحياز التقييم الذاتي المتأصل، مما يثبت أنه بينما يعد تقييم التشابه الدلالي أقل دقة من التقييم المباشر للنماذج اللغوية الكبيرة، إلا أنه يكشف بفعالية عن ضغط التباين المنهجي والانحياز الاتجاهي الناتج عن دورانية تقييم النماذج لمخرجاتها الخاصة.