In-Situ Behavioral Evaluation for LLM Fairness, Not Standardized-Test Scores
تجادل هذه الورقة بأن عدالة النماذج اللغوية الكبيرة يجب أن تُقيّم من خلال سلوك المحادثة متعدد الوكلاء في سياقه الطبيعي بدلاً من اختبارات المعايير القياسية، مقدمةً إطار عمل "MAC-Fairness" للكشف عن بصمات سلوكية مستقرة وخاصة بكل نموذج، والتي تحجبها عدم الموثوقية الهيكلية للاختبارات القائمة على الأوامر التقليدية.