Evaluating Scoring Bias in LLM-as-a-Judge
تتناول هذه الورقة البحثية مسألة تحيز التقييم في أنظمة "النموذج اللغوي الكبير كحكم" (LLM-as-a-Judge) التي لم تنل حظها الكافي من الدراسة، وذلك عبر تعريف وقياس ثلاثة أنواع مستحدثة من التحيز —وهي تحيز ترتيب المعايير، وتحيز معرف الدرجة، وتحيز درجة الإجابة المرجعية— واقتراح إطار عمل شامل للتخفيف منها من خلال تحسين تصميم الأوامر البرمجية والتقييم الآلي.