Anchoring Bias in LLM-as-a-Judge Systems: Prior Scores Compromise Evaluation Independence
تُثبت هذه الورقة أن النماذج اللغوية الكبيرة التي تعمل كحكام تعاني من انحياز كبير بسبب الدرجات السابقة المدرجة في البيانات الوصفية للسياق الخاص بها، مما يتسبب في تحولات نظامية في التقييم وأخطاء في اتخاذ القرار تستمر حتى مع محاولات التخفيف مثل "سلسلة الأفكار" أو التحذيرات، مما يتحدى فرضية استقلالية التقييم في أنظمة "النموذج اللغوي الكبير كحكم".