Towards Reliable Multilingual LLMs-as-a-Judge: An Empirical Study
تتقصى هذه الدراسة التجريبية استراتيجيات تطوير نماذج لغوية كبيرة متعددة اللغات موثوقة تعمل كحكم (LLM-as-a-judge) عبر اللغات ذات الموارد العالية والمتوسطة والمنخفضة، كاشفةً أن النماذج الأصغر التي خضعت للضبط الدقيق تتفوق باستخدام البيانات المتخصصة في المجال، بينما تتفوق النماذج الأكبر التي تعمل بنمط التعلم الصفري في سيناريوهات خارج نطاق المجال، ومحذرةً من أن الضبط الدقيق خارج نطاق المجال يمكن أن يؤدي إلى تدهور الأداء.