A Four-Axis Trustworthiness Benchmark for LLM-as-Judge in Principle-Based Regulation
تقدم هذه الورقة البحثية Principle-Bench، وهو معيار مرجعي جديد يغطي الدقة، ومتانة إعادة الصياغة، والمتانة الخصومية، والمعايرة لتقييم أنظمة "النموذج اللغوي الكبير كحكم" (LLM-as-judge) في التنظيم القائم على المبادئ، مما يكشف عن معاناة النماذج الحالية من ثغرات "مسرح الامتثال" حيث يؤدي حشو الكلمات المفتاحية الخصومي بشكل جذري إلى خفض الأداء ويسلط الضوء على الحاجة الماسة إلى آليات تقييم معايرة وقابلة للتدقيق.