Easy to Complete, Hard to Choose: Investigating LLM Performance on the ProverbIT Benchmark
تقدم هذه الورقة ProverbIT، وهو معيار تقييم للأمثال الإيطالية يكشف أن النماذج اللغوية الكبيرة تواجه صعوبة في التمييز بين نهايات الأمثال الصحيحة والمرادفات الحرفية في مهام الاختيار من متعدد، مما يشير إلى أن أداءها يعتمد على الأنماط المحفوظة أكثر من الفهم الدلالي العميق للغة المجازية المتجذرة ثقافياً.