From Causal Plausibility to Causal Reliability: Evaluating LLMs as Calibrated Direct Causal-Edge Classifiers
تقيم هذه الورقة البحثية بشكل منهجي اثني عشر نموذجاً من نماذج اللغات الكبيرة بصفتها مصنفات مباشرة للحواف السببية، وتجد أنه بينما تُظهر هذه النماذج قدرة قوية على الاستدعاء، إلا أنها تعاني من الإفراط الملحوظ في التنبؤ، وضعف التمييز بين العلاقات المباشرة وغير المباشرة، والثقة المفرطة الشديدة في الأحكام الخاطئة، مما يشير إلى أنها ملائمة لتكون مصادر للبديهيات السببية الناعمة بدلاً من كونها أدلة مباشرة موثوقة للبنية السببية.