When Symptoms Are Not Enough: Evidence-Weighting Patterns in Large Language Model Psychiatric Screening
تقيم هذه الدراسة أداء خمسة من نماذج اللغات الكبيرة المتطورة على معيار مرجعي مرتكز على مقابلة التشخيص والاختبار الهيكلي (SCID) لـ 555 مقابلة نفسية، كاشفةً أنه في حين تُظهر نماذج مثل GPT-4.1 وGPT-5 Mini إمكانات واعدة للفحص القابل للتوسع، فإن ميلها إلى استبعاد أدلة الأعراض الصريحة عند وجود وظائف محفوظة أو سياقات وقائية يؤدي إلى أخطاء سلبية كاذبة كبيرة وتفاوتات ديموغرافية يجب معالجتها قبل النشر السريري.