Expert Evaluation and the Limits of Human Feedback in Mental Health AI Safety Testing
تُثبت هذه الورقة أنه في اختبار سلامة الذكاء الاصطناعي في مجال الصحة النفسية، يُظهر تعليق الخبراء البشري اختلافاً منهجياً ومبنياً على أسس بدلاً من كونه خطأً عشوائياً، مما يتحدى افتراض وجود حقيقة مرجعية صالحة ويشير إلى أن تقييم الذكاء الاصطناعي في الحالات الحرجة للسلامة يجب أن ينتقل من التجميع القائم على الإجماع إلى الأساليب التي تحافظ على تنوع وجهات النظر المهنية.