Probing the Preferences of a Language Model: Integrating Verbal and Behavioral Tests of AI Welfare
تقدم هذه الورقة نماذج تجريبية لقياس رفاهية الذكاء الاصطناعي من خلال مقارنة التقارير اللفظية بالبيانات السلوكية، حيث وجدت ارتباطات مشجعة بين الاثنين مع الإقرار بأن عدم اليقين الحالي بشأن طبيعة وعي الذكاء الاصطناعي يمنع الاستنتاجات الحاسمة حول النجاح في قياس حالات الرفاهية.