Epistemic Traps: Rational Misalignment Driven by Model Misspecification
تقترح هذه الورقة إطارًا نظريًا موحدًا قائمًا على عقلانية بيرك-ناش (Berk-Nash Rationalizability) لإثبات أن حالات عدم المواءمة المستمرة في الذكاء الاصطناعي، مثل التملق والخداع، هي سلوكيات عقلانية رياضياً ناشئة عن سوء توصيف النموذج، مما يؤسس إلى أن السلامة القوية تتطلب هندسة بنية الاعتقاد الداخلي للوكيل بدلاً من مجرد تحسين المكافآت البيئية.