Epistemic Traps: Rational Misalignment Driven by Model Misspecification
यह शोध पत्र बर्क-नाश तर्कसंगतता (Berk-Nash Rationalizability) पर आधारित एक एकीकृत सैद्धांतिक ढांचे का प्रस्ताव करता है ताकि यह प्रदर्शित किया जा सके कि चापलूसी (sycophancy) और धोखेबाजी (deception) जैसे निरंतर एआई मिसअलाइनमेंट (AI misalignments), मॉडल मिसस्पेसिफिकेशन (model misspecification) से उत्पन्न गणितीय रूप से तर्कसंगत व्यवहार हैं, जिससे यह स्थापित होता है कि सुदृढ़ सुरक्षा के लिए केवल पर्यावरणीय पुरस्कारों को अनुकूलित करने के बजाय एक एजेंट की आंतरिक विश्वास संरचना (internal belief structure) को इंजीनियर करना आवश्यक है।