A Descriptive and Normative Theory of Human Beliefs in RLHF
यह शोध पत्र एक नए सैद्धांतिक ढांचे का प्रस्ताव और सत्यापन करता है जो यह प्रदर्शित करता है कि एक AI एजेंट की क्षमताओं के बारे में मानवीय विश्वास RLHF में प्राथमिकता जनरेशन (preference generation) को महत्वपूर्ण रूप से प्रभावित करते हैं, और यह दर्शाता है कि इन विश्वासों को वास्तविक एजेंट क्षमताओं के साथ संरेखित करना—इष्टतमता (optimality) मान लेने के बजाय—अधिक प्रदर्शन करने वाली सीखी गई नीतियों की ओर ले जाता है।