Three Models of RLHF Annotation: Extension, Evidence, and Authority
تقترح هذه الورقة التمييز بين ثلاثة نماذج مفاهيمية للمُعلّقين البشريين في التعلم التعزيزي من التغذية الراجعة البشرية (RLHF) —وهي: الامتداد، والدليل، والسلطة— لتوجيه تصميم مسارات تعليق أكثر فعالية عبر تخصيص استراتيجيات جمع وتجميع البيانات لتناسب الدور المعياري المحدد لكل بُعد من أبعاد محاذاة النموذج.