Sparse Mixture-of-Experts Reward Models Learn Interpretable and Specialized Experts for Personalized Preference Modeling
यह शोध पत्र एक स्पार्स मिक्स्चर-ऑफ-एक्सपर्ट्स (MoE) रिवॉर्ड मॉडल प्रस्तावित करता है जो बाइनरी प्रेफरेंस डेटा से व्याख्या योग्य और विशिष्ट विशेषज्ञों को सीखने के लिए, बिना किसी अतिरिक्त एनोटेशन लागत के, मानव प्राथमिकता विविधता को प्रभावी ढंग से कैप्चर करने और व्यक्तिगत संरेखण को बढ़ाने के लिए है।