RLHF in an SFT Way: From Optimal Solution to Reward-Weighted Alignment
यह शोध पत्र वेरिएशनल अलाइनमेंट विद री-वेटिंग (VAR) का प्रस्ताव करता है, जो एक नवीन ऑफलाइन विधि है जो बेहतर अलाइनमेंट प्रदर्शन और स्थिरता प्राप्त करने के लिए मानव फीडबैक से सुदृढीकरण लर्निंग (RLHF) को एक रिवॉर्ड-वेटेड सुपरवाइज्ड फाइन-ट्यूनिंग कार्य के रूप में पुनर्गठित करती है, जबकि पारंपरिक ऑनलाइन विधियों और DPO जैसे मौजूदा ऑफलाइन दृष्टिकोणों की तुलना में कम्प्यूटेशनल लागत को काफी कम करती है।